Laguna S 2.1은 Poolside가 공개한 장기추론(long-horizon reasoning) 코딩 모델이다. 총 118B 파라미터, 토큰당 8B 활성 파라미터를 쓰는 MoE 모델이며, thinking과 no-thinking 모드 모두 최대 100만 토큰 컨텍스트를 지원한다.
이 모델의 핵심 메시지는 “더 큰 모델”보다 “오래 붙잡고 검증하는 모델”이다. Poolside는 Laguna S 2.1이 부분 성공에서 멈추지 않고, 테스트·벤치마크·대안 탐색을 반복하는 행동을 강화했다고 설명한다.
핵심 스펙
| 항목 | 내용 |
|---|---|
| 모델 크기 | 118B total, 8B active MoE |
| 컨텍스트 | 최대 1M 토큰 |
| 모드 | thinking 기본, no-thinking 선택 가능 |
| 공개 형태 | Hugging Face 공개 |
| 가중치 형식 | BF16, FP8, INT4, NVFP4, GGUF, MLX 변환 제공 |
| 라이선스 | OpenMDW-1.1 |
벤치마크 포지션
Poolside가 공개한 비교에서 Laguna S 2.1은 자기 체급 대비 강한 코딩 에이전트 성능을 보인다.
| 벤치마크 | Laguna S 2.1 |
|---|---|
| Terminal-Bench 2.1 | 70.2 |
| SWE-Bench Multilingual | 78.5 |
| SWE-Bench Pro public | 59.4 |
| DeepSWE | 40.4 |
| SWE Atlas Codebase QnA | 46.2 |
| Toolathlon Verified | 49.7 |
특히 Terminal-Bench 2.1에서는 118B 모델이 훨씬 큰 1T급 모델들과 같은 표 안에서 비교될 만큼 올라왔다. 다만 Poolside도 벤치마크별 harness 차이와 self-reported 수치 혼합을 명시하므로, 절대 순위보다 “소형 MoE 장기 작업 모델의 가능성”으로 해석하는 편이 안전하다.
왜 장기 작업에 초점을 맞췄나
코딩 에이전트의 실제 성능은 첫 답변보다 이후 행동에서 갈린다. 잘못된 가정을 발견했을 때 되돌아가기, 테스트 실패를 읽고 고치기, 도구 제약을 우회가 아니라 정상 경로로 해결하기 같은 행동이 중요하다.
Laguna S 2.1 글의 사례도 이 지점을 강조한다.
- 빈 폴더에서 HTML/CSS 렌더링 엔진을 만들고 Chromium screenshot 비교로 검증
- Poolside 내부 agent harness를 반복 벤치마크로 최적화해 속도와 메모리 할당 개선
- 수학 문제를 장시간 탐색하며 별도 도구 없이 Perl로 패턴을 검증
이 사례들은 모델이 단순 코드 생성기가 아니라 긴 실행 궤적을 유지하는 작업자에 가까워지고 있음을 보여준다.
thinking 모드의 비용
thinking 모드는 성능을 크게 올리지만 completion token 사용량도 늘린다. Poolside 공개 수치에서 Terminal-Bench 2.1은 no-thinking 60.4에서 thinking 70.2로 올라가고, DeepSWE는 16.5에서 40.4로 올라간다. 대신 평균 completion token은 어려운 작업에서 수십만 토큰까지 커질 수 있다.
운영 관점에서는 다음처럼 나누는 것이 현실적이다.
| 작업 | 권장 모드 |
|---|---|
| 단순 코드 수정, 요약, 검색 | no-thinking |
| 긴 디버깅, 리팩터링, 벤치마크 최적화 | thinking |
| 수학·연구·불확실한 설계 탐색 | thinking |
한계
Poolside는 Laguna S 2.1의 한계도 공개했다. third-party agent harness의 도구 스키마가 Poolside 내부 도구와 비슷하지만 약간 다르면 첫 호출에서 형식을 잘못 기억할 수 있다. XML 유사 tool call 포맷과 JSON 배열 인자가 섞이는 경우 escaping 오류도 가능하다. 또한 thinking 모드가 과하게 오래 이어지는 overthinking 문제가 남아 있다.
따라서 Laguna S 2.1은 무감독 자동화보다는 테스트, 권한 경계, 토큰 예산, 중단 조건이 있는 에이전트 하네스에서 쓰는 것이 맞다.
누구에게 적합한가
- 로컬·자체 호스팅 코딩 모델을 찾는 팀: GGUF·MLX 변환을 활용해 자체 환경에서 실험할 수 있다
- 코딩 에이전트 연구자: 긴 trajectory와 공개 평가 데이터를 통해 모델 행동을 분석하기 좋다
- 에이전트 하네스 개발자: 긴 컨텍스트, 검증 루프, tool schema 견고성을 시험하는 기준 모델로 쓸 수 있다
관련 문서
- kimi — 장기 코딩·에이전트 스웜에 특화된 Moonshot AI 오픈소스 LLM
- inkling — Thinking Machines의 975B 오픈웨이트 멀티모달 MoE 모델
- muse-spark-1-1 — Meta의 API 지원 코딩·에이전트 모델
- agent-harness — AI 에이전트 성능을 결정하는 스캐폴딩 체계적 설계 방법론
- long-horizon-model-safety — 장시간 자율 작업 모델을 평가하고 통제하는 방법
참고 자료
- Introducing Laguna S 2.1 — Poolside (2026-07-21)