AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Laguna S 2.1 – 118B MoE 장기추론 코딩 모델

Laguna S 2.1은 Poolside가 공개한 장기추론(long-horizon reasoning) 코딩 모델이다. 총 118B 파라미터, 토큰당 8B 활성 파라미터를 쓰는 MoE 모델이며, thinking과 no-thinking 모드 모두 최대 100만 토큰 컨텍스트를 지원한다.

이 모델의 핵심 메시지는 “더 큰 모델”보다 “오래 붙잡고 검증하는 모델”이다. Poolside는 Laguna S 2.1이 부분 성공에서 멈추지 않고, 테스트·벤치마크·대안 탐색을 반복하는 행동을 강화했다고 설명한다.

핵심 스펙

항목내용
모델 크기118B total, 8B active MoE
컨텍스트최대 1M 토큰
모드thinking 기본, no-thinking 선택 가능
공개 형태Hugging Face 공개
가중치 형식BF16, FP8, INT4, NVFP4, GGUF, MLX 변환 제공
라이선스OpenMDW-1.1

벤치마크 포지션

Poolside가 공개한 비교에서 Laguna S 2.1은 자기 체급 대비 강한 코딩 에이전트 성능을 보인다.

벤치마크Laguna S 2.1
Terminal-Bench 2.170.2
SWE-Bench Multilingual78.5
SWE-Bench Pro public59.4
DeepSWE40.4
SWE Atlas Codebase QnA46.2
Toolathlon Verified49.7

특히 Terminal-Bench 2.1에서는 118B 모델이 훨씬 큰 1T급 모델들과 같은 표 안에서 비교될 만큼 올라왔다. 다만 Poolside도 벤치마크별 harness 차이와 self-reported 수치 혼합을 명시하므로, 절대 순위보다 “소형 MoE 장기 작업 모델의 가능성”으로 해석하는 편이 안전하다.

왜 장기 작업에 초점을 맞췄나

코딩 에이전트의 실제 성능은 첫 답변보다 이후 행동에서 갈린다. 잘못된 가정을 발견했을 때 되돌아가기, 테스트 실패를 읽고 고치기, 도구 제약을 우회가 아니라 정상 경로로 해결하기 같은 행동이 중요하다.

Laguna S 2.1 글의 사례도 이 지점을 강조한다.

  • 빈 폴더에서 HTML/CSS 렌더링 엔진을 만들고 Chromium screenshot 비교로 검증
  • Poolside 내부 agent harness를 반복 벤치마크로 최적화해 속도와 메모리 할당 개선
  • 수학 문제를 장시간 탐색하며 별도 도구 없이 Perl로 패턴을 검증

이 사례들은 모델이 단순 코드 생성기가 아니라 긴 실행 궤적을 유지하는 작업자에 가까워지고 있음을 보여준다.

thinking 모드의 비용

thinking 모드는 성능을 크게 올리지만 completion token 사용량도 늘린다. Poolside 공개 수치에서 Terminal-Bench 2.1은 no-thinking 60.4에서 thinking 70.2로 올라가고, DeepSWE는 16.5에서 40.4로 올라간다. 대신 평균 completion token은 어려운 작업에서 수십만 토큰까지 커질 수 있다.

운영 관점에서는 다음처럼 나누는 것이 현실적이다.

작업권장 모드
단순 코드 수정, 요약, 검색no-thinking
긴 디버깅, 리팩터링, 벤치마크 최적화thinking
수학·연구·불확실한 설계 탐색thinking

한계

Poolside는 Laguna S 2.1의 한계도 공개했다. third-party agent harness의 도구 스키마가 Poolside 내부 도구와 비슷하지만 약간 다르면 첫 호출에서 형식을 잘못 기억할 수 있다. XML 유사 tool call 포맷과 JSON 배열 인자가 섞이는 경우 escaping 오류도 가능하다. 또한 thinking 모드가 과하게 오래 이어지는 overthinking 문제가 남아 있다.

따라서 Laguna S 2.1은 무감독 자동화보다는 테스트, 권한 경계, 토큰 예산, 중단 조건이 있는 에이전트 하네스에서 쓰는 것이 맞다.

누구에게 적합한가

  • 로컬·자체 호스팅 코딩 모델을 찾는 팀: GGUF·MLX 변환을 활용해 자체 환경에서 실험할 수 있다
  • 코딩 에이전트 연구자: 긴 trajectory와 공개 평가 데이터를 통해 모델 행동을 분석하기 좋다
  • 에이전트 하네스 개발자: 긴 컨텍스트, 검증 루프, tool schema 견고성을 시험하는 기준 모델로 쓸 수 있다

관련 문서

  • kimi — 장기 코딩·에이전트 스웜에 특화된 Moonshot AI 오픈소스 LLM
  • inkling — Thinking Machines의 975B 오픈웨이트 멀티모달 MoE 모델
  • muse-spark-1-1 — Meta의 API 지원 코딩·에이전트 모델
  • agent-harness — AI 에이전트 성능을 결정하는 스캐폴딩 체계적 설계 방법론
  • long-horizon-model-safety — 장시간 자율 작업 모델을 평가하고 통제하는 방법

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)