AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Needle 2 – 14MB로 배포되는 초소형 에이전트 LLM

Needle 2는 Cactus Compute가 공개한 4,500만 파라미터급 초소형 에이전트 LLM이다. 14MB 파일, 28MB 세션 RAM, 2비트 Cactus Quant 압축을 전제로 설계됐고, 스마트홈, 웨어러블, 소형 로봇, 저가형 기기에서 도구 호출(tool calling), 기기 제어(device use), 구조화 추출을 수행하는 데 초점을 맞춘다.

Needle 1과 무엇이 다른가

기존 needle은 2,600만 파라미터 함수 호출 모델이었다. Needle 2는 파라미터 수가 45M으로 늘었지만 배포 단위는 더 강하게 제품화됐다. 모델, 토크나이저, grammar compiler, CPU별 커널 선택 로직을 하나의 의존성 없는 C++ 바이너리로 묶어 “가중치를 다운로드해 런타임에 얹는 모델”보다 하드웨어 제품에 넣기 쉬운 형태를 지향한다.

항목Needle 2
파라미터45M
파일 크기14MB
세션 RAM28MB
압축CQ2-bit
대상저가형 휴대폰, Raspberry Pi, 마이크로컨트롤러, 웨어러블, 소형 로봇
라이선스Apache 2.0

문제 정의를 좁힌 모델

Needle 2는 일반 채팅 모델이 아니다. 사용자의 자연어 요청과 선언된 도구 스키마를 보고 어떤 함수를 어떤 인자로 호출할지 결정한다. 조명을 켜거나, 로봇을 세 번 움직이거나, 문서에서 필드를 추출하는 일은 방대한 세계 지식보다 스키마에 맞는 구조화된 매핑이 더 중요하다는 가정이다.

이 때문에 모든 응답은 call envelope 형태로 제한된다. 호출할 수 없거나 범위를 벗어난 요청은 빈 호출로 거절한다. 출력은 선언된 스키마에서 컴파일한 byte-level grammar로 제약되어, 모델이 JSON 형식이나 enum 값을 임의로 깨뜨릴 여지를 줄인다.

아키텍처와 추론 최적화

Needle 2는 Simple Attention Network 계열 구조를 사용한다. 공개 설명에서 특히 중요한 부분은 다음이다.

  • 256토큰 sliding window로 KV cache가 세션 길이에 따라 무한히 커지지 않는다.
  • 시스템 프롬프트와 도구 선언은 permanent sink로 고정해 도구 정보를 잊지 않게 만든다.
  • Hadamard MLP와 hashed n-gram table 기반 engram으로 파라미터 대비 대역폭 비용을 줄인다.
  • 가중치는 RAM으로 풀어놓지 않고 2비트 코드를 벡터 레지스터 안에서 확장해 int8 경로로 계산한다.
  • grammar matcher가 가능한 토큰 후보를 미리 좁혀 vocabulary projection 계산을 크게 줄인다.

핵심은 “작은 모델을 나중에 억지로 양자화”한 것이 아니라, 처음부터 CQ2-bit 배포 정밀도와 고정 RAM 조건을 염두에 두고 훈련·추론 엔진을 함께 설계했다는 점이다.

벤치마크 해석

Cactus는 Needle 2를 Google Mobile Actions, DroidCall, Seal-Tools, BFCL v4 single-turn에서 평가했다. Mobile Actions에서는 CQ2-bit 배포 설정으로 63.7% ordered strict exact match를 기록해, f16으로 돌린 FunctionGemma 270M과 비슷한 수준을 보였다고 공개했다. Seal-Tools in-domain/out-of-domain에서는 더 큰 소형 모델보다 함수명 선택과 다중 호출에서 경쟁력 있는 결과를 냈다.

다만 BFCL 전체 점수는 Apple FM이나 LFM2.5 230M보다 낮다. 이는 Needle 2가 범용 API 호출·Java·JavaScript SDK 같은 넓은 함수 호출 범위보다 소비자 기기 액션과 구조화 추출에 특화됐기 때문이다. 따라서 벤치마크 숫자는 “모든 tool calling 모델 대체”가 아니라 “초저메모리 기기 제어 모델”이라는 관점에서 읽어야 한다.

적합한 사용 케이스

  • 화면 없는 웨어러블에서 음성 명령을 앱 액션으로 변환
  • 스마트홈·로봇·자동차·TV 같은 고정 도구 집합 라우팅
  • 문서나 센서 로그에서 typed schema로 값 추출
  • 오프라인·저지연·저전력 조건에서 클라우드 에스컬레이션 전 1차 판단
  • 제품별 도구 vocabulary에 맞춘 초소형 파인튜닝

Needle 2는 신뢰도 점수를 함께 내고, 낮은 확신이나 범위 밖 요청은 클라우드 모델 또는 사용자 재질문으로 넘기는 edge-cloud 협업 구조에 잘 맞다.

관련 문서

  • needle — 26M 파라미터 Needle 1 함수 호출 모델
  • lfm2-5-230m — Liquid AI의 230M 온디바이스 모델
  • local-slm-tips-tool-calling-models — 구조화된 도구 호출을 지원하는 소형 모델 비교
  • local-slm — 로컬 소형 언어 모델 개요
  • agent-device — AI 에이전트가 모바일·데스크톱 앱을 검증하게 하는 디바이스 자동화 CLI

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)