AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

LFM2.5-2.6B – 휴대폰과 CPU에서 도구 호출을 수행하는 온디바이스 에이전트 모델

LFM2.5-2.6B는 Liquid AI가 공개한 26억 파라미터급 오픈 가중치 언어 모델이다. 단순 채팅보다 로컬 에이전트 워크플로에 초점을 맞춰, 계획 수립, 도구 호출(tool calling), 다단계 작업 수행을 휴대폰·CPU·소비자 GPU에서 실행하도록 훈련됐다.

왜 2.6B 에이전트 모델인가

에이전트 워크플로의 모든 단계를 대형 클라우드 모델에 맡기면 비용, 지연, 개인정보 문제가 동시에 커진다. 반면 로컬 모델은 토큰당 비용이 사실상 0에 가까워 백그라운드 작업, 병렬 탐색, 반복 검증을 더 과감하게 돌릴 수 있다.

LFM2.5-2.6B는 이 지점을 겨냥한다. Liquid AI는 이 모델이 2.5GB 미만 메모리에서 동작하고, M5 Max에서 220 tokens/s, Ryzen AI Max+ 395에서 113 tokens/s, 휴대폰에서도 30 tokens/s 수준을 낸다고 설명한다.

훈련 파이프라인

단계역할
사전학습약 34T 토큰, 128K vocabulary, 128K context-extension phase
SFTagentic tasks, reasoning, tool use 중심의 2단계 지도 파인튜닝
Teacher Specializationinstruction, math, knowledge, code, tool use, long context별 specialist teacher 학습
MOPD학생 모델이 자기 policy로 rollout하고 domain teacher가 token-level feedback 제공
Agentic RLHermes Agent, OpenClaw 등 실제 agent harness와 sandbox 안에서 GRPO 기반 학습

흥미로운 점은 최종 강화학습이 별도 toy environment가 아니라 실제 에이전트 하네스와 샌드박스 위에서 수행된다는 점이다. 모델은 도구 호출, 코드 실행, 문서 처리, 분석 작업을 여러 턴에 걸쳐 수행하며 outcome reward를 받는다.

벤치마크 해석

Liquid AI의 공개 표에 따르면 LFM2.5-2.6B는 instruction following과 tool use 계열에서 더 큰 Gemma·Qwen 모델과 경쟁한다. BFCLv4 56.88, ToolSandbox 77.83, τ³-Bench Banking 5.67을 기록했고, BrowseComp+ OpenClaw도 26.89로 Gemma 4 계열보다 높게 보고됐다.

다만 coding-heavy workload에서는 더 큰 모델이 여전히 유리하다. LiveCodeBenchv6에서는 59.41로 경쟁력은 있지만, Qwen3.5-9B와 Gemma-4-E4B-it이 더 높은 점수를 낸다. 따라서 LFM2.5-2.6B는 “모든 것을 대체하는 소형 모델”보다는 반복적이고 비용 민감한 로컬 에이전트 단계에 맞다.

실행 환경

LFM2.5-2.6B는 공개 시점부터 여러 추론 런타임을 지원한다.

런타임용도
llama.cpp / GGUFCPU·엣지 디바이스 로컬 실행
MLXApple Silicon 최적화
vLLM / SGLangGPU 기반 프로덕션 서빙
ONNX다양한 가속기와 앱 내 배포

로컬 에이전트로 쓰려면 OpenAI 호환 endpoint로 모델을 띄운 뒤 Hermes Agent, OpenClaw, Pi 같은 harness가 그 endpoint를 보게 만들면 된다.

적합한 사용 케이스

  • 온디바이스 개인 에이전트: 개인정보가 민감한 작업을 기기 안에서 처리
  • 고빈도 tool routing: 대형 모델 호출 전 로컬에서 의도 분류와 도구 선택 수행
  • 백그라운드 자동화: 비용 부담 없이 많은 짧은 작업을 병렬 실행
  • 엣지 앱: 네트워크가 불안정하거나 지연이 중요한 환경에서 기본 에이전트 기능 제공

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)