AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Neutrino-1 8B – 3.88GB 단일 파일로 배포되는 ternary 계열 8B 로컬 모델

Neutrino-1 8B는 Fermion Research가 공개한 8.19B 파라미터 decoder-only transformer다. Qwen3-8B를 기반으로 하며, 252개 transformer linear weight를 proprietary ternary-family format으로 저장해 3.88GB 단일 컨테이너로 배포한다.

핵심 특징

일반 fp16 8B 모델은 약 16GB급 weight artifact가 필요하다. Neutrino-1 8B는 weight를 bit-packed 상태로 저장하고 matrix kernel 안에서 바로 decode하므로, 실행 경로에서 fp16/fp32 weight material로 풀어놓지 않는다. 작은 working set은 단일 스트림 decode에서 메모리 대역폭 병목을 줄인다.

항목내용
기반 모델Qwen3-8B, Apache-2.0
파라미터8,190,735,360
레이어36 decoder layers
컨텍스트40,960 tokens
배포 파일3.88GB container, 2.56GB coded transport
KV cache288KiB/token, 4k에서 약 1.21GB
라이선스Apache-2.0 오픈 가중치

실행 경로

Neutrino-1 8B는 하나의 artifact를 여러 런타임에서 쓴다는 점을 강조한다.

  • pip engine: pip install fermion-research 후 native binary로 CPU 실행
  • GGUF pack + llama.cpp fork: Fermion의 fork에서 CUDA full offload 지원
  • MLX pack: Apple Silicon에서 custom Metal kernel로 실행
  • OpenAI 호환 서버: fermion serve로 로컬 API 제공
pip install fermion-research
fermion chat --model fermionresearch/Neutrino-8B
fermion serve --model fermionresearch/Neutrino-8B

성능과 speculative decoding

공개 수치 기준 단일 스트림 greedy decode는 H100 80GB에서 396 tok/s, NVIDIA L4에서 30.7 tok/s, Apple M5 MacBook optimized 경로에서 33.7 tok/s, Apple M5 CPU-only 9 threads에서 24.9 tok/s다.

Neutrino-1 0.6B를 draft model로 함께 쓰는 speculative decoding도 제공한다. 8B가 0.6B draft의 토큰을 검증하고 일치하는 prefix만 채택하므로 출력은 plain greedy와 동일하게 유지된다. 공개 검증에서는 27,648개 연속 토큰에서 divergence가 없었다.

사용 대상

  • 8GB GPU나 16GB 노트북에서 8B급 모델을 로컬 실행하려는 개발자
  • local-slm을 API 서버, CLI, 데스크톱 앱에 내장하려는 제품 팀
  • GGUF, MLX, native CPU 경로의 모델 배포 형식을 비교하려는 연구자
  • speculative decoding을 작은 draft model과 함께 실험하려는 LLMOps 팀

주의할 점

Neutrino의 packed format은 범용 생태계와 완전히 호환되는 표준 양자화 포맷이 아니다. GGUF pack도 stock llama.cpp, Ollama, LM Studio가 아니라 Fermion fork가 필요하다. 도입 전에는 런타임 의존성, long-context KV cache, tool calling 품질, 한국어 성능을 별도 평가해야 한다.

관련 문서

  • local-slm — 내 컴퓨터에서 실행하는 소형 언어 모델 개요
  • qwen — Alibaba Qwen 모델 생태계
  • lfm2-5-230m — 라즈베리파이와 스마트폰에서 도는 230M 온디바이스 모델
  • bonsai-27b — 스마트폰까지 내려온 27B급 1비트·삼진 가중치 모델

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)