Neutrino-1 8B는 Fermion Research가 공개한 8.19B 파라미터 decoder-only transformer다. Qwen3-8B를 기반으로 하며, 252개 transformer linear weight를 proprietary ternary-family format으로 저장해 3.88GB 단일 컨테이너로 배포한다.
핵심 특징
일반 fp16 8B 모델은 약 16GB급 weight artifact가 필요하다. Neutrino-1 8B는 weight를 bit-packed 상태로 저장하고 matrix kernel 안에서 바로 decode하므로, 실행 경로에서 fp16/fp32 weight material로 풀어놓지 않는다. 작은 working set은 단일 스트림 decode에서 메모리 대역폭 병목을 줄인다.
| 항목 | 내용 |
|---|---|
| 기반 모델 | Qwen3-8B, Apache-2.0 |
| 파라미터 | 8,190,735,360 |
| 레이어 | 36 decoder layers |
| 컨텍스트 | 40,960 tokens |
| 배포 파일 | 3.88GB container, 2.56GB coded transport |
| KV cache | 288KiB/token, 4k에서 약 1.21GB |
| 라이선스 | Apache-2.0 오픈 가중치 |
실행 경로
Neutrino-1 8B는 하나의 artifact를 여러 런타임에서 쓴다는 점을 강조한다.
- pip engine:
pip install fermion-research후 native binary로 CPU 실행 - GGUF pack + llama.cpp fork: Fermion의 fork에서 CUDA full offload 지원
- MLX pack: Apple Silicon에서 custom Metal kernel로 실행
- OpenAI 호환 서버:
fermion serve로 로컬 API 제공
pip install fermion-research
fermion chat --model fermionresearch/Neutrino-8B
fermion serve --model fermionresearch/Neutrino-8B성능과 speculative decoding
공개 수치 기준 단일 스트림 greedy decode는 H100 80GB에서 396 tok/s, NVIDIA L4에서 30.7 tok/s, Apple M5 MacBook optimized 경로에서 33.7 tok/s, Apple M5 CPU-only 9 threads에서 24.9 tok/s다.
Neutrino-1 0.6B를 draft model로 함께 쓰는 speculative decoding도 제공한다. 8B가 0.6B draft의 토큰을 검증하고 일치하는 prefix만 채택하므로 출력은 plain greedy와 동일하게 유지된다. 공개 검증에서는 27,648개 연속 토큰에서 divergence가 없었다.
사용 대상
- 8GB GPU나 16GB 노트북에서 8B급 모델을 로컬 실행하려는 개발자
- local-slm을 API 서버, CLI, 데스크톱 앱에 내장하려는 제품 팀
- GGUF, MLX, native CPU 경로의 모델 배포 형식을 비교하려는 연구자
- speculative decoding을 작은 draft model과 함께 실험하려는 LLMOps 팀
주의할 점
Neutrino의 packed format은 범용 생태계와 완전히 호환되는 표준 양자화 포맷이 아니다. GGUF pack도 stock llama.cpp, Ollama, LM Studio가 아니라 Fermion fork가 필요하다. 도입 전에는 런타임 의존성, long-context KV cache, tool calling 품질, 한국어 성능을 별도 평가해야 한다.
관련 문서
- local-slm — 내 컴퓨터에서 실행하는 소형 언어 모델 개요
- qwen — Alibaba Qwen 모델 생태계
- lfm2-5-230m — 라즈베리파이와 스마트폰에서 도는 230M 온디바이스 모델
- bonsai-27b — 스마트폰까지 내려온 27B급 1비트·삼진 가중치 모델
참고 자료
- Neutrino-1 8B — Fermion Research (2026-07-27)