Deltafin은 kimi-k3처럼 전체 가중치가 워크스테이션 메모리를 훨씬 넘는 대형 MoE 모델을 로컬에서 실행해보는 연구 프로젝트다. 핵심 아이디어는 MoE가 매 토큰마다 모든 expert를 쓰지 않는다는 점을 이용해 resident spine은 로컬에 두고, 라우팅된 expert만 디스크나 네트워크 캐시에서 읽는 것이다.
왜 흥미로운가
Kimi K3는 약 1.56TB 가중치를 가진 2.8T 파라미터 MoE 모델이다. 일반적인 로컬 LLM 실행 관점에서는 비현실적인 크기지만, Deltafin은 “빠른 제품 추론”보다 “단일 머신에서 실제로 돌아가게 만드는 경로”를 보여준다.
| 영역 | Deltafin의 접근 |
|---|---|
| 모델 | Kimi K3 2.8T MoE |
| 플랫폼 | Apple Silicon macOS, Linux x86-64/aarch64 |
| 가속 경로 | MPS, CUDA, CPU 자동 선택 |
| expert 형식 | MXFP4 native kernel |
| 설치 모드 | 전체 다운로드 약 1.7TB 또는 스트리밍 캐시 약 215GB |
| API | OpenAI 호환 로컬 서버 제공 |
관리자 기준 측정치는 64GB M1 Max에서 0.0687 token/s, 즉 약 14.6초/token이다. 느리지만, 첫 세대 Apple Silicon 워크스테이션에서 2.8T MoE를 실제로 생성까지 수행했다는 점이 중요하다.
작동 방식
Deltafin은 K3 가중치를 크게 두 부분으로 본다.
- Resident spine: attention, shared expert, latent projection, embedding 등 약 114GB. int8 변환 후 레이어 단위로 로드한다.
- Routed experts: 82,432개 expert, 약 1.45TB. 각 토큰에서 92개 레이어마다 16개 expert만 선택되므로 선택된 expert만 읽는다.
- 캐시 전략: 전체 expert를 로컬 SSD에 두는 모드와 Hugging Face에서 HTTP range request로 필요한 expert를 받아오는 스트리밍 모드를 지원한다.
- 최적화: MXFP4 dequant+GEMV fused kernel, double-buffered layer loading, 이전 토큰 expert prefetch, int8 spine, n-gram speculation을 조합한다.
사용 흐름
git clone https://github.com/gavamedia/deltafin.git
cd deltafin
python3 -m venv venv
./venv/bin/pip install torch numpy safetensors tiktoken ml_dtypes blobfile "transformers==4.56.2" einops tokenizers
python3 tools/build_native.py
./venv/bin/python tools/setup_k3.py --fullOpenAI 호환 서버도 제공한다.
./venv/bin/python tools/serve_openai.py --port 8000사용 대상
- 대형 MoE 모델의 로컬 추론 병목을 연구하는 엔지니어
- Apple Silicon 또는 단일 Linux 워크스테이션에서 극단적 로컬 LLM 실험을 해보고 싶은 사용자
- kimi-k3의 Kimi Delta Attention, MoE 라우팅, expert 캐싱을 실제 경로로 관찰하려는 연구자
- 제품 도입 전 로컬 실행 가능성과 I/O 병목을 감으로 확인하려는 플랫폼 팀
한계
Deltafin은 상용 추론 서버라기보다 투명한 연구 실험에 가깝다. 전체 설치에는 약 1.7TB 디스크가 필요하고, 스트리밍 모드는 네트워크 병목 때문에 훨씬 느리다. 실제 서비스용으로 쓰려면 품질 회귀 평가, CUDA MXFP4 커널, KV 캐시 비용, 긴 답변 지연을 별도로 검증해야 한다.
관련 문서
- kimi-k3 — Deltafin이 실행 대상으로 삼는 Kimi K3 모델
- local-slm — 로컬 모델 실행의 기본 개념
- unified-memory — Apple Silicon 로컬 LLM에서 중요한 통합 메모리 구조
- model-routing — 대형 로컬 모델과 클라우드 모델을 함께 쓰는 운영 계층
참고 자료
- gavamedia/deltafin — GitHub 공식 저장소