AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Deltafin – 단일 워크스테이션에서 Kimi K3 2.8T MoE를 실행하는 로컬 추론 실험

Deltafinkimi-k3처럼 전체 가중치가 워크스테이션 메모리를 훨씬 넘는 대형 MoE 모델을 로컬에서 실행해보는 연구 프로젝트다. 핵심 아이디어는 MoE가 매 토큰마다 모든 expert를 쓰지 않는다는 점을 이용해 resident spine은 로컬에 두고, 라우팅된 expert만 디스크나 네트워크 캐시에서 읽는 것이다.

왜 흥미로운가

Kimi K3는 약 1.56TB 가중치를 가진 2.8T 파라미터 MoE 모델이다. 일반적인 로컬 LLM 실행 관점에서는 비현실적인 크기지만, Deltafin은 “빠른 제품 추론”보다 “단일 머신에서 실제로 돌아가게 만드는 경로”를 보여준다.

영역Deltafin의 접근
모델Kimi K3 2.8T MoE
플랫폼Apple Silicon macOS, Linux x86-64/aarch64
가속 경로MPS, CUDA, CPU 자동 선택
expert 형식MXFP4 native kernel
설치 모드전체 다운로드 약 1.7TB 또는 스트리밍 캐시 약 215GB
APIOpenAI 호환 로컬 서버 제공

관리자 기준 측정치는 64GB M1 Max에서 0.0687 token/s, 즉 약 14.6초/token이다. 느리지만, 첫 세대 Apple Silicon 워크스테이션에서 2.8T MoE를 실제로 생성까지 수행했다는 점이 중요하다.

작동 방식

Deltafin은 K3 가중치를 크게 두 부분으로 본다.

  • Resident spine: attention, shared expert, latent projection, embedding 등 약 114GB. int8 변환 후 레이어 단위로 로드한다.
  • Routed experts: 82,432개 expert, 약 1.45TB. 각 토큰에서 92개 레이어마다 16개 expert만 선택되므로 선택된 expert만 읽는다.
  • 캐시 전략: 전체 expert를 로컬 SSD에 두는 모드와 Hugging Face에서 HTTP range request로 필요한 expert를 받아오는 스트리밍 모드를 지원한다.
  • 최적화: MXFP4 dequant+GEMV fused kernel, double-buffered layer loading, 이전 토큰 expert prefetch, int8 spine, n-gram speculation을 조합한다.

사용 흐름

git clone https://github.com/gavamedia/deltafin.git
cd deltafin
python3 -m venv venv
./venv/bin/pip install torch numpy safetensors tiktoken ml_dtypes blobfile "transformers==4.56.2" einops tokenizers
python3 tools/build_native.py
./venv/bin/python tools/setup_k3.py --full

OpenAI 호환 서버도 제공한다.

./venv/bin/python tools/serve_openai.py --port 8000

사용 대상

  • 대형 MoE 모델의 로컬 추론 병목을 연구하는 엔지니어
  • Apple Silicon 또는 단일 Linux 워크스테이션에서 극단적 로컬 LLM 실험을 해보고 싶은 사용자
  • kimi-k3의 Kimi Delta Attention, MoE 라우팅, expert 캐싱을 실제 경로로 관찰하려는 연구자
  • 제품 도입 전 로컬 실행 가능성과 I/O 병목을 감으로 확인하려는 플랫폼 팀

한계

Deltafin은 상용 추론 서버라기보다 투명한 연구 실험에 가깝다. 전체 설치에는 약 1.7TB 디스크가 필요하고, 스트리밍 모드는 네트워크 병목 때문에 훨씬 느리다. 실제 서비스용으로 쓰려면 품질 회귀 평가, CUDA MXFP4 커널, KV 캐시 비용, 긴 답변 지연을 별도로 검증해야 한다.

관련 문서

  • kimi-k3 — Deltafin이 실행 대상으로 삼는 Kimi K3 모델
  • local-slm — 로컬 모델 실행의 기본 개념
  • unified-memory — Apple Silicon 로컬 LLM에서 중요한 통합 메모리 구조
  • model-routing — 대형 로컬 모델과 클라우드 모델을 함께 쓰는 운영 계층

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)