AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Qwen 3.8 튜토리얼 – 로컬 양자화 모델을 Unsloth·llama.cpp로 실행하기

qwen의 Qwen3.8 계열은 비전과 사고(thinking)를 지원하고 기본 256K, 최대 약 100만 토큰 컨텍스트를 안내한다. 이 글은 소형 27B와 초대형 2.4T-A95B를 혼동하지 않고, 하드웨어에 맞는 양자화를 골라 Unsloth Desktop 또는 llama.cpp로 실행하는 방법을 정리한다.

먼저 모델 크기를 확인한다

모델·양자화필요 메모리/저장공간 안내의미
Qwen3.8-27B16GB 이상 VRAM 또는 RAM개인 PC에서 가장 현실적인 출발점
2.4T-A95B BF164.9TB무손실 가중치, 일반 로컬 환경에는 비현실적
2.4T-A95B Q8_02.6TB품질 우선 양자화
2.4T-A95B 1-bit Dynamic GGUF약 397GB접근성 우선, 원본 안내상 최소 450GB RAM 권장

2.4T-A95B는 전체 파라미터 2.4T, 활성 파라미터 95B의 MoE 모델이다. 양자화 파일 크기와 RAM+VRAM 합계가 비슷해야 디스크 오프로딩으로 인한 심한 속도 저하를 피할 수 있다. 대형 모델을 꼭 써야 하는 이유가 없다면 27B부터 품질을 확인하는 편이 낫다.

방법 1: Unsloth Desktop으로 실행하기

GUI가 편하거나 여러 GPU·RAM 오프로딩을 자동 처리하고 싶다면 Unsloth Desktop이 간단하다.

  1. 운영체제에 맞는 Unsloth Desktop을 설치한다.
  2. Chat 또는 Model hub에서 Qwen 3.8을 검색한다.
  3. 보유 메모리에 맞는 양자화 파일을 내려받는다.
  4. 모델을 열고 컨텍스트 길이와 chat template을 확인한 뒤 실행한다.

원본 가이드는 Open Qwen3.8 모델을 thinking-only, Qwen3.8-Max를 hybrid로 구분한다. 기본 샘플링 값은 temperature=1.0, top_p=0.95, top_k=20, min_p=0.0이며, Desktop에서는 추론 수준도 조절할 수 있다.

방법 2: llama.cpp로 실행하기

Q1_0 같은 특수 초저비트 양자화를 쓰려면 Unsloth의 iq1-narrow 브랜치가 필요하다. 표준 IQ1_S 등은 일반 llama.cpp 빌드로도 된다.

git clone --branch iq1-narrow https://github.com/unslothai/llama.cpp
cmake llama.cpp -B llama.cpp/build -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first \
  --target llama-cli llama-mtmd-cli llama-server llama-gguf-split

pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \
  --local-dir unsloth/Qwen3.8-2.4T-A95B-GGUF --include "*Q1_0*"

Apple Silicon에서는 CUDA 옵션을 끄면 Metal 지원이 기본으로 사용된다. 다운로드한 첫 번째 분할 파일을 지정해 실행한다.

./llama.cpp/llama-cli \
  --model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-Q1_0/Qwen3.8-2.4T-A95B-UD-Q1_0-00001-of-00010.gguf \
  --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

실행 전 체크리스트

  • 모델 파일 하나가 아니라 분할 GGUF 전체와 여유 디스크를 확보한다.
  • 비전 입력·도구 호출·100만 토큰 컨텍스트를 모두 켜기 전에 짧은 텍스트 작업으로 메모리와 속도를 측정한다.
  • 실험용 초저비트 양자화는 품질 손실과 호환성 위험을 검증한 뒤 업무에 사용한다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)