qwen의 Qwen3.8 계열은 비전과 사고(thinking)를 지원하고 기본 256K, 최대 약 100만 토큰 컨텍스트를 안내한다. 이 글은 소형 27B와 초대형 2.4T-A95B를 혼동하지 않고, 하드웨어에 맞는 양자화를 골라 Unsloth Desktop 또는 llama.cpp로 실행하는 방법을 정리한다.
먼저 모델 크기를 확인한다
| 모델·양자화 | 필요 메모리/저장공간 안내 | 의미 |
|---|---|---|
| Qwen3.8-27B | 16GB 이상 VRAM 또는 RAM | 개인 PC에서 가장 현실적인 출발점 |
| 2.4T-A95B BF16 | 4.9TB | 무손실 가중치, 일반 로컬 환경에는 비현실적 |
| 2.4T-A95B Q8_0 | 2.6TB | 품질 우선 양자화 |
| 2.4T-A95B 1-bit Dynamic GGUF | 약 397GB | 접근성 우선, 원본 안내상 최소 450GB RAM 권장 |
2.4T-A95B는 전체 파라미터 2.4T, 활성 파라미터 95B의 MoE 모델이다. 양자화 파일 크기와 RAM+VRAM 합계가 비슷해야 디스크 오프로딩으로 인한 심한 속도 저하를 피할 수 있다. 대형 모델을 꼭 써야 하는 이유가 없다면 27B부터 품질을 확인하는 편이 낫다.
방법 1: Unsloth Desktop으로 실행하기
GUI가 편하거나 여러 GPU·RAM 오프로딩을 자동 처리하고 싶다면 Unsloth Desktop이 간단하다.
- 운영체제에 맞는 Unsloth Desktop을 설치한다.
- Chat 또는 Model hub에서
Qwen 3.8을 검색한다. - 보유 메모리에 맞는 양자화 파일을 내려받는다.
- 모델을 열고 컨텍스트 길이와 chat template을 확인한 뒤 실행한다.
원본 가이드는 Open Qwen3.8 모델을 thinking-only, Qwen3.8-Max를 hybrid로 구분한다. 기본 샘플링 값은 temperature=1.0, top_p=0.95, top_k=20, min_p=0.0이며, Desktop에서는 추론 수준도 조절할 수 있다.
방법 2: llama.cpp로 실행하기
Q1_0 같은 특수 초저비트 양자화를 쓰려면 Unsloth의 iq1-narrow 브랜치가 필요하다. 표준 IQ1_S 등은 일반 llama.cpp 빌드로도 된다.
git clone --branch iq1-narrow https://github.com/unslothai/llama.cpp
cmake llama.cpp -B llama.cpp/build -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first \
--target llama-cli llama-mtmd-cli llama-server llama-gguf-split
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \
--local-dir unsloth/Qwen3.8-2.4T-A95B-GGUF --include "*Q1_0*"Apple Silicon에서는 CUDA 옵션을 끄면 Metal 지원이 기본으로 사용된다. 다운로드한 첫 번째 분할 파일을 지정해 실행한다.
./llama.cpp/llama-cli \
--model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-Q1_0/Qwen3.8-2.4T-A95B-UD-Q1_0-00001-of-00010.gguf \
--temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0실행 전 체크리스트
- 모델 파일 하나가 아니라 분할 GGUF 전체와 여유 디스크를 확보한다.
- 비전 입력·도구 호출·100만 토큰 컨텍스트를 모두 켜기 전에 짧은 텍스트 작업으로 메모리와 속도를 측정한다.
- 실험용 초저비트 양자화는 품질 손실과 호환성 위험을 검증한 뒤 업무에 사용한다.
관련 문서
- qwen — Alibaba의 오픈 가중치·API 대형 언어 모델 시리즈
- unsloth-studio — 로컬 모델 실행과 파인튜닝을 다루는 Unsloth 환경
- local-llm-tips-ollama-lm-studio-llama-cpp — 로컬 LLM 실행 도구 선택 기준
참고 자료
- Qwen3.8 – How to Run Locally — Unsloth Documentation (2026-08-14)