AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Qwen – Alibaba의 오픈 가중치·API 대형 언어 모델 시리즈

Qwen(千问)은 Alibaba Cloud가 개발·공개하는 대형 언어 모델(LLM) 시리즈다. 텍스트 생성, 코드 작성, 이미지·비디오 이해, 문서 처리 등 다양한 기능을 지원하며, 오픈소스 가중치와 API 모두 제공한다. 2026년 4월 기준 최신 모델인 Qwen3.6-Max-Preview가 SWE-bench Pro, Terminal-Bench 2.0 등 6개 주요 코딩 벤치마크에서 1위를 기록했다.

Qwen3.8: 2.4T MoE를 공개 가중치로

Qwen3.8-2.4T-A95B는 총 2.4조 파라미터 중 950억 개를 토큰마다 활성화하는 혼합 전문가(MoE) 모델이다. 네이티브 컨텍스트 길이는 262,144토큰이며 최대 약 101만 토큰까지 확장할 수 있다. 512개 전문가 중 라우팅 전문가 10개와 공유 전문가 1개를 사용한다.

동일 기반의 관리형 Qwen3.8-Max는 비전 입력, 비추론 모드, 기본 100만 토큰 컨텍스트, 내장 도구를 추가로 제공한다. 자체 인프라 없이 바로 쓰려면 Max/API를, 대규모 가중치 배포·서빙을 통제해야 하면 A95B를 검토하는 구분이 현실적이다. reasoning_effort로 추론 깊이를 조절하고 preserve_thinking으로 이전 추론 문맥을 유지할 수 있어, 장기 에이전트에서 비용과 완성도를 함께 조정할 수 있다.

Qwen3.8-27B: 개인 장비에서 쓸 수 있는 밀집 모델

Qwen3.8-27B는 텍스트·이미지 입력과 텍스트 출력을 지원하는 27B 밀집(dense) 공개 가중치 모델이다. Apache 2.0 라이선스와 256K 컨텍스트 창을 제공하며, Artificial Analysis는 2026년 8월 기준 Intelligence Index 52점을 기록했다고 집계했다. 27B라는 크기는 초대형 MoE보다 로컬 실행의 출발점으로 현실적이지만, 밀집 모델 특성상 메모리 대역폭이 속도를 좌우한다.

실사용에서는 기본 xhigh 추론 수준을 그대로 쓰지 않는 편이 좋다. Simon Willison의 로컬 시험에서는 간단한 SVG 요청에도 긴 사고 토큰을 써서 응답이 지연됐으며, low 또는 reasoning 비활성화가 속도·비용의 합리적인 시작점이었다. 복잡한 코드·비전 작업에서만 추론 수준을 다시 높이고, 그 차이를 같은 입력으로 측정해야 한다.

항목Qwen3.8-27B에서의 의미
가중치·라이선스27B 공개 가중치, Apache 2.0
입력·컨텍스트텍스트·이미지 입력, 256K 토큰
로컬 실사용Q4_K_M 양자화가 약 17GB 수준이라 고사양 노트북·워크스테이션에서 시험 가능
속도 병목로컬에서 약 15–30 tok/s 관찰 사례가 있어 대화형 주력 모델로는 느릴 수 있음
가속 선택지MTP speculative decoding으로 동일 사례에서 처리량이 약 72% 개선됨

Qwen3.6-Max-Preview

Qwen3.6-Plus의 후속 독점 모델 미리보기로, 세 가지 영역에서 전 버전 대비 유의미한 개선을 이뤘다.

주요 개선 사항 (vs Qwen3.6-Plus)

영역벤치마크개선 폭
에이전트 코딩SkillsBench+9.9
SciCode+6.3
NL2Repo+5.0
Terminal-Bench 2.0+3.8
세계 지식QwenChineseBench+5.3
SuperGPQA+2.3
지시 따르기ToolcallFormatIFBench+2.8

6개 주요 코딩 벤치마크(SWE-bench Pro, Terminal-Bench 2.0, SkillsBench, QwenClawBench, QwenWebBench, SciCode)에서 최고 점수 기록.

접근 방법

  • Qwen Studio: chat.qwen.ai에서 대화형 사용
  • API: Alibaba Cloud Model Studio에서 qwen3.6-max-preview 모델명으로 호출 (OpenAI 호환 프로토콜 지원)
from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.6-max-preview",
    messages=[{"role": "user", "content": "..."}],
    extra_body={"enable_thinking": True},
    stream=True,
)

에이전트 작업 권장 설정: preserve_thinking: True — 이전 턴의 추론 내용을 메시지에 유지해 멀티턴 에이전트 성능을 높임

API 리전: 베이징·싱가포르·미국(버지니아) 엔드포인트 선택 가능.

Qwen3.6-27B: 27B 밀집 모델로 플래그십급 코딩

2026년 4월 22일 공개된 Qwen3.6-27B는 27B 파라미터 밀집 모델(dense model)로 이전 플래그십이던 Qwen3.5-397B-A17B(총 397B, 활성 17B MoE)를 모든 주요 코딩 벤치마크에서 넘어섰다.

항목Qwen3.5-397B-A17BQwen3.6-27B
모델 크기807 GB55.6 GB
Q4_K_M 양자화 크기16.8 GB
성능이전 플래그십전 플래그십 초과

Simon Willison이 M 시리즈 Mac에서 llama.cpp(llama-server)를 사용해 Q4_K_M 양자화 버전을 실행하고 SVG 생성을 테스트한 결과 “16.8GB 로컬 모델 중 최고 수준”이라는 평가를 남겼다.

# llama.cpp로 로컬 실행
brew install llama.cpp

llama-server \
    -hf unsloth/Qwen3.6-27B-GGUF:Q4_K_M \
    --no-mmproj --fit on -np 1 -c 65536 \
    --cache-ram 4096 -ctxcp 2 --jinja \
    --temp 0.6 --top-p 0.95 --top-k 20 \
    --reasoning on \
    --chat-template-kwargs '{"preserve_thinking": true}'

성능(Q4_K_M, M 시리즈 Mac): 약 25 tok/s 생성, 6,500 토큰 생성에 약 4분.

Q8 + MTP 로컬 개발 실사용 평가

Quesma의 Piotr Migdal은 Qwen3.6-27B를 로컬 개발의 “sweet spot”으로 평가했다. 핵심 비교는 MoE인 Qwen3.6-35B-A3B가 더 빠를 수 있지만, 27B dense 모델이 지시 준수와 코딩 작업 품질에서 더 믿을 만했다는 점이다.

권장 실행 예시는 unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0를 llama.cpp llama-server로 띄우는 방식이다.

llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
  --spec-type draft-mtp -ngl 999 -fa on -c 65536 --port 8080

기사의 실측 환경(MacBook Max M5 128GB)에서는 8-bit Qwen3.6-27B가 약 30 tokens/s 수준으로 동작했다고 보고됐다. 48GB급 Apple Silicon 공유 메모리에서도 두 Qwen 3.6 변형을 실행할 수 있고, consumer NVIDIA RTX에서는 더 강한 양자화가 필요하지만 속도는 더 빠를 수 있다는 설명이다.

모델 라인업

모델특징
Qwen3.8-2.4T-A95B총 2.4T·활성 95B MoE 공개 가중치, 262K 네이티브 컨텍스트
Qwen3.7-Max2026년 5월 발표, 장시간 에이전트 실행·코딩·복잡한 추론을 겨냥한 Model Studio 제공 예정 모델
Qwen-AgentWorld에이전트 환경을 언어로 시뮬레이션하는 월드 모델 연구
Qwen3.6-Max-Preview2026년 4월 미리보기, 에이전트 코딩·지식·지시 따르기 강화
Qwen3.6-27B27B 밀집 모델, 플래그십급 코딩, 로컬 실행 가능 (55.6 GB)
Qwen3.6-PlusMax-Preview의 전 버전, 기준선 모델
Qwen-VL비전-언어 멀티모달
Qwen-Coder코드 특화
Qwen-Audio오디오 이해

주요 특징

  • 광범위한 모달리티: 텍스트·코드·이미지·비디오 이해, 이미지 생성, 문서 처리
  • 웹 검색 통합: 실시간 정보 검색 기능 내장
  • 툴 사용 및 아티팩트: 함수 호출(tool use), 코드 실행, 구조화 출력 지원
  • OpenAI + Anthropic 호환 API: 기존 코드 마이그레이션 부담 최소화
  • 오픈소스 + 상용 이중 전략: 소형 모델은 Apache 2.0으로 공개, 대형 모델은 API 형태

사용 대상 및 케이스

  • 에이전트 코딩 파이프라인 구축자: SWE-bench 수준의 자율 코딩 에이전트에 최적화된 모델 탐색 중인 팀
  • 기업: OpenAI 호환 API로 기존 인프라를 그대로 유지하면서 Qwen으로 전환
  • 연구자: 오픈소스 가중치를 파인튜닝해 특정 도메인 특화 모델 개발
  • 멀티모달 앱 빌더: 이미지/비디오 이해가 필요한 서비스에 Qwen-VL 활용

라이선스

모델별 상이. 소형 오픈소스 모델은 Apache 2.0 또는 자체 Qwen 라이선스 적용. Qwen3.6-Max-Preview는 독점 모델(API 전용).

관련 문서

  • qwen-3-8-tutorial-local-running — Qwen3.8 양자화 모델을 로컬에서 실행하는 절차
  • kimi — 비슷한 포지션의 오픈소스 코딩 특화 모델 Kimi K2.6
  • agent-harness — Qwen3.6-Max-Preview를 에이전트 하네스에 통합하는 방법
  • lightrag — Qwen 모델과 함께 사용 가능한 RAG 시스템
  • flashqla — Qwen 팀이 공개한 GDN 선형 어텐션용 고성능 CUDA 커널 라이브러리
  • cybersecqwen-4b — Qwen 기반 방어적 사이버보안 특화 소형 로컬 실행 모델
  • local-slm-tips-m4-24gb — M4 24GB MacBook에서 Qwen 3.5-9B Q4 실용 운용 팁
  • qwen-image-2 — 2K 생성·편집과 타이포그래피에 강한 Qwen 이미지 모델
  • qwen-image-3-0 — 조밀한 텍스트와 레이아웃에 강한 이미지 생성 모델
  • qwen-audio-3-0-tts-plus — 음성 품질 1위를 노리는 Alibaba TTS 모델
  • qwen-3-7 — 장시간 에이전트 실행을 겨냥한 Alibaba의 차세대 모델
  • qwen-agentworld — 범용 에이전트를 위한 언어 월드 모델
  • qwen-tutorial-local-mcp — Qwen3.6과 MCP로 로컬 AI 시스템 만들기
  • bonsai-27b — Qwen3.6 27B 기반 1비트·삼진 가중치 온디바이스 모델

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)