Qwen-Audio-3.0 TTS Plus는 Alibaba Qwen 계열의 고품질 텍스트 음성 변환(text-to-speech) 모델이다. The Decoder 보도에 따르면 Artificial Analysis Speech Arena provider voice 리더보드에서 Elo 1,236으로 Simba 3.2, Gemini 3.1 Flash TTS, Sonic 3.5보다 앞선 점수를 기록했다.
Plus와 Flash의 역할
Qwen-Audio-3.0 TTS는 두 갈래로 나뉜다.
| 모델 | 방향 | 적합한 작업 |
|---|---|---|
| Qwen-Audio-3.0 TTS Flash | 약 300ms 지연 시간의 실시간 상호작용 | 음성 챗봇, 콜센터, 실시간 대화 |
| Qwen-Audio-3.0 TTS Plus | 고품질 음성 합성 | 내레이션, 콘텐츠 더빙, 고품질 음성 출력 |
Plus는 품질 우선 모델이라 속도는 약점이다. 보도 기준 생성 속도는 초당 16자 수준으로, Sonic 3.5의 120자/s, Simba 3.2의 30.2자/s보다 느리다.
주요 기능
- 16개 언어 지원
- Tagalog, Malay, Thai, Vietnamese 등 상대적으로 덜 지원되던 언어 포함
- 중국어 방언 지원
- 자연어로 말투·감정·억양 지시
[angry],[giggles]같은 태그 기반 비언어 신호 제어- 잡음이나 에코가 있는 참조 음성에서도 이전 버전보다 나은 voice cloning 강건성
가격과 운영상 판단
Alibaba Cloud Model Studio 기준 가격은 100만 문자당 $27.60으로 보도됐다. 고품질 모델로는 경쟁력이 있지만, 대량 실시간 변환에서는 속도와 단가를 함께 봐야 한다.
| 우선순위 | 판단 |
|---|---|
| 음성 자연스러움 | Plus 검토 가치 높음 |
| 실시간 응답 | Flash 또는 다른 저지연 TTS와 비교 필요 |
| 대량 배치 변환 | 문자당 가격과 생성 속도 병목 확인 필요 |
| 다국어 콘텐츠 | 16개 언어 지원 때문에 후보군에 넣을 만함 |
누구에게 적합한가
- 다국어 콘텐츠 제작팀: 여러 언어 내레이션을 같은 모델 계열에서 처리하고 싶을 때
- 음성 앱 개발자: 품질 우선 TTS와 실시간 TTS를 같은 공급자에서 비교하고 싶을 때
- 중국어·동남아 언어권 서비스: 방언과 지역 언어 지원이 중요한 경우
- 보이스 클로닝 워크플로: 참조 녹음 품질이 일정하지 않은 환경에서 강건성이 필요할 때
관련 문서
- qwen — Alibaba의 오픈소스 대형 언어 모델 시리즈
- gemini-3-1-flash-tts — 프롬프트로 음색·감정·억양을 조절하는 Google TTS 모델
- moss-tts — 대화형 음성 합성을 위한 오픈 TTS 모델
- offlinetts — 브라우저에서 실행되는 무료 프라이빗 TTS·STT 오디오 도구
참고 자료
- Alibaba’s Qwen Audio 3.0 TTS Plus tops the competition in the text-to-speech rankings — The Decoder (2026-07-21)