AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Qwen-Audio-3.0 TTS Plus – 음성 품질 1위를 노리는 Alibaba TTS 모델

Qwen-Audio-3.0 TTS Plus는 Alibaba Qwen 계열의 고품질 텍스트 음성 변환(text-to-speech) 모델이다. The Decoder 보도에 따르면 Artificial Analysis Speech Arena provider voice 리더보드에서 Elo 1,236으로 Simba 3.2, Gemini 3.1 Flash TTS, Sonic 3.5보다 앞선 점수를 기록했다.

Plus와 Flash의 역할

Qwen-Audio-3.0 TTS는 두 갈래로 나뉜다.

모델방향적합한 작업
Qwen-Audio-3.0 TTS Flash약 300ms 지연 시간의 실시간 상호작용음성 챗봇, 콜센터, 실시간 대화
Qwen-Audio-3.0 TTS Plus고품질 음성 합성내레이션, 콘텐츠 더빙, 고품질 음성 출력

Plus는 품질 우선 모델이라 속도는 약점이다. 보도 기준 생성 속도는 초당 16자 수준으로, Sonic 3.5의 120자/s, Simba 3.2의 30.2자/s보다 느리다.

주요 기능

  • 16개 언어 지원
  • Tagalog, Malay, Thai, Vietnamese 등 상대적으로 덜 지원되던 언어 포함
  • 중국어 방언 지원
  • 자연어로 말투·감정·억양 지시
  • [angry], [giggles] 같은 태그 기반 비언어 신호 제어
  • 잡음이나 에코가 있는 참조 음성에서도 이전 버전보다 나은 voice cloning 강건성

가격과 운영상 판단

Alibaba Cloud Model Studio 기준 가격은 100만 문자당 $27.60으로 보도됐다. 고품질 모델로는 경쟁력이 있지만, 대량 실시간 변환에서는 속도와 단가를 함께 봐야 한다.

우선순위판단
음성 자연스러움Plus 검토 가치 높음
실시간 응답Flash 또는 다른 저지연 TTS와 비교 필요
대량 배치 변환문자당 가격과 생성 속도 병목 확인 필요
다국어 콘텐츠16개 언어 지원 때문에 후보군에 넣을 만함

누구에게 적합한가

  • 다국어 콘텐츠 제작팀: 여러 언어 내레이션을 같은 모델 계열에서 처리하고 싶을 때
  • 음성 앱 개발자: 품질 우선 TTS와 실시간 TTS를 같은 공급자에서 비교하고 싶을 때
  • 중국어·동남아 언어권 서비스: 방언과 지역 언어 지원이 중요한 경우
  • 보이스 클로닝 워크플로: 참조 녹음 품질이 일정하지 않은 환경에서 강건성이 필요할 때

관련 문서

  • qwen — Alibaba의 오픈소스 대형 언어 모델 시리즈
  • gemini-3-1-flash-tts — 프롬프트로 음색·감정·억양을 조절하는 Google TTS 모델
  • moss-tts — 대화형 음성 합성을 위한 오픈 TTS 모델
  • offlinetts — 브라우저에서 실행되는 무료 프라이빗 TTS·STT 오디오 도구

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)