AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

NVIDIA Magpie TTS – 저지연 다국어 음성 에이전트용 오픈 TTS 모델

NVIDIA Magpie TTS Multilingual은 NVIDIA가 공개한 다국어 텍스트 음성 변환(TTS) 모델이다. 364M 파라미터 오픈 가중치 모델과 NVIDIA NIM 배포 경로를 함께 제공해, 고객지원·헬스케어·엔터프라이즈 코파일럿 같은 음성 에이전트에서 낮은 지연시간과 배포 제어권을 확보하는 데 초점을 둔다.

왜 음성 에이전트에서 중요한가

음성 에이전트의 체감 품질은 ASR, LLM 추론, 검색, 도구 호출, TTS가 합쳐진 전체 지연시간으로 결정된다. 이 중 TTS는 사용자가 바로 듣는 마지막 단계라서, 첫 오디오가 늦게 나오면 전체 시스템이 느리게 느껴진다.

Magpie TTS는 통합 음성 API 하나로 모든 것을 처리하는 방식보다, ASR·LLM·TTS를 분리한 캐스케이드(cascaded) 아키텍처에 맞다. 팀은 각 컴포넌트를 독립적으로 교체하고, 데이터가 있는 인프라 안에서 실행하며, 지연시간을 직접 측정할 수 있다.

지원 언어와 배포 방식

Magpie TTS Multilingual은 다음 12개 언어를 지원한다.

언어비고
영어, 스페인어, 프랑스어, 독일어, 이탈리아어기존 주요 언어
베트남어, 중국어, 힌디어, 일본어아시아권 언어
현대 표준 아랍어, 한국어, 브라질 포르투갈어2026년 8월 릴리스에서 확장

각 언어는 공유 다국어 speaker representation 위에서 남성·여성 화자를 제공한다. 힌디어와 일본어는 IPA 기반 grapheme-to-phoneme 처리와 커스텀 발음 사전을 통해 code-switching과 이름·전문용어 발음을 더 잘 다루는 방향으로 개선됐다.

성능 지표

NVIDIA가 공개한 NIM 성능 문서 기준 단일 스트림 Time to First Audio(TTFA)는 B200 32ms, H100 47ms, DGX Spark 53ms, A100 79ms다. 64개 동시 스트림에서는 B200 239ms TTFA와 319.81x RTFX를 기록했다. 여기서 TTFA는 음성 생성 시작 후 첫 오디오가 나오는 시간이고, RTFX는 실제 재생 시간 대비 몇 배 빠르게 오디오를 생성하는지 나타낸다.

이 수치는 Hugging Face 체크포인트 자체가 아니라 NVIDIA NIM으로 서빙한 온프레미스 결과다. 연구·파인튜닝에는 공개 checkpoint를 쓰고, 프로덕션 저지연 서빙에는 NIM 컨테이너를 쓰는 구조로 이해하는 편이 정확하다.

아키텍처 개선

Magpie의 저지연 설계는 두 요소가 핵심이다.

요소역할
Frame stacking디코더가 한 번에 두 오디오 프레임을 예측해 디코딩 반복 수를 줄인다
Local transformer동시에 생성된 codebook token 간 의존성을 보정해 frame stacking으로 인한 품질 저하를 줄인다

이 구조는 Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation 논문에 설명된 방식이다. 목표는 단순히 빠르게 말하는 것이 아니라, 프레임 수를 줄이면서도 자연스러운 음성 품질을 유지하는 것이다.

음성 에이전트 구성

NVIDIA는 Magpie TTS를 Nemotron Voice Agent Developer Example의 일부로 배치한다. 구성 요소는 다음과 같다.

  • Nemotron Speech: 스트리밍 음성 인식
  • Magpie TTS: 다국어 음성 합성
  • Nemotron 언어·멀티모달 모델: 추론, 도구 호출, 시각 이해
  • NVIDIA NIM: GPU 최적화 추론 마이크로서비스
  • NeMo: 도메인 발음, 화자, 브랜드 음성 파인튜닝

이 접근은 “좋은 TTS 모델”보다 “interruptible conversation, barge-in, tool calling, multilingual interaction을 포함한 전체 음성 에이전트”에 가깝다.

어디에 적합한가

  • 고객 대화가 사내 인프라나 특정 리전에 머물러야 하는 기업
  • 한국어·아랍어·브라질 포르투갈어까지 하나의 TTS 기반으로 묶고 싶은 음성 서비스
  • 브랜드 고유 발음, 화자, 전문용어를 NeMo로 커스터마이즈하려는 팀
  • TTS 지연시간을 관리형 API 왕복시간이 아니라 자체 GPU 기준으로 직접 튜닝하려는 플랫폼 팀

주의할 점도 있다. NIM 성능 수치는 NVIDIA GPU와 최적화 컨테이너 기준이다. 오픈 checkpoint를 임의 서버에서 실행하면 같은 TTFA가 보장되지 않는다. 또한 NVIDIA Open Model License 조건을 배포 전에 확인해야 한다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)