알리바바 통의랩, 16개 언어 AI 음성합성 모델 Qwen-Audio-3.0-TTS 공개 — Flash·Plus 두 버전 한눈에 보기
실시간 응답용 Flash와 고품질 생성용 Plus, 86개 감정 태그, Artificial Analysis 1위까지. 가격과 처리량도 솔직하게 비교했습니다.
중국 알리바바의 AI 연구팀 통의랩(Tongyi Lab)이 텍스트를 사람 목소리처럼 읽어주는 TTS(음성합성) 모델 신작을 내놨습니다. 이름은 Qwen-Audio-3.0-TTS예요. 이번 모델은 단순한 신버전이 아니라, 음성 AI를 실제 서비스에 붙이는 개발자가 가장 자주 부딪히는 네 가지 문제를 해결하는 데 초점을 맞췄습니다.
- 🌐 더 많은 언어 지원 — 무려 16개 언어
- 🗣️ 자연어 스타일 제어 — 평소 말하듯 명령만 내리면 됨
- 🎭 세밀한 태그 제어 — 감정과 효과음을 한 단어 단위로 지정
- 🛡️ 노이즈에 강한 견고성 — 깨끗하지 않은 참조 음성도 잘 처리
게다가 상위 모델인 Plus는 외부 평가 기관 Artificial Analysis의 TTS 리더보드에서 1위를 차지했습니다. 한 번에 알아두면 쓸모 있는 정보를 정리해 봤어요.
1. Qwen-Audio-3.0-TTS란?
쉽게 말해 "텍스트를 입력하면 사람이 읽어주는 것처럼 음성을 만들어 주는 AI"입니다. 알리바바 클라우드의 Model Studio라는 서비스를 통해 API로 호출하는 방식이며, 모델 파일을 직접 다운로드해 내 서버에 올릴 수는 없습니다. 한 마디로 호스팅(클라우드) 전용 모델이에요.
같은 뿌리에서 나온 두 가지 버전이 함께 출시됐습니다.
2. Flash와 Plus, 어떤 차이가 있을까?
두 버전의 역할이 다릅니다. 상황에 맞는 모델을 골라 쓰는 구조예요.
| 구분 | Flash | Plus |
|---|---|---|
| 목적 | 실시간 응답 (챗봇·콜센터) | 고품질 콘텐츠 (오디오북·더빙) |
| 첫 응답 지연 | 약 300ms 수준 | 품질 우선이라 다소 김 |
| 처리 속도 | 빠름 | 느림 (품질에 집중) |
| 음색 충실도 | 좋음 | 최상 |
| 모델 ID | qwen-audio-3.0-tts-flash | qwen-audio-3.0-tts-plus |
두 버전 모두 양방향 WebSocket 스트리밍으로 호출하며, PCM · WAV · MP3 · Opus 포맷과 최대 48kHz 출력을 지원합니다. 음성 복제, Voice Design, 명령어 제어 같은 기능도 함께 제공되고, SDK는 Python·Java·Go·C#·PHP·Node.js까지 6개 언어로 공개됐습니다. 서버는 싱가포르와 베이징 리전에서 이용 가능해요.
3. 모델은 어떻게 만들었길래 이렇게 잘하나?
기술적으로 어려운 부분은 짧게, 핵심만 뽑으면 두 가지 설계 포인트가 있습니다.
① 초저속 음성 토크나이저 (12.5Hz)
음성을 잘게 쪼개 토큰(작은 단위)으로 바꾸는데, 이걸 초당 12.5번만 합니다. 속도가 느리다는 게 오히려 장점이에요. 오디오 1초당 토큰 수가 줄어 추론 속도가 빨라지고, 내용과 화자 정보는 그대로 유지됩니다.
② 5단계 점진 학습
언어 모델(LM)과 음성 생성 모듈(FM)을 다음 5단계로 차근차근 가르쳤습니다.
- LM·FM 각각 사전 학습
- 고품질 데이터로 함께 다지기 (어닐링)
- LM 강화 학습
- FM 견고성 학습
- FM 강화 학습
이 파이프라인 덕분에 발화 자연스러움·음색 충실도·인지 품질·잡음 내성이 모두 좋아졌다고 연구팀은 설명합니다. 또 최대 3분짜리 긴 글 한 번에 합성이 가능하고, 숫자·약어처럼 까다로운 텍스트 정규화도 잘 처리해요.
4. 16개 언어와 20개 중국 방언까지
지원 언어는 다음과 같습니다.
이 중 7개는 이번에 처음 추가됐고, 중국 20개 지방 방언까지 커버합니다. 정확도 면에서도 16개 언어 중 10개에서 단어/문자 오류율(WER/CER) 1위를 기록했어요.
| 지표 | Flash | Plus |
|---|---|---|
| 평균 WER/CER (낮을수록 좋음) | 3.87 (1위) | 3.96 |
| 화자 유사도 (높을수록 좋음) | 80.44 | 82.75 (16개 언어 전부 1위) |
거기에 미리 만들어둔 프리셋 음성 라이브러리가 함께 제공돼, 처음부터 음성 복제를 하지 않아도 16개 언어 음성을 바로 써볼 수 있습니다.
5. 감정·효과음 태그 86개로 섬세하게 조절
평범한 문장 사이사이에 대괄호 태그를 넣으면, 그 구간에만 감정이나 음성 효과를 입힐 수 있습니다. 이번 출시에서 86개의 세밀한 인라인 태그가 추가됐어요. 크게 두 종류로 나뉩니다.
① 제어 태그 (Control tags)
다음 태그가 나오기 전까지 감정이나 톤을 유지합니다.
② 리치 언어 태그 (Rich-language tags)
톤은 바꾸지 않고 그 자리에서 한 번만 효과를 넣습니다.
[excited]오늘 같은 멋진 날이야![laughing]우리 같이 밖에 나가서 재미있게 놀자!
6. 외부 평가에서는 1위 — 그런데 대가는 있다
Qwen-Audio-3.0-TTS-Plus는 Artificial Analysis의 Speech Arena (Provider Voices)에서 Elo 점수 약 1,236으로 1위를 차지했습니다.
| 순위 | 모델 | Elo 점수 |
|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus NEW | 1,236 |
| 2 | Simba 3.2 | 1,234 |
| 3 | Gemini 3.1 Flash TTS | 1,214 |
| 4 | Sonic 3.5 | 1,207 |
다만 Simba 3.2와의 격차는 신뢰구간 안쪽이라 통계적으로는 사실상 동률이라 봐야 합니다. 두 가지 트레이드오프는 분명히 짚고 가야 해요.
처리량은 다소 느림
Plus는 초당 약 16자를 생성합니다. 경쟁 모델과 비교하면 한참 못 미치는 수준이에요.
| 모델 | 처리량 (자/초) |
|---|---|
| Qwen-Audio-3.0-TTS-Plus | 16 |
| Gemini 3.1 Flash TTS | 27 |
| Simba 3.2 | 30.2 |
| Sonic 3.5 | 120 |
가격은 의외로 저렴
100만 자당 $27.59입니다. ElevenLabs·MiniMax 같은 주요 경쟁 서비스의 약 3분의 1 수준이라 가성비는 강점입니다.
7. 개발자·커뮤니티 반응은?
초기 반응은 "조심스러운 기대"에 가깝습니다. 가장 많이 회자되는 화제는 "비(非)서구권 TTS가 기존 가격의 일부만으로 정상을 탔다"는 점이에요. 반면 우려도 여럿 있습니다.
- 호스팅 전용이라 사내 서버에 직접 올릴 수 없다
- 처리량이 경쟁사 대비 낮다
- 이름이 오픈소스
Qwen3-TTS라인과 헷갈린다
특히 마지막 포인트는 주의가 필요해요. 이번 3.0 모델은 API 전용(closed)이고, 오픈 가중치 Apache-2.0 라인인 Qwen3-TTS와는 별개 제품입니다.
8. 핵심 요약 (한 줄씩)
- 📦 두 버전 호스팅 TTS — Flash(실시간·약 300ms 응답) / Plus(고품질)
- 🥇 Artificial Analysis 1위 — Plus Elo 약 1,236, 100만 자당 $27.59 / 단 처리량은 초당 약 16자
- 🌐 16개 언어 + 20개 중국 방언 — 10개 언어에서 WER/CER 1위, Plus 화자 유사도 16개 언어 전부 1위
- 🎚️ 두 가지 제어 방식 — 자유형 자연어 명령 + 86개 인라인 태그
- 🔒 오픈소스 Qwen3-TTS와 다름 — 3.0은 Alibaba Cloud Model Studio API 전용