알리바바 통의랩, 16개 언어 AI 음성합성 모델 Qwen-Audio-3.0-TTS 공개 — Flash·Plus 두 버전 한눈에 보기

실시간 응답용 Flash와 고품질 생성용 Plus, 86개 감정 태그, Artificial Analysis 1위까지. 가격과 처리량도 솔직하게 비교했습니다.

📅 2026-01-15 ✍️ AI Tech Brief ⏱️ 약 6분 분량 🏷️ TTS · 음성AI · 알리바바

중국 알리바바의 AI 연구팀 통의랩(Tongyi Lab)이 텍스트를 사람 목소리처럼 읽어주는 TTS(음성합성) 모델 신작을 내놨습니다. 이름은 Qwen-Audio-3.0-TTS예요. 이번 모델은 단순한 신버전이 아니라, 음성 AI를 실제 서비스에 붙이는 개발자가 가장 자주 부딪히는 네 가지 문제를 해결하는 데 초점을 맞췄습니다.

  • 🌐 더 많은 언어 지원 — 무려 16개 언어
  • 🗣️ 자연어 스타일 제어 — 평소 말하듯 명령만 내리면 됨
  • 🎭 세밀한 태그 제어 — 감정과 효과음을 한 단어 단위로 지정
  • 🛡️ 노이즈에 강한 견고성 — 깨끗하지 않은 참조 음성도 잘 처리

게다가 상위 모델인 Plus는 외부 평가 기관 Artificial Analysis의 TTS 리더보드에서 1위를 차지했습니다. 한 번에 알아두면 쓸모 있는 정보를 정리해 봤어요.

1. Qwen-Audio-3.0-TTS란?

쉽게 말해 "텍스트를 입력하면 사람이 읽어주는 것처럼 음성을 만들어 주는 AI"입니다. 알리바바 클라우드의 Model Studio라는 서비스를 통해 API로 호출하는 방식이며, 모델 파일을 직접 다운로드해 내 서버에 올릴 수는 없습니다. 한 마디로 호스팅(클라우드) 전용 모델이에요.

같은 뿌리에서 나온 두 가지 버전이 함께 출시됐습니다.

2. Flash와 Plus, 어떤 차이가 있을까?

두 버전의 역할이 다릅니다. 상황에 맞는 모델을 골라 쓰는 구조예요.

구분FlashPlus
목적실시간 응답 (챗봇·콜센터)고품질 콘텐츠 (오디오북·더빙)
첫 응답 지연300ms 수준품질 우선이라 다소 김
처리 속도빠름느림 (품질에 집중)
음색 충실도좋음최상
모델 IDqwen-audio-3.0-tts-flashqwen-audio-3.0-tts-plus

두 버전 모두 양방향 WebSocket 스트리밍으로 호출하며, PCM · WAV · MP3 · Opus 포맷과 최대 48kHz 출력을 지원합니다. 음성 복제, Voice Design, 명령어 제어 같은 기능도 함께 제공되고, SDK는 Python·Java·Go·C#·PHP·Node.js까지 6개 언어로 공개됐습니다. 서버는 싱가포르와 베이징 리전에서 이용 가능해요.

3. 모델은 어떻게 만들었길래 이렇게 잘하나?

기술적으로 어려운 부분은 짧게, 핵심만 뽑으면 두 가지 설계 포인트가 있습니다.

① 초저속 음성 토크나이저 (12.5Hz)

음성을 잘게 쪼개 토큰(작은 단위)으로 바꾸는데, 이걸 초당 12.5번만 합니다. 속도가 느리다는 게 오히려 장점이에요. 오디오 1초당 토큰 수가 줄어 추론 속도가 빨라지고, 내용과 화자 정보는 그대로 유지됩니다.

② 5단계 점진 학습

언어 모델(LM)과 음성 생성 모듈(FM)을 다음 5단계로 차근차근 가르쳤습니다.

  1. LM·FM 각각 사전 학습
  2. 고품질 데이터로 함께 다지기 (어닐링)
  3. LM 강화 학습
  4. FM 견고성 학습
  5. FM 강화 학습

이 파이프라인 덕분에 발화 자연스러움·음색 충실도·인지 품질·잡음 내성이 모두 좋아졌다고 연구팀은 설명합니다. 또 최대 3분짜리 긴 글 한 번에 합성이 가능하고, 숫자·약어처럼 까다로운 텍스트 정규화도 잘 처리해요.

4. 16개 언어와 20개 중국 방언까지

지원 언어는 다음과 같습니다.

🇸🇦 아랍어🇨🇳 중국어🇺🇸 영어🇫🇷 프랑스어🇩🇪 독일어🇮🇩 인도네시아어🇮🇹 이탈리아어🇯🇵 일본어🇰🇷 한국어🇲🇾 말레이어🇵🇹 포르투갈어🇷🇺 러시아어🇪🇸 스페인어🇵🇭 타갈로그어🇹🇭 태국어🇻🇳 베트남어

이 중 7개는 이번에 처음 추가됐고, 중국 20개 지방 방언까지 커버합니다. 정확도 면에서도 16개 언어 중 10개에서 단어/문자 오류율(WER/CER) 1위를 기록했어요.

지표FlashPlus
평균 WER/CER (낮을수록 좋음)3.87 (1위)3.96
화자 유사도 (높을수록 좋음)80.4482.75 (16개 언어 전부 1위)

거기에 미리 만들어둔 프리셋 음성 라이브러리가 함께 제공돼, 처음부터 음성 복제를 하지 않아도 16개 언어 음성을 바로 써볼 수 있습니다.

5. 감정·효과음 태그 86개로 섬세하게 조절

평범한 문장 사이사이에 대괄호 태그를 넣으면, 그 구간에만 감정이나 음성 효과를 입힐 수 있습니다. 이번 출시에서 86개의 세밀한 인라인 태그가 추가됐어요. 크게 두 종류로 나뉩니다.

① 제어 태그 (Control tags)

다음 태그가 나오기 전까지 감정이나 톤을 유지합니다.

[excited][sad][whispers][asmr]외 다수

② 리치 언어 태그 (Rich-language tags)

톤은 바꾸지 않고 그 자리에서 한 번만 효과를 넣습니다.

[laughing][gasp][clears throat]외 다수
실제 사용 예시
[excited]오늘 같은 멋진 날이야![laughing]우리 같이 밖에 나가서 재미있게 놀자!
주의 — 이 감정·효과 태그는 단방향 스트리밍 모드에서만 동작합니다. 양방향 모드에서는 아직 쓸 수 없어요.

6. 외부 평가에서는 1위 — 그런데 대가는 있다

Qwen-Audio-3.0-TTS-Plus는 Artificial Analysis의 Speech Arena (Provider Voices)에서 Elo 점수 약 1,236으로 1위를 차지했습니다.

순위모델Elo 점수
1Qwen-Audio-3.0-TTS-Plus NEW1,236
2Simba 3.21,234
3Gemini 3.1 Flash TTS1,214
4Sonic 3.51,207

다만 Simba 3.2와의 격차는 신뢰구간 안쪽이라 통계적으로는 사실상 동률이라 봐야 합니다. 두 가지 트레이드오프는 분명히 짚고 가야 해요.

처리량은 다소 느림

Plus는 초당 약 16자를 생성합니다. 경쟁 모델과 비교하면 한참 못 미치는 수준이에요.

모델처리량 (자/초)
Qwen-Audio-3.0-TTS-Plus16
Gemini 3.1 Flash TTS27
Simba 3.230.2
Sonic 3.5120

가격은 의외로 저렴

100만 자당 $27.59입니다. ElevenLabs·MiniMax 같은 주요 경쟁 서비스의 약 3분의 1 수준이라 가성비는 강점입니다.

참고 — 리더보드 순위와 가격은 자주 바뀌므로, 실제 도입 전에 반드시 공식 가격표와 현재 순위를 다시 확인하세요.

7. 개발자·커뮤니티 반응은?

초기 반응은 "조심스러운 기대"에 가깝습니다. 가장 많이 회자되는 화제는 "비(非)서구권 TTS가 기존 가격의 일부만으로 정상을 탔다"는 점이에요. 반면 우려도 여럿 있습니다.

  • 호스팅 전용이라 사내 서버에 직접 올릴 수 없다
  • 처리량이 경쟁사 대비 낮다
  • 이름이 오픈소스 Qwen3-TTS 라인과 헷갈린다

특히 마지막 포인트는 주의가 필요해요. 이번 3.0 모델은 API 전용(closed)이고, 오픈 가중치 Apache-2.0 라인인 Qwen3-TTS와는 별개 제품입니다.

8. 핵심 요약 (한 줄씩)

  • 📦 두 버전 호스팅 TTS — Flash(실시간·약 300ms 응답) / Plus(고품질)
  • 🥇 Artificial Analysis 1위 — Plus Elo 약 1,236, 100만 자당 $27.59 / 단 처리량은 초당 약 16자
  • 🌐 16개 언어 + 20개 중국 방언 — 10개 언어에서 WER/CER 1위, Plus 화자 유사도 16개 언어 전부 1위
  • 🎚️ 두 가지 제어 방식 — 자유형 자연어 명령 + 86개 인라인 태그
  • 🔒 오픈소스 Qwen3-TTS와 다름 — 3.0은 Alibaba Cloud Model Studio API 전용

자주 묻는 질문 (FAQ)

Qwen-Audio-3.0-TTS는 무료인가요?
무료가 아닙니다. Alibaba Cloud Model Studio에서 API 호출량 기준으로 과금하며, Plus는 100만 자당 약 $27.59입니다. Flash는 그보다 저렴한 요금제가 별도로 제공됩니다.
모델 파일을 직접 다운로드해 제 서버에 설치할 수 있나요?
아니요. 이번 3.0 버전은 호스팅 전용(API 호출식)입니다. 직접 설치·운영이 필요하다면 오픈 가중치인 Qwen3-TTS(Apache-2.0) 라인을 살펴보세요.
Flash와 Plus 중 어떤 걸 선택해야 하나요?
실시간 응답이 중요하다면 Flash(첫 패킷 약 300ms)를, 음질과 자연스러움이 우선이라면 Plus를 권장합니다. Plus는 처리량이 낮으니 대량 배치 작업에는 Flash가 더 어울립니다.
한국어 품질은 어떤가요?
한국어가 16개 지원 언어에 포함되어 있으며, 16개 언어 평균 WER/CER 경쟁에서 상위권을 기록했습니다. 다만 실제 서비스 적용 전에는 우리 도메인 텍스트로 직접 테스트해 보는 것을 추천합니다.