AI  ›  음성 AI  ›  오픈 ASR 모델 비교

2026년 최고의 오픈 소스 음성 인식(ASR) 모델 비교 — WER·언어·처리량·라이선스 총정리

Applications Voice AI Open Source 발행: 2026-07-23 최종 수정: 2026-07-23

음성 인식(ASR) 시장은 이제 Whisper 일변도가 끝났습니다. 2026년 3월 Cohere의 Transcribe가 평균 WER 5.42%로 Hugging Face Open ASR Leaderboard 1위에 오른 뒤, IBM의 Granite Speech 4.1 2B(5.33%), ARK-ASR-3B, MOSS-Transcribe가 뒤를 이었습니다. 상위 모델 간 WER 격차는 이제 1포인트 미만입니다. 따라서 모델 선택 기준은 "누가 더 정확한가"가 아니라 ① 라이선스 ② 지원 언어 ③ 스트리밍 여부 ④ 오디오 시간당 비용입니다. 이 글은 네 가지 기준으로 시장을 정리합니다.

📑 목차
  1. 리더보드 숫자의 함정
  2. 정확도 우위 모델 4종
  3. 처리량(Throughput) — 비용을 좌우하는 지표
  4. 스트리밍(STT) — 저지연이 필요한 경우
  5. 지원 언어 범위 — 글로벌 서비스용
  6. 연구 최전선 — Diffusion ASR·화자 분할
  7. 라이선스 비교표
  8. 실제 모델 선택 가이드
  9. 용어 사전

1. 모두가 인용하지만 모두가 오해하는 "리더보드 숫자"

Hugging Face Open ASR Leaderboard의 평균값은 절대 고정된 수치가 아닙니다. 나란히 표시된 모델들이 모두 같은 방식으로 평가된 것도 아닙니다.

📌 사례: 같은 모델이라도 평가 묶음에 따라 평균이 달라진다

⚠️
리더보드 점수 3가지 함정
① 일부 점수는 리더보드 학습 데이터로 강화학습 미세조정된 결과 (MOSS-Transcribe 모델 카드에 명시)
② 비공개 평가 트랙(Appen의 호주·캐나다·인도·미국식 억양 세트)을 적용하면 zoom/scribe_v1이 1위로 올라감
③ 깨끗한 낭독 음성에 맞춰진 모델은 즉흥 대화에서 성능이 크게 떨어짐
리더보드는 "후보 목록을 만드는 도구"로 사용하세요. 승자를 고르는 도구로 사용하지 마세요.

2. 정확도 우위 모델 4종

① Cohere Transcribe (2B / Apache 2.0 / 14개 언어)

Apache 2.0WER 5.42%14개 언어

이미 제품 환경에서 검증된 모델입니다. 한 달 만에 62만 회 이상 다운로드되었으며, transformers, vLLM, Apple Silicon용 mlx-audio, Rust 포트, WebGPU 빌드까지 다양한 실행 환경을 지원합니다. 구조는 처음부터 학습된 경량 Transformer 디코더 + Conformer 인코더입니다.

Cohere가 사람을 대상으로 한 선호도 평가를 진행한 결과, 의미 보존·환각·고유명사 측면에서 평균 승률 61%를 기록했습니다. IBM Granite 4.0 1B Speech 대비 78%, Whisper large-v3 대비 64% 승률입니다.

⚠️
도입 전 반드시 알아야 할 제약
• 자동 언어 감지 / 타임스탬프 / 화자 분할(Speaker Diarization) 기능이 없음
• 무음도 전사하려는 경향이 있어 앞단에 VAD 또는 노이즈 게이트 추가 권장
• 라이선스는 Apache 2.0이지만 저장소는 연락처 정보 제공 동의 절차 뒤에 있음

② IBM Granite Speech 4.1 2B (Apache 2.0 / 6개 언어)

Apache 2.0WER 5.33%RTFx 231.29

단순히 더 낮은 수치가 아니라 기능이 필요한 경우 더 나은 선택입니다. ASR용 6개 언어 + 양방향 음성 번역 + 키워드 편향(고유명사·전문용어) + 구두점 처리 + 독일어 명사 대문자 표기까지 지원합니다. 학습 데이터는 17만 4,000시간입니다.

파생 모델 두 가지:

③ NVIDIA Canary-Qwen-2.5B (CC-BY-4.0 / 영어 전용)

CC-BY-4.0WER 5.63%RTFx 418

FastConformer 인코더 + Qwen3-1.7B 디코더 결합. 두 가지 모드 — ① 순수 전사 모드, ② LLM 모드(전사 내용을 요약하고 그에 관한 질문에 답함) — 로 실행됩니다.

강점 vs. 약점
강점: AMI 데이터 15% 과다 샘플링으로 말더듬·중단 같은 비유창성을 그대로 보존 → 법률 업무에 적합
약점: 회의록 작성에는 불편한 특성. 영어 전용이라는 명확한 한계

④ Qwen3-ASR-1.7B (Apache 2.0 / 52개 언어·방언)

Apache 2.0WER 5.76%52개 언어·방언

30개 언어 + 22개 중국어 방언을 지원합니다. 11개 언어에서 강제 정렬(Forced Alignment)로 타임스탬프를 생성하는 별도 모델이 함께 제공됩니다. 만다린·중국 지역 방언 음성을 다룬다면 이 모델이 가장 자연스러운 출발점입니다.

3. 처리량(Throughput) — 실제 청구 금액을 결정하는 지표

상위 모델의 정확도 차이는 WER 1포인트 미만이지만, 처리량은 10배 이상 차이 납니다. 실제 청구 금액은 거의 항상 처리량이 결정합니다.

모델규모WERRTFx언어라이선스
Parakeet TDT 0.6B v30.6B6.32%3,332.7425개 유럽CC-BY-4.0
Granite Speech 4.1 2B-NAR2B~1,820제한Apache 2.0
Qwen3-ASR-0.6B0.6B~2,00052개Apache 2.0
Granite Speech 4.1 2B2B5.33%231.296개Apache 2.0

① Parakeet TDT 0.6B v3 — 다국어 공개 모델 중 처리량 선두

25개 유럽 언어에서 RTFx 3,332.74를 기록합니다. A100 80GB 한 장에서 한 번에 최대 24분의 음성을 처리합니다. WER 6.32%는 Granite 4.1 2B보다 1포인트 정도 높지만, GPU 1초당 처리하는 오디오 양은 약 14배입니다.

② Granite Speech 4.1 2B-NAR — 공학적으로 흥미로운 결과

비자기회귀 방식(Non-autoregressive)으로, 양방향 LLM이 한 번의 순방향 실행에서 CTC 가설을 수정합니다. 대신 일본어·음성 번역·키워드 편향 기능을 포기했습니다.

③ Qwen3-ASR-0.6B

52개 언어를 모두 유지하면서 동시성 128에서 약 2,000배의 처리량에 도달합니다.

4. 스트리밍(STT) — 저지연이 꼭 필요한 경우

배치 WER은 스트리밍 모델을 평가하기에 부적절하지만, 리더보드는 여전히 스트리밍 모델에도 배치 점수를 매깁니다. Voxtral Realtime 7.68%, Kyutai STT 2.6B 6.40%는 Whisper보다 낮은 WER이지만, 이 숫자만으로는 의도된 용도에 대한 정보가 거의 없습니다.

① Mistral Voxtral Mini 4B Realtime 2602 (Apache 2.0)

Apache 2.013개 언어지연 80~1200ms

처음부터 학습한 970M 인과적 오디오 인코더 + 3.4B 언어 모델로 구성됩니다. 양쪽에 슬라이딩 윈도우 어텐션을 사용해 사실상 길이 제한이 없는 스트리밍을 구현합니다. 전사 지연 시간은 80ms 단위로 80~1200ms 설정 가능, 별도 2400ms 옵션도 제공합니다.

Mistral은 480ms가 최적 균형점이라고 권장하며, 이 설정에서 선도적인 오프라인 공개 모델과 맞먹는다고 보고합니다. 16GB GPU 한 장에서 실행되며 출시 첫날부터 vLLM Realtime API를 지원했습니다.

② Kyutai STT (CC-BY-4.0) — 의미 기반 VAD가 핵심

두 가지 형태로 제공됩니다:

💡
왜 음성 에이전트에서 VAD가 더 중요한가
음성 에이전트에서는 전사 지연보다 의미 기반 VAD가 더 중요합니다. 의미 기반 VAD는 화자가 실제로 말을 끝냈는지를 예측하기 때문입니다. 이것이 사용자가 체감하는 발화 전환 지연 시간을 좌우합니다. H100 한 장으로 실시간 동시 스트림 400개를 처리할 수 있습니다.

5. 지원 언어 범위 — 글로벌 서비스용

① Meta Omnilingual ASR (Apache 2.0 / 말뭉치 CC-BY)

Apache 2.01,600+ 언어 기본5,400+ 확장

WER 경쟁용 모델이 아니며, 그런 기준으로 평가해서도 안 됩니다. 기본적으로 1,600개 이상의 언어를 지원하고, 제로샷 인컨텍스트 학습으로 5,400개 이상의 언어로 확장됩니다. 7B까지 확장한 wav2vec 2.0 인코더 기반이며, 약 430만 시간 데이터로 사전 학습되었습니다.

7B LLM-ASR 변형 모델은 지원 언어의 78%에서 문자 오류율 10% 미만을 달성합니다. 여기에는 이전에 어떤 ASR 시스템도 지원하지 않았던 500개 이상의 언어가 포함됩니다. Meta는 350개 이상의 소외 언어를 포함한 Omnilingual ASR Corpus도 함께 공개했습니다.

② Whisper large-v3 (1.55B / MIT / 99개 언어)

MIT99개 언어

정확도 면에서는 약 10개 공개 모델에 추월당했지만, 여전히 많은 프로젝트에서 올바른 기본 선택입니다. MIT 라이선스는 이 분야에서 가장 자유로운 라이선스입니다. whisper.cpp, faster-whisper, WhisperX로 이어지는 실행 생태계는 최신 출시 모델들에 동등한 대안이 없습니다.

요구사항이 "어떤 언어든 일부 지원 + 어떤 하드웨어에서든 실행 + 라이선스 변호사가 필요 없는 것"이라면 여전히 Whisper가 답입니다.

6. 연구 최전선 — Diffusion ASR과 화자 분할

① Interfaze Diffusion-Gemma ASR Small — 가장 창의적인 2026년 아키텍처

YC 스타트업 Interfaze의 diffusion-gemma-asr-small은 올해 가장 창의적인 아키텍처의 출시작입니다. 256토큰 캔버스에서 8~16회의 병렬 확산 잡음 제거를 수행해 전사 결과를 생성합니다. 따라서 전사 길이가 늘어나도 디코딩 비용이 증가하지 않습니다.

학습 파라미터약 4,200만 개 (전체의 0.16%)
기반 모델고정된 26B DiffusionGemma + whisper-small
LibriSpeech test-cleanWER 6.6%, 11~17x 실시간
FLEURS 영어15.7%
FLEURS 만다린CER 29.6%
🚫
배포에 부적합하지만, ASR 분야 종사자라면 모두 읽어봐야 할 논문입니다. LibriSpeech 수치는 상한선으로 간주해야 합니다.

② MOSS-Transcribe-Diarize 0.9B — 비교 기사가 외면하는 문제

ASR 결과를 별도의 화자 분할 시스템에 연결하는 대신, 한 번의 생성 과정에서 화자 라벨 + 단어 타임스탬프 + 전사 결과를 함께 출력합니다. 50개 이상 언어, 128k 컨텍스트, 한 번에 약 90분 오디오 처리, RTX 4090에서 RTF 약 0.017, 핫워드 편향 기능까지 제공합니다.

7. 라이선스 비교 — 출시를 막는 진짜 이유

실제로 제품 출시를 막는 부분은 바로 라이선스입니다. 이 분야의 라이선스는 명확하게 세 갈래로 나뉩니다.

라이선스저작자 표시상업적 사용대표 모델
Apache 2.0불필요제한 없음Cohere Transcribe, Granite Speech 4.1(-plus·-nar 포함), Qwen3-ASR(0.6B·1.7B), Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe
MIT불필요제한 없음Whisper large-v3 (이 분야 가장 자유로운 선택)
CC-BY-4.0필수가능Canary-Qwen-2.5B, Parakeet TDT 0.6B v3, Kyutai STT
⚠️
주의: "Apache 2.0"이라도 저장소가 게이트 뒤에 있을 수 있다
라이선스 자체는 Apache 2.0이지만, Cohere 저장소는 연락처 정보 제공 동의 절차 뒤에 있습니다. 임베디드 제품·화이트라벨 API의 경우 저작자 표시는 실제로 준수해야 하는 의무이며, "테스트에서 가장 정확했던 모델"이 아닌 다른 모델을 결국 출시하게 되는 가장 흔한 이유이기도 합니다. Meta의 Omnilingual ASR은 이 둘을 분리합니다 — 모델은 Apache 2.0, 말뭉치는 CC-BY.

8. 실제 모델 선택 가이드 — 5단계 의사결정

리더보드 순서만 따르지 말고 다음 순서로 진행하세요.

  1. 라이선스부터 확인 — 저작자 표시가 장애물이라면 CC-BY-4.0 모델(Parakeet, Canary-Qwen, Kyutai)을 벤치마크 대상에서 제외.
  2. 언어 지원 범위 확인 — Cohere 14개, Granite 6개, Canary 영어 전용은 "유연하게 바꿀 수 있는 조건"이 아니라 "명확한 한계"입니다. Cohere는 자동 언어 감지가 없으므로 사전에 언어를 알고 있어야 합니다.
  3. 스트리밍 vs. 배치 결정 — 아키텍처의 문제입니다. 아무리 조정해도 오프라인 인코더-디코더를 저지연 스트리밍 모델로 바꿀 수 없습니다.
  4. 자체 오디오에서 WER 측정 — 공개 벤치마크 상위 10개 모델 격차는 1포인트 미만이지만, 억양이 있고 시끄러운 자체 오디오에서는 격차가 몇 배가 될 수 있고 순위도 달라집니다.
  5. 자체 GPU에서 오디오 시간당 비용 계산 — RTFx는 대규모 배치 + 데이터센터 하드웨어 기준이므로 그대로 적용되지 않습니다.
🎯
2026년 한 줄 요약
"특정 모델 하나가 승리했다"가 아닙니다. 개방형 가중치를 제공하는 2B 모델이 허용적인 라이선스 아래에서, 폐쇄형 API가 18개월 전까지 요구하던 비용으로 제공하던 성능을 넘어섰습니다. 남은 결정은 연구 문제가 아니라 조달 문제입니다.

9. 용어 사전 (쉽게 풀어쓴 ASR 용어 10선)

ASR — Automatic Speech Recognition, 자동 음성 인식
음성 신호를 분석해 사람이 읽을 수 있는 텍스트로 변환하는 기술입니다. 음성-텍스트 변환(STT)의 핵심 기술입니다.
WER — Word Error Rate, 단어 오류율
음성 인식 정확도의 대표 지표입니다. 기준 전사와 모델 전사를 비교해 치환·삽입·삭제된 단어 수를 전체 단어 수로 나눈 값이며, 낮을수록 정확합니다.
RTFx — Inverse Real-Time Factor, 실시간 배수
모델의 처리 속도 지표입니다. RTFx = 1이면 1분 오디오를 약 1분에 처리, 그보다 크면 실시간보다 빠릅니다. RTFx 3,332는 같은 GPU에서 1분 오디오를 0.018초에 처리한다는 뜻입니다.
VAD — Voice Activity Detection, 음성 활동 감지
오디오에서 사람이 말하는 구간과 무음·배경소음 구간을 자동으로 구분하는 기술입니다. 음성 에이전트의 발화 시작·종료를 감지하고 불필요한 무음 전사를 줄입니다.
Speaker Diarization — 화자 분할
여러 사람이 말하는 녹음에서 "누가 언제 말했는가"를 판별하는 기술입니다. 오디오를 화자별 구간으로 나누고 라벨을 붙입니다.
Conformer — Convolution-augmented Transformer
합성곱 신경망(CNN)의 지역 음성 특징 추출 능력과 Transformer의 셀프 어텐션을 결합한 음성 인식용 하이브리드 신경망 구조입니다.
CTC — Connectionist Temporal Classification, 연결주의 시간 분류
입력 음성과 출력 문장이 시간상 정확히 정렬되어 있지 않을 때 신경망을 학습시키는 손실 함수·출력 방식입니다. 음성·단어를 일일이 수작업으로 맞추지 않아도 되게 합니다.
Non-autoregressive — 비자기회귀 방식
이전 출력 토큰을 순서대로 참고해 다음 토큰을 만드는 자기회귀 방식과 달리, 여러 토큰을 동시에 예측하는 방식입니다. 디코딩은 빠르지만 정확도와의 절충이 필요합니다.
Forced Alignment — 강제 정렬
이미 작성된 전사문과 오디오를 맞춰 각 단어·음소가 언제 시작·끝나는지 시간 정보를 생성하는 기술입니다. 텍스트를 음성 구간에 정밀하게 정렬합니다.
Zero-shot In-context Learning — 제로샷 인컨텍스트 학습
예시를 주거나 가중치를 다시 학습하지 않고, 입력 문맥·지시만으로 모델이 학습하지 않은 작업·언어를 처리하는 방식입니다. Omnilingual ASR이 기본 1,600개 언어를 5,400개로 확장하는 원리입니다.

참고: 본 비교는 2026년 7월 기준 공개 데이터와 Hugging Face Open ASR Leaderboard, 각 모델 카드(MOSS-Transcribe, Cohere Transcribe, IBM Granite Speech 4.1, NVIDIA Canary-Qwen, Meta Omnilingual ASR 등)의 공식 수치를 기반으로 정리되었습니다.