NVIDIA NemotronLabs VoiceChat 11B 출시: 450ms 발화 교대와 실시간 도구 호출을 지원하는 오픈 풀듀플렉스 음성 모델
NVIDIA가 듣기와 말하기를 동시에 처리하는 풀듀플렉스(Full-Duplex) 음성 모델을 공개했습니다. 캐스케이드 방식 없이 한 모델로 음성→음성을 처리하며, 사용자가 중간에 끊어 말하면 480ms 안에 자연스럽게 양보합니다.
NVIDIA NemotronLabs VoiceChat 11B란 무엇인가요?
기존 음성 AI는 보통 자동 음성 인식(ASR) → 거대 언어 모델(LLM) → 텍스트 음성 변환(TTS) 순서로 모델을 연쇄적으로 연결하는 캐스케이드 방식으로 동작했습니다. 각 단계를 따로 운영해야 해서 응답이 늦고, 발화 도중 사용자가 끼어들면 처리가 매끄럽지 않았습니다.
NemotronLabs VoiceChat 11B는 이런 캐스케이드 방식 대신, 하나의 통합 네트워크에서 들어오는 음성 스트림을 실시간으로 이해하고 동시에 음성 답변을 만들어냅니다. NVIDIA는 이를 엔드투엔드 음성대음성(Speech-to-Speech) 모델이라고 설명합니다.
핵심 수치는 다음과 같습니다.
- 매끄러운 발화 교대(Turn-Taking) 지연 시간: 448ms (Full-Duplex-Bench 1.0 기준)
- 사용자가 중간에 끼어들 때 양보하는 인계율: 1.00 (480ms에서)
- 모델 규모: 11B 파라미터
- 오디오 컨텍스트 상한: 약 2분
또한 대화 도중 외부 API를 호출하는 실시간 도구 호출(Tool Calling)을 지원하는 최초의 오픈 풀듀플렉스 모델입니다.
바로 배포할 수 있나요?
짧게 답하면, 파일럿(PoC) 단계에서는 오늘 바로 가능하지만, 운영 환경(production)에 그대로 쓰기에는 아직 무리가 있습니다.
가중치와 컨테이너는 모두 공개되어 있고 라이선스도 허용적(OpenMDW-1.1)입니다. 다만 NVIDIA 팀은 공식적으로 이 체크포인트를 "연구 목적으로만 사용 가능"하다고 못 박았으며, 저장소 문서에는 다음과 같은 실제 실패 사례가 기록되어 있습니다.
- 오디오 컨텍스트는 약 2분까지만 안정적으로 처리
- 여러 턴이 지나면 의미가 없는 출력으로 퇴화하는 현상 발생
- 턴이 끝난 뒤에도 혼잣말이 멈추지 않는 경우 보고
- 사용자 음성을 전사할 때 단어가 빠지는 문제 발생
어떤 팀과 산업에 적합한가요?
이 모델은 80GB 이상 VRAM을 갖춘 GPU 한 대를 독점적으로 할당할 수 있는 팀이라면 누구나 시험해볼 수 있습니다. 호환되는 GPU는 A100, H100, RTX 6000 Pro, x86_64 Linux 기반 B200입니다.
주요 도입 후보
- AI 네이티브 스타트업과 자금을 확보한 스케일업
- 기업 R&D 및 혁신 랩
- GPU 클라우드 제공업체
- 대학의 음성/대화 연구 그룹
현재 호스팅 API는 없고 외부 추론 제공업체가 이 모델을 서비스하지 않기 때문에, GPU 자원이 없는 팀은 바로 평가가 어렵다는 점도 고려해야 합니다.
활용 가능성이 큰 산업 분야
- 컨택센터 및 고객 경험(CX) 플랫폼
- 차량 내 인캐빈 어시스턴트
- 소매·드라이브스루 음성 주문
- 통신사 IVR(자동 응답 시스템) 현대화
- 게임 NPC 대화 시스템
- 음성 기반 접근성 도구
대표 응용 사례로는 끼어들기 가능한 음성 에이전트, 내부 API 위의 음성 프론트엔드, 날씨·가격·주문 상태를 실시간으로 조회하는 어시스턴트, 그리고 풀듀플렉스 지연 시간을 측정하는 벤치마킹 하네스 등이 있습니다.
모델 아키텍처는 어떻게 구성되었나요?
NemotronLabs VoiceChat 11B는 NVIDIA의 기존 구성 요소 3개와 새 출력 경로 1개를 조립한 하이브리드 맘바(Mamba)/Transformer 구조입니다.
| 구성 요소 | 역할 |
|---|---|
| Nemotron-Speech-Streaming-En-0.6b (Fast Conformer) | 들어오는 16kHz 음성 스트림을 연속적으로 인코딩 |
| NVIDIA Nemotron Nano v2 LLM 백본 | 오디오 토큰을 소비하고 텍스트 토큰을 예측 |
| NVIDIA TTS 디코더 및 코덱 | 오디오 코드를 예측해 22.05kHz 음성으로 렌더링 |
| 도구 호출 전용 출력 채널 | <TOOLCALL> 스크립트를 별도 채널로 방출 |
출력 채널은 에이전트 오디오, 에이전트 텍스트, 그리고 실시간 사용자 전사로 나뉘며, 학습 데이터에는 실제 및 합성 음성 코퍼스 약 55만 시간이 사용되었습니다. 기반 모델로는 SALM-Duplex와 Audio Flamingo 3를 들 수 있습니다.
대화 도중에도 도구를 호출할 수 있다고요?
네, 이 점이 이 모델의 가장 큰 차별점입니다. 도구 호출은 메인 음성 채널이 아니라 사이드 채널에서 <TOOLCALL> 블록으로 방출되고, 외부 코드는 결과를 <TOOL_RESPONSE> 블록으로 다시 흘려보냅니다.
특히 인상적인 부분은 "대기 메시지(Filler Message)" 기능입니다. 운영자는 도구별로 한 줄짜리 문장을 미리 정의해 둘 수 있고, 모델이 외부 API를 부르는 순간 에이전트가 그 문장을 자연스럽게 말해서, 사용자가 침묵을 느끼지 않게 합니다. 예를 들어 "잠시 주문 내역을 확인하고 있습니다" 같은 문장을 API 응답이 돌아올 때까지 이어서 말하는 식입니다.
다만 제약도 분명합니다.
- 한 세션당 도구는 최대 5개까지만 권장
- 여러 도구를 동시에 안정적으로 호출하기는 어려움
- 도구가 실행되는 동안에는 사용자가 에이전트를 중단(barge-in)할 수 없음
- 시스템 프롬프트와 도구 응답은 ASCII만 허용되며 TTS가 자연스럽게 읽을 수 있어야 함
벤치마크 성적은 어떤가요?
NVIDIA가 공개한 측정 결과입니다. 풀듀플렉스 음성 모델의 품질을 평가하는 표준 벤치마크인 Full-Duplex-Bench에서 의미 있는 수치를 기록했습니다.
| 벤치마크 | 항목 | 점수 |
|---|---|---|
| Full-Duplex-Bench 1.0 | 매끄러운 발화 교대 TOR (448ms) | 0.82 |
| Full-Duplex-Bench 1.0 | 사용자 끼어들기 TOR (480ms) | 1.00 |
| Full-Duplex-Bench 1.0 | 일시 정지 처리 TOR (합성) | 0.153 (낮을수록 좋음) |
| Full-Duplex-Bench 1.0 | 일시 정지 처리 TOR (Candor) | 0.255 (낮을수록 좋음) |
| AU Harness BFCL-v3 | 단순 도구 호출 | 58.5% |
| AU Harness BFCL-v3 | 다중 도구 호출 | 62.5% |
| AU Harness BFCL-v3 | 병렬 도구 호출 | 42.5% |
| AU Harness BFCL-v3 | 병렬 다중 도구 호출 | 27.5% |
| AU Harness BFCL-v3 | 무관 도구 거부 | 89.6% |
| AU Harness BFCL-v3 | 평균 | 56.1% |
| Full-Duplex-Bench v3 | 도구 선택 | 82.5% |
| Full-Duplex-Bench v3 | 인자 정확도 | 44.2% |
| Full-Duplex-Bench v3 | pass@1 | 33% |
NVIDIA에 따르면 이 모델은 VoiceBench 오픈 풀듀플렉스 모델 중 2위, Full-Duplex-Bench 1.0 오픈 모델 중 2위를 기록했습니다.
자주 묻는 질문 (FAQ)
- Q. 풀듀플렉스(Full-Duplex)란 무엇인가요?
- 한쪽이 말하는 동안 다른 쪽이 동시에 들을 수 있는 양방향 동시 통신 방식입니다. 일반적인 음성 어시스턴트는 한쪽이 끝나야 다른 쪽이 말하는 반이중(half-duplex) 방식이지만, 풀듀플렉스는 사람이 끼어들어도 자연스럽게 양보할 수 있습니다.
- Q. 음성대음성(Speech-to-Speech) 모델은 기존과 무엇이 다른가요?
- 기존에는 음성을 텍스트로 바꾸고(ASR), LLM이 답하고, 다시 음성으로(TTS) 만드는 3단계 파이프라인이 필요했습니다. 음성대음성 모델은 이 세 단계를 하나의 모델로 통합해 응답 지연과 정보 손실을 줄입니다.
- Q. 도구 호출(Tool Calling)은 왜 중요한가요?
- 음성 어시스턴트가 단순 대화를 넘어 실제 서비스(예약, 주문 조회, 결제)를 처리하려면 외부 API를 불러야 합니다. 풀듀플렉스 대화 도중에도 API를 호출할 수 있어야 진짜로 자연스러운 음성 비서가 됩니다.
- Q. 왜 호스팅 API가 없나요?
- NVIDIA가 가중치와 컨테이너는 공개했지만, 이 모델을 직접 서비스하는 추론 제공업체는 아직 없습니다. 평가하려면 80GB VRAM 이상의 GPU 한 대를 직접 준비해야 합니다.
- Q. 상용 서비스에 바로 쓸 수 있나요?
- NVIDIA가 명시적으로 "연구 목적 전용"이라고 분류했기 때문에, 파일럿이나 내부 PoC 용도 외에는 권장되지 않습니다. 운영 환경 적용 전 추가 미세 조정(fine-tuning)과 안정성 검증이 필요합니다.
핵심 요점 정리
- 11B 파라미터 한 모델이 ASR → LLM → TTS 체인을 대체하며, 매끄러운 발화 교대 지연 시간 448ms를 달성했습니다.
- 사이드 채널 + 운영자 정의 대기 메시지를 활용한 도구 호출을 지원하는 최초의 오픈 풀듀플렉스 모델입니다.
- 가중치는 OpenMDW-1.1 허용적 라이선스이지만, NVIDIA는 체크포인트를 연구 전용으로 분류했습니다.
- 80GB VRAM GPU 한 대가 필요하며, 현재 호스팅 API는 존재하지 않습니다.
가중치와 컨테이너는 Hugging Face 모델 카드, GitHub(NeMo Speech), NGC 컨테이너에서 확인할 수 있습니다.