코스모스 3 엣지 출시 — 40억 파라미터 오픈 월드 모델이 장치 위에서 로봇 동작을 만든다
클라우드 없이 로봇이 스스로 주변 환경을 이해하고, 실시간으로 추론하며, 동작까지 생성하는 시대가 열렸습니다. NVIDIA가 공개한 새로운 오픈 월드 모델의 핵심을 정리합니다.
한 줄 요약
코스모스 3 엣지(Cosmos 3 Edge)는 엣지 디바이스에서 직접 돌아가는 40억 파라미터 오픈 월드 모델입니다. 로봇이 카메라로 본 환경을 이해하고, 다음에 어떤 동작을 해야 할지 추론하고, 그 동작이 만들어낼 미래를 시뮬레이션한 뒤 실제 동작을 생성합니다 — 이 모든 과정이 로컬에서 일어납니다.
월드 모델(World Model) 이란?
월드 모델은 단순한 이미지 인식기가 아닙니다. 시간에 따라 환경이 어떻게 변하는지를 학습해서, "내가 이렇게 움직이면 세상이 저렇게 변한다"를 예측하는 모델입니다. 사물의 위치, 움직임, 공간 관계, 그리고 동작의 결과까지 모두 내부적으로 표현합니다.
코스모스 3 엣지는 이해·추론·생성을 단 하나의 온디바이스 모델로 묶었습니다. 즉, 외부 서버 없이 로컬에서 세계 상태를 이해하고, 가능한 미래를 시뮬레이션하고, 그 미래를 실제 동작으로 연결할 수 있습니다.
두 개의 타워, 하나의 공유 표현
코스모스 3 패밀리는 Mixture-of-Transformers(트랜스포머 혼합)라는 구조를 사용합니다. 쉽게 말해 두 개의 전문 트랜스포머를 한 시스템 안에 결합한 것입니다.
- 자기회귀 타워 (Autoregressive) — 시각·텍스트 토큰을 처리해 상황을 이해하고 추론합니다. 마치 독해·분석 담당.
- 디퓨전 타워 (Diffusion) — 비디오·오디오·동작 토큰을 처리해 미래를 예측하고 새로운 영상을 생성합니다. 마치 영상 스튜디오 담당.
- 공유 다중 모달 어텐션 계층 — 두 타워를 가로질러 텍스트·영상·음성·동작 정보를 정렬합니다. 두 팀이 같은 회의록을 공유하는 셈입니다.
엣지 등급은 이 중 추론부에 2B 밀집 트랜스포머를 사용합니다. 이미지·영상 입력 규약은 Qwen3-VL과 호환되도록 설계됐습니다.
다양한 구현 형태(Embodiment)를 하나로 묶다
현실의 기계들은 동작을 모두 다르게 표현합니다. 자동차는 자차 자세·이동량으로, 카메라는 카메라 움직임으로, 로봇 팔은 엔드 이펙터(그리퍼 끝) 자세로요. 코스모스 3은 이런 다양한 표현을 이동·회전·조작 상태를 담은 압축된 벡터 하나로 매핑합니다.
그 결과는 인상적입니다. 픽셀 변화와 실제 물리적 움직임을 직접 연결하기 때문에, 생성된 영상은 단순 예측이 아니라 "이 동작을 따라 하면 세상이 이렇게 변해야 한다"를 보여줍니다.
- 카메라 이동 — 9차원 (9D)
- 자율주행 차량 — 9D
- 1인칭 시점 동작 (Egocentric) — 57D
- 단팔 로봇 — 10D
- 双臂(양팔) 로봇 — 20D
- 휴머노이드 로봇 — 29D
양방향 정책 모드 — 동작과 결과를 함께
정책(Policy)이란 "어떤 입력이 들어오면 어떤 동작을 낼지" 결정하는 신경망입니다. 코스모스 3 엣지의 정책 모드는 단순한 액션 매핑이 아닙니다. 동작과 그로 인한 미래 영상을 동시에 출력하기 때문에 흐름이 양방향입니다.
- 순방향 — "지금 상태 → 동작 + 예상 미래 영상"
- 역방향 — "원하는 미래 영상 → 어떤 동작이었는지" 추론
이 덕분에 월드 모델이 로봇 정책 학습·평가와 직접 연결됩니다. NVIDIA는 픽앤플레이스(Pick & Place) 작업용으로 DROID 데이터셋으로 미세조정(Fine-Tuning)된 코스모스 3 엣지 정책 (DROID)도 함께 공개했고, 사후 학습 스크립트도 제공합니다.
실제 배포는 가능한가?
엣지 모델이라 가장 중요한 건 메모리 효율과 실시간 제어입니다. 코스모스 3 엣지는 다음 하드웨어를 공식 지원합니다.
- NVIDIA RTX PRO GPU, DGX
- GeForce RTX GPU (RTX 3070 이상 권장)
- Jetson T2000, T3000 모듈 (신규 발표)
- Jetson Thor — 640×360 해상도, 추론당 32개 동작, 15Hz 실시간 제어
생성 작업에서는 256p·480p 해상도를 지원하며, 12~30fps로 50~150 프레임을 다룹니다. 오픈 코스모스 프레임워크를 사용하면 약 하루 만에 자체 구현 형태와 센서 세트에 맞게 파인튜닝할 수 있습니다.
쉽게 풀어보는 핵심 용어
자주 묻는 질문 (FAQ)
기존 코스모스 3과 무엇이 다른가요?
기존 나노(16B)·슈퍼(64B)는 데이터센터용 대형 모델이었습니다. 엣지는 슈퍼의 약 1/16 크기로, 메모리가 제한된 엣지 디바이스에서 실시간 추론이 가능하도록 경량화됐습니다.
Jetson Thor에서 진짜로 15Hz가 나오나요?
NVIDIA는 Jetson Thor에서 640×360 해상도, 추론 1회당 32개 동작, 15Hz 실시간 제어를 측정했다고 발표했습니다. 이는 사후 학습된 월드 액션 모델(WAM) 기준입니다.
라이선스는 어떻게 되나요?
Linux Foundation OpenMDW-1.1 라이선스로 배포됩니다. 오픈소스이므로 상용·연구 모두 활용 가능하지만, 각 라이선스의 의무 사항은 직접 확인해야 합니다.
파이낸튜닝은 무슨 장비가 필요한가요?
개발자는 배포 전에 소규모 H100 클러스터 또는 NVIDIA DGX Station에서 자체 데이터로 미세조정할 수 있습니다. 프로토타이핑은 GeForce RTX 3070 이상이면 충분합니다.
언제 어디서 받을 수 있나요?
2026년 7월 20일 허깅페이스(Hugging Face)에 4B 모델이 공개됐습니다. 코스모스 깃허브 저장소에서 사후 학습 스크립트와 구현 형태별 차원 명세도 함께 제공됩니다.
핵심 요약
- 코스모스 3 엣지는 4B 오픈 월드 모델 (추론부 2B 밀집 트랜스포머)로, 7월 20일 허깅페이스에 공개됐다.
- Mixture-of-Transformers 설계가 공유 다중 모달 어텐션으로 자기회귀 추론 타워와 디퓨전 생성 타워를 결합한다.
- NVIDIA Jetson Thor에서 640×360 제어 해상도, 추론당 32개 동작, 15Hz 실시간 제어를 달성한다.
- 동작은 카메라·차량·단팔·양팔·휴머노이드 등 6가지 구현 형태에 걸쳐 공통 표현으로 매핑된다.
- 4B 규모 VANTAGE-Bench 1위는 내부 주장이며, OpenMDW-1.1 라이선스로 배포된다.