Cosmos 3 Edge는 nvidia-cosmos 계열의 4B 파라미터 오픈 월드 모델이다. 데이터센터급 모델을 로봇, 비전 AI 에이전트, Jetson 같은 엣지 장치에 내리기 위해 설계됐다. 장면을 이해하고, 다음 상태를 예측하고, 행동이 세계를 어떻게 바꾸는지 추론하는 것을 목표로 한다.
핵심 포인트
| 항목 | 내용 |
|---|---|
| 모델 크기 | 4B |
| 실행 대상 | NVIDIA RTX PRO, DGX, GeForce RTX, Jetson T2000/T3000 등 |
| 입력 해상도 | 로봇 제어용 640×360 관찰 |
| 액션 출력 | Jetson Thor에서 inference당 32개 action 생성 |
| 제어 속도 | 실시간 제어 15Hz 목표 |
| 공개 위치 | Hugging Face nvidia/Cosmos3-Edge |
NVIDIA는 Cosmos 3 Edge가 유사한 4B급 모델 중 VANTAGE-Bench vision analytics에서 1위를 기록했고, 로봇 policy learning에서도 state of the art라고 설명한다.
월드 모델링이 필요한 이유
로봇은 물체를 보는 것만으로 행동할 수 없다. 물체 위치, 손이나 그리퍼의 움직임, 접촉 후 결과, 실패했을 때의 다음 행동까지 추론해야 한다. 월드 모델(world model)은 현재 장면과 행동 사이의 인과관계를 학습해 “무엇이 보이는가”와 “무엇을 해야 하는가”를 연결한다.
Cosmos 3 Edge는 이 능력을 온디바이스로 가져오는 시도다. 공장, 창고, 병원처럼 지연 시간과 네트워크 의존성이 중요한 환경에서 의미가 있다.
아키텍처
Cosmos 3는 두 개의 transformer tower를 공유 표현으로 묶는다.
| 구성 | 역할 |
|---|---|
| Autoregressive tower | 비전·텍스트 토큰을 처리해 이해와 reasoning 수행 |
| Diffusion tower | 비전·오디오·액션 토큰을 처리해 예측, 생성, neural simulation 수행 |
| Shared multimodal attention | 언어, 비디오, 오디오, 액션 정보를 같은 표현 공간에서 정렬 |
언어는 causal attention을 쓰고, diffusion token은 더 넓은 문맥에 attention을 둔다. 이 구조 덕분에 모델은 먼저 장면을 이해하고, 이후 행동이나 시각적 결과를 생성할 수 있다.
액션 표현
Cosmos 3 Edge는 서로 다른 물리 시스템의 action을 공통 기하 벡터로 매핑한다.
- Translation
- Rotation
- Manipulation state
차량, 카메라, 로봇 팔, 그리퍼가 서로 다른 action 표현을 쓰더라도 모델 안에서는 시각 변화와 제어 입력을 연결할 수 있다. 이 때문에 생성 비디오는 단순한 미래 프레임이 아니라 “이 행동을 하면 세계가 이렇게 바뀐다”는 정책 학습 데이터가 된다.
후훈련과 배포
NVIDIA는 Cosmos 3 Edge Policy DROID도 함께 공개했다. DROID 데이터셋으로 post-training한 pick-and-place 로봇 조작 policy이며, 후훈련 스크립트도 제공된다. 개발자는 H100 소규모 클러스터나 NVIDIA DGX Station에서 도메인에 맞게 fine-tuning한 뒤 엣지 장치에 배포하는 흐름을 취할 수 있다.
누구에게 적합한가
- 로보틱스 팀: 센서 근처에서 장면 이해와 action 생성을 함께 처리해야 할 때
- 스마트 인프라 개발자: 공장·창고·병원 등 엣지 vision AI가 필요한 환경
- Physical AI 연구자: 세계 모델을 policy 학습과 시뮬레이션에 연결하려는 경우
- NVIDIA Jetson 사용자: 클라우드 호출 없이 로컬에서 실시간 추론을 시험하려는 경우
관련 문서
- nvidia-cosmos — Physical AI를 위한 세계 모델 오픈 플랫폼
- nvidia-agent-skills — CUDA-X와 AI Blueprint 사용법을 에이전트에 주입하는 공식 스킬 카탈로그
- agentic-autonomy-levels — AI 에이전트 자율성을 6단계로 운영하는 프레임워크
- modern-vlms — 최신 비전-언어 모델 비교
참고 자료
- Introducing Cosmos 3 Edge — Hugging Face / NVIDIA (2026-07-20)
- nvidia/Cosmos3-Edge — Hugging Face