월드 모델(world model)은 텍스트의 다음 단어만 예측하는 대신, 현재 관찰과 행동이 주어졌을 때 방·도로·로봇 팔 같은 환경의 다음 상태를 예측하려는 모델이다. 이 예측을 여러 번 이어 붙이면 행동하기 전의 시뮬레이션, 계획, 가상 환경 생성으로 활용할 수 있다.
언어 모델과 무엇이 다른가
| 관점 | 언어 모델 | 월드 모델 |
|---|---|---|
| 예측 대상 | 다음 토큰 | 다음 상태·관찰 |
| 입력 | 주로 텍스트 | 영상, 센서, 행동, 공간 정보 |
| 핵심 능력 | 언어적 일관성 | 시간적·공간적·물리적 일관성 |
| 대표 용도 | 질의응답, 코드 | 로봇 계획, 자율주행, 시뮬레이션 |
영상이 자연스럽게 보인다고 물리 법칙을 이해한 것은 아니다. 물체가 가려진 뒤에도 존재하는지, 밀면 어떤 방향으로 움직이는지, 행동을 바꾸면 결과가 인과적으로 달라지는지가 더 중요한 검증 기준이다.
어디에 쓰이나
- 로보틱스: 실제 로봇을 위험하게 움직이기 전에 가능한 결과를 예측한다.
- 자율주행: 다른 차량·보행자·도로 상황의 다음 변화를 가상으로 전개한다.
- 생성형 미디어: 사용자가 조작 가능한 일관된 3D·영상 환경을 만든다.
- 기업 시뮬레이션: 설비·물류·운영 시나리오의 변화를 합성해 의사결정을 돕는다.
현주소와 주의점
World Labs, DeepMind Genie, NVIDIA Cosmos, Meta V-JEPA처럼 이름은 같아도 실제로는 신경 물리 시뮬레이터, 생성형 비디오, 잠재 상태 예측기, 행동 정책 등 접근이 다르다. 공개된 What-If World 평가에서도 인과 추론 성능은 아직 제한적이다. 그러므로 데모의 시각 품질만 보고 로봇 제어·안전 의사결정에 바로 쓰면 안 되며, 목표 환경의 장기 예측 오류와 안전 한계를 별도 평가해야 한다.
관련 문서
- nvidia-cosmos — 피지컬 AI 데이터·월드 기반 모델 플랫폼
- cosmos-3-edge — 엣지 로봇을 위한 소형 월드 모델
- qwen-agentworld — 언어로 에이전트 환경을 시뮬레이션하는 월드 모델 연구
- physical-ai-simulation — 피지컬 AI 시뮬레이션 엔진 선택 기준
참고 자료
- From Words to Worlds: The Rise of World Models — Techstrong.ai (2026-08-11)