Command Palette
Search for a command to run...
세계 행동 모델 WAM
월드 액션 모델(WAM)은 체화된 지능 및 로봇 공학 분야를 위한 새로운 AI 기반 모델 아키텍처입니다. 이 모델은 2026년 2월 NVIDIA에서 처음 제안되었으며, 관련 연구는 "WAM"이라는 제목의 논문에 발표되었습니다.세계 행동 모델은 제로샷 정책입니다.본 논문은 14개의 매개변수를 갖는 로봇 기초 모델인 DreamZero를 제안하고, 이 새로운 아키텍처를 정의하기 위해 처음으로 World Action Model(WAM)이라는 용어를 명시적으로 사용합니다. 논문은 기존의 VLA(단일 단계 동작만 매핑하는 모델)와 달리, WAM은 "미래의 세계 상태(비디오 스트림)"와 "로봇의 동작"을 동시에 예측함으로써 물리적 세계에 대한 사전 지식을 직접 계승하는 기초 모델이며, 따라서 매우 강력한 제로샷 일반화 능력(제로샷 정책)을 달성한다고 지적합니다. 또한, NVIDIA는 "..."라는 제목의 논문을 공식적으로 발표했습니다.세계 행동 모델이란 무엇인가?더 자세한 설명이 필요합니다.
2026년 5월, 푸단대학교, 상하이 혁신 아카데미, 싱가포르 국립대학교는 "..."라는 제목의 논문을 발표했습니다.세계 행동 모델: 구현된 AI의 다음 개척지이 논문은 체계적인 검토를 제공하며, WAM을 다음과 같이 명확하게 정의합니다. "WAM은 예측 상태 모델링과 행동 생성을 통합하는 구체화된 기초 모델로서, 행동 자체만이 아닌 미래 상태와 행동의 공동 분포를 학습하는 것을 목표로 합니다."
NVIDIA와 함께 드림제로 예를 들어, WAM의 기본 아키텍처는 실제로 대규모 비디오 생성 모델(WAN2.1 또는 NVIDIA Cosmos와 같은 비디오 확산 백본 네트워크 기반)입니다. 핵심 워크플로는 세 단계로 나눌 수 있습니다.
입력: 현재 화면 + 음성 명령 + 로봇의 현재 상태
⬇️
[WAM 코어 모델(예: 14B 파라미터 DiT 아키텍처)]
⬇️
전방 패스 1회:
- 미래 영상 프레임 예측 (미래의 세계 모습)
- 각 프레임에서의 로봇의 정확한 움직임(자유도 관절 궤적)
이러한 공동 예측을 통해 행동과 물리적 세계의 진화는 불가분하게 연결됩니다. 로봇이 정확한 행동을 생성하려면 물리 법칙(중력, 마찰, 가림 현상)에 부합하는 미래 영상을 머릿속으로 정확하게 생성해야 합니다.