1. 비디오 생성을 넘어 '행동'으로: GE-Act 2.0의 정면돌파
로보틱스 분야에서 '월드 모델(World Model)'을 구축하려는 시도는 이제 거스를 수 없는 흐름이 되었습니다. 하지만 현업에서 이를 구현할 때 마주치는 가장 큰 딜레마가 있습니다. 바로 "기존의 잘 만들어진 비디오 생성 모델(Sora, Stable Diffusion 등)을 가져다 쓸 것인가, 아니면 로봇 제어만을 위한 모델을 바닥부터 새로 학습시킬 것인가" 하는 점입니다.
기존의 많은 연구는 전자를 선택했습니다. 이미 수십억 장의 이미지로 학습된 비디오 생성기를 백본(Backbone)으로 삼아 물리적 세계의 인지 능력을 날로 먹으려(?) 했던 것이죠. 하지만 이 방식은 치명적인 약점이 있습니다. 로봇 제어 루프(보통 20Hz 이상)에서 돌리기에는 디노이징(Denoising) 단계를 수십 번 거쳐야 하는 비디오 생성 모델이 너무 무겁고 느리다는 것입니다.
중국의 대표적인 휴머노이드 스타트업인 AGIBOT(智元机器人)이 이번에 공개한 GE-Act 2.0(Genie Envisioner - Act 2.0)은 이 타협안을 거부하고 '정공법'을 택했습니다. 범용 비디오 생성 모델에 의존하지 않고, 로봇 매니퓰레이션(Manipulation) 데이터로부터 월드 생성과 액션 출력을 처음부터 끝까지(From Scratch) 함께 공동 학습(Co-pretraining)시키는 네이티브 월드 액션 모델(World Action Model, WAM)을 제안한 것입니다.
💡 AGIBOT GE-Act 2.0 핵심 아키텍처 요약
모델 분류: Native World Action Model (WAM, 월드 액션 모델)
- 학습 데이터 스케일: 300시간에서 시작해 최대 30,000시간의 매니퓰레이션 데이터로 스케일링 성공
- 핵심 혁신: 1단계 디노이징(Single-Step Denoising) 기반의 초고속 비주얼 플래너, 실패 데이터(Failed Grasp)의 자원화
2. 아키텍처 딥다이브: 제어 지향형 오토인코더와 단일 단계 플래너
GE-Act 2.0의 시스템 아키텍처를 뜯어보면, 실시간 제어 성능을 확보하기 위해 엔지니어링 측면에서 얼마나 치열하게 고민했는지 고스란히 느껴집니다. 핵심 파이프라인은 크게 세 가지 컴포넌트의 유기적인 결합으로 이루어집니다.
flowchart TD
A["Raw Video / Ego-centric Human Video"] --> B["Control-Oriented Vision Tokenizer"]
B --> C["Single-Step Visual Planner<br/>(Imagines Multiple Futures)"]
C --> D["Inverse Dynamics Model (IDM)<br/>(Infers Consistent Trajectory)"]
D --> E["Real-time Action Output<br/>(Pick, Place, Stack, etc.)"]
classDef default fill:#f8faff,stroke:#0066cc,stroke-width:1.5px,color:#222,font-size:13px;
제어 지향형 비전 토크나이저 (Control-Oriented Autoencoder)
월드 모델의 성능은 시각 데이터를 얼마나 효율적인 토큰으로 압축하느냐에 달렸습니다. 기존 토크나이저들은 모션 캡처에만 치중하거나, 의미론적(Semantic) 정보만 강조하거나, 혹은 무리하게 압축하다가 미세한 기하학적 정보를 잃어버리곤 했습니다. AGIBOT은 이 세 가지 균형을 모두 잡은 독자적인 오토인코더를 개발해, 로봇 그리퍼 끝단의 미세한 움직임과 주변 사물의 의미론적 관계를 동시에 보존하는 토큰화에 성공했습니다.
단일 단계 비주얼 플래너 (Single-Step Visual Planner)
이 아키텍처의 가장 짜릿한 부분입니다. 일반적인 확산(Diffusion) 모델 기반 월드 플래너들은 미래 예측 비디오를 만들기 위해 수십 번의 추론 패스(Pass)를 거쳐야 해서 제어 루프에 도저히 쓸 수 없었습니다. 하지만 GE-Act 2.0은 단 한 번의 패스(One Pass)로 노이즈를 제거해 미래의 시각적 상태를 상상해내는 단일 단계 플래너를 구축했습니다. 이를 통해 시스템 전체를 엔드투엔드(End-to-End)로 학습시킬 수 있는 실시간성을 확보했습니다.
역동학 모델(IDM)과 실패로부터의 학습
비주얼 플래너가 여러 개의 미래 시나리오($z_1, z_2, z_3, z_4$)를 상상하면, 역동학 모델(Inverse Dynamics Model, IDM)이 실제 일어난 물리적 궤적과 상상된 미래 궤적 사이의 일관성을 평가합니다. 가장 일관성 있는 미래를 선택해 물리 제어 토크(Action)로 변환하는 것이죠.
특히 흥미로운 점은 실패 데이터의 활용법입니다. 대다수 모방 학습 모델은 로봇이 물건을 놓치거나 실패한 궤적 데이터를 쓸모없다고 버립니다. 하지만 GE-Act 2.0의 IDM은 "왜 실패했는지, 이 실패 궤적에서 어떤 제어 입력이 들어갔는지"를 완벽한 학습 교사로 삼습니다. 실패 데이터마저도 정밀한 역동학 학습의 자양분으로 쓰는 셈입니다.
3. 30,000시간의 스케일링 법칙과 실무적 임팩트
로보틱스에서 늘 논쟁이 되는 주제가 있습니다. "데이터를 무작정 늘린다고 로봇이 진짜 똑똑해지는가?" 하는 의문입니다. AGIBOT은 이 논쟁에 대해 데이터 스케일링 벤치마크 결과로 답했습니다.
학습 데이터를 300시간에서 시작해 1,200시간, 5,000시간, 그리고 최종 30,000시간까지 확장하면서 100여 개의 미세 작업(Atomic Skills - 집기, 놓기, 쌓기, 붓기, 누르기, 열고 닫기 등)의 성공률 변화를 측정했습니다. 결과는 놀라웠습니다. 데이터가 늘어날수록 아웃 오브 디스트리뷰션(OOD, 학습 데이터 분포를 벗어난 완전히 새로운 환경)에서의 성능이 선형적으로 우상향하는 '스케일링 법칙(Scaling Law)'이 그대로 작동한 것입니다.
🎬 스마트 타임스탬프 바로재생 구간 (01:50 ~ 02:40)
(설명: 300시간에서 30,000시간으로 데이터가 스케일링됨에 따라, 한 번도 보지 못한 물체(Unseen Objects)와 낯선 환경에서 로봇의 작업 성공률이 비약적으로 상승하는 정량적 벤치마크 지표를 보여주는 구간입니다.)
특히 실무적으로 가장 고무적인 부분은 제로샷(Zero-shot) 강인성과 대립 지시문(Adversarial Instructions) 처리 능력입니다.
현업에서 로봇을 배포할 때 가장 머리 아픈 순간이 언제인가요? 사용자가 갑자기 물건을 치우거나, 중간에 명령을 취소(Cancel)하거나, 다른 물건을 집으라고 훼방을 놓을 때입니다. GE-Act 2.0은 자연어 지시문을 물리적 공간의 '어포던스(Affordance, 행동 가능성)'와 실시간으로 매핑하기 때문에, 동작 수행 도중 "멈춰!" 혹은 "다른 초록색 사과를 집어!" 같은 방해 명령이 들어와도 멈칫거림 없이 즉각적으로 궤적을 수정해 냅니다.
4. 마치며
AGIBOT의 GE-Act 2.0 발표를 보며 많은 생각이 들었습니다. 이들이 선택한 "처음부터 로봇 제어용으로 월드 모델을 빌드한다"는 전략은 엄청난 자본과 정제된 매니퓰레이션 데이터가 없으면 시도조차 하기 힘든 고난도 경로입니다. 하지만 결국 물리 AI(Physical AI) 시대의 진정한 승자는 범용 LLM/VLM을 대충 래핑해서 쓰는 곳이 아니라, 이처럼 실제 물리 엔진과 로봇의 동역학적 한계를 깊이 이해하고 하위 제어단까지 엔드투엔드로 정밀하게 엮어낸 아키텍처가 될 것임을 다시 한번 확신하게 되네요.
중국의 천재 엔지니어 '즈후이쥔(稚晖君)'이 이끄는 AGIBOT이 하드웨어뿐만 아니라 소프트웨어 파운데이션 영역에서도 테슬라 옵티머스 진영을 턱밑까지 추격하고 있다는 느낌을 강하게 받았습니다. 우리 제조 및 로보틱스 업계도 이러한 네이티브 월드 액션 모델로의 아키텍처 전환을 진지하게 고민해야 할 시점인 것 같습니다.