💡 [연재 기획] 샤오미 MiMo-V2.6 심층 엔지니어링 시리즈 (총 2편)
- 1편 (아키텍처): [아키텍처 편] 1조 파라미터 MoE 구조와 100만 달러 비동기 GRPO 강화학습 인프라 딥다이브
- 2편 (현재 글): [실무 실증 편] 3D 가상 공간 인지와 VLA 로봇 제어 실증 (Three.js·Blender 및 물리 한계 분석)
1. 샤오미 MiMo 2.6 라인업의 핵심 발표와 실증 요약
최근 빅테크 기업들의 피지컬 AI(Physical AI)와 임바디드 AI(Embodied AI) 경쟁이 뜨거운데요, 이번에 샤오미(Xiaomi)가 정말 작정하고 만든 듯한 오픈소스 모델을 들고 나왔습니다. 바로 MiMo 2.6 라인업입니다.
이번 발표의 핵심은 로봇 공학의 성배라 불리는 RSI(Robot-Scene Interaction, 로봇-환경 상호작용)로 가기 위한 확장형 강화학습(RL Scaling) 아키텍처를 전면에 내세웠다는 점입니다. 라인업은 최고 성능을 지향하는 MiMo 2.6 Pro와 연산 효율 및 속도에 극대화된 MiMo 2.6 Flash로 이원화되었는데요, 특히 Pro 버전에는 기존 대비 최대 20배 빠른 출력을 뽑아내는 '울트라 스피드 모드'가 탑재되어 실시간 제어 성능을 대폭 끌어올렸습니다.
무엇보다 놀라운 건 가격 정책입니다. 이전 2.5 버전의 파격적인 단가를 그대로 유지하면서 성능만 대폭 올렸는데, 백만 토큰당 입력 43센트, 출력 87센트 수준입니다. 글로벌 빅테크의 프론티어 모델들과 비교하면 지능 대비 비용이 무려 20분의 1에서 60분의 1 수준에 불과하네요. 게다가 100만 토큰의 컨텍스트 윈도우를 기본 제공하고, OpenRouter를 통해 오픈소스로 완전히 풀렸기 때문에 현업 엔지니어들이 시뮬레이터나 테스트베드에 즉각 연동해 볼 수 있는 최적의 환경이 열렸습니다.
🎬 [03:20] 3D 공간 추론 및 로보틱스 시뮬레이션 제어 실증
(설명: MiMo 2.6 Pro가 단순 텍스트와 이미지를 넘어, 물리 엔진이 작동하는 3D 세계를 이해하고 로봇 제어 코드를 자율 생성하는 구간입니다.)
2. 현업 엔지니어가 분석한 MiMo 2.6의 아키텍처적 무기
로봇 엔지니어 관점에서 이번 MiMo 2.6 Pro가 보여준 3D 공간 추론과 물리적 검증(Verifiable Tasks) 능력은 꽤 신선한 충격을 줍니다. 단순히 그럴싸한 텍스트를 뱉는 LLM을 넘어, 물리적 공간의 기하학(Geometry)과 동역학(Dynamics)을 내재화하려는 시도가 엿보이기 때문입니다.
RL Scaling을 통한 물리적 검증 메커니즘
MiMo 2.6이 기존 오픈소스 모델들과 차별화되는 지점은 바로 '검증 가능한 작업(Verifiable Tasks)'에 대한 강화학습(RL) 학습 방식을 고도화했다는 것입니다.
예를 들어, 모델에게 물리 법칙이 작용하는 3D 소닉 스타일 게임이나 F1 드리프트 시뮬레이션을 코딩하라고 지시했을 때, 단순히 코드 문법만 맞추는 게 아닙니다. 중력 가속도, 마찰력, 카메라 앵글 제어 등 실제 '동작하는 물리 시스템'을 피드백 루프 안에서 스스로 검증하며 최적화합니다. 이는 로봇 분야에서 시뮬레이션 환경(Sim)의 피드백을 받아 정책(Policy)을 진화시키는 Sim2Real 강화학습 파이프라인과 정확히 궤를 같이합니다.
VLA(Vision-Language-Action) 모델로서의 3D 공간 추론
실제 구동 데모를 보면 Three.js나 Blender 장면을 생성하고, 아이소메트릭(등각 투영) 뷰에서 마우스 오버 시 가구들이 반응하는 인터랙티브 3D 룸을 빌드해 냅니다.
이것이 의미하는 바는 큽니다. 모델이 2D 픽셀 격자를 넘어, 깊이(Depth)와 가려짐(Occlusion)이 존재하는 3D 공간의 맥락을 완벽히 이해하고 있다는 뜻이거든요. 이러한 3D 공간 인지 구조는 로봇이 3차원 공간에서 장애물을 회피하고 매니퓰레이터(로봇 팔)의 궤적을 계획하는 VLA(Vision-Language-Action) 모델의 뼈대가 됩니다.

flowchart TD
A["① 멀티모달 입력 데이터 수집<br/>(Vision, Language, Action History)"] --> B["② 확장형 RL 기반 추론 엔진<br/>(검증 가능한 작업 및 CoT 탐색)"]
B --> C["③ 3D 공간 및 물리 법칙 추론<br/>(Blender / Three.js 시뮬레이션)"]
C --> D["④ 로봇 제어 명령 및 액션 출력<br/>(Sim2Real 제어 코드 생성)"]
classDef default fill:#f8faff,stroke:#0066cc,stroke-width:1.5px,color:#222,font-size:13px;
3. 기존 방식 대비 비교 분석 및 실무 고려사항
하지만 필드에 있는 엔지니어로서 마냥 감탄만 하고 있을 수는 없겠죠. 이 강력한 모델을 실제 하드웨어 로봇이나 상용 솔루션에 얹으려고 할 때 마주치게 될 현실적인 한계와 고려사항들을 짚고 넘어가야 합니다.
물리적 일관성(Physics Consistency)의 롱테일 오류
실증 테스트 중 뉴욕 스카이라인 SVG 생성 씬을 보면 아주 흥미로운 버그가 하나 잡힙니다. 다리가 있어야 할 자리에 건물들이 겹쳐서 생성되고, 그 위로 자동차들이 하늘을 날아다니는 현상이 발생하죠.
이것이 바로 현재 생성형 AI가 가진 대표적인 롱테일(Long-tail) 물리 오류입니다. 시각적으로는 그럴듯한 렌더링을 하지만, '차는 다리 위로만 다녀야 한다'는 물리적 제약 조건(Hard Constraints)을 완벽하게 보장하지 못하는 것이죠. 시뮬레이션 안에서는 단순 해프닝으로 끝나지만, 실제 60kg짜리 휴머노이드 로봇이 계단을 오르거나 물건을 나르는 실태스크에서 이런 궤적 오류가 발생하면 즉각적인 하드웨어 파손이나 인명 사고로 이어집니다. 따라서 실제 로봇에 적용할 때는 VLA의 출력을 그대로 액추에이터에 쏘는 것이 아니라, 하단에 물리적 충돌 회피 및 역동학 제어를 담당하는 전통적인 제어기(MPC 등)를 안전 필터(Safety Filter)로 반드시 결합해야 합니다.
실시간 제어(Real-time Control)의 병목과 추론 지연 시간
Pro 울트라 스피드 모드가 아무리 빨라졌다고 해도, 온보드(On-board) 환경에서 1M 토큰급 컨텍스트를 처리하는 대형 모델을 실시간으로 추론하는 것은 또 다른 문제입니다. 로봇의 햅틱 피드백이나 모터 토크 제어는 최소 100Hz에서 1kHz(1ms~10ms) 수준의 극도로 낮은 지연 시간(Latency)을 요구합니다.
현실적인 타협안은 하이레벨 태스크 플래닝(예: "냉장고에서 콜라 가져와")은 클라우드 상의 MiMo 2.6 Pro 같은 대형 VLA가 1~2초 주기로 수행하고, 로봇 팔의 관절 제어 같은 로우레벨 제어는 로컬 디바이스의 경량화된 정책 네트워크가 전담하는 하이브리드 아키텍처를 구성하는 것입니다.
🎬 [08:34] 3D 물리 엔진 시뮬레이션 디테일 분석
(설명: 3D 공간에서 복잡한 물리 법칙이 적용된 F1 드리프트 씬을 자율적으로 구현하고 렌더링하는 실증 장면입니다.)
4. 마치며
샤오미의 행보를 보면 단순히 가전제품이나 스마트폰을 잘 만드는 제조사를 넘어, 로보틱스와 인공지능 생태계를 통째로 장악하려는 거대한 그림이 보입니다. 자사 휴머노이드 로봇인 CyberOne을 개발하며 쌓은 피지컬 AI 노하우가 이러한 파운데이션 모델(VLA) 고도화에 강력한 밑거름이 되었음이 분명합니다.
이번 MiMo 2.6 Pro의 출시는 값비싼 상용 폐쇄형 API에 의존하던 로봇 연구진과 개발사들에게 가뭄의 단비 같은 존재가 될 것입니다. 비록 물리적 안전 필터 설계와 실시간 지연 시간 극복이라는 숙제가 남아있지만, 이 정도 가격에 이만한 3D 인지 능력을 갖춘 오픈웨이트 모델이 풀렸다는 것 자체로 피지컬 AI의 진입 장벽이 한 단계 더 낮아졌다고 확신합니다. 당장 오늘 퇴근하고 시뮬레이터에 MiMo API를 연동해 테스트해 봐야겠네요. 여러분의 생각은 어떠신가요?
📚 [연재 1편 안내] 1조 파라미터와 100만 달러 비동기 GRPO 인프라 분석
MiMo-V2.6의 3D 공간 추론과 시뮬레이션 제어 코드를 가능케 한 '훈련 뒷단'의 기술이 궁금하시다면,
1조 파라미터 MoE 구조, 100만 달러 규모의 비동기 GRPO 훈련 루프, 리워드 해킹 방지 노하우를 다룬 [1편: 아키텍처] 100만 달러 비동기 GRPO로 빚어냈다: 샤오미 MiMo-V2.6이 딥시크와 빅테크를 저격한 강화학습 인프라의 비밀 을 함께 확인해 보세요!
참고 자료 및 공식 영상 (References)
- 영상 출처: WorldofAI 공식 유튜브 채널 - Xiaomi MiMo-V2.6 Pro IS THE BEST Open Source Model EVER! (Fully Tested)
- 공식 원문 기사: VentureBeat - Xiaomi's MiMo-V2.6-Pro Debuts as Top Open Weights Model
- 커뮤니티 발굴 소스: Reddit r/reinforcementlearning 토론 원문