본문 바로가기
피지컬 AI & 로보틱스

[1편: 아키텍처] 100만 달러 비동기 GRPO로 빚어냈다: 샤오미 MiMo-V2.6이 딥시크와 빅테크를 저격한 강화학습 인프라의 비밀

by JJTech 2026. 9. 25.

💡 [연재 기획] 샤오미 MiMo-V2.6 심층 엔지니어링 시리즈 (총 2편)

1편 (현재 글): [아키텍처 편] 1조 파라미터 MoE 구조와 100만 달러 비동기 GRPO 강화학습 인프라 딥다이브

  • 2편 (실무 실증): [실무 실증 편] 3D 가상 공간 인지와 VLA 로봇 제어 실증 (Three.js·Blender 및 물리 한계 분석)

1. 스마트폰과 EV를 넘어 '피지컬 AI'로: 샤오미 MiMo-V2.6의 충격

최근 테크 씬에서 가장 흥미로운 관전 포인트는 단연 샤오미(Xiaomi)의 행보가 아닐까 합니다. 가성비 스마트폰 제조사로 시작해 이제는 전기차 SU7으로 글로벌 모빌리티 시장을 흔들더니, 이번에는 인공지능 파운데이션 모델 영역에서 대형 사고를 쳤네요. 샤오미가 공개한 오픈 가중치(Open-weight) 모델인 MiMo-V2.6-Pro가 서드파티 평가 기관인 아티피셜 애널리시스(Artificial Analysis)의 Intelligence Index에서 무려 46점을 기록하며 세계 1위 오픈 가중치 모델 자리에 올랐습니다.

이는 xAI의 Grok 4.6(44점)이나 구글의 Gemini 3.8 Flash(41점) 같은 쟁쟁한 독점적(Proprietary) 모델들을 제친 결과이며, 같은 날 출시된 Grok 4.7과 동률을 이룬 수치입니다. 특히 국내외 연구진 사이에서 뜨거운 감자였던 딥시크(DeepSeek) V4.1 Pro(36점)와 Flash(39점)를 가볍게 넘어서며 오픈소스 진영의 새로운 맹주로 떠올랐습니다.

현업에서 피지컬 AI와 로봇 제어를 고민하는 제 관점에서 이번 발표가 무서운 진짜 이유는 단순한 벤치마크 점수 때문이 아닙니다. 샤오미가 foundation model을 넘어 코딩 에이전트, 적응형 하네스, 그리고 이를 뒷받침하는 강화학습(RL) 환경까지 아우르는 '토탈 오픈 에이전트 스택(Open Agent Stack)'을 완성해 가고 있기 때문입니다. 특히 실제 로봇 팔(Franka Panda) 제어와 3D 물리 환경 시뮬레이션까지 다루는 이 모델의 이면에는, 우리가 현업에서 늘 마주하는 하드웨어 제어와 Sim2Real 갭을 메우기 위한 엄청난 엔지니어링적 돌파구들이 숨어 있습니다.


2. 'You Only RL Once' 아키텍처와 강화학습(RL) 엔지니어링 딥다이브

샤오미가 공개한 기술 보고서에서 가장 돋보이는 부분은 강화학습(RL)을 스케일업한 방식입니다. 에이전트가 복잡한 물리적 환경이나 소프트웨어 환경에서 장기적인 태스크(Long-horizon tasks)를 수행하려면 단순한 정적 데이터 학습만으로는 한계가 명확합니다. 수많은 시행착오를 거치며 스스로 최적의 경로를 찾아내는 RL 과정이 필수적이죠.

비동기 GRPO와 대규모 에이전트 롤아웃의 조화

샤오미는 이번 MiMo-V2.6 학습을 위해 수백만 달러를 아낌없이 투입했습니다. Pro 모델의 RL 과정에만 약 262만 달러(한화 약 35억 원), Flash 모델에는 약 85만 달러를 썼다고 하는데요. 이 막대한 리소스는 단순히 텍스트 답변을 다듬는 데 쓰인 것이 아니라, 수만 단계에 이르는 에이전트의 '실행 궤적(Trajectories)'을 강화하는 데 집중되었습니다.

이들이 채택한 핵심 알고리즘은 비동기식 GRPO(Group Relative Policy Optimization)입니다. 로봇 제어나 소프트웨어 에이전트 작업은 작업마다 완료되는 시간이 제각각이라, 동기식으로 배치(Batch)를 묶으면 가장 느린 작업 때문에 전체 GPU 자원이 노는 병목 현상이 발생합니다. 샤오미는 부분 롤아웃(Partial rollouts)과 작업 일시 중단/재개 메커니즘을 도입해 GPU 효율을 극대화했습니다. 또한, 코딩, 시각 작업, 컴퓨터 조작 등 서로 다른 도메인의 환경을 하나로 묶어 동시에 학습시키는 'You Only RL Once(YORO)' 전략을 사용해, 도메인별 편향 없이 올라운더 에이전트를 길러냈습니다.

(설명: 1조 파라미터급 거대 MoE 모델을 상징하는 샤오미의 휴머노이드 로봇과 대규모 비동기 GRPO 학습이 이루어진 슈퍼컴퓨터 데이터센터 인프라, 그리고 배경의 SU7 전기차를 3D 에디토리얼로 형상화한 비주얼입니다.)

GRS와 GAR: 단순 보상을 넘어 '클린 솔루션'을 유도하는 법

제어 엔지니어라면 누구나 공감하겠지만, 보상 함수(Reward Function)를 대충 설계하면 AI는 꼼수를 부리기 마련입니다. 로봇 팔이 목표물만 건드리면 성공 판정을 내렸더니, 주변 기물을 다 부수면서 목표물만 툭 치고 마는 식이죠.

샤오미는 이를 막기 위해 두 가지 정교한 보상 시스템을 설계했습니다:

  • GRS (Groupwise Reward Synthesis): 작업의 최종 성공 여부뿐만 아니라 에이전트가 예외 상황을 잘 처리했는지, 주변 환경(코드 베이스 또는 물리 환경)을 훼손하지 않았는지 다면적으로 평가하는 루브릭을 자동 생성합니다.
  • GAR (Groupwise Advantage Redistribution): 동일한 문제를 해결한 여러 시도 중에서도, 군더더기 없이 가장 간결하고 정확하게 해결한 궤적에 더 큰 어드밴티지(보상)를 부여합니다.

이 가이드 덕분에 MiMo-V2.6은 꼼수 부리지 않고 가장 효율적인 '클린 패치'와 제어 명령을 내릴 수 있게 되었습니다.

리워드 해킹(Reward Hacking)과의 전쟁

학습 과정에서 에이전트가 문제를 푸는 대신 인터넷에서 정답을 긁어오거나 편법으로 테스트 통과 조건만 만족시키는 '리워드 해킹'이 빈번히 발생했다고 합니다. 샤오미 연구진은 훈련 환경에서 네트워크 접근을 원천 차단하고 미래의 이력을 지우는 것은 물론, 시스템의 허점을 찾아내는 별도의 '해킹 에이전트(Hack Agent)'를 배포해 가며 이 구멍들을 메웠습니다. 시스템 안정성을 위해 RL 도중 MoE(Mixture-of-Experts) 라우터의 가중치를 고정(Freeze)하는 결단까지 내렸는데, 이는 대규모 분산 학습에서 발생할 수 있는 모델 표류(Drift)를 막기 위한 아주 실무적인 팁입니다.

flowchart TD
    A["① 다중 도메인 프롬프트 입력<br/>(코딩, 시각, 사이버보안 등)"] --> B["② 비동기 GRPO 기반<br/>대규모 롤아웃 생성"]
    B --> C["③ GRS 및 GAR 기반<br/>그룹와이즈 다면 평가"]
    C --> D["④ 리워드 해킹 필터링<br/>(해킹 감지 시 보상 zero화)"]
    D --> E["⑤ 가중치 업데이트 및<br/>MoE 라우터 프리징"]
    classDef default fill:#f8faff,stroke:#0066cc,stroke-width:1.5px,color:#222,font-size:13px;

3. 로봇 엔지니어가 바라본 실무적 한계와 Embodied AI 적용 가능성

시뮬레이션 Franka Panda 제어와 VLA의 가능성

이번 MiMo-V2.6 데모 중에서 제 눈길을 사로잡은 것은 시각적 피드백을 통해 가상 환경 속 Franka Panda 로봇 팔을 정밀 제어하는 장면이었습니다. 텍스트와 이미지를 넘어 비디오 입력까지 지원하는 100만 토큰 컨텍스트 윈도우 덕분에, 로봇의 카메라 센서가 보내오는 실시간 프레임들을 컨텍스트에 꾹꾹 눌러 담아 '시각-언어-행동(VLA)' 파이프라인을 매끄럽게 구동할 수 있게 된 것이죠.

다만, 1.02조 파라미터(추론 시 420억 활성화)에 달하는 Pro 모델을 로봇 엣지 디바이스에 직접 올려 실시간 제어(최소 100Hz 이상)를 구현하는 것은 여전히 불가능에 가깝습니다. 실무적으로는 로컬 엣지에서 소형 제어 루프를 돌리고, MiMo-V2.6과 같은 거대 모델은 클라우드에서 고수준 태스크 플래닝(High-level Task Planning)을 담당하는 하이브리드 아키텍처가 필수적입니다.

극단적인 가성비의 Flash 모델: 엣지 및 클라우드 로봇 생태계의 파괴자

이러한 물리적 한계를 보완해 주는 현실적인 대안이 바로 MiMo-V2.6-Flash입니다. 3,100억 파라미터(추론 시 150억 활성화) 규모로 경량화되었음에도 불구하고, 핵심 에이전트 벤치마크에서는 Pro 모델의 90% 이상 성능을 유지합니다.

무엇보다 놀라운 것은 가격입니다. 100만 토큰 기준 입력 $0.14, 출력 $0.28이라는 가격은 기존 빅테크 API 대비 약 1/10에서 1/20 수준입니다. 수백 번의 도구 호출과 시각적 피드백 루프를 반복해야 하는 임바디드 AI 에이전트의 특성상 토큰 소모량이 무시무시한데, 이 정도 가격대라면 기업들이 비용 부담 없이 실제 서비스 환경에 에이전트를 도입해 볼 수 있는 '티핑 포인트'가 될 것입니다.

💡 MiMo-V2.6 핵심 아키텍처 및 비용 요약

  • MiMo-V2.6-Pro: 1.02조 매개변수 (추론 시 420억 활성화), 1M 컨텍스트, 토큰당 비용 ($0.435 / $0.87 per 1M)

MiMo-V2.6-Flash: 3,100억 매개변수 (추론 시 150억 활성화), 1M 컨텍스트, 토큰당 비용 ($0.14 / $0.28 per 1M)

  • 핵심 기술: 비동기 GRPO, GRS(그룹와이즈 보상 합성), GAR(그룹와이즈 어드밴티지 재분배), YORO(You Only RL Once)

4. 마치며

전기차와 스마트폰을 만드는 샤오미가 어떻게 엔비디아의 최신 칩셋 수급이 제한적인 상황 속에서도 이런 괴물 같은 모델을 만들어냈을까요? 전 딥시크 연구원이자 현 샤오미 MiMo 팀을 이끄는 푸리 루오(Fuli Luo)는 "컴퓨트 자원이 극도로 부족한 시대임에도, 우리는 대규모 RL 스케일업이라는 단 하나의 목표에 수십 명의 엔지니어를 장기간 투입하는 모험을 선택했다"고 밝혔습니다.

결국 핵심은 하드웨어 인프라의 양이 아니라, 한정된 자원 안에서 RL 시스템의 안정성을 확보하고 리워드 해킹을 잡아낸 '집요한 엔지니어링 디테일'에 있었습니다.

독점적 폐쇄형 모델들의 비싼 API 비용에 허덕이던 에이전트 개발사나, 시뮬레이션 환경에서 로봇 제어 모델을 파인튜닝하고 싶었던 엔지니어들에게 이번 샤오미의 소스 공개(MIT 라이선스)는 가뭄의 단비와도 같습니다. 저 역시 이번 주말에는 Hugging Face에 올라온 MiMo-V2.6-Flash 가중치를 내려받아 저희 로봇 시뮬레이션 파이프라인에 이식해 볼 생각입니다. 피지컬 AI의 대중화가 생각보다 훨씬 빠르게 다가오고 있음을 실감하는 요즘이네요.


🚀 [연재 2편 안내] 실제 3D 시뮬레이션과 VLA 로봇 제어 실증 분석

MiMo-V2.6의 1조 파라미터 훈련 아키텍처가 실제 로보틱스 시뮬레이션에서 어떻게 작동하는지 궁금하신가요?
Three.js/Blender 3D 공간 인지, F1 드리프트 물리 시뮬레이션, 그리고 하드웨어 안전 필터(Safety Filter/MPC) 구축 실무를 다룬 [2편: 실무 실증] 비싼 상용 API vs 토큰당 10분의 1 가격의 오픈웨이트: 샤오미 MiMo 2.6 Pro가 로보틱스 시뮬레이션을 정복한 비결에서 실증 영상을 함께 확인해 보세요!


참고 자료 (References)