본문 바로가기
SDV & 자율주행 SW

엔비디아가 Jetson Thor와 Cosmos 3 Edge로 구현한 '클라우드 없는' 온디바이스 물리 AI의 실체

by JJTech 2026. 10. 3.

1. Cosmos 3 Edge 온디바이스 제어의 핵심 요약

로보틱스와 물리 AI(Physical AI) 분야에서 최근 가장 뜨거운 화두는 단연 '온디바이스(On-Device) 추론'입니다. 아무리 똑똑한 월드 모델(World Model)이라도 수십 기가바이트(GB)에 달하는 가중치 때문에 데이터센터 GPU에 의존해야 한다면, 네트워크 지연(Latency)과 연결 끊김 현상으로 인해 실시간 로봇 제어는 사실상 불가능해지기 때문인데요.

엔비디아가 새롭게 공개한 Cosmos 3 Edge는 이러한 하드웨어적 병목을 정조준한 4B(40억 매개변수) 규모의 경량 옴니 모델(Omni-model)입니다. 내부적으로 2B 규모의 NVIDIA Nemotron 기반 추론기(Reasoner)를 품고 있으면서도, 로봇의 온보드 컴퓨터인 NVIDIA Jetson Thor에서 외부 서버 도움 없이 네이티브로 구동되도록 설계된 점이 핵심입니다.

💡 Cosmos 3 Edge 핵심 아키텍처 및 실증 스펙

  • 모델 아키텍처: 4B Omni-Model (2B NVIDIA Nemotron 기반 추론기 내장)
  • 구동 플랫폼: NVIDIA Jetson AGX Thor T5000 (온보드 메모리 약 9GB 점유, BF16 포맷)
  • 학습 데이터셋: nvidia/Cosmos3-DROID (76k 성공 궤적, 약 350시간 분량, Franka Panda + Robotiq 그리퍼 조합)
  • 제어 루프 성능: 640×540 해상도, 15 Hz 기준 action chunk 생성에 1.53초 소요 (2.13초 분량의 모션 커버)
  • 폐루프(Closed-loop) 성능: RoboLab 120개 언어 조건부 조작 태스크에서 22.9% 성공률 기록

2. 아키텍처 딥다이브: 1.53초의 지연율과 연속 제어의 마법

현업 자율주행 및 로봇 제어 엔지니어 입장에서 가장 먼저 눈여겨보게 되는 지표는 역시 '제어 주기(Control Frequency)와 추론 지연 시간의 관계'입니다. 로봇 팔이 끊김 없이 부드럽게 움직이려면 제어 명령이 끊임없이 스트리밍되어야 하는데요. Cosmos 3 Edge는 이를 해결하기 위해 후퇴 수평선 제어(Receding-Horizon Control, RHC) 루프와 액션 청킹(Action Chunking) 기법을 영리하게 결합했습니다.

제어 지연을 극복하는 액션 청킹과 재계획 루프

Cosmos 3 Edge는 한 번의 추론으로 향후 15 Hz 주기로 실행될 32개의 미래 액션(약 2.13초 분량)을 통째로 예측합니다. NVIDIA Jetson AGX Thor T5000에서 이 한 청크를 계산하는 데 걸리는 시간은 약 1.53초입니다.

여기서 마법 같은 제어 루프가 완성되는데요. 로봇이 이전 추론 결과물인 32개 액션 중 앞선 16개(약 1.07초 분량)를 실행하는 동안, 온보드에서는 이미 다음 상태(State)와 카메라 입력을 받아 새로운 32개 액션 청크를 계산(1.53초 소요)하고 있습니다. 즉, 이전 액션 실행이 끝나기 전에 다음 액션 청크가 준비되므로 로봇은 멈칫거림 없이 연속적으로 동작할 수 있게 됩니다.

flowchart TD
    A["① 멀티카메라 입력 수집<br/>(Wrist 360x640 + Exterior 1&2 180x320)"] --> B["② 로봇 현재 상태 결합<br/>(7자유도 관절각 + 그리퍼 상태)"]
    B --> C["③ Cosmos 3 Edge 온디바이스 추론<br/>(Jetson Thor T5000, 1.53초 소요)"]
    C --> D["④ 32개 액션 청크 생성<br/>(15 Hz 주기의 미래 경로)"]
    D --> E["⑤ 선행 16개 액션 실행<br/>(실시간 암 제어 및 재계획 루프 트리거)"]
    E --> A
    classDef default fill:#f8faff,stroke:#0066cc,stroke-width:1.5px,color:#222,font-size:13px;

상태 조건화(State-Conditioned)와 동적 재계획

이 모델은 단순히 이미지만 보고 움직이는 비전-투-액션(Vision-to-Action) 모델이 아닙니다. 로봇의 실제 관절 위치(Joint Position)와 그리퍼 상태(Proprioception)를 모델의 입력 피처로 직접 전달받는 '상태 조건화' 모델입니다.

덕분에 매 재계획(Replan) 루프마다 로봇이 이전 청크의 예측대로 정확히 움직였는지를 확인하고, 실제 물리적 오차가 발생했다면 그 오차가 반영된 현재 시점의 관절각을 기준으로 다음 궤적을 수정합니다. 실무에서 외란(Disturbance)이 발생했을 때 시스템이 뻗지 않고 스스로 복구(Self-correction)할 수 있는 강건성을 확보한 비결이 바로 여기에 있습니다.


3. 기존 방식 대비 실무적 한계와 극복 과제

기술 문서만 보면 당장이라도 완벽한 자율 로봇을 양산할 수 있을 것 같지만, 현업 엔지니어의 차가운 눈으로 바라보면 여전히 실무 적용을 위해 넘어야 할 거대한 장벽들이 존재합니다.

22.9% 성공률의 잔혹한 현실과 성능 타협

가장 직관적인 한계는 폐루프 시뮬레이션 환경인 RoboLab(Isaac Lab-Arena 기반)에서의 성공률입니다. Cosmos 3 Edge는 120개 조작 태스크에서 22.9%의 성공률을 기록했습니다. 상위 모델인 Cosmos 3 Nano가 36.8%의 성공률을 보이는 것에 비하면 꽤 큰 폭의 하락인데요.

이는 4B라는 모델 크기 제약으로 인해 시각적 의미 이해(Semantic Understanding)와 정밀한 물리적 조작 간의 표현력(Capacity) 타협이 일어났음을 방증합니다. 온보드 칩셋의 메모리 한계(9GB 점유)를 지키기 위해 FP16/BF16 수준으로 경량화하고 추론 속도를 끌어올린 대가로, 복잡한 다단계(Multi-stage) 작업에서의 정확도를 잃은 셈입니다. 실무에 적용하려면 특정 도메인에 맞춘 고강도 파인튜닝이나 하이브리드 제어(전통적 모션 플래너와의 결합)가 필수적입니다.

상상을 초월하는 사후 학습(Post-Training) 인프라 비용

엔비디아는 이 튜토리얼을 '경량 모델의 온디바이스 구현'이라고 소개하지만, 정작 이를 위한 사후 학습(Post-training) 인프라 요구사항은 중소기업이나 스타트업 수준을 가볍게 상회합니다.

검증된 베이스라인 학습 환경을 보면 NVIDIA GB200 Grace Blackwell Superchip 64개 노드(총 256개 GPU)를 동원해 60K 이터레이션을 수행해야 합니다. 이는 약 17,400 GB200-hours에 달하는 막대한 연산량입니다. 단일 GPU나 워크스테이션 수준에서 가볍게 미세조정(Fine-tuning)할 수 있는 수준이 아닌, 사실상 파운데이션 모델의 사후 학습 영역이기 때문에 인프라 비용 부담이 매우 큽니다.


4. 마치며

이번 엔비디아의 Cosmos 3 Edge 발표는 물리 AI가 단순한 연구실의 장난감을 넘어 '실시간 로컬 제어'라는 양산형 스펙에 한 걸음 더 가까워졌음을 보여주는 이정표입니다. 비록 22.9%라는 독자적인 성공률은 아직 산업 현장에 바로 투입하기엔 무리가 있어 보이지만, 클라우드 연결 없이 오직 온보드 칩셋(Jetson Thor)의 연산만으로 1.53초의 지연율을 달성하며 연속 제어 루프를 닫았다는(Closed-loop) 사실 자체만으로도 기술적 가치는 충분합니다.

결국 미래의 SDV와 로보틱스는 외부 망이 차단된 극한의 상황에서도 안전하게 작동하는 '완전 자율형 온디바이스 에이전트'로 수렴할 것입니다. 엔비디아가 하드웨어(Thor)와 소프트웨어 파이프라인(Cosmos Framework, RoboLab)을 통째로 장악해 나가는 이 시점에서, 우리 엔지니어들이 고민해야 할 것은 이 거대한 플랫폼 위에서 어떻게 우리만의 도메인 특화 데이터셋(DROID 포맷 등)을 효율적으로 구축하고 빠르게 파인튜닝할 것인가 하는 실무적 전략이 아닐까 싶네요.


참고 자료 및 공식 영상 (References)