1. 비전 중심 로보틱스의 뼈아픈 병목, '시각 폐쇄(Occlusion)'
최근 로보틱스 업계, 특히 휴머노이드 분야를 보면 너도나도 카메라 기반의 비전 파운데이션 모델(VLA)과 엔드투엔드(E2E) 학습을 외치고 있습니다. 대형 카메라 센서와 인공지능이 알아서 다 해줄 것처럼 말이죠. 하지만 실제 현장에서 로봇을 만지는 엔지니어들은 다들 알고 있습니다. 로봇이 물건을 집어 올리는 바로 그 순간, 카메라 시야는 로봇 자신의 손가락에 의해 완벽하게 가려진다는 사실을요. 이를 엔지니어링 용어로 '자가 폐쇄(Self-occlusion)'라고 부릅니다.
캐나다의 대표적인 휴머노이드 기업인 Sanctuary AI의 이번 발표는 바로 이 지점을 정조준하고 있습니다. 정교한 조작(Dextrous Manipulation)은 단순히 눈으로 보고 경로를 계획(Planning)하는 차원의 문제가 아니라, 보이지 않는 상태에서 끊임없이 미끄러짐을 감지하고 힘을 조절하는 '상호작용(Interacting)'의 영역이라는 것이 핵심입니다.
💡 Sanctuary AI 기술 발표 핵심 요약
- 핵심 과제: 물체를 쥐는 순간 발생하는 시각적 폐쇄(Occlusion) 극복
해결 솔루션: 유압식 액추에이터 기반의 고유 힘 피드백 + 고해상도 촉각 센서(Touch Sensors)의 하이브리드 융합
- 비즈니스 타깃: 기존 산업용 로봇 하드웨어(Industrial Arms)에 정교한 촉각 조작 성능을 이식하는 브라운필드 시장 공략
2. 유압식 액추에이터와 촉각 센서의 하이브리드 아키텍처
많은 휴머노이드 제조사(예: Tesla Optimus, Unitree 등)가 가볍고 제어가 용이한 전기 모터와 감속기 조합을 선택할 때, Sanctuary AI는 독특하게도 유압식(Hydraulic) 액추에이션 기술을 고집해 왔습니다.
이유는 단순합니다. 유압식 시스템은 유체의 압력 변화를 실시간으로 모니터링할 수 있기 때문에, 외부에서 가해지는 힘(Force)을 별도의 고가 토크 센서 없이도 거의 '공짜(for free)'로 감지할 수 있습니다. 이를 백드라이버빌리티(Backdrivability)와 힘 피드백 루프에 결합하는 아키텍처는 아래와 같은 흐름으로 작동합니다.
flowchart TD
A["① 비전 센서 (대략적인 물체 위치 파악)"] --> B["② 1차 접근 및 그리핑 시작"]
B --> C["③ 자가 폐쇄 (Occlusion) 발생 <br/>*비전 피드백 차단*"]
C --> D["④ 유압식 압력 감지 <br/>*대략적인 힘 피드백*"]
C --> E["⑤ 손가락 촉각 센서 작동 <br/>*미세 텍스처 및 슬립 감지*"]
D --> F["⑥ 하이브리드 햅틱 제어 루프 <br/>*실시간 토크/압력 보정*"]
E --> F
F --> G["⑦ 안정적인 물체 파지 및 조작 완료"]
classDef default fill:#f8faff,stroke:#0066cc,stroke-width:1.5px,color:#222,font-size:13px;
유압식 힘 피드백이 주는 압도적 이점
전기 모터 구동계에서 외력을 감지하려면 전류치를 역산하거나 감속기 단에 정밀 토크 센서를 달아야 합니다. 하지만 감속기 자체의 마찰력(Friction)과 백래시(Backlash) 때문에 미세한 외력 변화를 걸러내기가 무척 까다롭습니다.
반면, 유압 실린더는 유체 압력 자체를 직접 측정하므로 응답 속도가 빠르고 직관적입니다. Sanctuary AI는 이 유압식 힘 피드백 위에 고해상도 촉각 센서를 레이어링(Overlay)하는 방식을 취했습니다. 쉽게 말해, 유압을 통해 '내 손이 무언가 단단한 것에 닿았다'는 거시적 힘을 느끼고, 손가락 끝의 촉각 센서로 '물체가 미끄러지려 하니 손가락 마디를 2mm 더 쥐어야겠다'는 미시적 제어를 수행하는 이중 피드백 루프를 완성한 것이죠.
3. 기존 기술 대비 실무적 한계 및 극복 과제
현업 엔지니어의 시각에서 봤을 때, Sanctuary AI의 이 '유압+촉각' 하이브리드 접근법은 매우 현실적이고 영리한 돌파구입니다. 하지만 실제 양산 및 현장 적용(Deployment) 관점에서는 여전히 몇 가지 뼈아픈 과제들이 남아 있습니다.
데이터셋 표준화의 부재
비전 데이터(이미지, 비디오)는 인터넷에 널려 있고 표준 포맷(JPEG, MP4)이 확립되어 있어 파운데이션 모델 학습이 쉽습니다. 반면, 촉각 데이터(Tactile Data)는 센서 제조사마다 출력 포맷이 다르고 표준화된 데이터셋이 거의 없습니다.
유압식 압력 데이터 역시 로봇 하드웨어의 관절 배치, 밸브 특성에 종속적이기 때문에 범용적인 물리 AI(Physical AI) 모델로 전이 학습(Transfer Learning)을 시키기가 극도로 어렵습니다. Sanctuary AI 역시 이 촉각 피드백 데이터를 인공지능 모델에 어떻게 규격화하여 주입할 것인가에 대한 아키텍처적 고민을 깊게 하고 있을 겁니다.
누유와 유지보수의 장벽
유압식 시스템은 강력한 힘과 자연스러운 피드백을 주지만, 누유(Leakage) 문제에서 자유로울 수 없습니다. 특히 정밀한 반도체 공장이나 깨끗해야 하는 물류 창고에서 미세한 유압유 누출은 치명적입니다. 또한, 전기 모터에 비해 복잡한 유압 라인과 밸브 시스템은 현장 유지보수 엔지니어들에게 엄청난 관리 리스크를 안겨줍니다. 오프더쉘프(Off-the-shelf) 시장에서 왜 여전히 전기 모터 구동식 로봇 팔이 주류를 차지하는지 보여주는 반증이기도 하죠.
🎬 전체 실증 및 인터뷰 영상
(설명: Sanctuary AI 담당자가 설명하는 시각 폐쇄 상황에서의 촉각 피드백 및 유압식 제어 메커니즘)
4. 마치며
눈으로 보고 경로를 짜는 'Planning'만으로는 물리 세계의 거친 불확실성을 절대 극복할 수 없습니다. 주머니 속에 손을 넣어 열쇠를 쥐거나, 불투명한 부품 상자(Tote) 속에서 부품을 더듬어 꺼내는 인간의 일상적인 동작은 철저히 보이지 않는 상태에서의 상호작용(Interacting)에 기반하기 때문입니다.
Sanctuary AI가 보여준 유압식 힘 피드백과 촉각 센서의 레이어링 아키텍처는, 단순히 똑똑한 두뇌(LLM/VLA)를 만드는 것을 넘어 '제대로 느끼는 몸체(Physical Embodiment)'를 만드는 것이 얼마나 중요한지 다시금 일깨워 줍니다. 기존 산업용 로봇 팔에 이러한 정교한 덱스터리티(Dexterity)를 이식하겠다는 이들의 시도가 성공한다면, 우리는 공장 바닥에서 사람처럼 부품을 조립하는 진짜 '피지컬 AI'의 시대를 더 빨리 맞이하게 될지도 모르겠습니다.