UCAG-P가 보여준 통합 로봇 정책의 조건: 팔·휴머노이드·손을 한 기하로 묶는 방법 | DAKER 커뮤니티

로봇 팔, 휴머노이드, 사람 손 시연을 한 정책으로 함께 학습하려는 시도는 많았지만, 실제로는 데이터의 이질성 때문에 자주 막힙니다. 로봇 형태가 다르고, 카메라 배치가 다르며, 저수준 행동 공간도 제각각이기 때문입니다. 이 차이를 억지로 하나의 조인트 명령으로 맞추면, 정작 정책이 배워야 할 조작 능력보다 리타깃팅 오차가 더 크게 작동하기 쉽습니다.

2026년 8월 26일 Xiaomi Embodied Intelligence Team과 University of Macau 연구진이 arXiv에 공개한 UCAG-P는 이 문제를 다른 방식으로 다룹니다. 핵심은 로봇별 명령을 직접 공유하지 않고, 카메라에서 관측되는 운동을 공통의 기하 행동 공간으로 삼는 데 있습니다. 이 글은 arXiv:2608.26058 초록과 프로젝트 페이지에 나온 범위 안에서, 왜 이 접근이 중요한지 정리합니다.

한 정책으로 로봇과 휴머노이드와 손을 같이 다룹니다

논문은 2026년 8월 26일 arXiv에 올라왔습니다. 초록은 arXiv:2608.26058에서 확인할 수 있고, PDF는 같은 번호의 pdf입니다. 프로젝트 페이지는 https://public-bots.github.io/UCAG-P입니다. 저자는 Xiaomi Embodied Intelligence Team, University of Macau, Shaoqing Xu, Fang Li, Guozhi Zhan, Zhixiang Duan, Yuhan Wang, Yuechen Luo, Shengyin Jiang, Hanbing Li, Zhiying Du, Longlong Wang 외 12명입니다.

한 정책으로 로봇과 휴머노이드와 손을 같이 다룹니다 장면

로봇별 명령 대신 카메라에서 보이는 운동을 공유합니다

UCAG-P는 로봇 전용 제어 명령을 바로 공유 정책의 목표로 두지 않습니다. 대신 조작을 이미지·카메라 좌표계에서 관측 가능한 앵커 운동으로 표현합니다. 이 방식에서는 로봇 팔, 휴머노이드, 사람 손이 서로 다른 하드웨어이면서도 같은 행동 스키마 안에 놓입니다.

이후 기하 조건 행동 변환기가 예측된 운동과 목표 신체의 기구학을 결합해 실제로 실행 가능한 제어로 바꿉니다. 즉, 공유 정책은 전이 가능한 조작 기하를 배우고, 각 신체에서 가능한 제어의 차이는 변환기가 맡는 구조입니다.

공유 타깃을 로봇별 조인트 명령이 아니라 카메라에서 보이는 운동으로 두고, 실행 변환은 신체별로 분리하는 것이 UCAG-P의 핵심입니다.

이 점이 중요한 이유는 분명합니다. 기존에는 명시적 행동 리타깃팅, 인간-로봇 비디오 합성, 데이터셋별 적응 분기 같은 방식으로 불일치를 처리해 왔는데, 초록은 이런 접근이 통합 정책의 공동 학습을 근본적으로 방해한다고 설명합니다. UCAG-P는 이질성을 후처리로 덮는 대신, 처음부터 공유 기하 공간으로 구조화합니다.

학습 데이터와 단일 체크포인트 성능

초록에 따르면 UCAG-P는 로봇·시뮬레이션 데이터 4.03K시간과 인간 시연 2.34K시간으로 학습합니다. 그리고 단일 체크포인트가 벤치별 파인튜닝 없이 LIBERO 98.3%, RoboTwin Easy 88.7%, RoboTwin Hard 89.2%, LIBERO-Plus 제로샷 82.0%, RoboCasa GR-1 62.0%에 도달했다고 보고합니다.

단일 체크포인트가 벤치별 파인튜닝 없이 여러 벤치마크를 통과했다는 점이 이 결과의 중심입니다.

여기서 중요한 것은 숫자 자체만이 아니라 조건입니다. 같은 모델이 여러 벤치에서 동작했다는 점, 그리고 벤치별 파인튜닝이 없었다는 점이 통합 정책이라는 주장과 직접 연결됩니다. 따라서 이 결과를 인용할 때는 점수만 떼어내기보다, 단일 체크포인트와 파인튜닝 없음이라는 조건을 함께 적는 것이 좋습니다.

UCAG-P가 겨냥한 병목은 무엇인가

범용 비전-언어-행동(VLA) 정책을 키울 때 가장 큰 병목 중 하나는 신체화 데이터의 이질성입니다. 초록이 짚는 세 축은 로봇 형태, 카메라 배치, 저수준 행동 공간입니다. 이 세 가지가 다르면, 같은 조작 장면을 보더라도 데이터셋끼리 바로 합쳐 학습하기 어렵습니다.

UCAG-P는 이 문제를 공유 기하 행동 공간으로 정렬하는 방식으로 다룹니다. 공유 공간은 기하이고, 실제 실행은 변환기가 담당합니다. 그래서 사람 손 시연을 넣을 때도 먼저 로봇 조인트로 바꾸는 대신, 카메라에서 보이는 앵커 운동으로 맞춘 뒤 목표 신체에 맞게 변환하는 흐름을 취합니다.

공유 공간은 기하이고, 실행은 변환기입니다.

이 구조는 통합 학습에서 자주 생기는 혼선을 줄여 줍니다. 데이터셋마다 별도 분기를 늘리는 방식은 당장은 편해 보여도, 결국 하나의 통합 체크포인트가 무엇을 배웠는지 확인하기 어렵게 만듭니다. UCAG-P는 그 분기를 줄이는 방향을 제시합니다.

제로샷 수치가 말해 주는 것

LIBERO-Plus 제로샷 82.0%는 단순한 부가 수치가 아닙니다. 같은 체크포인트가 본 적 없는 변형에도 얼마나 견디는지를 보여 주는 지표이기 때문입니다. 학습 분포와 유사한 장면에서만 잘 작동하는 모델이라면, 통합 기하를 배웠다고 보기 어렵습니다.

또한 RoboCasa GR-1 62.0%처럼 신체나 과제가 다른 결과도 같은 표 안에서 별도로 읽어야 합니다. 팔, 휴머노이드, 손을 한 문장으로 뭉뚱그리기보다, 어떤 신체와 어떤 벤치에서 나온 수치인지 구분해 보는 편이 정확합니다. RoboTwin Easy 88.7%와 Hard 89.2% 역시 평균 한 줄로 지우기보다 난이도 차이를 그대로 남겨 두는 편이 좋습니다.

이 글에서 확인할 수 있는 범위

이 글은 초록과 프로젝트 페이지에 나온 사실만 옮깁니다. 따라서 조인트 리타깃팅 튜토리얼을 제공하는 글은 아니고, 초록 밖의 벤치 점수를 덧붙이는 글도 아닙니다. RoboCasa GR-1 62.0%는 해당 설정에서 보고된 수치이며, 모든 휴머노이드에 일반화된 값으로 읽으면 곤란합니다.

마찬가지로 인간 시연만으로 로봇 정책이 완성된다고 말하는 내용도 아닙니다. 초록은 로봇·시뮬레이션 4.03K시간과 인간 시연 2.34K시간을 함께 제시합니다. 한쪽만으로 결론을 내리기보다, 서로 다른 데이터가 어떤 구조 안에서 결합되는지를 보는 편이 더 중요합니다.

참고 자료

arXiv:2608.26058 — UCAG-P (2026-08-26)
PDF
Project

여러 신체를 하나의 정책으로 묶을 때, 여러분은 조인트 공간보다 카메라 중심 기하를 먼저 맞추는 접근이 얼마나 현실적이라고 보시나요?