양손 가정 조작 시연 1,500시간 공개와 XR-2가 보여준 두 가지 스케일 축 | DAKER 커뮤니티
2026년 9월 3일, 양손 가정 조작 데이터를 다룬 새로운 공개 소식이 나왔습니다. 일상 가정 과제를 포함한 양손(bimanual) 시연 1,500시간이 공개되었고, 이를 바탕으로 비전–언어–행동(VLA) 모델 XR-2를 학습했다는 내용입니다. 로봇 조작 연구에서 데이터 규모와 학습 방식이 성능에 어떤 영향을 주는지, 비교적 분명한 축으로 정리해 보여준 점이 눈에 띕니다.
특히 이 논문은 단순히 데이터가 많다고 말하는 데서 그치지 않고, 전문가 시연량과 실시간 인간 개입 DAgger 보정 데이터를 분리해 봅니다. 어떤 축에서 성능이 오르는지 구분해 읽을 수 있다는 점에서, 재현 연구나 실험 설계를 고민하는 팀에도 참고할 만한 발표입니다.

논문은 2026-09-03 arXiv에 올라왔습니다. 초록은 arXiv:2609.03591에서 확인할 수 있습니다. 영문 제목은 Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections입니다. 저자는 Jiafeng Xu, Qi Li, Yan Shen, Yiyu Ren, Travis Davies, Shaowen He, Ze Wang, Yifan Yang, Ran Cheng, Hao Dong입니다. PDF는 같은 번호의 pdf입니다. 이 글은 제공된 사실과 초록에서 확인한 범위만 옮깁니다.
1,500시간의 양손 가정 조작 데이터를 공개했습니다
논문이 출발점으로 삼는 문제는 분명합니다. 견고한 양손 조작을 위한 범용 정책 학습은 고품질의 대규모 사람 시연 데이터가 부족할 때 쉽게 막힙니다. 연구팀은 이 지점을 겨냥해, 일상 가정 과제를 다루는 다양한 양손 시연 1,500시간을 공개하고, 그 코퍼스로 XR-2라는 VLA 모델을 학습했다고 설명합니다.
또한 목적에 맞게 설계한 고처리량 데이터 파이프라인과 다단계 학습을 함께 제시합니다. 논문은 체계적 실험에서 강한 조작 성능을 보이면서도 학습 효율과 데이터 활용이 좋다고 보고합니다. 다만 이 글에서는 초록에 없는 세부 벤치 점수나 모델 크기까지 확장하지 않습니다.
이 연구의 핵심은 양손 가정 조작을 위한 1,500시간 규모의 공개 시연 코퍼스와, 이를 바탕으로 학습한 XR-2를 함께 제시했다는 점입니다.
XR-2가 본 두 가지 스케일 축
이 논문에서 특히 중요한 부분은 스케일을 두 축으로 나눠 본다는 점입니다. 첫째는 전문가 시연량의 변화입니다. 둘째는 실시간 인간 개입에서 얻은 DAgger 보정 데이터로 후학습하는 축입니다.
논문은 조사한 데이터 범위에서 두 설정 모두 과제 성공률이 꾸준히 상승하는 스케일링 경향을 보였다고 적습니다. 즉, 시연 데이터가 늘어날 때와 온폴리시 보정 데이터가 추가될 때를 분리해서 봐도, 각각 성능 향상 흐름이 관찰되었다는 뜻입니다.
전문가 시연량과 온폴리시 DAgger 보정량은, 조사한 데이터 범위에서 모두 과제 성공률 상승과 함께 움직였습니다.
이 결과는 XR-2의 학습 용량과 함께, 공개 데이터셋 자체의 스케일링 가능성을 뒷받침하는 근거로 제시됩니다. 데이터셋은 재현 가능한 양손 조작 학습 연구를 위해 오픈소스한다고 밝혔지만, 초록에는 구체 다운로드 URL이 없습니다. 따라서 공개 범위는 논문이 밝힌 수준까지만 읽는 것이 좋습니다.
이 발표를 읽을 때 놓치지 말아야 할 점
이 글이 말하는 것은 모든 가정 과제에서의 보장된 성공이 아닙니다. 어디까지나 조사한 데이터 범위 안에서 관찰된 스케일링 경향 보고입니다. 같은 이유로, DAgger 보정이 언제나 무한히 성능을 올린다는 약속으로 읽을 수도 없습니다.
또한 1,500시간이라는 숫자는 논문이 공개한 코퍼스 규모입니다. 특정 팀이 그 전체를 이미 재학습했다는 뜻은 아닙니다. 초록에 없는 세부 벤치 점수, 모델 파라미터 수, 구체 데이터 URL 역시 이 글에서 확정할 수 있는 정보가 아닙니다.
1,500시간은 공개 코퍼스의 규모이며, 세부 점수와 모델 크기까지 이 글이 확정하는 것은 아닙니다.
재현 관점에서 보면 무엇이 남는가
재현 연구 관점에서 이 논문이 남기는 메시지는 비교적 실용적입니다. 양손 조작을 다룰 때는 단순히 데이터 총량만 적기보다, 전문가 시연과 온폴리시 보정 데이터를 구분해 기록하는 편이 해석에 도움이 됩니다. 논문도 바로 그 구분을 통해 성능 상승 경향을 읽어냅니다.
또한 양손 조작은 한 팔 조작보다 협조와 접촉의 의미가 큽니다. 따라서 성공 여부를 볼 때도 양손이 동시에 물체를 다루는 구간이 어떤 역할을 하는지 함께 보는 것이 자연스럽습니다. 다만 이 역시 이 글에서 새 기준을 추가하는 것이 아니라, 논문이 다루는 문제의 성격상 중요하게 읽히는 지점입니다.
참고 자료
https://arxiv.org/abs/2609.03591
https://arxiv.org/pdf/2609.03591
양손 조작 데이터의 규모와 온폴리시 보정의 역할을 함께 본 이번 발표에서, 가장 인상 깊었던 지점은 무엇이었나요?