VLAct가 말하는 VLA의 다음 단계: 로봇 데이터를 더 모으기 전에 표현을 먼저 키우는 이유 | DAKER 커뮤니티

범용 Vision-Language-Action(VLA) 모델을 이야기할 때 흔히 먼저 떠오르는 해법은 데이터 확장입니다. 다만 로봇 궤적은 웹 규모 이미지·텍스트처럼 쉽게 모을 수 없고, 물리 세계를 촘촘하게 덮기도 어렵습니다. 그래서 같은 데이터 예산 안에서도 무엇을 먼저 학습하느냐가 성능 차이로 이어집니다.

2026년 8월 27일 arXiv에 공개된 VLAct는 바로 이 지점을 겨냥합니다. 과제별 파인튜닝에 앞서, 다중 신체 로봇 데이터로 표현 중심의 이어 사전학습을 수행해 VLA의 기반 표현을 키우는 접근입니다. 이 글은 arXiv:2608.27550 초록과 공개 프로젝트 페이지 https://starvla.github.io/VLAct에 나온 범위만 정리합니다.

2026년 8월 27일 Senqiao Yang 연구팀이 과제별 파인튜닝 전에 다중 신체 로봇 데이터로 표현 중심 이어 사전학습을 하는 VLAct를 arXiv에 공개했습니다.

로봇 표현을 먼저 키운 뒤 VLA를 이어 학습합니다

논문은 2026년 8월 27일 arXiv에 올라왔습니다. 저자는 Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia입니다. 초록은 arXiv:2608.27550, PDF는 같은 번호의 pdf에서 볼 수 있습니다.

모델과 학습 파이프라인은 https://starvla.github.io/VLAct에 공개되어 있습니다.

로봇 표현을 먼저 키운 뒤 VLA를 이어 학습합니다 장면

데이터 확장만으로는 부족하다는 문제의식

논문이 출발하는 문제의식은 분명합니다. 로봇 데이터 확장은 범용 VLA에 중요하지만, 로봇 궤적은 수집 비용이 크고 물리 세계를 듬성듬성 덮습니다. 이런 조건에서는 단순히 행동을 맞추는 학습만으로는 한계가 있고, 제한된 궤적을 전이 가능한 시각·행동 지식으로 바꾸는 과정이 중요해집니다.

고정된 로봇 데이터 예산에서는 행동 적합만이 아니라 전이 가능한 표현을 만드는 일이 병목이 됩니다.

VLAct는 이 문제를 해결하기 위해, 넓고 이질적인 다중 신체 로봇 데이터로 먼저 학습한 VLA 지향 VLM 백본을 제안합니다. 핵심은 넓은 VLM 사전을 지키면서도 로봇 행동 학습을 함께 끌어오는 데 있습니다.

VLAct가 제안하는 학습 방식

초록에 따르면 VLAct는 넓은 VLM 사전을 보존하면서, 다중 헤드 연속 행동 공동 감독과 부분 통합 교차 신체 행동 배치를 사용해 신체 간 공유 행동 의미를 키웁니다. 그리고 파인튜닝 단계에서는 과제별 행동 헤드를 허용합니다.

이 구조는 신체마다 행동 공간이 다르더라도, 완전히 분리된 문제로 두지 않고 일부 의미를 공유하는 방향으로 설계된 것으로 읽힙니다. 다시 말해, 로봇별 차이를 인정하되 공통 표현을 먼저 키우는 접근입니다.

VLAct는 VLM 사전을 보존하면서 다중 신체 로봇 데이터에서 공유 행동 의미를 학습하도록 설계됐습니다.

논문은 시뮬레이션, 실세계, 미본 신체 전이에서 고정 파인튜닝 프로토콜 아래 하류 성능이 일관되게 오른다고 보고합니다.

초록에 보고된 성능 수치

성능 수치는 초록에 적힌 범위만 그대로 옮기는 것이 좋습니다. VLAct는 LIBERO-Plus에서 성공률 82.6%, RoboTwin 2.0에서 92.5%를 달성하며 ABot-M0와 LingBot-VLA를 포함한 산업 VLA 시스템을 앞선다고 적습니다.

또한 RoboDojo에서는 성공률 기준 전체 정책 중 6위이며, 명시적으로 지정된 월드-행동 모델(WAM) 항목을 두 지표 모두에서 앞선다고 합니다. 가장 눈에 띄는 결과로는 미본 휴머노이드 설정 RoboCasa-GR1에서 하류 궤적의 20%만으로 전체 데이터 GR00T-N1.6 베이스라인을 이긴다고 보고합니다.

RoboCasa-GR1에서는 하류 궤적의 20%만으로 전체 데이터 GR00T-N1.6 베이스라인을 이겼다고 보고합니다.

이 결과는 완전 오픈소스 데이터와 16-GPU 학습 설정에서 나왔다고 적혀 있습니다. 논문은 이를 통해 표현 중심 이어 사전학습이 modest한 계산에서도 경쟁력 있는 성능을 낼 수 있으며, 데이터 확장과는 별개의 VLA 진전 축이라고 주장합니다.

이 결과를 읽을 때 주의할 점

이 논문을 읽을 때는 몇 가지 선을 분명히 그어두는 편이 좋습니다. 먼저, 이것은 데이터만 더 모으면 된다는 처방이 아닙니다. 오히려 고정 예산에서 표현 품질과 이어 사전학습의 중요성을 강조하는 내용입니다.

또한 모든 벤치에서 1등이라는 주장도 아닙니다. RoboDojo는 성공률 기준 전체 정책 중 6위입니다. 순위를 과장하지 않고, 초록에 적힌 표현 그대로 이해하는 것이 맞습니다.

마찬가지로 20% 데이터 결과 역시 RoboCasa-GR1의 미본 휴머노이드 설정에서 보고된 내용입니다. 이를 다른 신체나 다른 베이스라인으로 일반화해 적는 것은 원문 범위를 벗어납니다.

데이터 확장과 표현 중심 이어 사전학습은 서로 대체재가 아니라 별개의 축으로 읽는 것이 맞습니다.

실험 설계 관점에서 남는 시사점

이 논문이 특히 흥미로운 이유는, 파인튜닝 이전의 표현 학습을 별도 단계로 분리해 보게 만든다는 점입니다. 팀 단위로 로봇·에이전트 스택을 올리는 환경에서는 데이터 양만 늘리는 계획과 표현 중심 이어 사전학습 계획을 같은 항목으로 뭉뚱그리지 않는 편이 좋습니다.

예를 들어 고정 파인튜닝 프로토콜을 먼저 두고 백본만 바꾸어 비교하면, 표현 학습의 기여를 더 분명하게 볼 수 있습니다. 또 교차 신체 데이터 구성, 행동 레이아웃, 데이터 비율 실험 같은 요소를 함께 기록해두면 재현성과 비교 가능성이 높아집니다.

특히 미본 신체 전이는 별도 항목으로 보는 것이 중요합니다. 본 신체에서의 성공률만으로 전이를 말하기보다, 학습에 본 신체와 평가 신체를 구분해 보는 방식이 더 적절합니다. 초록의 RoboCasa-GR1 결과도 이런 비대각 전이 맥락에서 읽을 수 있습니다.

참고 자료

arXiv:2608.27550
PDF
Project

로봇 VLA를 볼 때 여러분은 데이터 확장과 표현 중심 이어 사전학습 가운데 어느 축이 지금 더 중요하다고 보시는지 궁금합니다.