CLAP 논문 공개: 교차 신체 영상 월드모델로 물리 시뮬레이터를 만드는 방법 | DAKER 커뮤니티
로봇 비디오 모델은 빠르게 발전하고 있지만, 많은 모델이 여전히 한 가지 신체 구조에 묶여 있습니다. 이 한계 때문에 사람 영상이나 다른 로봇 영상에 담긴 물리 신호를 충분히 활용하지 못하는 경우가 많습니다. 2026년 8월 27일 공개된 CLAP는 바로 이 지점을 겨냥합니다.
이번 글은 CLAP 논문의 초록과 공개 링크를 바탕으로, 무엇이 새롭고 왜 지금 읽어둘 만한지 정리합니다. 원문에 없는 수치나 성능 해석은 덧붙이지 않고, 초록이 말하는 범위 안에서 핵심만 구조화해 보겠습니다.
논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27406에서 볼 수 있고, PDF는 같은 번호의 pdf입니다. 저자는 Kechen Liu, Ola Shorinwa입니다. 프로젝트 웹사이트는 https://omni-clap.github.io입니다. 초록에는 코드와 모델을 모두 오픈소스한다고 적혀 있습니다.
한 신체에 묶인 비디오 모델의 한계를 넘으려는 시도
최신 행동 조건 비디오 모델은 보통 하나의 로봇 신체에 맞춰 학습됩니다. 이렇게 되면 사람 영상이나 다른 로봇 플랫폼의 영상에 들어 있는 일반적인 물리 신호를 활용하기 어렵습니다. CLAP는 사람과 로봇 에이전트가 섞인 인터넷 규모 영상으로 학습할 수 있는 교차 신체 프레임워크를 제안합니다.
시공간 역학을 지배하는 물리 법칙은 행위자와 무관하게 보편적이라는 점이 CLAP의 핵심 통찰입니다.
다만 이 접근은 간단하지 않습니다. 플랫폼마다 행동 표현이 크게 다르고, 사람 영상에는 행동 라벨이 없는 경우도 많기 때문입니다. 초록은 이 문제를 정면으로 다루며, 서로 다른 행동 공간을 연결하는 방식으로 접근합니다.
세 가지 행동 공간을 커리큘럼으로 잇습니다
CLAP는 서로 다른 행동 공간을 end-effector 포즈, 언어 지시, latent action으로 맞춥니다. 각각은 장단점이 분명합니다. end-effector 포즈는 실제 제어와 가깝지만 사람 영상에는 잘 없고, 언어 지시는 폭넓게 붙일 수 있지만 물리 궤적을 직접 담기에는 약할 수 있습니다. latent action은 라벨 없는 영상에서 기초적인 prior를 배우는 데 유리합니다.
이 때문에 CLAP는 하나의 표현만 고집하지 않고 커리큘럼형 교차 신체 학습을 둡니다. 먼저 라벨 없는 영상에서 latent action으로 기초 물리 prior를 배우고, 이후 이를 end-effector 행동 공간에 정착시켜 실제 과제에 제로샷으로 연결하는 흐름입니다.
latent action으로 물리 prior를 먼저 배우고, 이후 end-effector 행동 공간에 grounding하는 순서가 CLAP의 학습 경로입니다.
초록은 few-shot 적응에서도 이점이 더해진다고 설명합니다. 다만 구체적인 퍼센트나 수치는 초록에 없으므로, 여기서도 없는 숫자를 보태지 않습니다.
단일 신체 모델과 경쟁하는 성능을 겨냥합니다
초록에 따르면 CLAP는 DROID처럼 어려운 환경에서 최신 단일 신체 비디오 모델에 근접하거나 상회합니다. 이 문장은 방향성을 보여 주지만, 초록에는 구체적인 퍼센트가 적혀 있지 않습니다. 따라서 성능 해석도 그 범위 안에서 읽는 것이 좋습니다.
또한 초록과 본문이 가리키는 범위에는 DROID, Bridge, 양팔 YAM, G1 휴머노이드 같은 이름이 등장합니다. 다만 이런 이름은 지원 범위나 평가 스위트를 설명하는 맥락으로 읽어야 하며, 별도의 실험 결과와 혼동하지 않는 편이 좋습니다.
CLAP는 단일 신체 비디오 월드모델을 학습하는 새로운 패러다임으로, 교차 신체 prior 위에 few-shot 적응을 얹는 경로를 제시합니다.
제로샷 물리 시뮬레이터라는 표현이 뜻하는 것
제목에 들어간 zero-shot physical simulator는 별도의 물리 엔진을 뜻하기보다, 행동 조건 영상 월드모델이 물리 예측의 역할을 수행한다는 방향으로 읽을 수 있습니다. 즉, 교차 신체 prior를 학습한 뒤 이를 실제 행동 공간에 정착시키고, 추가 학습 없이 바로 과제에 적용하는 흐름입니다.
이 표현은 생성 영상이 그럴듯하다는 의미만으로 충분하지 않습니다. 어떤 행동 조건이 들어갔는지, latent 단계에서 무엇을 배웠는지, end-effector grounding이 어떻게 이어졌는지가 함께 설명될 때 비로소 물리 시뮬레이터라는 주장도 설득력을 갖습니다.
이 글에서 분명히 선을 긋는 부분
이 글은 퍼센트 점수표가 아닙니다. 초록은 DROID 등에서 단일 신체 SOTA에 근접하거나 상회한다고 적지만, 구체 수치를 제시하지 않습니다.
또한 사람 영상만 있으면 바로 로봇 제어가 된다는 주장도 아닙니다. 초록이 말하는 경로에는 latent prior 이후 end-effector grounding, 그리고 제로샷과 few-shot 적응이 함께 놓여 있습니다.
언어 조건만으로 물리가 완성된다는 해석도 적절하지 않습니다. CLAP는 end-effector, 언어, latent를 함께 다루고 이를 커리큘럼으로 연결합니다. 특정 회사의 제품 출시 공지나 모든 플랫폼에서 검증이 끝났다는 선언으로 읽는 것도 맞지 않습니다.
오픈소스와 프로젝트 링크
CLAP는 논문뿐 아니라 프로젝트 웹사이트도 함께 공개했습니다. 초록에는 코드와 모델을 모두 오픈소스한다고 적혀 있습니다. 재현이나 후속 실험을 염두에 둔다면 논문 초록, PDF, 프로젝트 페이지를 함께 보는 것이 좋습니다.
관련 링크는 아래와 같습니다.
https://arxiv.org/abs/2608.27406
https://arxiv.org/pdf/2608.27406
https://omni-clap.github.io
마무리
CLAP가 던지는 질문은 분명합니다. 로봇 비디오 모델을 한 신체 안에 가둘 것인지, 아니면 사람과 여러 로봇에 걸친 영상에서 더 일반적인 물리 prior를 배울 것인지입니다. 이번 논문은 그 두 번째 길을 교차 신체 학습과 커리큘럼 설계로 구체화하려는 시도로 읽힙니다.
특히 행동 조건 비디오 모델을 물리 시뮬레이터처럼 쓰고 싶다면, 어떤 행동 공간을 어떻게 연결했는지가 앞으로 더 중요한 기준이 될 가능성이 큽니다.
참고 자료
arXiv:2608.27406 — CLAP (2026-08-27)
PDF
Project
교차 신체 학습이 실제 로봇 월드모델 개발에 얼마나 큰 변화를 만들지, 어떻게 보시는지 궁금합니다.