Riemann-1.0: 정책 실행과 월드 시뮬레이션을 하나의 모델로 묶은 이유 | DAKER 커뮤니티
로봇 정책과 월드 시뮬레이터를 따로 두는 방식은 익숙하지만, 실제 실행과 예측이 서로 어긋나는 문제도 자주 남깁니다. 2026년 8월 27일 arXiv에 공개된 Riemann-1.0은 바로 이 지점을 겨냥합니다. 실행 가능한 정책과 행동 조건 월드 시뮬레이션을 한 모델 안에서 함께 다루겠다는 제안입니다.
이번 글은 논문의 초록에 나온 내용과 숫자만 바탕으로, Riemann-1.0이 무엇을 통합했고 어떤 성능을 보고했는지 정리합니다. 원문은 arXiv:2608.27033와 PDF에서 볼 수 있습니다.
2026년 8월 27일 Haofeng Sun 연구팀이 정책 실행과 행동 조건 월드 시뮬레이션을 한 모델에 넣은 Riemann-1.0을 arXiv에 공개했습니다. Riemann-1.0은 완전 인과 오토리그레시브 World Action Model입니다. 다중 시점 시각 관측, 로봇 상태, 신체별 행동을 하나의 인과 시퀀스로 같이 모델링합니다. 로봇 행동과 월드 진화를 인과적 상태 전이로 표현합니다. 기존 WAM의 결합 생성, 비디오 우선 예측, 분리 모델링과 달리, 온라인 로봇 정책과 행동 조건 월드 시뮬레이터를 단일 모델로 통합합니다.
논문은 2026년 8월 27일 arXiv에 올라왔습니다. 초록은 arXiv:2608.27033에서 확인할 수 있습니다. 저자는 Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao 외 4명입니다. PDF는 같은 번호의 pdf입니다.
정책과 월드 시뮬레이터를 하나의 인과 시퀀스로 다룹니다
Riemann-1.0의 핵심은 실행 가능한 로봇 정책이면서 동시에 다중 신체 시각 월드 시뮬레이터라는 점입니다. 두 역할을 따로 학습한 뒤 연결하는 구조가 아니라, 하나의 완전 인과 오토리그레시브 시퀀스 안에서 관측, 상태, 행동을 함께 모델링합니다.
온라인 로봇 정책과 행동 조건 월드 시뮬레이터를 단일 모델로 통합합니다.
초록은 이 접근을 기존 WAM의 결합 생성, 비디오 우선 예측, 분리 모델링과 구분합니다. 다시 말해, 다음 행동을 내놓는 일과 그 행동이 세계를 어떻게 바꿀지 예측하는 일을 같은 모델 안에서 처리하려는 방향입니다.
다중 시점 관측과 로봇 상태, 신체별 행동을 함께 넣습니다
Riemann-1.0은 다중 시점 시각 관측, 로봇 상태, 신체별 행동을 하나의 인과 시퀀스로 다룹니다. 이 구성은 로봇 행동과 월드 진화를 인과적 상태 전이로 표현한다는 설명과 이어집니다.
이 점은 단순히 비디오를 생성하는 모델과도 다릅니다. 관측만 이어 붙이는 것이 아니라, 상태와 행동까지 같은 흐름 안에 포함하기 때문입니다. 초록이 강조하는 통합의 의미도 여기에 있습니다.
점진적 신체화 사전학습으로 이종 데이터를 묶습니다
초록은 대규모 이종 데이터에서 신체화 경험을 키우기 위해 progressive embodied pretraining 프레임워크를 제안합니다. 여기에는 1인칭 인간 비디오, 핸드헬드 그리퍼 시연, 이종 로봇 궤적이 포함되며, 모두 공유된 World Action Modeling 목표 아래에서 함께 학습됩니다.
상호작용 데이터는 200K시간 이상입니다.
논문은 이 규모의 데이터를 바탕으로 대규모 신체화 경험을 실행 가능한 조작 능력으로 점진적으로 전이한다고 설명합니다. 이 부분은 인간 비디오만으로 충분하다고 말하는 것이 아니라, 서로 다른 형태의 embodied data를 함께 활용하는 설정이라는 점이 중요합니다.
초록이 보고한 성능 수치
이 글에서는 초록에 나온 숫자만 옮깁니다. 시뮬레이션 벤치마크와 실기 조작 결과는 구분해서 보는 것이 좋습니다.
RoboTwin2.0에서 성공률 94.3%, LIBERO에서 99.0%, RoboCasa-365에서 62.6%이며, 이전 최고 대비 8.4%포인트 우위입니다.
장기 실기 조작에서는 Success Rate(SR) 85.0%, Progress Success Rate(PSR) 94.4%이며, 가장 강한 오픈소스 베이스라인 대비 SR이 15%포인트 높습니다.
시뮬레이션 결과와 실기 결과는 같은 의미의 숫자가 아니므로 섞어 읽기보다 각각의 과제 맥락에서 보는 편이 자연스럽습니다. 초록은 RoboTwin2.0, LIBERO, RoboCasa-365, 그리고 장기 실기 조작의 SR·PSR을 따로 제시합니다.
이 논문을 읽을 때 구분해 둘 점
Riemann-1.0은 비디오만 생성하는 모델 소개가 아닙니다. 초록은 실행 가능한 정책과 행동 조건 월드 시뮬레이터의 통합을 말합니다.
또한 초록에 없는 벤치마크 점수나 추가 순위를 이 글에 덧붙이지 않았습니다. 옮긴 수치는 RoboTwin2.0 94.3%, LIBERO 99.0%, RoboCasa-365 62.6%, 장기 실기 조작 SR 85.0%, PSR 94.4%, 그리고 이전 최고 대비 8.4%포인트, 오픈소스 베이스라인 대비 SR 15%포인트뿐입니다.
아울러 이것은 특정 제품 출시 공지가 아니라 연구 논문 소개입니다. 상용 시스템 탑재나 별도 코드 공개에 대한 내용은 초록에 포함되어 있지 않습니다.
왜 지금 볼 만한가
로봇 분야에서 정책 모델과 월드 모델을 어떻게 연결할지는 여전히 중요한 주제입니다. Riemann-1.0은 관측, 상태, 행동을 하나의 인과 시퀀스로 묶고, 온라인 정책과 행동 조건 시뮬레이션을 단일 모델로 통합했다는 점에서 눈에 띕니다.
특히 다중 시점 시각 관측과 이종 embodied data를 함께 다루면서, 200K시간 이상의 상호작용 데이터와 시뮬레이션·실기 성능 수치를 함께 제시했다는 점이 이번 논문의 읽을 이유가 됩니다.
참고 자료
arXiv:2608.27033 — Riemann-1.0
https://arxiv.org/pdf/2608.27033
정책과 월드 시뮬레이션을 한 모델로 묶는 접근이 앞으로 로봇 학습에서 얼마나 넓게 쓰일지 어떻게 보시는지 궁금합니다.