MINERVA가 보여준 LIBERO의 용량 하한: 54만 파라미터로 평균 95.1% | DAKER 커뮤니티

2026년 9월 3일 arXiv에 공개된 MINERVA는, LIBERO에서 높은 점수를 내려면 정말 큰 모델이 필요한지 다시 묻게 합니다. 수십억 파라미터 VLA가 주목받는 흐름 속에서 이 논문은 반대로 의도적으로 작은 visuomotor 정책을 만들고, 표준 LIBERO가 실제로 요구하는 용량 하한을 재려 합니다.

결과는 단순한 축약으로 보기 어렵습니다. 0.54M(54만) 파라미터 정책이 표준 LIBERO 4 suites 2,000 롤아웃에서 평균 성공률 95.1%를 냈지만, 같은 레시피를 섭동 환경에 두면 성능은 크게 떨어집니다. 그래서 이 논문은 작은 모델의 가능성과 함께, 표준 점수만으로는 놓치기 쉬운 한계도 같이 보여줍니다.

54만 파라미터 정책으로 LIBERO 평균 95.1%를 냅니다

논문은 2026-09-03 arXiv에 올라왔습니다. 초록은 arXiv:2609.03715에서 볼 수 있고, 영문 제목은 MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?입니다. 저자는 Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa입니다. PDF는 같은 번호의 pdf입니다. 이 글은 제공된 사실과 초록에서 확인한 범위만 바탕으로 정리합니다.

작은 정책으로 LIBERO의 하한을 재다

MINERVA는 LIBERO 조작 벤치에서 과제 수행에 실제로 필요한 모델 크기가 어느 정도인지 가늠하려는 시도입니다. 핵심은 대형 모델을 더 키우는 대신, 과제 특화 용량 하한을 보기 위해 초소형 visuomotor 정책 패밀리를 두고 비교하는 데 있습니다.

0.54M 파라미터 정책이 표준 LIBERO 4 suites 2,000 롤아웃에서 평균 성공률 95.1%를 냅니다.

논문이 적는 비교에 따르면, 이 수치는 보고된 LeRobot π0.5 결과보다 2.4점 낮지만 파라미터는 약 7,700배 적습니다. 또 성능은 약 1M 부근에서 포화하고, 0.25M 아래에서는 붕괴합니다. 즉, 표준 LIBERO에서는 아주 큰 모델이 아니어도 높은 점수에 도달할 수 있지만, 그렇다고 무한히 줄여도 되는 것은 아니라는 뜻입니다.

무엇이 성능을 바꾸고, 무엇은 그렇지 않았나

논문은 아키텍처, 학습, 추론 설정을 넓게 훑는 스윕도 함께 제시합니다. 그중에서 ±1점 학습 시드 밴드를 일관되게 넘는 요인은 action-chunk 길이와 vision capacity뿐이라고 정리합니다.

광범위 스윕에서 action-chunk 길이와 vision capacity만 ±1점 시드 밴드를 일관되게 넘습니다.

학습 방식 비교도 눈에 띕니다. flow matching은 3시드에서 direct L1 regression 대비 이점이 없었고, regression은 GPU에서 최대 3.8배 빠르다고 적습니다. 이 결과는 특정 설정에서의 보고이므로 일반화할 수는 없지만, 적어도 이 실험에서는 더 복잡한 방식이 항상 이득을 주지 않았다는 점을 보여줍니다.

표준 점수는 높지만, 강건성은 별개의 문제입니다

이 논문이 특히 중요해지는 지점은 표준 벤치 점수와 강건성 점수를 분리해서 보게 만든다는 데 있습니다. 같은 레시피로 LIBERO-90 89과제에서 94.6%를 보고하지만, LIBERO-Plus 섭동에서는 46–56%로 떨어지고 광도 변화에는 거의 0에 가까운 강건성을 보입니다.

표준 LIBERO에서는 높게 나오지만, LIBERO-Plus 섭동과 광도 변화에서는 크게 무너집니다.

또 task-ID 순열 프로브는 표준 LIBERO의 지시 조건이 암기된 과제 선택에 가까울 수 있다는 신호를 줍니다. task-ID 매핑만 바꾸면 성공률이 거의 우연 수준으로 떨어진다고 적습니다. 이 대목은 표준 점수만으로 지시 이해 능력을 곧바로 해석하기 어렵다는 문제의식을 남깁니다.

배포 관점에서 본 속도와 효율

MINERVA는 성능뿐 아니라 지연과 배포 효율도 함께 강조합니다. 0.54M 정책은 노트북 CPU에서 청크당 5–9ms로 재계획하며, SmolVLA 대비 113배, π0.5 대비 1,400배 빠르다고 적습니다. 여기서 비교 수치는 논문이 보고한 값으로 읽는 것이 좋습니다.

0.54M 정책은 노트북 CPU에서 청크당 5–9ms로 재계획합니다.

이 수치는 GPU 없이도 빠르게 동작하는 정책이 가능하다는 점에서 의미가 있습니다. 다만 이 효율은 표준 벤치 점수와 함께, 섭동 환경에서의 취약성까지 같이 놓고 봐야 균형이 맞습니다.

이 논문을 읽을 때 놓치지 말아야 할 점

MINERVA의 메시지는 단순히 작은 모델도 잘된다는 선언이 아닙니다. 오히려 표준 LIBERO에서 높은 점수를 내는 데 필요한 용량이 생각보다 작을 수 있다는 점, 그리고 그 점수가 곧바로 강건성이나 일반화로 이어지지 않는다는 점을 함께 보여줍니다.

그래서 이 논문을 인용할 때는 하나의 평균 수치만 앞세우기보다, 표준 4 suites 95.1%, LIBERO-90 94.6%, LIBERO-Plus 46–56%, 광도 변화 거의 0이라는 결과를 분리해서 읽는 편이 좋습니다. 논문이 제안하는 문제의식도 여기에 가깝습니다. 오늘 팀은 거대 VLA 점수와 용량·지연을 제출 표에서 나눠 보자는 것입니다.

참고 자료

arXiv:2609.03715 — MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO? (2026-09-03)
PDF

표준 벤치 점수와 배포 효율, 그리고 섭동 강건성 가운데 여러분은 어떤 지표를 가장 먼저 보게 되는지 궁금합니다.