Instruct-to-Act: VLM은 계획하고 월드모델 제어기는 움직이는 분리 설계 | DAKER 커뮤니티

낯선 환경에서 지시를 이해하고 바로 움직여야 하는 과제는 여전히 어렵습니다. 사전 학습된 비전-언어 모델은 지시와 관측을 고수준 계획으로 바꾸는 데 강하지만, 그 계획을 저지연의 안정적인 동작으로 이어 붙이는 일에서는 한계가 드러나곤 합니다. 반대로 월드모델 기반 제어기는 빠른 관측-동작 루프에 강하지만, 열린 과제를 언어로 안내받아 처리하는 능력은 부족할 수 있습니다.

2026년 8월 27일 Zineng Tang 연구팀이 arXiv에 공개한 Instruct-to-Act는 이 둘을 한 시스템으로 묶습니다. 오늘 글은 arXiv:2608.26788의 초록 범위 안에서만 내용을 옮깁니다. 초록에 없는 벤치 이름이나 퍼센트는 덧붙이지 않습니다.

계획은 VLM에 두고 동작은 월드모델 제어기에 맡깁니다

논문은 2026년 8월 27일 arXiv에 올라왔고, COLM 2026 학회 논문으로 실렸습니다. 저자는 Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr입니다. PDF는 https://arxiv.org/pdf/2608.26788, 프로젝트 페이지는 https://zinengtang.github.io/instruct-to-act/입니다.

계획은 VLM에 두고 동작은 월드모델 제어기에 맡깁니다 장면

계획과 제어를 나누는 이유

Instruct-to-Act에서 VLM 플래너는 성긴 고수준 텍스트 지시를 만들고, 월드모델 제어기는 그 지시에 조건화된 채 높은 빈도로 동작합니다. 플래너는 더 추상적인 문장을 내고, 제어기는 빠른 관측-동작 루프를 맡습니다. 한 모델이 계획과 저지연 동작을 동시에 떠안으면 낯선 환경에서 둘 중 하나가 흔들리기 쉽다는 문제의식이 이 구조의 출발점입니다.

계획은 VLM에 두고, 빠른 실행은 월드모델 제어기에 맡기는 것이 Instruct-to-Act의 핵심입니다.

이 분리는 단순한 역할 분담을 넘어 실험 설계의 장점도 만듭니다. 플래너만 바꾸거나 제어기만 바꿔 비교할 수 있어, 무엇이 성능 차이를 만들었는지 더 분명하게 볼 수 있습니다. 초록이 강조하는 지점도 여기에 가깝습니다. 계획과 제어를 분리하면 각 모듈의 강점을 유지한 채 하나의 시스템으로 묶을 수 있다는 것입니다.

합성 지시로 제어기를 언어에 맞추는 방식

언어로 지시 가능한 제어기를 학습하기 위해, 연구팀은 제어기 정책 롤아웃의 구간을 합성 지시로 다시 라벨합니다. 그다음 행동 복제 목표와 기존 보상 최대화 목표, 월드모델링 목표를 함께 최적화합니다.

이 구성은 각 목표가 서로의 빈틈을 메우는 형태입니다. 행동 복제만으로는 보상 신호가 약해질 수 있고, 보상 최대화만으로는 언어 조건이 느슨해질 수 있으며, 월드모델링이 빠지면 빠른 제어를 위한 예측 기반이 약해질 수 있습니다. 초록은 이 세 요소를 함께 두는 방식으로 언어 조건 제어기를 학습한다고 설명합니다.

제어기는 합성 지시 재라벨과 행동 복제, 보상 최대화, 월드모델링을 함께 사용해 학습됩니다.

일곱 환경에서 확인한 분리 설계의 효과

평가는 일곱 개의 체현 환경에서 이뤄졌고, 그중 세 개는 다중 에이전트 환경입니다. 이 설정에서 VLM 플래너는 언어로 조율하고, 학습된 제어기는 액추에이터 역할을 합니다.

초록에 따르면 관측·동작 공간을 맞춘 조건에서 이 분리 접근은 제어기만 사용하는 설정과 VLM이 동작을 직접 생성하는 설정보다 일관되게 앞섰습니다. 동시에 빠른 제어를 유지하면서도 서로 다른 사전 학습 VLM 플래너를 미세 조정 없이 교체할 수 있었습니다.

관측·동작 공간을 맞춘 비교에서, 분리 접근은 제어기 단독 방식과 VLM 직접 동작 생성 방식보다 일관되게 더 나은 결과를 보였습니다.

또한 강한 VLA 및 다중 에이전트 RL 기준선과 비교했을 때도 일곱 과제 중 여섯에서 경쟁력 있는 결과를 보였다고 초록은 적고 있습니다. 여기서 중요한 점은 전 과제 우세가 아니라, 초록이 제시한 범위를 그대로 읽는 것입니다.

플래너를 바꿔도 제어를 유지할 수 있다는 점

미세 조정 없이 사전 학습 VLM 플래너를 교체할 수 있었다는 결과는, 플래너와 제어기 사이의 인터페이스가 텍스트 지시로 안정적으로 작동했다는 뜻으로 읽을 수 있습니다. 이 점은 실험 비용과도 연결됩니다. 큰 모델을 과제마다 다시 학습하지 않고도, 제어기를 유지한 채 플래너를 바꿔 볼 수 있기 때문입니다.

특히 다중 에이전트 환경에서는 언어 조율이 중요합니다. 플래너가 문장으로 역할을 나누고, 제어기가 그 문장을 실제 동작으로 옮기는 구조이기 때문에, 계획과 실행이 서로 다른 강점을 살린 채 연결됩니다.

빠른 제어를 유지하면서도 서로 다른 사전 학습 VLM 플래너를 미세 조정 없이 교체할 수 있었습니다.

이 글에서 넘어서지 않는 범위

오늘 글은 초록이 말하는 범위만 다룹니다. 따라서 과제별 퍼센트나 세부 벤치 점수표를 추가하지 않습니다. 또한 일곱 과제 중 여섯에서 경쟁력 있었다는 내용을 모든 과제에서 1등이었다는 식으로 바꾸지 않습니다.

마찬가지로 이 연구는 VLM을 버리자는 제안이 아닙니다. VLM은 플래너로 남고, 월드모델 제어기는 빠른 실행을 맡습니다. 핵심은 둘 중 하나를 없애는 것이 아니라, 각자의 강점을 살리도록 역할을 나누는 데 있습니다.

참고 자료

arXiv:2608.26788 — Instruct-to-Act
PDF
Project Page

여러분은 계획과 제어를 한 모델에 묶는 방식과 분리하는 방식 가운데 어느 쪽이 더 설득력 있게 느껴지시나요?