DriveZero 논문 공개: 사람 주행 로그를 넘어 닫힌 루프 강화학습으로 가는 이유 | DAKER 커뮤니티

2026년 9월 5일 DriveZero 논문이 arXiv에 공개되었습니다. 종단간 자율주행은 흔히 사람 주행 로그를 모방하는 방식으로 설명되지만, 이 접근은 결국 기록된 데이터의 품질과 행동 범위에 영향을 받습니다. 이번 논문 초록은 바로 그 한계를 어떻게 넘으려 하는지 비교적 선명하게 보여줍니다.

핵심은 인식과 행동을 하나의 문제로 뭉뚱그리지 않고, 서로 다른 학습 조건이 필요한 두 축으로 나눈 뒤 다시 하나의 플래너로 결합하는 데 있습니다. 오늘 글은 arXiv:2609.06055 초록과 공개된 PDF 범위 안에서만 정리합니다.

사람 로그를 넘어 닫힌 루프로 주행을 배웁니다

사람 로그 모방의 한계와 DriveZero의 출발점

논문은 대부분의 종단간 자율주행이 사람 주행 로그를 모방하는 방식으로 학습된다고 적습니다. 그 결과, 학습된 행동은 기록된 궤적의 품질과 행동 범위에 묶이게 됩니다.

DriveZero는 사람 시연을 넘는 종단간 시스템으로, 인식 모델과 행동 모델을 분해해 각각에 맞는 방식으로 사전학습한 뒤 하나의 플래너로 결합합니다.

이 분해는 단순한 구성상의 선택이 아니라, 무엇을 어떤 데이터로 배워야 하는지에 대한 문제 설정과 연결됩니다. 초록에 따르면 인식은 세계를 이해하는 문제이므로 대규모이면서도 다양한 시각 데이터가 유리합니다. 반면 행동은 세계와 상호작용하는 문제이므로 닫힌 루프 피드백이 필요합니다.

인식은 대규모·다양한 시각 데이터가 유리하고, 행동은 닫힌 루프 피드백이 필요하다고 적습니다.

DriveRL과 DriveVFM, 그리고 하나의 플래너

행동 모델: DriveRL

행동 쪽 구성요소인 DriveRL은 혼합 에이전트 닫힌 루프 강화학습 프레임워크로 소개됩니다. 초록은 실제 주행 로그를 상호작용 세계로 바꾸고, 특권 교사 정책을 PPO로 닫힌 루프 롤아웃 학습한다고 설명합니다.

DriveRL은 실제 주행 로그를 상호작용 세계로 바꾸고, 특권 교사 정책을 PPO로 닫힌 루프 롤아웃 학습합니다.

인식 모델: DriveVFM

인식 쪽 구성요소인 DriveVFM은 여러 고정 비전 기반 모델을 원시 이미지만으로 하나의 백본에 통합하는 방식입니다. 초록에서 언급된 모델은 DINOv3, SigLIP2, SAM, Depth Anything V2 등이며, 과제별 주석이 불필요하다고 적습니다.

DriveVFM은 DINOv3, SigLIP2, SAM, Depth Anything V2 등 여러 고정 비전 기반 모델을 원시 이미지만으로 하나의 백본으로 통합하며 과제별 주석이 불필요하다고 적습니다.

통합 플래너

DriveZero는 이 두 모델을 카메라만으로 동작하는 하나의 플래너로 통합한다고 보고합니다. 또한 동결된 DriveRL 교사를 롤아웃 궤적으로 증류한다고 적습니다. 목표 조건 교사는 증강된 주행 의도로도 질의할 수 있어, 로그 데이터만으로는 얻기 어려운 다양하고 목표 일관된 감독을 제공한다고 설명합니다.

초록이 보고한 성능 범위

초록에 따르면 nuPlan에서 DriveRL은 value-guided test-time action search를 사용해 Val14, Test14-hard, Test14-random 커뮤니티 분할에서 non-reactive와 reactive 모두 평균 점수 93.57을 기록하며, 세 분할 모두 Log-Replay 전문가를 넘는다고 적습니다.

nuPlan에서 DriveRL이 value-guided test-time action search로 Val14·Test14-hard·Test14-random 커뮤니티 분할에서 non-reactive·reactive 모두 평균 점수 93.57을 내며 세 분할 모두 Log-Replay 전문가를 넘는다고 적습니다.

또한 DriveZero는 NAVSIMv1, NAVSIMv2, 닫힌 루프 HUGSIM에서 사람 궤적 감독 없이 최신 성능을 냈다고 보고합니다.

DriveZero는 NAVSIMv1·NAVSIMv2·닫힌 루프 HUGSIM에서 사람 궤적 감독 없이 최신 성능을 낸다고 보고합니다.

이 글에서 넘겨 읽지 말아야 할 점

이 글은 초록에 적힌 범위만 옮깁니다. 따라서 모든 자율주행 벤치에서 93.57이 나왔다는 뜻은 아닙니다. nuPlan의 Val14, Test14-hard, Test14-random과 보고된 모드 범위만 해당합니다.

또한 사람 데모가 언제나 불필요하다는 주장으로 읽을 수는 없습니다. 초록은 DriveZero가 사람 궤적 감독 없이 특정 벤치에서 최신 성능을 냈다고 보고할 뿐입니다.

마찬가지로 LiDAR나 다른 센서를 배제해야 한다는 지침도 아닙니다. 여기서는 카메라만으로 통일했다고 보고한 문장만 다룹니다.

참고 자료

arXiv:2609.06055 — DriveZero: End-to-End Driving Beyond Human Demonstrations
https://arxiv.org/pdf/2609.06055

이 논문 초록에서 가장 눈에 들어온 지점은 사람 로그를 넘기 위한 분해 전략이었는지, 아니면 닫힌 루프 RL과 비전 백본의 결합 방식이었는지 궁금합니다.