Qwen-Drive-1.0 공개: 3D 인식과 플래닝을 함께 다루는 주행 VLM의 초기 단계 | DAKER 커뮤니티
자율주행용 비전언어 모델을 볼 때 가장 자주 놓치기 쉬운 지점은, 대화 성능과 주행 성능이 같은 축에 있지 않다는 점입니다. Qwen Team이 공개한 Qwen-Drive-1.0은 바로 그 구분을 분명히 보여주는 사례입니다. 일반적인 비전언어 모델의 구조를 유지하면서도 3D 인식과 모션 플래닝을 한 틀 안에 넣고, 각 결과를 별도 인터페이스로 드러냅니다.
이번 공개가 눈에 띄는 이유는 숫자 자체보다도 평가를 나누는 방식에 있습니다. 팀은 주행 VLM을 설명할 때 일반 VQA 점수와 3D·플래닝 지표를 분리해 적고 있습니다. 연구를 읽거나 데모를 정리할 때도 이 구분을 그대로 가져가는 것이 좋습니다.

논문은 2026-08-31 arXiv에 올라왔습니다. 초록은 arXiv:2609.00111에서 확인할 수 있습니다. 영문 제목은 Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving입니다. 저자는 Xin Zhou, Zongchuang Zhao, Zhibo Yang 외 (Qwen Team, HUST)입니다. PDF는 같은 번호의 pdf입니다. 코드는 GitHub QwenLM/Qwen-Drive-1.0에 공개되어 있습니다.
Qwen-Drive-1.0이 제시하는 방향
Qwen-Drive-1.0은 자율주행을 위한 비전언어 기반 모델로 가는 초기 단계라고 스스로를 정의합니다. 사전학습 VLM 아키텍처를 유지한 채 3D 인식, 시각 질의응답, 모션 플래닝을 통합하며, 백본은 natively multimodal Qwen3.5-4B입니다.
이 모델의 핵심은 외부 BEV 인식 헤드와 Planning Expert를 분명히 둔 점입니다. 외부 BEV 헤드는 3D 객체 검출, 의미 occupancy 예측, BEV 맵 분할을 공동으로 수행합니다. 이를 통해 공유 표현 안에 있는 3D 정보를 읽어내고, 장면 구조를 명시적으로 검사할 수 있는 인터페이스를 제공합니다. Planning Expert는 같은 공유 VLM 표현을 조건으로 미래 ego 궤적을 생성합니다.
Qwen-Drive-1.0은 채팅형 VLM에 주행 데이터를 조금 더한 수준이 아니라, 3D 인식과 플래닝을 함께 다루는 통합 틀로 제시됩니다.
학습 방식도 이 방향과 맞닿아 있습니다. 단계적 학습 레시피는 주행 감독과 일반 비전언어 데이터를 함께 사용해, 주행 능력을 얻으면서도 넓은 시각 이해와 지시 따르기 능력을 유지하도록 설계됐다고 설명합니다. 논문은 오픈루프, 의사클로즈드루프, 클로즈드루프 평가에서 경쟁력 있는 모션 플래닝을 보고합니다.
공개된 가중치와 보고된 성능
가중치는 Hugging Face Qwen/Qwen-Drive-1.0-4B와 ModelScope에 있으며, 코드는 github.com/QwenLM/Qwen-Drive-1.0에서 확인할 수 있습니다.
3D 인식에서는 nuScenes에서 43.95 mAP와 맵 mIoU 60.99, OpenScene에서 43.45 mAP와 맵 mIoU 71.27을 보고합니다. 모션 플래닝에서는 NAVSIM Predictive Driver Model Score 90.7, WOD-E2E Rater Feedback Score 7.91을 제시합니다. 일반 비전언어 능력도 크게 유지했다고 적고 있습니다.
이 모델을 읽을 때는 일반 VQA 점수와 3D 인식·플래닝 지표를 한 줄로 합치지 않는 것이 중요합니다.
같은 숫자처럼 보여도 의미하는 바는 서로 다릅니다. nuScenes와 OpenScene의 mAP, 맵 mIoU는 3D 인식 축의 결과이고, NAVSIM PDMS와 WOD-E2E Rater Feedback Score는 플래닝과 선호 평가 축의 결과입니다. 따라서 연구 노트나 발표 자료에 옮길 때도 데이터셋 이름과 지표를 함께 적어 두는 편이 정확합니다.
실제로 옮겨 적을 때 확인할 점
팀 단위로 이 모델을 검토한다면, 우선 주행 VLM을 단순한 카메라 기반 채팅 모델로만 보지 않는 것이 좋습니다. BEV 헤드 출력인 검출, occupancy, 맵 분할과 Planning Expert의 궤적은 서로 다른 산출물로 다루는 편이 맞습니다.
공개 4B 체크포인트를 사용할 때는 HF 카드, 라이선스, 입력 카메라 뷰 수를 먼저 확인하면 됩니다. 원문에는 nuScenes 6뷰, OpenScene 8뷰 설정이 언급되어 있습니다. 재현을 시도할 경우에는 사용한 체크포인트와 전처리 설정, 재현 스크립트와 시드를 README에 남겨 두는 것이 좋습니다.
또한 오픈루프인지, 의사클로즈드루프인지, 클로즈드루프인지 평가 조건을 분명히 적어야 합니다. 실차 실험이 아니라면 실차 미사용 여부를 함께 밝혀 두는 편이 혼동을 줄입니다.
인식 출력과 플래닝 출력은 분리해 저장하고, 평가 표에서도 서로 다른 열로 다루는 편이 좋습니다.
이 공개를 과장해서 읽지 않기
이 논문은 실차 완전 자율 상용화 발표가 아닙니다. 연구용 비전언어 주행 모델과 벤치마크 결과를 보고하는 문서입니다.
또한 모든 주행 벤치마크에서 최고점을 선언하는 글도 아닙니다. 여기서 확인할 수 있는 것은 nuScenes, OpenScene, NAVSIM, WOD-E2E에서 보고한 숫자입니다.
일반 VLM 능력이 절대적으로 줄지 않았다는 보증으로 읽는 것도 적절하지 않습니다. 논문은 크게 유지했다고 보고하지만, 그 표현은 실험 결과의 범위 안에서 이해하는 편이 맞습니다. 마찬가지로 4B 모델이 기존의 대형 주행 스택을 대체한다는 주장도 아닙니다. 통합 VLM 기반 접근의 초기 단계 보고로 보는 것이 자연스럽습니다.
참고 자료
arXiv:2609.00111 — Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving (2026-08-31)
PDF
GitHub QwenLM/Qwen-Drive-1.0
Hugging Face Qwen/Qwen-Drive-1.0-4B
여러분은 주행 VLM을 평가할 때 일반 VQA 성능과 3D·플래닝 성능을 어떻게 나눠 보고 계신가요?