본문 바로가기

IT & AI

자율주행에 특화된 Qwen-Drive-1.0, 하나의 모델로 보고 묻고 달린다

728x90

자율주행에 특화된 Qwen-Drive-1.0, 하나의 모델로 보고 묻고 달린다

AI 뉴스 썸네일
AI 뉴스 썸네일

자율주행 개발에서 인식, 질의응답, 경로 계획은 보통 각각 다른 모델이 맡아요. 알리바바 Qwen 팀과 화중과기대가 공개한 Qwen-Drive-1.0은 이 세 가지를 하나의 모델 안에 넣었어요. 주변을 3D로 인식하고, 주행 장면에 대해 자연어로 답하고, 앞으로 이동할 경로까지 생성해요. 1

핵심 요약

구분핵심왜 볼 만한가요
모델 구조Qwen3.5-4B 비전언어모델에 BEV 인식 헤드와 경로 계획 전문 모듈을 결합인식·질의응답·계획이 하나의 모델에서 동작하는 구성을 공개 자료로 확인할 수 있어요
성능NAVSIM v1.1 navtest PDMS 90.7점(강화학습 버전), 주행 질의응답 벤치마크 대폭 개선같은 파라미터 수의 범용 모델보다 주행 이해에서 앞서는 결과예요
공개 범위Apache-2.0 라이선스로 코드·데모 데이터·평가 도구·가중치(9.1GB) 공개GPU 24GB 이상 환경에서 직접 내려받아 실행해볼 수 있어요

1. 하나의 모델이 인식부터 계획까지

Qwen-Drive-1.0의 출발점은 Qwen3.5-4B 비전언어모델이에요. 여기에 두 개의 모듈을 붙였어요. BEV 인식 헤드는 주변 물체의 3D 위치, 공간 점유 상태, 도로 구조를 파악해요. Planning Expert는 모델이 이해한 장면을 바탕으로 차량이 앞으로 이동할 위치와 방향을 생성해요. 원래 있던 언어 디코더는 그대로라서 일반적인 이미지 질의응답과 주행 질의응답을 모두 다뤄요. 2

인식 결과를 별도로 확인할 수 있다는 점이 눈에 들어요. 모델이 주변을 어떻게 이해했는지 인식 단계에서 직접 들여다볼 수 있어서, 결과가 이상할 때 어느 단계에서 잘못됐는지 추적하기 쉬워요. 자율주행처럼 실패 원인을 설명해야 하는 분야에서는 디버깅 가능성 자체가 중요해요.

728x90

경로 생성은 데모 기준으로 향후 5초간의 웨이포인트를 출력해요. 10Hz 기준 50개 지점의 좌표와 진행 방향을 만들어요. 교차로 출발, 좌우회전, 주차된 트럭 옆 감속 같은 장면이 데모 데이터로 함께 묶여 있어서 가중치만 내려받으면 바로 실행해볼 수 있어요. 1

2. 범용 능력을 지키면서 주행에 특화

주행 데이터만으로 학습하면 범용 시각 이해 능력이 무뎌지기 쉬워요. Qwen 팀은 주행 데이터와 일반 이미지·언어 데이터를 함께 쓰는 단계별 학습 전략을 택했어요. 공개된 평가에서는 주행 질의응답 성능이 기반이 된 Qwen3.5-4B보다 크게 개선됐고, 일반 시각 벤치마크에서도 기반 모델 수준을 유지했어요. LingoQA 주행 질의응답에서는 비교 대상인 InternVL3.5-8B(46.4점)를 77.8점으로 앞셨고, 3D 공간 이해를 묻는 Ego3D RMSE는 23.01에서 7.78로 줄었어요. 2

경로 계획 성능은 버전이 둘로 나뉘어요. 모방학습으로 훈련한 planner-sft와 보상 기반으로 추가 훈련한 planner-rl이에요. NAVSIM v1.1 navtest에서 강화학습 버전은 PDMS 90.7점을 기록했고, Waymo Open Dataset 종단간 테스트에서도 SFT보다 앞서요. 둘 다 같은 비전언어모델을 공유해서 필요에 따라 붙여 쓰는 구조예요. 2

왜 중요한가요

자율주행 스택을 여러 모델로 쪼개면 시스템이 복잡해지고 오류 추적도 어려워요. 인식, 질의응답, 계획을 하나의 모델로 묶고 그 결과를 검사 가능한 형태로 공개했다는 점에서, 이 모델은 통합 접근이 어느 수준까지 왔는지 보여주는 사례예요. Apache-2.0 라이선스로 코드와 가중치, 평가 도구가 모두 공개됐고 Hugging Face에서 내려받을 수 있어서 연구·검증 진입장벽이 낮아요. 2

다만 벤치마크 점수를 실도로 안전성과 동일하게 보면 안 돼요. 제작 쪽도 공개 벤치마크 성능이 실제 도로의 안전성 보장은 아니라고 명시했어요. GPU 메모리 24GB 이상을 권장한다는 점도 실 서비스 탑재와는 거리가 있는 연구용 배포라는 신호예요. 4B 크기의 비전언어모델 기반이라는 점, 차량에 탑재하려면 별도의 경량화가 필요하다는 점까지 감안해야 해요.

참고 자료

  1. Qwen-Drive-1.0 - 도로 상황을 이해하고 주행 경로까지 계획하는 자율주행 AI 모델 — GeekNews
  2. QwenLM/Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving — GitHub
  3. Qwen-Drive-1.0-4B 모델 가중치 — Hugging Face
728x90