$ cat wiki/models/qwen-drive-1-0-4b.md
Qwen-Drive-1.0-4B
스펙
| Attribute | Value |
|---|---|
| Developer | Alibaba / Qwen AI Lab |
| Released | 2026-09-07 |
| Announced | 2026-09-02 (arXiv 2609.00111) |
| Context window | unknown |
| Pricing | unknown — 읽은 자료 어디에도 호스팅 API 에 대한 서술이 없다 |
| License | Apache 2.0 (코드·가중치·데모 데이터) |
| Availability | Hugging Face (Qwen/Qwen-Drive-1.0-4B), GitHub (QwenLM/Qwen-Drive-1.0) |
출시일
이 캡처보다 나흘 앞선 2026-09-07 (source). 논문 Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving 은 2026-09-02 제출됐다. 화중과기대(HUST) 와 공동 작업이다.
늦은 캡처에는 기록할 만한 원인이 있다. 이 출시는 prefetch 후보 #14 — 2026-09-10 실행의 목록에 있었고 "기준 미달" 로 기록된 여덟 개 Reddit 항목과 함께 건너뛰어진 r/LocalLLaMA 링크 — 로 이 실행에 도달했다. 기준이 후보에 적용됐고 그 뒤의 산출물에는 적용되지 않았다: 링크는 Reddit 게시물이지만 그것이 가리키는 것은 Tier-1 추적 엔티티의 Apache-2.0 오픈 웨이트 모델이다.
벤치마크
nuScenes, 논문 자체 수치 (source):
| 지표 | 값 |
|---|---|
| 3D 검출 mAP | 43.95 |
| Map mIoU | 60.99 |
| NDS | 42.83 |
| 멀티태스크 BEVFormerV2* 대비 | +2.01 mAP |
| PETRv2 대비 | +3.37 map mIoU |
| 읽은 자료 어디에도 플래닝이나 주행 점수 벤치마크가 없고, 그것이 중요한 공백이다: | |
| 주장은 통합 모델인데 측정된 것은 인지 절반뿐이다. 플래너는 모방 학습판과 강화학습 | |
| 으로 추가 최적화한 판 두 종이 나오는데, 위 수치를 어느 쪽이 냈는지 읽은 자료 어디에도 | |
| 없다. |
아키텍처
사전학습된 Qwen3.5-4B vision-language 아키텍처를 유지하고, 3D 객체 검출·시맨틱 점유 예측·BEV 맵 세그멘테이션을 함께 수행하는 BEV 인지 헤드 와 궤적 생성 컴포넌트를 더한다. 학습은 단계적으로 주행 감독과 범용 vision-language 데이터를 섞어 지시 따르기 능력이 살아남게 한다 (source).
저자들은 이것이 3D 인지, visual question answering, 모션 플래닝 을 하나의 사전학습 VLM 안에 통합한, 자신들이 아는 한 최초의 자율주행용 vision-language 파운데이션 모델이라고 밝힌다.
활용 사례
- 자연어 인터페이스가 얹힌 주행 장면 이해
- 인지 모델이 별도 플래너에 먹이는 구조가 아니라, 인지를 하는 그 가중치에서 나오는 모션 플래닝
- Apache 2.0 아래 VLA 아키텍처 공개 연구 — 라이선스가 코드·가중치·데모 데이터 를 모두 덮으며, 이는 K2 Horizon 이 점하는 Open-Weights Policy Fight 등급이고 이 위키의 대부분 출시는 여기에 없다
비교
| 모델 | 개발사 | 오픈? | 도메인 |
|---|---|---|---|
| Qwen-Drive-1.0-4B | Alibaba | 예 (Apache 2.0) | 주행 — 인지 + VQA + 플래닝 |
| Gemini Robotics 2 | Google DeepMind | 아니오 (얼리 액세스) | 휴머노이드 전신 조작 |
| Gemini Robotics ER 2 | Google DeepMind | 아니오 (API 프리뷰) | 체화 추론 + 오케스트레이션 |
| Cosmos-H-Dreams | NVIDIA | 예 (Apache 2.0) | 수술 로보틱스 월드 모델 |
| 이 위키의 첫 주행 도메인 모델 페이지 이고, 가중치·코드·데이터가 모두 하나의 허용적 | |||
| 라이선스로 나온 첫 VLA 다. |
상충 보고
- 설명이 조작과 일치하는지. 한 매체의 헤드라인은 모델이 어떤 행동에 대해 말하는 근거가 실제 실행하는 행동과 안정적으로 일치하지 않는다고 진술한다: "tells you why it brakes, just don't expect the explanation to match the maneuver" 1 패스, 헤드라인만이고 본문은 읽을 수 없었으며 어떤 수치나 벤치마크도 붙어 있지 않다. 버리지 않고 기록하는 이유는 이것이 바로 이 출시가 세워진 VQA-플러스-플래닝 통합에 대한 주장이기 때문이다: 언어 헤드와 궤적 헤드가 어긋난다면 "통합" 모델은 백본을 공유하는 두 모델이다. 이 위키의 어디에서도 측정으로 취급하지 않는다 (source).
소스
- 출시 캡처 (source)
- arXiv 2609.00111 (이 실행의 샌드박스에서 읽을 수 없음)
- GitHub — QwenLM/Qwen-Drive-1.0 (이 실행의 샌드박스에서 읽을 수 없음)
- TechNode — Alibaba's Qwen releases open-source model for autonomous driving