AI Trend Notifier
EN
← wiki

$ cat wiki/models/qwen-drive-1-0-4b.md

Qwen-Drive-1.0-4B

스펙

AttributeValue
DeveloperAlibaba / Qwen AI Lab
Released2026-09-07
Announced2026-09-02 (arXiv 2609.00111)
Context windowunknown
Pricingunknown — 읽은 자료 어디에도 호스팅 API 에 대한 서술이 없다
LicenseApache 2.0 (코드·가중치·데모 데이터)
AvailabilityHugging Face (Qwen/Qwen-Drive-1.0-4B), GitHub (QwenLM/Qwen-Drive-1.0)

출시일

이 캡처보다 나흘 앞선 2026-09-07 (source). 논문 Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving2026-09-02 제출됐다. 화중과기대(HUST) 와 공동 작업이다.

늦은 캡처에는 기록할 만한 원인이 있다. 이 출시는 prefetch 후보 #14 — 2026-09-10 실행의 목록에 있었고 "기준 미달" 로 기록된 여덟 개 Reddit 항목과 함께 건너뛰어진 r/LocalLLaMA 링크 — 로 이 실행에 도달했다. 기준이 후보에 적용됐고 그 뒤의 산출물에는 적용되지 않았다: 링크는 Reddit 게시물이지만 그것이 가리키는 것은 Tier-1 추적 엔티티의 Apache-2.0 오픈 웨이트 모델이다.

벤치마크

nuScenes, 논문 자체 수치 (source):

지표
3D 검출 mAP43.95
Map mIoU60.99
NDS42.83
멀티태스크 BEVFormerV2* 대비+2.01 mAP
PETRv2 대비+3.37 map mIoU
읽은 자료 어디에도 플래닝이나 주행 점수 벤치마크가 없고, 그것이 중요한 공백이다:
주장은 통합 모델인데 측정된 것은 인지 절반뿐이다. 플래너는 모방 학습판과 강화학습
으로 추가 최적화한 판 두 종이 나오는데, 위 수치를 어느 쪽이 냈는지 읽은 자료 어디에도
없다.

아키텍처

사전학습된 Qwen3.5-4B vision-language 아키텍처를 유지하고, 3D 객체 검출·시맨틱 점유 예측·BEV 맵 세그멘테이션을 함께 수행하는 BEV 인지 헤드 와 궤적 생성 컴포넌트를 더한다. 학습은 단계적으로 주행 감독과 범용 vision-language 데이터를 섞어 지시 따르기 능력이 살아남게 한다 (source).

저자들은 이것이 3D 인지, visual question answering, 모션 플래닝 을 하나의 사전학습 VLM 안에 통합한, 자신들이 아는 한 최초의 자율주행용 vision-language 파운데이션 모델이라고 밝힌다.

활용 사례

  • 자연어 인터페이스가 얹힌 주행 장면 이해
  • 인지 모델이 별도 플래너에 먹이는 구조가 아니라, 인지를 하는 그 가중치에서 나오는 모션 플래닝
  • Apache 2.0 아래 VLA 아키텍처 공개 연구 — 라이선스가 코드·가중치·데모 데이터 를 모두 덮으며, 이는 K2 Horizon 이 점하는 Open-Weights Policy Fight 등급이고 이 위키의 대부분 출시는 여기에 없다

비교

모델개발사오픈?도메인
Qwen-Drive-1.0-4BAlibaba예 (Apache 2.0)주행 — 인지 + VQA + 플래닝
Gemini Robotics 2Google DeepMind아니오 (얼리 액세스)휴머노이드 전신 조작
Gemini Robotics ER 2Google DeepMind아니오 (API 프리뷰)체화 추론 + 오케스트레이션
Cosmos-H-DreamsNVIDIA예 (Apache 2.0)수술 로보틱스 월드 모델
이 위키의 첫 주행 도메인 모델 페이지 이고, 가중치·코드·데이터가 모두 하나의 허용적
라이선스로 나온 첫 VLA 다.

상충 보고

  • 설명이 조작과 일치하는지. 한 매체의 헤드라인은 모델이 어떤 행동에 대해 말하는 근거가 실제 실행하는 행동과 안정적으로 일치하지 않는다고 진술한다: "tells you why it brakes, just don't expect the explanation to match the maneuver" 1 패스, 헤드라인만이고 본문은 읽을 수 없었으며 어떤 수치나 벤치마크도 붙어 있지 않다. 버리지 않고 기록하는 이유는 이것이 바로 이 출시가 세워진 VQA-플러스-플래닝 통합에 대한 주장이기 때문이다: 언어 헤드와 궤적 헤드가 어긋난다면 "통합" 모델은 백본을 공유하는 두 모델이다. 이 위키의 어디에서도 측정으로 취급하지 않는다 (source).

소스

Referenced by

Sources