:sunglasses: Awesome VLA for Autonomous Driving

June 27, 2026 · View on GitHub

Awesome Logo arXiv Visitors PR's Welcome

:sunglasses: Awesome VLA for Autonomous Driving

Autonomous driving has long relied on modular "Perception-Decision-Action" pipelines, whose hand-crafted interfaces and rule-based components often struggle in complex, dynamic, or long-tailed scenarios. Their cascaded structure also amplifies upstream perception errors, undermining downstream planning and control.

This survey reviews vision-action (VA) models and vision-language-action (VLA) models for autonomous driving. We trace the evolution from early VA approaches to modern VLA frameworks, and organize existing methods into two principal paradigms:

  • End-to-End VLA, which integrates perception, reasoning, and planning within a single model.
  • Dual-System VLA, which separates slow deliberation (via VLMs) from fast, safety-critical execution (via planners).

For more details, kindly refer to our :books: Paper, :globe_with_meridians: Project Page, and :hugs: HuggingFace Leaderboard.

:books: Citation

If you find this work helpful for your research, please kindly consider citing our paper:

@article{survey_vla4ad,
    title   = {Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future},
    author  = {Tianshuai Hu and Xiaolu Liu and Song Wang and Yiyao Zhu and Ao Liang and Lingdong Kong and Guoyang Zhao and Zeying Gong and Jun Cen and Zhiyu Huang and Xiaoshuai Hao and Linfeng Li and Hang Song and Xiangtai Li and Jun Ma and Shaojie Shen and Jianke Zhu and Dacheng Tao and Ziwei Liu and Junwei Liang},
    journal = {arXiv preprint arXiv:2512.16760},
    year    = {2025},
}
@article{survey_3d_4d_world_models,
    title   = {{3D} and {4D} World Modeling: A Survey},
    author  = {Lingdong Kong and Wesley Yang and Jianbiao Mei and Youquan Liu and Ao Liang and Dekai Zhu and Dongyue Lu and Wei Yin and Xiaotao Hu and Mingkai Jia and Junyuan Deng and Kaiwen Zhang and Yang Wu and Tianyi Yan and Shenyuan Gao and Song Wang and Linfeng Li and Liang Pan and Yong Liu and Jianke Zhu and Wei Tsang Ooi and Steven C. H. Hoi and Ziwei Liu},
    journal = {arXiv preprint arXiv:2509.07996},
    year    = {2025}
}

Table of Contents

1. Vision-Action Models

:one: Action-Only Models

:timer_clock: In chronological order, from the earliest to the latest.

ModelPaperVenueWebsiteGitHub
LBCarXiv
Learning by Cheating
CoRL 2020-GitHub
Latent-DRLarXiv
End-to-End Model-Free Reinforcement Learning for Urban Driving using Implicit Affordances
CVPR 2020--
NEATarXiv
NEAT: Neural Attention Fields for End-to-End Autonomous Driving
ICCV 2021-GitHub
RoacharXiv
End-to-End Urban Driving by Imitating a Reinforcement Learning Coach
ICCV 2021WebsiteGitHub
WoRarXiv
Learning to Drive from A World on Rails
ICCV 2021WebsiteGitHub
TCParXiv
Trajectory-guided Control Prediction for End-to-end Autonomous Driving: A Simple yet Strong Baseline
NeurIPS 2022-GitHub
Urban-DriverarXiv
Urban Driver: Learning to Drive from Real-world Demonstrations Using Policy Gradients
CoRL 2022WebsiteGitHub
LAVarXiv
Learning from All Vehicles
CVPR 2022WebsiteGitHub
TransFuserarXiv
TransFuser: Imitation with Transformer-Based Sensor Fusion for Autonomous Driving
TPAMI 2023-GitHub
GRIarXiv
GRI: General Reinforced Imitation and its Application to Vision-Based Autonomous Driving
Robotics 2023--
BEVPlannerarXiv
Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?
CVPR 2024-GitHub
Raw2DrivearXiv
Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)
NeurIPS 2025--
RADarXiv
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
NeurIPS 2025Website-
TrajDiffarXiv
TrajDiff: End-to-End Autonomous Driving without Perception Annotation
arXiv 2025-GitHub
SimScalearXiv
SimScale: Learning to Drive via Real-World Simulation at Scale
arXiv 2025WebsiteGitHub
-arXiv
Addressing the Waypoint-Action Gap in End-to-End Autonomous Driving via Vehicle Motion Models
arXiv 2026--

:two: Perception-Action Models

:timer_clock: In chronological order, from the earliest to the latest.

ModelPaperVenueWebsiteGitHub
ST-P3arXiv
ST-P3: End-to-End Vision-Based Autonomous Driving via Spatial-Temporal Feature Learning
ECCV 2022-GitHub
UniADarXiv
Planning-Oriented Autonomous Driving
CVPR 2023-GitHub
VADarXiv
VAD: Vectorized Scene Representation for Efficient Autonomous Driving
ICCV 2023-GitHub
OccNetarXiv
Scene as Occupancy
ICCV 2023-GitHub
GenADarXiv
GenAD: Generative End-to-End Autonomous Driving
ECCV 2024-GitHub
PARA-DriveCVPR
PARA-Drive: Parallelized Architecture for Real-Time Autonomous Driving
CVPR 2024Website-
Hydra-MDPCVPRW
Hydra-MDP: End-to-End Multimodal Planning with Multi-Target Hydra-Distillation
CVPRW 2024WebsiteGitHub
SparseADarXiv
SparseAD: Sparse Query-Centric Paradigm for Efficient End-to-End Autonomous Driving
arXiv 2024--
GaussianADarXiv
GaussianAD: Gaussian-Centric End-to-End Autonomous Driving
arXiv 2024--
DiFSDarXiv
DiFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving
arXiv 2024-GitHub
DriveTransformerarXiv
DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving
ICLR 2025-GitHub
SparseDrivearXiv
SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
ICRA 2025-GitHub
DiffusionDrivearXiv
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
CVPR 2025-GitHub
GoalFlowarXiv
GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
CVPR 2025WebsiteGitHub
GuideFlowarXiv
GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
arXiv 2025-GitHub
ETAarXiv
ETA: Efficiency through Thinking Ahead, A Dual Approach to Self-Driving with Large Models
arXiv 2025-GitHub
GeoarXiv
Spatial Retrieval Augmented Autonomous Driving
arXiv 2025--
DiffusionDriveV2arXiv
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
arXiv 2025-GitHub
NaviHydraarXiv
NaviHydra: Controllable Navigation-Guided End-to-End Autonomous Driving with Hydra Distillation
arXiv 2025--
MimirarXiv
Mimir: Hierarchical Goal-Driven Diffusion with Uncertainty Propagation for End-to-End Autonomous Driving
arXiv 2025-GitHub
FROST-DrivearXiv
FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder
arXiv 2026--
DrivoRarXiv
Driving on Registers
arXiv 2026WebsiteGitHub
SPSarXiv
See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection
arXiv 2026--
BevADarXiv
What Matters for Scalable and Robust Learning in End-to-End Driving Planners?
CVPR 2026WebsiteGitHub

:three: Image-Based World Models

:timer_clock: In chronological order, from the earliest to the latest.

ModelPaperVenueWebsiteGitHub
DriveDreamerarXiv
DriveDreamer: Towards Real-World-Driven World Models for Autonomous Driving
ECCV 2024WebsiteGitHub
GenADarXiv
GenAD: Generalized Predictive Model for Autonomous Driving
CVPR 2024-GitHub
Drive-WMarXiv
Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving
CVPR 2024WebsiteGitHub
DrivingWorldarXiv
DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT
arXiv 2024WebsiteGitHub
Imagine-2-DrivearXiv
Imagine-2-Drive: Leveraging High-Fidelity World Models via Multi-Modal Diffusion Policies
IROS 2025Website-
DrivingGPTarXiv
DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive Transformers
ICCV 2025Website-
EponaarXiv
Epona: Autoregressive Diffusion World Model for Autonomous Driving
ICCV 2025WebsiteGitHub
VaViMarXiv
VaViM and VaVAM: Autonomous Driving through Video Generative Modeling
arXiv 2025WebsiteGitHub
UniDrive-WMarXiv
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving
arXiv 2026Website-
DwDarXiv
Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving
arXiv 2026--
WorldDrivearXiv
Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation
arXiv 2026-GitHub
OmniDreamsarXiv
NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation
arXiv 2026--
DriveDreamer-PolicyarXiv
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
arXiv 2026--
DriveVAarXiv
DriveVA: Video Action Models are Zero-Shot Drivers
arXiv 2026--
Xiaomi EV World ModelarXiv
Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving
arXiv 2026--
HERMES++arXiv
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
arXiv 2026--
LMGenDrivearXiv
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
arXiv 2026--
X-WorldarXiv
X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving
arXiv 2026--

:four: Occupancy-Based World Models

:timer_clock: In chronological order, from the earliest to the latest.

ModelPaperVenueWebsiteGitHub
OccWorldarXiv
OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving
ECCV 2024WebsiteGitHub
NeMoECCV
Neural Volumetric World Models for Autonomous Driving
ECCV 2024--
OccVAROpenReview
OCCVAR: Scalable 4D Occupancy Prediction via Next-Scale Prediction
OpenReview 2024--
RenderWorldarXiv
RenderWorld: World Model with Self-Supervised 3D Label
arXiv 2024--
DFIT-OccWorldarXiv
An Efficient Occupancy World Model via Decoupled Dynamic Flow and Image-assisted Training
arXiv 2024--
Drive-OccWorldarXiv
Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving
AAAI 2025WebsiteGitHub
T³FormerarXiv
Temporal Triplane Transformers as Occupancy World Models
arXiv 2025--
OmniNWMarXiv
OmniNWM: Omniscient Driving Navigation World Models
arXiv 2025-GitHub
AD-R1arXiv
AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
arXiv 2025--
SparseOccVLAarXiv
SparseOccVLA: Bridging Occupancy and Vision-Language Models via Sparse Queries for Unified 4D Scene Understanding and Planning
arXiv 2026-GitHub
GEMarXiv
GEM: Gaussian Evolution Model for Occupancy Forecasting and Motion Planning
arXiv 2026--

:five: Latent-Based World Models

:timer_clock: In chronological order, from the earliest to the latest.

ModelPaperVenueWebsiteGitHub
Covariate-ShiftarXiv
Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models
arXiv 2024--
World4DrivearXiv
World4Drive: End-to-End Autonomous Driving via Intention-aware Physical Latent World Model
ICCV 2025--
WoTEarXiv
End-to-End Driving with Online Trajectory Evaluation via BEV World Model
ICCV 2025-GitHub
LAWarXiv
Enhancing End-to-End Autonomous Driving with Latent World Model
ICLR 2025-GitHub
SSRarXiv
Navigation-Guided Sparse Scene Representation for End-to-End Autonomous Driving
ICLR 2025-GitHub
Echo-PlanningarXiv
Echo Planning for Autonomous Driving: From Current Observations to Future Trajectories and Back
arXiv 2025--
SeerDrivearXiv
Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution
NeurIPS 2025-GitHub
Drive-JEPAarXiv
Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
arXiv 2026-GitHub
GraphWorldarXiv
GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving
arXiv 2026--
Unified Driving TokensarXiv
Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning
arXiv 2026--
EponaV2arXiv
EponaV2: Driving World Model with Comprehensive Future Reasoning
arXiv 2026--
IDOLarXiv
IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving
arXiv 2026--
ExploreVLAarXiv
ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving
arXiv 2026--
Kinematics-Aware LWMarXiv
Kinematics-Aware Latent World Models for Data-Efficient Autonomous Driving
arXiv 2026--
SparseWorldarXiv
SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation
arXiv 2026--
LWM SurveyarXiv
Latent World Models for Automated Driving: A Unified Taxonomy, Evaluation Framework, and Open Challenges
arXiv 2026--
World ModelsarXiv
World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications
arXiv 2026--
DynVLAarXiv
DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
arXiv 2026--
DriveWorld-VLAarXiv
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
arXiv 2026--

2. Vision-Language-Action Models

:one: Textual Action Generator

:timer_clock: In chronological order, from the earliest to the latest.

ModelPaperVenueWebsiteGitHub
DriveMLMarXiv
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
arXiv 2023-GitHub
RAG-DriverarXiv
RAG-Driver: Generalisable Driving Explanations with Retrieval-Augmented In-Context Learning in Multi-Modal Large Language Model
RSS 2024WebsiteGitHub
RDA-DriverarXiv
Making Large Language Models Better Planners with Reasoning-Decision Alignment
ECCV 2024--
DriveLMarXiv
DriveLM: Driving with Graph Visual Question Answering
ECCV 2024WebsiteGitHub
DriveGPT4arXiv
DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model
RA-L 2024Website-
DriVLMearXiv
DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social Experience
IROS 2024WebsiteGitHub
LLaDAarXiv
Driving Everywhere with Large Language Model Policy Adaptation
CVPR 2024WebsiteGitHub
VLAADWACVW
VLAAD: Vision and Language Assistant for Autonomous Driving
WACVW 2024-GitHub
OccLLaMAarXiv
OccLLaMA: A Unified Occupancy-Language-Action World Model for Understanding and Generation Tasks in Autonomous Driving
arXiv 2024Website-
Doe-1arXiv
Doe-1: Closed-Loop Autonomous Driving with Large World Model
arXiv 2024WebsiteGitHub
LINGO-2arXiv
LINGO-2: Driving with Natural Language
-Website-
SafeAutoarXiv
SafeAuto: Knowledge-Enhanced Safe Autonomous Driving with Multimodal Foundation Models
ICML 2025-GitHub
OpenEMMAarXiv
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
WACV 2025-GitHub
ReasonPlanarXiv
ReasonPlan: Unified Scene Prediction and Decision Reasoning for Closed-loop Autonomous Driving
CoRL 2025-GitHub
WKERarXiv
World Knowledge-Enhanced Reasoning Using Instruction-Guided Interactor in Autonomous Driving
AAAI 2025--
OmniDrivearXiv
OmniDrive: A Holistic LLM-Agent Framework for Autonomous Driving with 3D Perception, Reasoning and Planning
CVPR 2025-GitHub
S4-DriverarXiv
S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Model with Spatio-Temporal Visual Representation
CVPR 2025Website-
Occ-LLMarXiv
Occ-LLM: Enhancing Autonomous Driving with Occupancy-BasedLarge Language Models
ICRA 2025--
DriveBencharXiv
Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives
ICCV 2025WebsiteGitHub
FutureSightDrivearXiv
FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
NeurIPS 2025WebsiteGitHub
ImpromptuVLAarXiv
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
NeurIPS 2025WebsiteGitHub
Sce2DriveXarXiv
Sce2DriveX: A Generalized MLLM Framework for Scene-to-Drive Learning
RA-L 2025--
EMMAarXiv
EMMA: End-to-End Multimodal Model for Autonomous Driving
TMLR 2025Website-
DriveAgent-R1arXiv
DriveAgent-R1: Advancing VLM-Based Autonomous Driving with Hybrid Thinking and Active Perception
arXiv 2025--
Drive-R1arXiv
Drive-R1: Bridging Reasoning and Planning in VLMs for Autonomous Driving with Reinforcement Learning
arXiv 2025--
FastDriveVLAarXiv
FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-Based Token Pruning
arXiv 2025--
WiseADarXiv
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
arXiv 2025WebsiteGitHub
AutoDrive-R²arXiv
AutoDrive-R²: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving
arXiv 2025--
OmniReasonarXiv
OmniReason: A Temporal-Guided Vision-Language-Action Framework for Autonomous Driving
arXiv 2025--
OpenREADarXiv
OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic
arXiv 2025-GitHub
dVLM-ADarXiv
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
arXiv 2025--
PLAarXiv
A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving
arXiv 2025--
AlphaDrivearXiv
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
arXiv 2025-GitHub
CoReVLAarXiv
CoReVLA: A Dual-Stage End-to-End Autonomous Driving Framework for Long-Tail Scenarios via Collect-and-Refine
arXiv 2025WebsiteGitHub
WAM-DiffarXiv
WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving
arXiv 2025-GitHub
VLADriveBencharXiv
VLADriveBench: Evaluating CoT-Action Relationship in VLA for Autonomous Driving
arXiv 2026--
BLUEarXiv
BLUE: Toward Better Language Use in Efficient Vision-Language-Action Models for Autonomous Driving
arXiv 2026--
DriveMAarXiv
DriveMA: Rethinking Language Interfaces in Driving VLAs with One-Step Meta-Actions
arXiv 2026--
C-CoTarXiv
C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving
arXiv 2026--
MAGNIFIEDarXiv
MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning
arXiv 2026--
DriveRewardarXiv
DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving
arXiv 2026--
nuReasoningarXiv
nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving
arXiv 2026--
Decision-MakingarXiv
Decision-Making with Lightweight Confidence-Aware Language Model for Autonomous Driving
arXiv 2026--
IsarXiv
Is VLA Reasoning Faithful? Probing Safety of Chain-of-Causation in Autonomous Driving Models
arXiv 2026--
ReasonBreakarXiv
ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving
arXiv 2026--
Intend,arXiv
Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving
arXiv 2026--
Judge, Then DrivearXiv
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
arXiv 2026--
EvoDrivearXiv
EvoDrive: Pareto Evolution for Safety-Critical Autonomous Driving via Self-Improving LLM Agents
arXiv 2026--
UnifyingarXiv
Unifying Language-Action Understanding and Generation for Autonomous Driving
arXiv 2026--
MindDriverarXiv
MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving
arXiv 2026--
HERMESarXiv
HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving
arXiv 2026--
Counterfactual VLAarXiv
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
arXiv 2025--
OmniDrive-R1arXiv
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
arXiv 2025--
BeLLAarXiv
BeLLA: End-to-End Birds Eye View Large Language Assistant for Autonomous Driving
arXiv 2025--

:two: Numerical Action Generator

:timer_clock: In chronological order, from the earliest to the latest.

ModelPaperVenueWebsiteGitHub
LMDrivearXiv
LMDrive: Closed-Loop End-to-End Driving with Large Language Models
CVPR 2024WebsiteGitHub
BEVDriverarXiv
BEVDriver: Leveraging BEV Maps in LLMs for Robust Closed-Loop Driving
IROS 2025--
CoVLA-AgentarXiv
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
WACV 2025Website-
ORIONarXiv
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
ICCV 2025WebsiteGitHub
SimLingoarXiv
SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment
CVPR 2025WebsiteGitHub
DriveGPT4-V2CVPR
DriveGPT4-V2: Harnessing Large Language Model Capabilities for Enhanced Closed-Loop Autonomous Driving
CVPR 2025--
AutoVLAarXiv
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
NeurIPS 2025WebsiteGitHub
DriveMoEarXiv
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
arXiv 2025WebsiteGitHub
DSDrivearXiv
DSDrive: Distilling Large Language Model for Lightweight End-to-End Autonomous Driving with Unified Reasoning and Planning
arXiv 2025--
OccVLAarXiv
OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision.
arXiv 2025--
VDRivearXiv
VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-End Autonomous Driving
arXiv 2025--
ReflectDrivearXiv
Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving
arXiv 2025-GitHub
E3ADarXiv
E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
arXiv 2025--
LCDrivearXiv
Latent Chain-of-Thought World Modeling for End-to-End Driving
arXiv 2025--
Alpamayo-R1arXiv
Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
arXiv 2025--
UniUGParXiv
UniUGP: Unifying understanding, generation, and planing for end-to-end autonomous driving.
arXiv 2025--
MindDrivearXiv
MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving
arXiv 2025--
AdaThinkDrivearXiv
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
arXiv 2025--
Percept-WAMarXiv
Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
arXiv 2025--
Reasoning-VLAarXiv
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
arXiv 2025--
SpaceDrivearXiv
SpaceDrive: Infusing Spatial Awareness into VLM-Based Autonomous Driving
arXiv 2025--
OpenDriveVLAarXiv
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
AAAI 2026WebsiteGitHub
WAM-FlowarXiv
WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
CVPR 2026GitHub
ColaVLAarXiv
ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving
CVPR 2026WebsiteGitHub
AutoMoTarXiv
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
arXiv 2026--
OneDrivearXiv
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
arXiv 2026--
UniDriveVLAarXiv
UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
arXiv 2026--
VLA-WorldarXiv
Learning Vision-Language-Action World Models for Autonomous Driving
arXiv 2026--
MetisarXiv
Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation
arXiv 2026--
MindVLA-U1arXiv
MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving
arXiv 2026--
DVGT-2arXiv
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
arXiv 2026--
VLGAarXiv
VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving
arXiv 2026--
VECTOR-DrivearXiv
VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving
arXiv 2026--
ChainFlow-VLAarXiv
ChainFlow-VLA: Causal Flow Planning with Vision-Language Models
arXiv 2026--
LVDrivearXiv
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
arXiv 2026--
StyleVLAarXiv
StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving
arXiv 2026--
Masked-VLA-DiffusionarXiv
Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion
arXiv 2026--
Uni-World VLAarXiv
Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving
arXiv 2026--
DoesarXiv
Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?
arXiv 2026--
ReasoningarXiv
Reasoning About Traversability: Language-Guided Off-Road 3D Trajectory Planning
arXiv 2026--
SpanVLAarXiv
SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
arXiv 2026--
Sim2Real-ADarXiv
Sim2Real-AD: A Modular Sim-to-Real Framework for Deploying VLM-Guided Reinforcement Learning in Real-World Autonomous Driving
arXiv 2026--
Drive My WayarXiv
Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
arXiv 2026--
DriveVLM-RLarXiv
DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving
arXiv 2026--
Learning from MistakesarXiv
Learning from Mistakes: Post-Training for Driving VLA with Takeover Data
arXiv 2026--
SAMoE-VLAarXiv
SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving
arXiv 2026--
LaST-VLAarXiv
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
arXiv 2026--

:three: Explicit Action Guidance

:timer_clock: In chronological order, from the earliest to the latest.

ModelPaperVenueWebsiteGitHub
DriveVLMarXiv
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
CoRL 2024Website-
LeapADarXiv
Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving
NeurIPS 2024WebsiteGitHub
FasionADarXiv
FASIONAD: Fast and Slow Fusion Thinking Systems for Human-Like Autonomous Driving with Adaptive Feedback
arXiv 2024--
SennaarXiv
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
arXiv 2024-GitHub
DualADarXiv
DualAD: Dual-Layer Planning for Reasoning in Autonomous Driving
IROS 2025WebsiteGitHub
DME-DriverarXiv
DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving
AAAI 2025--
SOLVEarXiv
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
CVPR 2025--
ReAL-ADarXiv
ReAL-AD: Towards Human-Like Reasoning in End-to-End Autonomous Driving
ICCV 2025Website-
LeapVADarXiv
LeapVAD: A Leap in Autonomous Driving via Cognitive Perception and Dual-Process Thinking
TNNLS 2025--
DiffVLAarXiv
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
arXiv 2025--
FasionAD++arXiv
FASIONAD++: Integrating High-Level Instruction and Information Bottleneck in Fast-Slow fusion Systems for Enhanced Safety in Autonomous Driving with Adaptive Feedback
arXiv 2025--
HiST-VLAarXiv
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
arXiv 2026--
Senna-2arXiv
Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning
arXiv 2026--
FromarXiv
From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving
arXiv 2026--
Fast-dDrivearXiv
Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving
arXiv 2026--
DiffVLA++arXiv
DiffVLA++: Bridging Cognitive Reasoning and End-to-End Driving through Metric-Guided Alignment
arXiv 2025--
RT-VLAarXiv
RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation
arXiv 2026--
SlowarXiv
Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation
arXiv 2026--
SimpleVSFarXiv
SimpleVSF: VLM-Scoring Fusion for Trajectory Prediction of End-to-End Autonomous Driving
arXiv 2025--
CoWorld-VLAarXiv
CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving
arXiv 2026--
OneVLarXiv
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
arXiv 2026--
WorldVLMarXiv
WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning
arXiv 2026--
NaviDriveVLMarXiv
NaviDriveVLM: Decoupling High-Level Reasoning and Motion Planning for Autonomous Driving
arXiv 2026--
PRAM-RarXiv
PRAM-R: A Perception-Reasoning-Action-Memory Framework with LLM-Guided Modality Routing for Adaptive Autonomous Driving
arXiv 2026--
CorrectADarXiv
CorrectAD: A Self-Correcting Agentic System to Improve End-to-end Planning in Autonomous Driving
arXiv 2025--
MTRDrivearXiv
MTRDrive: Memory-Tool Synergistic Reasoning for Robust Autonomous Driving in Corner Cases
arXiv 2025--

:four: Implicit Representations Transfer

:timer_clock: In chronological order, from the earliest to the latest.

ModelPaperVenueWebsiteGitHub
VLParXiv
VLP: Vision Language Planning for Autonomous Driving
CVPR 2024--
VLM-ADarXiv
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
CoRL 2025--
DiMAarXiv
Distilling Multi-modal Large Language Models for Autonomous Driving
CVPR 2025--
DINO-ForesightarXiv
DINO-Foresight: Looking into the Future with DINO
NeurIPS 2025WebsiteGitHub
ALN-P3arXiv
ALN-P3: Unified Language Alignment for Perception, Prediction, and Planning in Autonomous Driving
arXiv 2025--
VERDIarXiv
VERDI: VLM-Embedded Reasoning for Autonomous Driving
arXiv 2025--
VLM-E2EarXiv
VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion
arXiv 2025--
ReCogDrivearXiv
ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
arXiv 2025WebsiteGitHub
InsightDrivearXiv
InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving
arXiv 2025-GitHub
NetRollerarXiv
NetRoller: Interfacing General and Specialized Models for End-to-End Autonomous Driving
arXiv 2025-GitHub
ViLaDarXiv
ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
arXiv 2025--
OmniScenearXiv
OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving
arXiv 2025--
LMADarXiv
LMAD: Integrated End-to-End VisionLanguage Model for Explainable Autonomous Driving
arXiv 2025--
BEVLMarXiv
BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations
arXiv 2026--

3. Datasets & Benchmarks

:timer_clock: In chronological order, from the earliest to the latest.

:one: Vision-Action Datasets

DatasetPaperVenueWebsiteGitHub
BDD100KarXiv
BDD100K: A Diverse Driving Dataset for Heterogeneous Multitask Learning
CVPR 2020WebsiteGitHub
nuScenesarXiv
nuScenes: A Multimodal Dataset for Autonomous Driving
CVPR 2020Website-
WaymoarXiv
Scalability in Perception for Autonomous Driving: Waymo Open Dataset
CVPR 2020WebsiteGitHub
nuPlanarXiv
nuPlan: A Closed-Loop ML-Based Planning Benchmark for Autonomous Vehicles
arXiv 2021WebsiteGitHub
Argoverse 2arXiv
Argoverse 2: Next Generation Datasets for Self-Driving Perception and Forecasting
NeurIPS 2021WebsiteGitHub
Bench2DrivearXiv
Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-to-End Autonomous Driving
NeurIPS 2024-GitHub
RoboBEVarXiv
Benchmarking and Improving Bird's Eye View Perception Robustness in Autonomous Driving
TPAMI 2025-GitHub
WOD-E2EarXiv
WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-Tail Scenarios
arXiv 2025WebsiteGitHub
navdreamarXiv
The Constant Eye: Benchmarking and Bridging Appearance Robustness in Autonomous Driving
arXiv 2026--

:two: Vision-Language-Action Datasets

DatasetPaperVenueWebsiteGitHub
BDD-XarXiv
Textual Explanations for Self-Driving Vehicles
ECCV 2018-GitHub
Talk2CarIEEE
Talk2Car: Predicting Physical Trajectories for Natural Language Commands
IEEE Access 2022-GitHub
SDNarXiv
DOROTHIE: Spoken Dialogue for Handling Unexpected Situations in Interactive Autonomous Driving Agents
EMNLP 2022-GitHub
DriveMLMarXiv
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
arXiv 2023-GitHub
LMDrivearXiv
LMDrive: Closed-Loop End-to-End Driving with Large Language Models
CVPR 2024WebsiteGitHub
DriveLM-nuScenesarXiv
DriveLM: Driving with Graph Visual Question Answering
ECCV 2024WebsiteGitHub
HBDarXiv
DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving
AAAI 2025--
VLAADWACVW
VLAAD: Vision and Language Assistant for Autonomous Driving
WACVW 2024-GitHub
SUP-ADarXiv
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
CoRL 2024Website-
NuInstructarXiv
Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models
CVPR 2024-GitHub
WOMD-ReasoningarXiv
WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving
ICML 2025WebsiteGitHub
DriveCoTarXiv
DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving
arXiv 2024Website-
Reason2DrivearXiv
Reason2Drive: Towards Interpretable and Chain-Based Reasoning for Autonomous Driving
ECCV 2024-GitHub
DriveBencharXiv
Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives
ICCV 2025WebsiteGitHub
MetaADarXiv
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
arXiv 2025WebsiteGitHub
OmniDrivearXiv
OmniDrive: A Holistic LLM-Agent Framework for Autonomous Driving with 3D Perception, Reasoning and Planning
CVPR 2025-GitHub
NuInteractarXiv
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
arXiv 2025--
DriveActionarXiv
DriveAction: A Benchmark for Exploring Human-like Driving Decisions in VLA Models
arXiv 2025--
ImpromptuVLAarXiv
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
arXiv 2025WebsiteGitHub
CoVLAarXiv
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
WACV 2025Website-
OmniReason-nuScenesarXiv
OmniReason: A Temporal-Guided Vision-Language-Action Framework for Autonomous Driving
arXiv 2025--
OmniReason-B2DarXiv
OmniReason: A Temporal-Guided Vision-Language-Action Framework for Autonomous Driving
arXiv 2025--
Bench2Drive-VLarXiv
Bench2Drive-VL: Benchmarks for Closed-Loop Autonomous Driving with Vision-Language Models
arXiv 2026--
V2X-QAarXiv
V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views
arXiv 2026--
DriveSpatialarXiv
DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving
arXiv 2026--
GeoDrive-BencharXiv
GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving
arXiv 2026--
VegaarXiv
Vega: Learning to Drive with Natural Language Instructions
arXiv 2026--
doScenes/DVDrivearXiv
A DVDrive Approach for doScenes Instructed Driving Challenge
arXiv 2026--
PedestrianQAarXiv
PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction
arXiv 2026--
WherearXiv
Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving
arXiv 2026--
EventDrivearXiv
EventDrive: Event Cameras for Vision-Language Driving Intelligence
arXiv 2026--
CrashSightarXiv
CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning
arXiv 2026--
Towards Safe MobilityarXiv
Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset
arXiv 2026--
TRIP-EvaluatearXiv
TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation
arXiv 2026--
DriveJudgearXiv
DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models
arXiv 2026--
ReactSim-BencharXiv
ReactSim-Bench: Benchmarking Reactive Behavior World Model Simulation in Autonomous Driving
arXiv 2026--
AnchorDrivearXiv
AnchorDrive: LLM Scenario Rollout with Anchor-Guided Diffusion Regeneration for Safety-Critical Scenario Generation
arXiv 2026--
ScenePilot-BencharXiv
ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving
arXiv 2026--
RoboDriveVLMarXiv
RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving
arXiv 2025--
IsarXiv
Is Your VLM for Autonomous Driving Safety-Ready? A Comprehensive Benchmark for Evaluating External and In-Cabin Risks
arXiv 2025--
CARScenesarXiv
CARScenes: Semantic VLM Dataset for Safe Autonomous Driving
arXiv 2025--

4. Applications

5. Other Resources