R
Published on

CVPR 2026 — Autonomous Driving & ADAS

Autonomous Driving & ADAS

127 papers

1. OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancement

2. AeroAgent: A Vision-Physics-Decision Framework for Aerodynamic Vehicle Design

3. SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving

4. The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models

5. VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving

6. Beyond Endpoints: Path-Centric Reasoning for Vectorized Off-Road Network Extraction

7. V2U4Real: A Real-world Large-scale Dataset for Vehicle-to-UAV Cooperative Perception

8. GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving

9. DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces

10. An Instance-Centric Panoptic Occupancy Prediction Benchmark for Autonomous Driving

11. Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving

12. Neuro-Cognitive Reward Modeling for Human-Centered Autonomous Vehicle Control

13. Probabilistic Discrepancy Learning for Roadside LiDAR Scene Completion

14. MTA: Multimodal Task Alignment for BEV Perception and Captioning

15. Learnability-Driven Submodular Optimization for Active Roadside 3D Detection

16. All Vehicles Can Lie: Efficient Adversarial Defense in Fully Untrusted-Vehicle Collaborative Perception via Pseudo-Random Bayesian Inference

17. CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing

18. KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System

19. Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning

20. RoadGIE: Towards A Global-Scale Aerial Benchmark for Generalizable Interactive Road Extraction

21. Semi-supervised Echocardiography Video Segmentation via Anchor Semantic Awareness and Continuous Pseudo-label Reforging

22. DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation

23. ActiveAD: Planning-Oriented Active Learning for End-to-End Autonomous Driving

24. CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction

25. The Road Less Seen: Segment Exploration for Weakly Supervised Video Anomaly Detection

26. CycleBEV: Regularizing View Transformation Networks via View Cycle Consistency for Bird's-Eye-View Semantic Segmentation

27. GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

28. DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

29. TruckDrive: Long-Range Autonomous Highway Driving Dataset

30. HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation

31. ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving

32. LDP-Slicing: Local Differential Privacy for Images via Randomized Bit-Plane Slicing

33. UAVLight: A Benchmark for Illumination-Robust 3D Reconstruction in Unmanned Aerial Vehicle (UAV) Scenes

34. DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning

35. WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios

36. DGGT: Feedforward 4D Reconstruction of Dynamic Driving Scenes using Unposed Images

37. EchoVDiff: Cardiac-Cycle Echocardiography Video Generation from Arbitrary Single Frame

38. CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning

39. MetaSpectra+: A Compact Broadband Metasurface Camera for Snapshot Hyperspectral+ Imaging

40. Beyond Rule-Based Agents: Active Markov Games for Realistic Multi-Agent Interaction in Autonomous Driving

41. E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving

42. Dr.Occ: Depth- and Region-Guided 3D Occupancy from Surround-View Cameras for Autonomous Driving

43. AdaSpot: Spend Resolution Where It Matters for Precise Event Spotting

44. LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving

45. Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems

46. HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles

47. CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving

48. RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding

49. FedCART: Tackling Long-Tailed Distributions in Federated Adversarial Training via Classifier Refinement

50. MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving

51. SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World

52. Unposed-to-3D: Learning Simulation-Ready Vehicles from Real-World Images

53. CARE: A Molecular-Guided Foundation Model with Adaptive Region Modeling for Whole Slide Image Analysis

54. RecEdit-Drive: 3D Reconstruction-Guided Spatiotemporal Video Editing for Autonomous Driving Scenes

55. CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

56. DVGT: Driving Visual Geometry Transformer

57. CARD: Correlation Aware Restoration with Diffusion

58. TopoHR: Hierarchical Centerline Representation for Cyclic Topology Reasoning in Driving Scenes with Point-to-Instance Relations

59. RAG-TP: A General Framework for Vehicle Trajectory Prediction via Retrieval-Augmented Generation

60. AdaSVD: Singular Value Decomposition with Adaptive Mechanisms for Large Multimodal Models

61. GSV2X: Geometry-Aware Uncertainty Modeling and Orthogonal Fusion for Robust Roadside Perception

62. Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving

63. DriveVLN: Towards Mapless Vision-and-Language Navigation in Autonomous Driving

64. MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving

65. Unifying Language-Action Understanding and Generation for Autonomous Driving

66. EchoPOSE: 6D Pose Estimation of Sparse Echocardiograms for Left-Ventricular 3D Shape Reconstruction

67. Spatial Retrieval Augmented Autonomous Driving

68. ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving

69. UFO: Unifying Feed-Forward and Optimization-based Methods for Large Driving Scene Modeling

70. Spe-BEVHead: Rethinking the Detection Head Design for Bird's-Eye-View Object Detection

71. Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures

72. Perceiving the Near, Reasoning the Distant: Coherent Long-Horizon Trajectory Prediction for Autonomous Driving

73. URScenes: A Multi-scenario Dataset for Unstructured Road Environments

74. WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving

75. Dual-Level Hypergraph Generation for Addressing Feature Scarcity in Whole-Slide Image Classification

76. Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving

77. MAD: Motion Appearance Decoupling for efficient Driving World Models

78. CARLoS: Retrieval via Concise Assessment Representation of LoRAs at Scale

79. SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectors

80. EventDrive: Event Cameras for Vision-Language Driving Intelligence

81. MoVie: Broaden Your Views with Human Motion for Action Detection

82. OptiMVMap: Offline Vectorized Map Construction via Optimal Multi-vehicle Perspectives

83. CGHair: Compact Gaussian Hair Reconstruction with Card Clustering

84. HybridDriveVLA: Vision-Language-Action Model with Visual CoT reasoning and ToT Evaluation for Autonomous Driving

85. CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention

86. PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving

87. Reliable Policy Transfer for Safety-Aware End-to-End Driving with Deep Reinforcement Learning

88. BEV-SLD: Self-Supervised Scene Landmark Detection for Global Localization with LiDAR Bird's-Eye View Images

89. Driving on Registers

90. Efficient Equivariant Transformer for Self-Driving Agent Modeling

91. DriverGaze360: OmniDirectional Driver Attention with Object-Level Guidance

92. DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving

93. EE-RL: Vision Language Guided Reinforcement Learning with Explorer and Expert model for End-to-End Autonomous Driving

94. GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

95. RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning

96. ReManNet: A Riemannian Manifold Network for Monocular 3D Lane Detection

97. Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving

98. CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis

99. AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding

100. DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving

101. DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

102. Towards Stealthy and Effective Backdoor Attacks on Lane Detection: A Naturalistic Data Poisoning Approach

103. DriveLaW: Unifying Planning and Video Generation in a Latent Driving World

104. BEV-CAR: Enhancing Monocular Bird's Eye View Segmentation with Context-Aware Rasterization

105. MatchMask: Mask-Centric Generative Data Augmentation for Label-Scarce Semantic Segmentation

106. SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving

107. AdaSFormer: Adaptive Serialized Transformers for Monocular Semantic Scene Completion from Indoor Environments

108. Robustness Under Data Scarcity: Few-Shot Continual Adversarial Training for Evolving Threats

109. CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model

110. WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World

111. Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning

112. Latent Chain-of-Thought World Modeling for End-to-End Autonomous Driving

113. RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generation

114. DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR

115. Multi-view Pyramid Transformer: Look Coarser to See Broader

116. Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles

117. LEAD: Minimizing Learner-Expert Asymmetry in End-to-End Driving

118. Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving

119. TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation

120. All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

121. MCHDoc: A Comprehensive Benchmark for Reading Multi-Carrier Chinese Historical Documents

122. Few-Shot Hybrid Incremental Learning:Continually Learning under Data Scarcity and Task Uncertainty

123. CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion

124. SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving

125. EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

126. High-Fidelity Virtual Try-On beyond Paired Data Scarcity via Diffusion-based Cycle-Consistent Learning

127. GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation