R
Published on

CVPR 2026 — Vision-Language & Multimodal

Vision-Language & Multimodal

1160 papers

1. CompBench: Benchmarking Complex Instruction-guided Image Editing

2. Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Models

3. White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation

4. Reallocating Attention Across Layers to Reduce Multimodal Hallucination

5. Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Models

6. RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward

7. GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning

8. MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark

9. Functional Mean Flow in Hilbert Space

10. One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework

11. Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients

12. Vocabulary Scaling Law: Tuning Open-vocabulary Predictors for Their Openness

13. Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention

14. Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis

15. AVION: Aerial Vision-Language Instruction from Offline Teacher to Prompt-Tuned Network

16. VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

17. The Missing Point in Vision Transformers for Universal Image Segmentation

18. Dynamics-Aware Preference Optimization for Vision-Language Models

19. CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space

20. The Surprising Effectiveness of Noise Pretraining for Implicit Neural Representations

21. Are Image-to-Video Models Good Zero-Shot Image Editors?

22. From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings

23. SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

24. Scaling Spatial Intelligence with Multimodal Foundation Models

25. Direct Segmentation without Logits Optimization for Training-Free Open-Vocabulary Semantic Segmentation

26. ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning

27. Basis-Oriented Low-rank Transfer for Few-Shot and Test-Time Adaptation

28. InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding

29. MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe

30. Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment

31. TRM-VLA: Temporal-Aware Chain-of-Thought Reasoning and Memorization for Vision-Language-Action Models

32. BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation

33. CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment

34. EG-3DVG: Expression and Geometry Aware Grounding Decoder for 3D Visual Grounding

35. LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning

36. CoIn: Coverage and Informativeness-Guided Token Reduction for Efficient Large Multimodal Models

37. RetFormer: Multimodal Retrieval for Enhancing Image Recognition

38. Twin-T & TwintVQA: A Reliable Structure-Detail Separating VLM and a Comprehensive Benchmark for Chart and Table Tasks

39. NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration

40. SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

41. Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

42. Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models

43. QueryMe: Query-Driven Open-Vocabulary 3D Object Affordances Grounding from Multimodal Evidence

44. Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions

45. Tell2Adapt: A Unified Framework for Source Free Unsupervised Domain Adaptation via Vision Foundation Model

46. Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models

47. IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting

48. RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding

49. Harnessing the Power of Foundation Models for Accurate Material Classification

50. Concept-Aware Batch Sampling Improves Language-Image Pretraining

51. Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding

52. StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering

53. A Causal Marriage between VLM and IRM from Understanding to Reasoning

54. Beyond Graph Model: Reliable VLM Fine-Tuning via Random Graph Adapter

55. HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models

56. WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition

57. Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models

58. MeToM: Metadata-Guided Token Merging for Efficient Video LLMs

59. Self-Evaluation Unlocks Any-Step Text-to-Image Generation

60. VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving

61. EMMA: Extracting Multiple physical parameters from Multimodal Data

62. DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Models

63. Understanding Counting Mechanisms in Large Language and Vision-Language Models

64. MMDIR: Multimodal Instruction-Driven Framework for Mixed-Degradation Document Image Restoration

65. Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models

66. Inconsistency-aware Multimodal Schrodinger Bridge for Deepfake Localization

67. ViTPrompt: Training-Free Prompt Refinement with Visual Tokens for Open-Vocabulary Detection

68. Beyond Heuristic Prompting: A Concept-Guided Bayesian Framework for Zero-Shot Image Recognition

69. Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

70. SDDF: Specificity-Driven Dynamic Focusing for Open-Vocabulary Camouflaged Object Detection

71. MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prior

72. Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

73. Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

74. Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

75. When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters

76. Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoning

77. OVI-MAP: Open-Vocabulary Instance-Semantic Mapping

78. What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models

79. Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching

80. Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment

81. Concept Regions Matter: Benchmarking CLIP with a New Cluster-Importance Approach

82. MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

83. CDICS: Delving Into Fine-Grained Attribute for In-Context Segmentation via Compositional Prompts and Phased Decoupling

84. STAR-R1: Multi-View Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs

85. Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers

86. Open the Motion Door: Atomic Motion Decomposition and Recomposition for Open-Vocabulary Motion Generation

87. CIGMA: Causal Information-Gain Mechanistic Attribution of Attention Heads in Vision Transformers

88. Active Perceptual Inference: A Corticothalamic-Inspired Dynamic Nested Recurrent Network for Multimodal Sentiment Analysis with Incomplete Data

89. Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis

90. Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

91. Geometry-Guided 3D Visual Token Pruning for Video-Language Models

92. DyFCLT: Dynamic Frequency-Decoupled Cross-Modal Learning Transformer for Multimodal Tiny Object Detection

93. RNED: Rotary Number Encoding and Decoding for Medical VLMs

94. Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves

95. HiFICL: High-Fidelity In-Context Learning for Multimodal Tasks

96. AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition

97. Learning from Itself: Mining Internal Knowledge from Vision Language Models for Continual Learning

98. EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

99. Edge-RecViT: Efficient Vision Transformer via Semantic-Refined Dynamic Recursion

100. TVHighlights: LLM-Guided Human-Free Collaborative Training for Video Highlight Detection in Movies and TV Dramas

101. GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking

102. CADFS: A Big CAD Program Dataset and Framework for Computer-Aided Design with Large Language Models

103. UZ3DVG: Unaided Zero-Shot 3D Visual Grounding with Generated Language Conditions

104. Breaking Multimodal LLM Safety via Video-Driven Prompting

105. Eliminate Distance Differences Induced by Backdoor Attacks: Layer-Selective Training and Clipping to Mask Backdoor Models

106. ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

107. ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation

108. REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding

109. Hilbert Curve-Based Attention Enabling Topology-Preserving Image Tensor Representation for Semantic Segmentation Network

110. Meta-Learning In-Context Enables Training-Free Cross Subject Brain Decoding

111. fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

112. DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance

113. Seeing What Matters: A Training-Free Self-Guided Framework for Multimodal Detail Perception and Reasoning

114. MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images

115. UNI-OOD: Unified Object- and Image-level Out-of-Distribution Detection via Cross-Context Attentive Vision-Language Modeling

116. Semantic-Guided Global-Local Collaborative Prompt Learning for Few-Shot Class Incremental Learning

117. LLM-Guided Probabilistic Fusion for Label-Efficient Document Layout Analysis

118. COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

119. AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models

120. PureCC: Pure Learning for Text-to-Image Concept Customization

121. Scaling Dense Event-Stream Pretraining from Visual Foundation Models

122. CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation

123. Back to Point: Exploring Point-Language Models for Zero-Shot 3D Anomaly Detection

124. Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models

125. GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation

126. BiGMINT: Biologically-guided Hierarchical Multimodal Integration for Modeling Multiple Compound Activities in Drug Discovery

127. Think 360deg: Beyond Depth: Evaluating the Width-centric Reasoning Capability of MLLMs

128. Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models

129. Towards Generalized Multimodal Homography Estimation

130. Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction

131. SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models

132. FVBench: Benchmarking Deepfake Video Detection Capability of Large Multimodal Models

133. MTA: Multimodal Task Alignment for BEV Perception and Captioning

134. Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

135. Language Does Matter for Cross-Domain Few-Shot Visual Feature Enhancement

137. Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models

138. VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

139. Direction-aware 3D Large Multimodal Models

140. MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model

141. Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset

142. ViLoMem: Agentic Learner with Grow-and-Refine Multimodal Semantic Memory

143. Memory Matters: Boosting Training-Free Zero-Shot Temporal Action Localization with a Learnable Lookup Table

144. Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

145. FAVE: A Structured Benchmark for Fine-Grained Audio-Visual Temporal Evaluation in Multimodal LLMs

146. Proof-of-Perception: Certified Tool-Using Multimodal Reasoning with Compositional Conformal Guarantees

147. CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation

148. TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

149. AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation

150. Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing

151. CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

152. Do Vision-Language Models Leak What They Learn? Adaptive Token-Weighted Model Inversion Attacks

153. Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models

154. SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models

155. FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips

156. Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning

157. Unlearning without Forgetting: Securely Removing Targeted Concepts from Large-Scale Vision-Language Open-Vocabulary Detectors

158. rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training

159. LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens

160. Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

161. Stable and Efficient Single-Rollout RL for Multimodal Reasoning

162. From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs

163. Nonparametric Deep Fine-grained Clustering with Low-Rank Guided Vision-Language Model

164. Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images

165. OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning

166. HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics

167. MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

168. HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models

169. Complementary Prototype Mapping for Efficient Multimodal Anomaly Detection

170. TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

171. OSMO: Open-vocabulary Self-eMOtion Tracking

172. DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

173. CMR-RD: Long-Tailed Adaptive VLM for Explainable CMR Diagnosis

174. CausalLens: Sensitivity-Guided Multi-Head Causal Intervention for Hallucination Mitigation in Large Vision-Language Models

175. Boosting Vision-Language Models Towards Cross-Domain Incremental Object Detection

176. Cross-Slice Knowledge Transfer via Masked Multi-Modal Heterogeneous Graph Contrastive Learning for Spatial Gene Expression Inference

177. FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model

178. Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning

179. HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

180. Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models

181. MuViT: Multi-Resolution Vision Transformers for Learning Across Scales in Microscopy

182. Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer

183. Spectrally Distilled Representations Aligned with Instruction-Augmented LLMs for Satellite Imagery

184. IF-Prune: Information-Flow Guided Token Pruning for Efficient Vision-Language Models

185. VL-RouterBench: A Benchmark for Vision-Language Model Routing

186. Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding

187. Asynchronous Temporal Modeling with Two-Agent Framework for Streaming Dense Video Captioning

188. Beyond Text: Visual Description Assembly by Probabilistic Model for CLIP-based Weakly Supervised Semantic Segmentation

189. R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment

190. ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior

191. Towards Human-Imperceptible Backdoor Attacks on Text-to-Image Diffusion Models

192. OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Data

193. ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

194. InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy

195. MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation

196. UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

197. Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models

198. THE MORE, THE MERRIER: CONTRASTIVE FUSION FOR HIGHER-ORDER MULTIMODAL ALIGNMENT

199. Test-Time Perturbation Tuning with Delayed Feedback for Vision-Language-Action Models

200. LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

201. SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge

202. Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videos

203. GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning

204. QuietPrune: Query-Guided Early Token Pruning for Vision-Language Models

205. b-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment

206. Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction

207. CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering

208. ModularAgent: A Task-Aware Modular Framework for Joint Optimization of Multimodal Large Language Models and World Models

209. Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

210. Evidential Transformation Network: Turning Pretrained Models into Evidential Models for Post-hoc Uncertainty Estimation

211. FlowComposer: Composable Flows for Compositional Zero-Shot Learning

212. Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training

213. Cross-Hand Latent Representation for Vision-Language-Action Models

214. NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection

215. Visual Grounding for Object Questions

216. Authorize-on-Demand: Dynamic Authorization with Legality-Aware Intellectual Property Protection for VLMs

217. Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection

218. LoPrune: Efficient Data Pruning for LoRA-Based Fine-Tuning of Vision Transformer

219. CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

220. Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring

221. Towards an Incremental Unified Multimodal Anomaly Detection: Augmenting Multimodal Denoising From an Information Bottleneck Perspective

222. FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillation

223. Bridging the Modality Gap in Compositional Zero-Shot Learning via Sparse Alignment and Unimodal Memory Bank

224. Towards Open-Vocabulary Industrial Defect Understanding with a Large-Scale Multimodal Dataset

225. AXG-Reasoner: Error Detection and Explanation in Long Task Videos with Vision-Language Models

226. GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

227. DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

228. Modeling the Brain's Grammar: ROI-Guided fMRI Pretraining for Transferable and Interpretable Vision Decoding

229. OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

230. RMIR: A Benchmark Dataset for Reasoning-Intensive Multimodal Image Retrieval

231. LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models

232. TextOVSR: Text-Guided Real-World Opera Video Super-Resolution

233. Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues

234. Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

235. EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization

236. SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models

237. Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

238. FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation

239. Multimodal Causality-Driven Representation Learning for Generalizable Medical Image Segmentation

240. RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs

241. OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation

242. AdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLM

243. STiTch: Semantic Transition and Transportation in Collaboration for Training-Free Zero-Shot Composed Image Retrieval

244. Role-SynthCLIP: A Role-Play Driven Diverse Synthetic Data Approach

245. AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention

246. From Few-way to Many-way: Rethinking Few-shot Fine-grained Image Classification

247. Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

248. The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts

249. CrossVL: Complexity-Aware Feature Routing and Paired Curriculum for Cross-View Vision-Language Detection

250. Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models

251. Real-Time Multimodal Fingertip Contact Detection via Depth and Motion Fusion for Vision-Based Human-Computer Interaction

252. MMGait: Towards Multi-Modal Gait Recognition

253. Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds

254. PhotoFramer: Multi-modal Image Composition Instruction

255. Will Multimodal Models Be Dazzled by Multi-Image Visual Puzzles?

256. GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

257. The Power of Prior: Training-Free Open-Vocabulary Semantic Segmentation with LLaVA

258. Image Guides Images: Consistent Video Amodal Completion with Rectified In-Context Exemplar Guidance

259. ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering

260. Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation

261. ConsistCompose: Unified Multimodal Layout Control for Image Composition

262. HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models

263. FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment

264. MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

265. Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

266. Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation

267. Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression

268. PromptStereo: Zero-Shot Stereo Matching via Structure and Motion Prompts

269. CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning

270. Incentivizing Versatile Video Reasoning in MLLMs via Data-Efficient Reinforcement Learning

271. Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance

272. FoSS: Modeling Long-Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier-State Space Integration

273. ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

274. EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

275. TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models

276. MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding

277. Masking Teacher and Reinforcing Student for Distilling Vision-Language Models

278. Quantum-Gated Task-interaction Knowledge Distillation for Pre-trained Model-based Class-Incremental Learning

279. See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs

280. Selective, Regularized, and Calibrated: Harnessing Vision Foundation Models for Cross-Domain Few-Shot Semantic Segmentation

281. MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals

282. Think Before You Drive: World Model-Inspired Multimodal Grounding

283. Align Once to Explain: Feature Alignment for Scalable B-cosification of Foundational Vision Transformers

284. HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives

285. S2^2-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

286. VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis

287. Data-Centric Meta-Learning for Robust Few-Shot Generalization

288. MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

289. Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following

290. On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models

291. VES-RFT: Rewarding Visual Evidence Sensitivity to Mitigate Hallucinations in Large Vision-Language Models

292. Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

293. G2^2VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning

294. Scaling Zero-Shot Reference-to-Video Generation

295. ⊘\oslash Source Models Leak What They Shouldn't ↛\nrightarrow: Unlearning Zero-Shot Transfer in Domain Adaptation Through Adversarial Optimization

296. Hyperbolic Relational Prompts for Intersectional Fairness in Medical VLMs

297. DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning

298. NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

299. Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

300. E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training

301. RPGFusion: 4D Radar Prior-Guided Multi-Modal Fusion for 3D Detection

302. TAMER: A Tri-Modal Contrastive Alignment and Multi-Scale Embedding Refinement Framework for Zero-Shot ECG Diagnosis

303. InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Space

304. Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models

305. UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register

306. PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks

307. SO(3)-Equivariant ViT-Adapter for Data-Efficient Zero-Shot Sim-to-Real Indoor Panoramic Depth Estimation

308. ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models

309. OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

310. SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning

311. Illuminating Visual Identity in Universal Multimodal Embeddings

312. SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization

313. PureProof: Diffusion-Resistant Black-box Targeted Attack on Large Vision-Language Models

314. LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistency

315. Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR

316. Token Warping Helps MLLMs Look from Nearby Viewpoints

317. Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models

318. Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation

319. MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation

320. Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs

321. CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning

322. U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation

323. Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation

324. Test-Time Multi-Prompt Adaptation for Open-Vocabulary Remote Sensing Image Segmentation

325. Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

326. Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models

327. Vinedresser3D: Towards Agentic Text-guided 3D Editing

328. EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling

329. TeHOR: Text-Guided 3D Human and Object Reconstruction with Textures

330. Dynamic Logits Adjustment and Exploration for Test-Time Adaptation in Vision Language Models

331. CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning

332. DualMirage: Hunting Stealthy Multimodal LLM Agents via CAPTCHAs with Contour and Adversarial Illusions

333. Hugging Visual Prompt and Segmentation Tokens: Consistency Learning for Fine-Grained Visual Understanding in MLLMs

334. Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning

335. AG-VAS: Anchor-Guided Zero-Shot Visual Anomaly Segmentation with Large Multimodal Models

336. STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative

337. How Much 3D Do Video Foundation Models Encode?

338. Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation

339. Stabilizing Feature Geometry in Noisy Pretrained Models for Robust Downstream Tasks

340. GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models

341. S2C2Seg: Semantic-Spatial Consistency and Category Optimization for Open-Vocabulary Segmentation

342. Beyond What's Shared: Recovering Lost Unique Information from Intermediate Layers to Boost Multimodal Geo-Foundation Models

343. A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models

344. TF-CADE: Foreground-Concentrated Text-Video Alignment for Zero-Shot Temporal Action Detection

345. Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception

346. NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Training

347. Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models

348. Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching

349. Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization

350. From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition

351. One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination

352. GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping

353. Disentangling to Re-couple: Resolving the Similarity-Controllability Paradox in Subject-Driven Text-to-Image Generation

354. PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and VLM-Guided Optimization

355. LVLM-Aided Alignment of Task-Specific Vision Models

356. HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidance

357. Bayesian Decomposition and Semantic Completion for Few-shot Semantic Segmentation

358. Ego: Embedding-Guided Personalization of Vision-Language Models

359. R-4B: Incentivizing General-Purpose Auto-Thinking in MLLMs via Bi-Mode Annealing and Reinforce Learning

360. ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models

361. World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models

362. NuWa: Deriving Lightweight Class-Specific Vision Transformers for Edge Devices

363. E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving

364. SenseSearch: Empowering Vision-Language Models with High-Resolution Agentic Search-Reasoning via Reinforcement Learning

365. Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization

366. PersonaVLM: Long-Term Personalized Multimodal LLMs

367. Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models

368. Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation

369. FloVerse: Floor Plan-Guided Multi-Modal Navigation

370. ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors

371. Grounded 3D-Aware Spatial Vision-Language Modeling

372. Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design

373. Towards Robust Multi-Modal Semantic Segmentation with Teacher-Student Framework and Hybrid Prototype Distillation

374. Towards Robust Vision Transformers: Path Dependency Analysis and a Simple Two-Stage Adversarial Training

375. Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting

376. OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding

377. ReAttnCLIP: Training-Free Open-Vocabulary Remote Sensing Image Segmentation via Re-defined Attention in CLIP

378. EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

379. Rethinking Token Reduction for Large Vision-Language Models

380. CaptionQA: Is Your Caption as Useful as the Image Itself?

381. PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

382. WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

383. Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?

384. HoneyBee: Data Recipes for Vision-Language Reasoners

385. Condensed Test-Time Adaptation of VLMs for Action Recognition

386. PointThinker: Point-Incentivized Parallel Thinking for Multimodal Large Language Model

387. VecGlypher: Unified Vector Glyph Generation with Language Models

388. GraPHFormer: A Multimodal Graph Persistent Homology Transformer for the Analysis of Neuroscience Morphologies

389. ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions

390. Delta Rectified Flow Sampling for Text-to-Image Editing

391. EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

392. Archon: A Unified Multimodal Model for Holistic Digital Human Generation

393. Linking Perception, Confidence and Accuracy in MLLMs

394. Diagram2Structure: Unlocking LLMs' Diagram Comprehension through DiagramDiff, a Framework for Structuring Offline Diagrams

395. AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

396. MOMO: Mars Orbital MOdel Foundation Model for Mars Orbital Applications

397. Zero-Shot Image Denoising via Hybrid Prior-Guided Pseudo Sample Generation

398. Humanoid Generative Pre-Training for Zero-Shot Motion Tracking

399. ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology

400. MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

401. Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection

402. Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

403. MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentation

404. OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models

405. FedMPT: Federated Multi-Label Prompt Tuning of Vision-Language Models

406. Dynamic Token Reweighting for Robust Vision-Language Models

407. Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding

408. IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation

409. CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning

410. VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation

411. EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease

412. Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models

413. DarkAct: A RGB-Thermal Dataset and Fusion Framework for Multimodal Low-Light Action Recognition

414. Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation

415. MoEActok: A MoE-based Action Tokenizer for Vision-Language-Action Models

416. ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering

417. Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining

418. Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow

419. UniVBench: Towards Unified Evaluation for Video Foundation Models

420. CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models

421. Few-shot Acoustic Synthesis with Multimodal Flow Matching

422. UniCompress: Token Compression for Unified Vision-Language Understanding and Generation

423. AURA: Multi-modal Shared Autonomy for Urban Navigation

424. WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval

425. PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs

426. VisPlay: Self-Evolving Vision-Language Models

427. DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models

428. Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought

429. Boosting Reasoning in Large Multimodal Models via Activation Replay

430. Enhancing Part-Level Point Grounding for Any Open-Source MLLMs

431. PACT: Phase-Like Transition Constraints in Adapter-Based Continual Learning of Vision-Language Models

432. Beyond Caption-Based Queries in Video Moment Retrieval

433. Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation

434. MDS-VQA: Model-Informed Data Selection for Video Quality Assessment

435. Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generation

436. PAS: Prelim Attention Score for Detecting Object Hallucinations in Large Vision-Language Models

437. HOPS: Hierarchical Open-vocabulary Part Segmentation with Attention-Aware Filtering and Affinity-Guided Enhancement

438. Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference

439. CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

440. Reading Your Actions: Learning Generalizable Action Representations via Pre-training AEMG

441. Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events

442. Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness

443. Zero-Shot Depth Completion with Vision-Language Model

444. Rosetta Stone For Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generation

445. TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models

446. Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shifts

447. Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

448. REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

449. Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification

450. Mario: Multimodal Graph Reasoning with Large Language Models

451. MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving

452. mVLM: A Vision Language Model for mNPUs

453. Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

454. SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control

455. An Empirical Study on How Video-LLMs Answer Video Questions

456. Distribution-Aligned Multimodal Fusion for Robust Object Detection

457. SRA-Det: Learning Omni-Grained Open-Vocabulary Detection Beyond Category Names

458. Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection

459. Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token

460. Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy

461. Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

462. Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing

463. Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards

464. GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding

465. MR-RAG: Multimodal Relevance-Aware Retrieval-Augmented Generation for Medical Visual Question Answering

466. OctoMed: Data Recipes for State-of-the-Art Multimodal Medical Reasoning

467. Similarity-as-Evidence: Calibrating Overconfident VLMs for Interpretable and Label-Efficient Medical Active Learning

468. Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes

469. Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

470. DiffuView: Multi-View Diffusion Pretraining for 3D Aware Robotic Manipulation

471. Disentangle-then-Align: Non-Iterative Hybrid Multimodal Image Registration via Cross-Scale Feature Disentanglement

472. Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

473. CARE: A Molecular-Guided Foundation Model with Adaptive Region Modeling for Whole Slide Image Analysis

474. Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation

475. MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding

476. One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

477. CF-IPT: Cross-Modal Fusion Interactive Prompt Tuning of Vision-Language Pre-Trained Model for Multisource Remote Sensing Data Classification

478. See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles

479. Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP

480. Representation-Steered Incremental Adapter-Tuning for Class-Incremental Learning with Pre-Trained Models

481. Efficient Encoder-Free Fourier-based 3D Large Multimodal Model

482. Lyapunov Probes for Hallucination Detection in Large Foundation Models

483. Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions

484. WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation

485. Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation

486. Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

487. CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

488. AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models

489. OmniGen2: Towards Instruction-Aligned Multimodal Generation

490. MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

491. VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer

492. Soft Modality-Guided Expert Specialization in MoE-VLMs

493. Streamlined Open-Vocabulary Human-Object Interaction Detection

494. Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

495. Beyond Layer-Wise Merging: Chain-of-Merging for Vision-Language Models

496. WeaveTime: Streaming from Earlier Frames into Emergent Memory in VideoLLMs

497. ReFAct: Empowering Multimodal Web Agents with Visual and Context Focusing

498. UNICBench: UNIfied Counting Benchmark for MLLM

499. Towards Open Environments and Instructions: General Vision-Language Navigation via Fast-Slow Interactive Reasoning

500. SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models

501. The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

502. OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environments

503. GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting

504. From 3D Pose to Prose: Biomechanics-Grounded Vision-Language Coaching

505. VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion

506. Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation

507. UI-Lens: Assessing General MLLMs' Potential to Automate UI Display Quality Assurance

508. VMD-FACT: A New Video Dataset and MLLM-based method for Detecting Realistic AI-Generated Video Misinformation

509. ReMatch: Boosting Representation through Matching for Multimodal Retrieval

510. Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

511. Seeing Both Sides: Towards Bidirectional Semantic Alignment for Open-Vocabulary Camouflaged Object Segmentation

512. PowerCLIP: Powerset Alignment for Contrastive Pre-Training

513. Copy-Transform-Paste: Zero-Shot Object-Object Alignment Guided by Vision-Language and Geometric Constraints

514. RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observation

515. MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

516. GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentation

517. ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

518. Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

519. VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments

520. Hyperbolic Defect Feature Synthesis for Few-Shot Defect Classification

521. Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

522. Bridging Facial Understanding and Animation via Language Models

523. Learning to Focus and Precise Cropping:A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

524. ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

525. 3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience

526. First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

527. HSI-GPT2: A Dual-Granularity Large Motion Reasoning Model with Diffusion Refinement for Human-Scene Interaction

528. Can You Learn to See Without Images? Procedural Warm-Up for Vision Transformers

529. Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition

530. MARIS: Marine Open-Vocabulary Instance Segmentation

531. Envision, Attend, Then Respond: Counterfactual Hallucination Mitigation in Large Vision-Language Models

532. StoryTailor:A Zero-Shot Pipeline for Action-Rich Multi-Subject Visual Narratives

533. GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

534. Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

535. Multi-speaker Attention Alignment for Multimodal Social Interaction

536. CoSMo3D: Open-World Promptable 3D Semantic Segmentation through LLM-Guided Canonical Spatial Modeling

537. M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG

538. M^3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

539. PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation

541. AdaSVD: Singular Value Decomposition with Adaptive Mechanisms for Large Multimodal Models

542. MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

543. WeDetect: Fast Open-Vocabulary Object Detection as Retrieval

544. Re-evaluating Continual VQA: Toward Fair and Robust Evaluation for Multimodal Continual Learning

545. Let VLMs Grade Their Own Thoughts: A Self-Quantification Approach to Reasoning-Aware Reward Modeling

546. UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression

547. Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

548. StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues

549. M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models

550. Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection

551. FluoCLIP: Stain-Aware Focus Quality Assessment in Fluorescence Microscopy

552. SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs

553. Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving

554. VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation

555. Multimodal Distribution Matching for Vision-Language Dataset Distillation

556. HAMMER: Harnessing MLLMs via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

557. Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation

558. Synthesizing Visual Concepts as Vision-Language Programs

559. GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

560. DSFlash: Comprehensive Panoptic Scene Graph Generation in Realtime

561. Text-guided Feature Disentanglement for Cross-modal Gait Recognition

562. Point Cloud as a Foreign Language for Multi-modal Large Language Model

563. Training-Free Open-Vocabulary Camouflaged Object Segmentation via Fine-Grained Object Binding and Adaptive Hybrid Prompt

564. MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving

565. CLIP-like Model as a Foundational Density Ratio Estimator

566. SkySense-VITA: Towards Universal In-context Segmentation of Multi-modal Remote Sensing Imagery

567. Flow Matching for Multimodal Distributions

568. Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods

569. HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation

570. Selectively Extracting and Injecting Visual Attributes into Text-to-Image Models

571. Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

572. Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance

573. JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization

574. When Anonymity Breaks: Identifying Models Behind Text-to-Image Leaderboards

575. When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness

576. LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding

577. Fine-Tuning Impairs the Balancedness of Foundation Models in Long-tailed Personalized Federated Learning

578. Towards Robust Multimodal Large Language Models Against Jailbreak Attacks

579. Adaptive Confidence Regularization for Multimodal Failure Detection

580. Conflict-Aware Adaptive Cross-Reconstruction for Multimodal Sentiment Analysis

581. History to Future: Evolving Agent with Experience and Thought for Zero-shot Vision-and-Language Navigation

582. DeRVOS: Decoupling Consistent Trajectory Generation and Multimodal Understanding for Referring Video Object Segmentation

583. EduDiag: A Benchmark for Educational Diagnostic Reasoning with Error Tracing and Correction on Large Multimodal Models

584. Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

585. Zoo3D: Zero-Shot 3D Object Detection at Scene Level

586. Unsupervised Multi-Scale Segmentation of 3D Subcellular World with Stable Diffusion Foundation Model

587. SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models

588. GenBreak: Red Teaming Text-to-Image Generation Using Large Language Models

589. FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models

590. GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding

591. TrajRAG: Retrieving Geometric-Semantic Experience for Zero-Shot Object Navigation

592. UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

593. A Closer Look at Cross-Domain Few-Shot Object Detection: Fine-Tuning Matters and Parallel Decoder Helps

594. Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

595. Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

596. Asking like Socrates: Socrates helps VLMs understand remote sensing images

597. Test-Time Attention Purification for Backdoored Large Vision Language Models

598. SCoRe: Salience-Coverage Reduction for Vision Token Pruning in Vision-Language Models

599. Cross-Modal Guided Visual Synthesis for Data-Efficient Multimodal Depression Recognition

600. From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs

601. Universal-to-Specific: Dynamic Knowledge-Guided Multiple Instance Learning for Few-Shot Whole Slide Image Classification

602. Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior

603. VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

604. KAMP: Knowledge-Anchored Multimodal Pretraining Framework for Medical Image Representation

605. Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

606. Open-Vocabulary Domain Generalization in Urban-Scene Segmentation

607. Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models

608. HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation

609. VQ-VA World: Towards High-Quality Visual Question-Visual Answering

610. Self-supervised Dynamic Heterogeneous Degradation Modeling for Unified Zero-Shot Image Restoration

611. 3D-LATTE: Latent Space 3D Editing from Textual Instructions

612. Generalizable Knowledge Distillation from Vision Foundation Models for Semantic Segmentation

613. UniSER: A Foundation Model for Unified Soft Effects Removal

614. VLM-PTQ: Efficient Post-Training Quantization for Large Vision-Language Models

615. CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models

616. Vision Transformers Need More Than Registers

617. HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

618. VLM4RSDet: Collaborative Optimization with Vision-Language Model for Enhancing Remote Sensing Object Detection

619. TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models

620. OpenMMReasoner: Pushing the Frontiers in Multimodal Reasoning with an Open and General Recipe

621. Same or Not? Enhancing Visual Perception in Vision-Language Models

622. MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

623. SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models

624. From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training

625. TAPE: Task-Adaptive Prototype Evolution in Audio-Language Models for Fully Few-shot Class-incremental Audio Classification

626. IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

627. AceTone: Bridging Words and Colors for Conditional Image Grading

628. Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

629. Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs

630. Synthetic Curriculum Reinforces Compositional Text-to-Image Generation

631. Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving

632. SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

633. PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference

634. Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT

635. Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation

636. Towards Multimodal Domain Generalization with Few Labels

637. Reclaiming Lost Text Layers for Source-Free Cross-Domain Few-Shot Learning

638. INSID3: Training-Free In-Context Segmentation with DINOv3

639. Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners

640. Lite Any Stereo: Efficient Zero-Shot Stereo Matching

641. VRCLIP: Multimodal Canonical Correlation Alignment for CLIP-Driven Vision-Radio Person Re-Identification

642. MMCP-GEN: A Modality-Extensible Diffusion Language Model for Conditional Protein Sequence Generation

643. PPM-CLIP: Probabilistic Prompt Modeling for Generalizable AI-Generated Image Detection

644. Beyond Weak Supervision: MLLMs-Guided Graded Knowledge Distillation for Unsupervised Camouflaged Object Detection

645. DuoGen: Towards Autonomous Interleaved Multimodal Generation

646. BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

647. Towards Streaming Referring Video Segmentation via Large Language Model

648. BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

649. Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretraining

650. Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration

651. Hidden Dangers of Compositional Generation: Diagnosing Semantic Safety Failures in Text-to-Image Models

652. M4-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection

653. UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement

654. UVU: Improving Multimodal Understanding via Vision-Language Unified Autoregressive Paradigm

655. Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation

656. FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoning

657. OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery

658. NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretraining

659. Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

660. HUMAPS-4D: A Multimodal Dataset for HUman Motion Analysis with Physiological and Semantic informations

661. LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds

662. Foundry: Distilling 3D Foundation Models for the Edge

663. Generalized and Personalized Federated Learning with Black-Box Foundation Models via Orthogonal Transformations

664. TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction

665. NAF: Zero-Shot Feature Upsampling via Neighborhood Attention Filtering

666. PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention

667. Widget2Code: From Visual Widgets to UI Code via Multimodal LLMs

668. SoccerMaster: A Vision Foundation Model for Soccer Understanding

669. A More Word-like Image Tokenization for MLLMs

670. Turning Pre-Trained Vision Transformers into End-to-End Histopathology Whole Slide Image Models for Survival Prediction

671. Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation

672. Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments

673. DDSF: Robust Few-Shot Learning via Disentangled Subspaces with Determinantal Point Process

674. Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs

675. Prototype-as-Prompt: Multimodal Sentiment Prototypes Endowing Large Language Models the Capability to Perform Multimodal Sentiment Analysis

676. SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

677. YieldSAT: A Multimodal Benchmark Dataset for High-Resolution Crop Yield Prediction

678. SARL-STG: A Spatially Aware Reinforcement Learning Framework for Refining MLLMs in Spatio-Temporal Video Grounding

679. MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Prediction

680. Keep It Frozen: Domain-Routed Conditional Residual Modulation for Multi-Domain Vision Transformers

681. WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

682. Factorize, Reconstruct, Enhance: A Unified Framework for Multimodal Sentiment Analysis

683. Retrieving Counterfactuals Improves Visual In-Context Learning

684. EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understanding

685. EMR-Diff: Edge-aware Multimodal Residual Diffusion Model for Hyperspectral Image Super-resolution

686. Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

687. UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

688. Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters

689. ROSE: Rotate Your Large Language Model to See

690. RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment

691. 4DP-QA: Scalable QA for 4D Perception in Vision Language Models

692. Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models

693. Self-Consistency for LLM-Based Motion Trajectory Generation and Verification

694. PromptEnhancer: Taming Your Rewriter for Text-to-Image Generation via Fine-Grained Reward

695. DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

696. PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentation

697. PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation

698. SOTA: Self-adaptive Optimal Transport for Zero-Shot Classification with Multiple Foundation Models

699. Dual-Level Confidence based Implicit Self-Refinement for Medical Visual Question Answering

700. SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition

701. POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs

702. EventDrive: Event Cameras for Vision-Language Driving Intelligence

703. NEAF: Natural Image Editing with Attention Fusion for Generalizable Test-time Optimization in Text-Guided Image Editing

704. VisiLock: Authorizing Instruction-based Image editing with Dual Score Distillation

705. When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance

706. PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Models

707. MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding

708. ApET: Approximation-Error Guided Token Compression for Efficient VLMs

709. Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning

710. Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

711. ORSATR-X: A Foundation Model based on Differential-and-Excitation Networks for Optical Remote Sensing Object Recognition

712. See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

713. Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

714. NitroGen: An Open Foundation Model for Generalist Gaming Agents

715. PEARL: Geometry Aligns Semantics for Training-Free Open-Vocabulary Semantic Segmentation

716. Protect to Adapt: Orthogonal Subspace Control with Ranked Negative-Prompt Curriculum for Few-Shot Action Recognition

717. ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

718. H2-Surv: Hierarchical Hyperbolic Multimodal Representation Learning for Survival Prediction

719. Structural Graph Probing of Vision-Language Models

720. Beyond Missing Modalities: Hypergraph Conditioned Diffusion for Uncertainty-Aware Multimodal Emotion Recognition

721. Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

722. SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling

723. SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation

724. SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

725. TRANSPORTER: Transferring Visual Semantics from VLM Manifolds

726. Zero-Shot Reconstruction of Animatable 3D Avatars with Cloth Dynamics from a Single Image

727. ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Senisng

728. Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting

729. CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning

730. SpatialTree: How Spatial Intelligence Branches Out in MLLMs

731. Prototypical Action Reasoning Facilitated by Vision-Language Alignment for Egocentric Action Anticipation

732. When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models

733. Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models

734. HybridDriveVLA: Vision-Language-Action Model with Visual CoT reasoning and ToT Evaluation for Autonomous Driving

735. SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

736. More than the Sum: Panorama-Language Models for Adverse Omni-Scenes

737. VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models

738. Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing

739. ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

740. Resolving the Identity Crisis in Text-to-Image Generation

741. VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment

742. Jailbreaking Vision-Language Models via Dissonance-Guided Suffix Optimization and Image-Phrase Injection

743. Transform to Transfer: Boosting Adversarial Attack Transferability on Vision-Language Pre-training Models

744. Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration

745. Multi-Modal Image Fusion via Intervention-Stable Feature Learning

746. Beyond Sequential Tools: A Unified VLM Agent System for Photographic Post-Processing via Dynamic Multi-Expert Fusion

747. OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data

748. Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings

749. CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects

750. OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

751. MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection

752. SineProject: Machine Unlearning for Stable Vision-Language Alignment

753. Delving Aleatoric Uncertainty in Medical Image Segmentation via Vision Foundation Models

754. Language Models Can Explain Visual Features via Steering

755. PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving

756. ReCoFuse: Ultra-Robust Image Fusion via Restorative Multi-Modal Diffusion Reciprocal Coupling

757. Breaking the Regional Perception Bottleneck of Multimodal Large Language Models via External Reasoning Framework

758. Cross-Modal Attention Calibration for LVLM Hallucination Mitigation

759. Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing

760. ArtLLM: Generating Articulated Assets via 3D LLM

761. SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

762. Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

763. AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs

764. CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs

765. MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures

766. Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

767. CICA: Coupling Confidence-Aware Pretraining with Confidence-Informed Attention for Robust Multimodal Sentiment Analysis

768. HyCal: A Training-Free Prototype Calibration Method for Cross-Discipline Few-Shot Class-Incremental Learning

769. HDR-VLM: HDR-Domain Adaptation of VLMs and Preference-Aligned Quality Assessment for HDR Video Color Grading

770. ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding

771. MoECLIP: Patch-Specialized Experts for Zero-shot Anomaly Detection

772. Rethinking Intermediate Representation for VLM-based Robot Manipulation

773. MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models

774. MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models

775. AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors

776. TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration

777. HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning

778. QUANTIPHY: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models

779. OctoT2I: A Self-Evolving Agentic Text-to-Image Router

780. Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning

781. MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

782. Improving Vision-language Models with Perception-centric Process Reward Models

783. Spatial Matters: Position-Guided 3D Referring Expression Segmentation

784. SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

785. MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

786. Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens

787. UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

788. VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction

789. SMAP: Semantic Route Planning with Map-Grounded Multimodal Alignment

790. Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

791. Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification

792. MPL: Match-guided Prototype Learning for Few-shot Action Recognition

793. Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models

794. Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation

795. CAST: Context-Aware Dynamic Latent Space Transformation for Interactive Text-to-Image Retrieval

796. Consistency Beyond Contrast: Enhancing Open-Vocabulary Object Detection Robustness via Contextual Consistency Learning

797. Streaming Video Instruction Tuning

798. A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks

799. Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection

800. Hierarchically Robust Zero-shot Vision-language Models

801. CLEP: Contrastive Language-Pose Pretraining

802. AutoDebias: An Automated Framework for Detecting and Mitigating Backdoor Biases in Text-to-Image Models

803. ReMoE: Region-Mixture Experts for Adversarially-Robust Vision Transformers

804. Hyperbolic Gramian Volumes for Multimodal Alignment

805. ProSoftArena: Benchmarking Hierarchical Capabilities of Multi-modal Agents in Professional Software Environments

806. DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs

807. UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying

808. ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models

809. Chain-of-Thought Guided Multi-Modal Object Re-Identification

810. MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation

811. Aligning Multi-Character Narrative Image Generation with Multi-Aspect Human Preferences

812. PP-Brep: Few-Shot B-rep Classification with Hybrid Graph Representation

813. VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents

814. Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibration

815. Cross-Domain Few-Shot Segmentation via Multi-view Progressive Adaptation

816. No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models

817. DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities

818. OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning

819. When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators

820. R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

821. Evo-Retriever: LLM-Guided Curriculum Evolution with Viewpoint-Pathway Collaboration for Multimodal Document Retrieval

822. G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval

823. Reconstructing CLIP for Open-Vocabulary Dense Perception

824. Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning

825. Hybrid Token Compression for Vision-Language Models

826. Parameter-Efficient Adaptation for MLLMs via Implicit Modality Decomposition

827. See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning

828. Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

829. InvCoSS: Inversion-driven Continual Self-supervised Learning in Medical Multi-modal Image Pre-training

830. Beyond Single Images: A Comprehensive Benchmark for Album-Level Vision-Language Understanding

831. Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding

832. CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection

833. ReasonX: MLLM-Guided Intrinsic Image Decomposition

834. SFR-Net: Steering-Fusion-Refining Network in Multi-label Zero-Shot Sewer Defect Detection

835. STAR: Test-Time Adaptation Can Enhance Universal Prompt Learning for Vision-Language Models

836. Adapter Shield: A Unified Framework with Built-in Authentication for Preventing Unauthorized Zero-Shot Image-to-Image Generation

837. Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

838. Hear you are: Teaching LLMs Spatial Reasoning with Vision and Spatial Sound

839. OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation

840. OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

841. Saliency-Driven Token Merging for Vision Transformers

842. What Makes Good Synthetic Training Data for Zero-Shot Stereo Matching?

843. RAAS: LLM Agentic System Architecture Search with GRPO

844. Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding

845. FINER: MLLMs Hallucinate under Fine-grained Negative Queries

846. HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

847. SeD-UD: An Influence-Driven and Hierarchically-Decoupled Information Bottleneck for Multimodal Intent Recognition

848. Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining

849. Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection

850. 3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds

851. SO-Bench: A Structural Output Evaluation of Multimodal LLM

852. Think Visually, Reason Textually: Vision-Language Synergy in Abstract Reasoning

853. When Do Models Actually Decide? Mapping the Layer-Wise Decision Timeline in Pretrained Neural Networks

854. Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability

855. MM-OVSeg: Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing

856. GGPT: Geometry-Grounded Point Transformer

857. Bulk RNA-seq Guided Multi-modal Detection of Anomalous Regions in Human Cancer via Spatial Transcriptomics

858. VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

859. From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature

860. Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning

861. OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

862. FILTR: Extracting Topological Features from Pretrained 3D Models

863. MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

864. Subspace Alignment for CLIP-based Continual Learning via Canonical Correlation Analysis

865. V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs

866. 3D Space as a Scratchpad for Editable Text-to-Image Generation

867. Omni-Attack: Adversarial Attacks on Open-Ended VQA in Black-Box Multimodal LLMs

868. From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing

869. Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation

870. CoRiM: Conflict-driven Risk Minimization for Dynamic Multimodal Fusion

871. MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learning

872. More Than Meets the Eye: A Unified Image Fusion Framework via Semantic-Pixel Entropy Trade-off for Zero-Shot Generalization

873. PhyCritic: Multimodal Critic Models for Physical AI

874. Scaling Parallel Sequence Models to Vision Foundation Models

875. GS-CLIP: Zero-shot 3D Anomaly Detection by Geometry-Aware Prompt and Synergistic View Representation Learning

876. SketchRevive: Fine-Grained Pixel-to-Vector Sketch Completion with Diffusion-Prior-Guided Multimodal LLMs

877. Emergent Extreme-View Geometry in 3D Foundation Models

878. SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering

879. DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles

880. ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

881. Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos

882. GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

883. Multi-Metric Representation Learning Strategy Based on Clustering for Fine-Grained Multimodal Sentiment Analysis

884. Time Blindness: Why Video-Language Models Can't See What Humans Can?

885. Image-to-Point Cloud Feature Back-Projection for Multimodal Training of 3D Semantic Segmentation

886. 2D-LFM: Lifting Foundation Model without 3D Supervision

887. Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs

888. Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation

889. PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models

890. LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight

891. Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

892. DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

893. VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA

894. BuildingGPT: Auto-Regressive Building Wireframe Reconstruction Model with Reinforcement Learning

895. No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection

896. LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

897. Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation

898. GPFlow: Gaussian Prototype Probability Flow for Unsupervised Multi-Modal Anomaly Detection

899. MVLM: Template-Free Tracking via Vision-Language Margin Confidence and Memory-Gated Tracking

900. Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens

901. Discover, Segment, and Select: A Progressive Mechanism for Zero-shot Camouflaged Object Segmentation

902. Medic-AD: Towards Medical Vision-Language Model's Clinical Intelligence

903. GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

904. BriMA: Bridged Modality Adaptation for Multi-Modal Continual Action Quality Assessment

905. Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

906. Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning

907. VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm

908. Anchor-Guided Gradient Alignment for Incomplete Multimodal Learning

909. Small Object, Great Challenge: A Benchmark for Small Object Visual Grounding

910. VKG-QA: Visual Knowledge Graph-based Question Answer for Large Multimodal Models

911. LOREAL: Mitigating Low-Resolution Challenges in Vision-Language Models with Attribute-driven Prompt Self-Distillation

912. Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models

913. BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation

914. Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

915. Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework

916. M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction

917. PV-Ground: Text-Guided Point-Voxel Interaction for 3D Visual Grounding

918. Lenses: Toward Polysemous Vision-Language Understanding

919. FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-and-Language Navigation

920. Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection

921. Grounded Chain-of-Thought for Multimodal Large Language Models

922. UniGame: Turning a Unified Multimodal Model Into Its Own Adversary

923. GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation

924. CineBrain: A Large-Scale Multi-Modal Audiovisual Brain Dataset for Brain-Conditioned Video Generation

925. Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention

926. Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing

927. Deformation-based In-Context Learning for Point Cloud Understanding

928. ReaGEN: Adaptive Generation of Structured Chains-of-Thought for Efficient Multimodal Reasoning

929. SALMUBench: A Benchmark for Sensitive Association-Level Multimodal Unlearning

930. Simple-ViLMedSAM: Simple Text Prompts Meet Vision-Language Models for Medical Image Segmentation

931. TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

932. The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition

933. Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

934. When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs

935. TANGO: Text-Anchored Guided Optimization for Robust Fine-tuning Vision-Language Models under Label Noise

936. In Pursuit of Pixel Supervision for Visual Pre-training

937. VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs

938. SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker

939. Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks

940. BiomedCCPL: Causal Conditional Prompt Learning for Biomedical Vision-Language Models

941. Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

942. MonoVLM: Monocular 3D Visual Grounding with Vision Language Models

943. Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset

944. Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

945. Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning

946. Decoupling Vision and Language: Codebook Anchored Visual Adaptation

947. Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models

948. Revisiting Visual Corruptions in LVLMs: A Shape-Texture Perspective on Model Failures

949. Learning to Diversify and Focus: A Reinforcement Framework for Open-Vocabulary HOI Detection

950. Deciphering Genotype-Phenotype Mechanisms from High-Content Profiling via Knowledge-Guided Multi-modal Graph Learning

951. FUSAR-GPT: A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery

952. CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods

953. Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild

954. From Attraction to Equilibrium: Physics-Inspired Semantic Gravitons for Zero-Shot Anomaly Detection

955. Curvature-Aware Captioning: Leveraging Geodesic Attention for 3D Scene Understanding

956. Experience Transfer for Multimodal LLM Agents in Minecraft Game

957. Towards Dynamic Modality Alignment in Multimodal Continual Learning

958. AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

959. See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

960. Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent

961. Graph Attention Prototypical Network for Robust Few-Shot Classification

962. DEVA: Fine-tuning Multimodal Large Language Models for Visual Perception Tasks

963. MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

964. DreamOmni2: Multimodal Instruction-based Generation and Editing

965. Interpretable Prompts made Edit-Friendly: Token-to-Token Similarity Reduction in dLLMs for Edit-Friendly Hard Prompt Inversion

966. LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

967. LA-Pose: Latent Action Pretraining Meets Pose Estimation

968. Unified Multimodal Models as Auto-Encoders

969. Robo-SGG: Exploiting Layout-Oriented Normalization and Restitution Can Improve Robust Scene Graph Generation

970. Vision-Language Model Guided Source-Free Domain Adaptation via Optimal Transport

971. VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models

972. Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

973. TaskIT: Memory-Efficient Fine-Tuning of Multi-LoRA LLMs via Cross-Task Importance Transfer

974. Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

975. ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos

976. CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration

977. Low-Rank Test-Time Training for Pre-Trained Point Cloud Models

978. AgentDet: A Shared-Blackboard Multi-Agent Framework for Zero-/Few-Shot Object Detection

979. Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

980. EVLF: Early Vision-Language Fusion for Generative Dataset Distillation

981. UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models

982. Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models

983. SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

984. Boosting Visual Reprogramming for CLIP with Dual Granularity Alignment

985. ORION: ORthonormal Text Encoding for Universal VLM AdaptatION

986. TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding

987. VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction

988. Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

989. Robustness Under Data Scarcity: Few-Shot Continual Adversarial Training for Evolving Threats

990. MM-ACT: Learn from Multimodal Parallel Generation to Act

991. Interpretable Debiasing of Vision-Language Models for Social Fairness

992. D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation

993. See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis

994. Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench

995. AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions

996. Mixture-of-Experts based Feature Decoupling for Open Vocabulary Scene Graph Generation

997. Language-guided Frequency Modulation for Large Vision-Language Models

998. SCIEval: Evaluating and Benchmarking the Faithfulness of Scientific Image Generation and Interpretation with Large Multimodal Models

999. Noise-Aware Few-Shot Learning through Bi-directional Multi-View Prompt Alignment

1000. Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

1001. Mixture of States: Routing Token-Level Dynamics for Multimodal Generation

1002. Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection

1003. ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

1004. Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training

1005. TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models

1006. MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification

1007. WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

1008. DLVP-CLIP: Enhancing Fine-Grained Zero-Shot Anomaly Detection via Dynamic Local Visual Prompting

1009. TTRV: Test-Time Reinforcement Learning for Vision Language Models

1010. Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis

1011. Grounding Everything in Tokens for Multimodal Large Language Models

1012. ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference

1013. VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes

1014. QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models

1015. Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detection

1016. ϕ\phi-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models

1017. DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation

1018. Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

1019. ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation

1020. Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models

1021. DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

1022. SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution

1023. LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMs

1024. Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning

1025. RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning

1026. VidEoMT: Your ViT is Secretly Also a Video Segmentation Model

1027. D2T2 - Multimodal Automated Planning for Brachytherapy

1028. Toward Early Quality Assessment of Text-to-Image Diffusion Models

1029. Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

1030. Explaining CLIP Zero-shot Predictions Through Concepts

1031. Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization

1032. Towards Calibrating Prompt Tuning of Vision- Language Models

1033. Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach

1034. SPOT: Spatiotemporal Prompt Optimization for Motion-Stabilized MLLM-Guided Video Segmentation

1035. Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning

1036. MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA

1037. FastRef: Fast Prototype Refinement for Few-shot Industrial Anomaly Detection

1038. SaPaVe: Towards Active Perception and Manipulation in Vision-Language Action Models for Robotics

1039. Understanding Task Transfer in Vision-Language Models

1040. IVAAN: Instance-level Vision-Language Alignment via Attribute-Guided Text Prompts Generation for Nuclei Analysis

1041. Revisiting Model Stitching In the Foundation Model Era

1042. MLLMSplat: A 2D MLLM-Powered Framework for 3D Gaussian Splatting Understanding, Generation, and Editing

1043. Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learning

1044. Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models

1045. AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models

1046. SegMo: Co-Designing Content-Aware Sparsity and Locally-Cohesive Segment Parallelism for Efficient VLM Inference

1047. Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Models

1048. FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglement

1049. DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval

1050. VL-Eraser: Vacuum Distillation for Machine Unlearning in Vision-Language Models

1051. CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation

1052. CodePercept: Code-Grounded Visual STEM Perception for MLLMs

1053. Collaborative Multi-Mode Pruning for Vision-Language Models

1054. EEGiT: Teaching Vision Transformers to Understand the EEG signal

1055. Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

1056. VCP-Attack: Visual-Contrastive Projection for Transferable Black-Box Targeted Attacks on Large Vision-Language Models

1057. DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR

1058. FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition

1059. ZINA: Multimodal Fine-grained Hallucination Detection and Editing

1060. Exploring Visual Pretraining for Learning Language Intelligence

1061. CASPA: Graph-Structured Concept Anchors for Modality-Agnostic Adaptation in Vision-Language Models

1062. 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

1063. EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decompositio

1064. PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction

1065. MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization

1066. TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

1067. AudioStory: Generating Long-Form Narrative Audio with Large Language Models

1068. ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction

1069. EasyV2V: A High-quality Instruction-based Video Editing Framework

1070. Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles

1071. OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

1072. LS-ViT: Least-Squares Hessian Based Block Reconstruction for Low-Bit Post-Training Quantization of Vision Transformers

1073. M4V: Multimodal Mamba for Efficient Text-to-Video Generation

1074. TableMix: Enhancing Multimodal Table Reasoning in MLLMs from a Data-Centric Perspective

1075. Information-Theoretic Decomposition for Multimodal Interaction Learning

1076. Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping

1077. IEBGL:An Interpretability-Enhanced Brain Graph Learning Framework with LLM-Instructed Topology and Literature-Augmented Semantics

1078. Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

1079. Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models

1080. Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos

1081. TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model

1082. SAMTok: Representing Any Mask with Two Words

1083. VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension

1084. Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction

1085. Merge3D: Efficient 3D Multimodal LLMs via Joint 2D-3D Token Merging

1086. LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings

1087. FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants

1088. IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignment

1089. Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

1090. Agentic Video Summarization via Self-Reflecting Multimodal Understanding

1091. Enhancing Video Vision Language Model with Hippocampal Sensing

1092. EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs

1093. HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos

1094. Demo2Tutorial: From Human Experience to Multimodal Software Tutorials

1095. Online3R: Online Learning for Consistent Sequential Reconstruction Based on Geometry Foundation Model

1096. Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios

1097. VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

1098. DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing

1099. HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

1100. EthoCLIP: Ontology-Enhanced Video-Language Pretraining for Animal Behavior Understanding

1101. Agentic Retoucher for Text-To-Image Generation

1102. 3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

1103. SAT-RRG: LLM-Guided Self-Adaptive Training for Radiology Report Generation with Token-Level Push-Pull Optimization

1104. dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

1105. Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models

1106. ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks

1107. R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning

1108. ORD: Object-Relation Decoupling for Generalized 3D Visual Grounding

1109. DynFusion: Rethinking Condition Fusion for Adaptive Multi-Conditional Text-to-Image Generation

1110. Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

1111. Mechanisms of Object Localization in Vision-Language Models

1112. KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing

1113. Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection

1114. VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions

1115. TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation

1116. MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents

1117. Leveraging Class Distributions in CLIP for Weakly Supervised Semantic Segmentation

1118. Defect Cue-Preserved Structural Feature Refinement for Few-Shot Anomaly Detection

1119. Distributed Image Compression with Multimodal Side Information at Extremely Low Bitrates

1120. GrOCE : Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models

1121. All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

1122. MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning

1123. Zero-shot Detection of AI-Generated Image via RAW-RGB Alignment

1124. MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestration

1125. SAQN: Semantic-based Adaptive Query Network for 3D Referring Expression Segmentation

1126. Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

1127. Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

1128. Self-Critical Distillation Network for Video-based Commonsense Captioning

1129. Inter-Edit: First Benchmark for Interactive Instruction-Based Image Editing

1130. AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

1131. NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction

1132. Few-Shot Hybrid Incremental Learning:Continually Learning under Data Scarcity and Task Uncertainty

1133. CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion

1134. Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation

1135. Unlocking Pre-trained Weights: Parameter Inheritance for Zero-Shot Initialization

1136. UniChange: Unifying Change Detection with Multimodal Large Language Model

1137. VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

1138. Adapting In-context Generation for Enhanced Composed Image Retrieval

1139. Focus on Background: Exploring SAM's Potential in Few-shot Medical Image Segmentation with Background-centric Prompting

1140. CoD: A Diffusion Foundation Model for Image Compression

1141. Unleashing Vision-Language Semantics for Deepfake Video Detection

1142. SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving

1143. Multi-modal Frequency Decomposition Network for Semantic Scene Completion

1144. SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation

1145. LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

1146. Pointing at Parts: Training-Free Few-Shot Grounding in Multimodal LLMs

1147. Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

1148. PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting

1149. ElasticFormer: Detecting Objects in HRW Shots via Elastic Computing Vision Transformer

1150. Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning

1151. DiGraphHal-Bench: Evaluating Multimodal Large Language Models on Complex Directed Graphs

1152. Alert-CLIP: Abnormality-aware Latent-Enhanced Representation Tuning of CLIP for Video Anomaly Detection

1153. MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosis

1154. BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates

1155. Self-guided Semantic Inspection for Zero-Shot Composed Image Retrieval

1156. Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification

1157. GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

1158. Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning

1159. CoT-Edit: Let CoT Guide Instruction Video Editing

1160. Sparse Spectral LoRA: Routed Experts for Medical VLMs