- Published on
ICLR 2026 — Multi-modal & Vision-Language
Multi-modal & Vision-Language
390 papers (0 oral)
Learning with Dual-level Noisy Correspondence for Multi-modal Entity Alignment
- Link: OpenReview
Multimodal Aligned Semantic Knowledge for Unpaired Image-text Matching
- Link: OpenReview
Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction–Reasoning Synergy
- Link: OpenReview
MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Models for Embodied Task Planning
- Link: OpenReview
Extending Sequence Length is Not All You Need: Effective Integration of Multimodal Signals for Gene Expression Prediction
- Link: OpenReview
Generative Universal Verifier as Multimodal Meta-Reasoner
- Link: OpenReview
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
- Link: OpenReview
Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs
- Link: OpenReview
MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction
- Link: OpenReview
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
- Link: OpenReview
A Scalable Distributed Framework for Multimodal GigaVoxel Image Registration
- Link: OpenReview
ContextNav: Towards Agentic Multimodal In-Context Learning
- Link: OpenReview
20. SVD Provably Denoises Nearest Neighbor Data
- Topics: Other / Unclassified
Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion
- Link: OpenReview
40. Taming Polysemanticity in LLMs: Theory-Grounded Feature Recovery via Sparse Autoencoders
- Topics: LLMs & Foundation Models, Interpretability & Mechanistic Interpretability, Theory & Deep Learning Theory
UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings
- Link: OpenReview
VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?
- Link: OpenReview
Culture In a Frame: CB as a Comic-Based Benchmark for Multimodal Culturally Awareness
- Link: OpenReview
MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
- Link: OpenReview
Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs
- Link: OpenReview
GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- Link: OpenReview
Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
- Link: OpenReview
Spotlight on Token Perception for Multimodal Reinforcement Learning
- Link: OpenReview
Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World
- Link: OpenReview
SiMO: Single-Modality-Operable Multimodal Collaborative Perception
- Link: OpenReview
Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving
- Link: OpenReview
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
- Link: OpenReview
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Video
- Link: OpenReview
Unified Multi-Modal Interactive and Reactive 3D Motion Generation via Rectified Flow
- Link: OpenReview
Revisual-R1: Advancing Multimodal Reasoning From Optimized Cold Start to Staged Reinforcement Learning
- Link: OpenReview
MergeTune: Continued Fine-Tuning of Vision-Language Models
- Link: OpenReview
IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
- Link: OpenReview
Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
- Link: OpenReview
VisualPRM400K: An Effective Dataset for Training Multimodal Process Reward Models
- Link: OpenReview
MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs
- Link: OpenReview
U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs
- Link: OpenReview
Efficient Multimodal Spatial Reasoning via Dynamic and Asymmetric Routing
- Link: OpenReview
Unveiling the Cognitive Compass: Theory-of-Mind–Guided Multimodal Emotion Reasoning
- Link: OpenReview
PIRN: Prototypical-based Intra-modal Reconstruction with Normality Communication for Multi-modal Anomaly Detection.
- Link: OpenReview
Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models
- Link: OpenReview
A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
- Link: OpenReview
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
- Link: OpenReview
Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation
- Link: OpenReview
Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection
- Link: OpenReview
Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?
- Link: OpenReview
Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models
- Link: OpenReview
GRAM-DTI: Adaptive Multimodal Representation Learning for Drug–Target Interaction Prediction
- Link: OpenReview
PoinnCARE: Hyperbolic Multi-Modal Learning for Enzyme Classification
- Link: OpenReview
Joint Adaptation of Uni-modal Foundation Models for Multi-modal Alzheimer's Disease Diagnosis
- Link: OpenReview
Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs
- Link: OpenReview
A Structured, Tagged, and Localized Visual Question Answering Dataset with Full Sentence Answers and Scene Graphs for Chest X-ray Images
- Link: OpenReview
FETAL-GAUGE: A BENCHMARK FOR ASSESSING VISION-LANGUAGE MODELS IN FETAL ULTRASOUND
- Link: OpenReview
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- Link: OpenReview
Vision-Language-Action Instruction Tuning: From Understanding to Manipulation
- Link: OpenReview
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
- Link: OpenReview
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
- Link: OpenReview
Unified Vision-Language-Action Model
- Link: OpenReview
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- Link: OpenReview
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
- Link: OpenReview
Towards Multimodal Time Series Anomaly Detection with Semantic Alignment and Condensed Interaction
- Link: OpenReview
Aurora: Towards Universal Generative Multimodal Time Series Forecasting
- Link: OpenReview
From Natural Alignment to Conditional Controllability in Multimodal Dialogue
- Link: OpenReview
Multimodal Policy Internalization for Conversational Agents
- Link: OpenReview
Think Then Embed: Generative Context Improves Multimodal Embedding
- Link: OpenReview
TINY BUT MIGHTY: A SOFTWARE-HARDWARE CO- DESIGN APPROACH FOR EFFICIENT MULTIMODAL IN- FERENCE ON BATTERY-POWERED SMALL DEVICES
- Link: OpenReview
MIAM: Modality Imbalance-Aware Masking for Multimodal Ecological Applications
- Link: OpenReview
Enhancing Vision-Language Model with Unmasked Token Alignment
- Link: OpenReview
821. AB-UPT: Scaling Neural CFD Surrogates for High- Fidelity Automotive Aerodynamics Simulations via Anchored- Branched Universal Physics Transformers
- Topics: LLMs & Foundation Models
822. Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek
- Topics: Diffusion Models & Generative AI, Computer Vision, Efficiency & Compression
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- Link: OpenReview
Multimodal Dataset Distillation via Phased Teacher Models
- Link: OpenReview
Supporting Multimodal Intermediate Fusion with Informatic Constraint and Distribution Coherence
- Link: OpenReview
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
- Link: OpenReview
MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models
- Link: OpenReview
PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
- Link: OpenReview
LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models
- Link: OpenReview
SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense
- Link: OpenReview
DeepEyesV2: Toward Agentic Multimodal Model
- Link: OpenReview
InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
- Link: OpenReview
Hallucination-aware Intermediate Representation Edit in Large Vision-Language Models
- Link: OpenReview
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Models
- Link: OpenReview
Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models
- Link: OpenReview
Divide, Harmonize, Then Conquer It: Shooting Multi-Commodity Flow Problems with Multimodal Language Models
- Link: OpenReview
Empowering Small VLMs to Think with Dynamic Memorization and Exploration
- Link: OpenReview
LLaVAction: evaluating and training multi-modal large language models for action understanding
- Link: OpenReview
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
- Link: OpenReview
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
- Link: OpenReview
What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging
- Link: OpenReview
GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
- Link: OpenReview
StreamingVLM: Real-Time Understanding for Infinite Video Streams
- Link: OpenReview
VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning
- Link: OpenReview
GranViT: A Fine-Grained Vision Model For Autoregressive Multimodal Large Language Models
- Link: OpenReview
TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
- Link: OpenReview
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
- Link: OpenReview
SpaCE-Eval: A Benchmark for Real-World Multi-Modal Reasoning
- Link: OpenReview
Inference-Time Dynamic Modality Selection for Incomplete Multimodal Classification
- Link: OpenReview
How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks
- Link: OpenReview
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
- Link: OpenReview
Multimodal Classification via Total Correlation Maximization
- Link: OpenReview
Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models
- Link: OpenReview
VLM-Guided Adaptive Negative Prompting for Creative Generation
- Link: OpenReview
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
- Link: OpenReview
No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
- Link: OpenReview
RoRE: Rotary Ray Embedding for Generalised Multi-Modal Scene Understanding
- Link: OpenReview
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
- Link: OpenReview
GaussianFusion: Unified 3D Gaussian Representation for Multi-Modal Fusion Perception
- Link: OpenReview
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
- Link: OpenReview
ScaleCap: Scalable Image Captioning via Dual-Modality Debiasing
- Link: OpenReview
Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
- Link: OpenReview
Pulp Motion: Framing-aware multimodal camera and human motion generation
- Link: OpenReview
Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
- Link: OpenReview
Knowledge Externalization: Reversible Unlearning and Modular Retrieval in Multimodal Large Language Models
- Link: OpenReview
ICYMI: The illusion of multimodal informativeness under missingness
- Link: OpenReview
MathNet: A Global Multimodal Benchmark for Mathematical Reasoning and Retrieval
- Link: OpenReview
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
- Link: OpenReview
Preserve and Sculpt: Manifold-Aligned Fine-tuning of Vision-Language Models for Few-Shot Learning
- Link: OpenReview
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- Link: OpenReview
OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis
- Link: OpenReview
CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
- Link: OpenReview
Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
- Link: OpenReview
CitySeeker: How Do VLMs Explore Embodied Urban Navigation with Implicit Human Needs?
- Link: OpenReview
VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation
- Link: OpenReview
Verifier-free Test-Time Sampling for Vision-Language-Action Models
- Link: OpenReview
Chart Deep Research in LVLMs via Parallel Relative Policy Optimization
- Link: OpenReview
OpenFly: A COMPREHENSIVE PLATFORM FOR AERIAL VISION-LANGUAGE NAVIGATION
- Link: OpenReview
Hybrid Training for Vision-Language-Action Models
- Link: OpenReview
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
- Link: OpenReview
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denosing Diffusion Process
- Link: OpenReview
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
- Link: OpenReview
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- Link: OpenReview
Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs
- Link: OpenReview
MARS-Sep: Multimodal-Aligned Reinforced Sound Separation
- Link: OpenReview
Spatially Guided Training for Vision-Language-Action Model
- Link: OpenReview
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
- Link: OpenReview
MindMix: A Multimodal Foundation Model for Auditory Perception Decoding via Deep Neural-Acoustic Alignment
- Link: OpenReview
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
- Link: OpenReview
AutoGPS: Automated Geometry Problem Solving via Multimodal Formalization and Deductive Reasoning
- Link: OpenReview
Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation
- Link: OpenReview
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
- Link: OpenReview
SketchThinker-R1: Towards Efficient Sketch-Style Reasoning in Large Multimodal Models
- Link: OpenReview
MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
- Link: OpenReview
CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Vision-Language Model
- Link: OpenReview
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
- Link: OpenReview
Building Massively Multimodal Foundation Models with Interaction-aware Mixture-of-Experts
- Link: OpenReview
Prompt-Robust Vision-Language Models via Meta-Finetuning
- Link: OpenReview
Post-hoc Probabilistic Vision-Language Models
- Link: OpenReview
Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation
- Link: OpenReview
Delving into Spectral Clustering with Vision-Language Representations
- Link: OpenReview
Efficient Test-Time Scaling for Small Vision-Language Models
- Link: OpenReview
SURGE: Surprise-Guided Token Reduction for Efficient Video Understanding with VLMs
- Link: OpenReview
CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing
- Link: OpenReview
Long-tailed Test-Time Adaptation for Vision-Language Models
- Link: OpenReview
Imitating the Truth: Attention-aware Truth-Guided Enhancement for Hallucination Mitigation in Large Vision-Language Models
- Link: OpenReview
TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models
- Link: OpenReview
pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models
- Link: OpenReview
InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models
- Link: OpenReview
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
- Link: OpenReview
Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking
- Link: OpenReview
Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence
- Link: OpenReview
LLMs as Rules Oracles: Exploring Real-World Multimodal Reasoning in Tabletop Strategy Game Environments
- Link: OpenReview
Detecting Temporal Misalignment Attacks in Multimodal Fusion for Autonomous Driving
- Link: OpenReview
MIMIC-Bench: Exploring the User-Like Thinking and Mimicking Capabilities of Multimodal Large Language Models
- Link: OpenReview
Mitigating Hallucination in Vision-Language Model with Depth and Spatial-aware Key-Value Refinement
- Link: OpenReview
Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning
- Link: OpenReview
RLAP-CLIP: Continual Multimodal Learning with Prototype Adaptation and Difficulty-Aware Routing
- Link: OpenReview
Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering
- Link: OpenReview
TableDART: Dynamic Adaptive Multi-Modal Routing for Table Understanding
- Link: OpenReview
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
- Link: OpenReview
Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification
- Link: OpenReview
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
- Link: OpenReview
Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning
- Link: OpenReview
Label-Free Mitigation of Spurious Correlations in VLMs using Sparse Autoencoders
- Link: OpenReview
VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety
- Link: OpenReview
Pi-CCA: Prompt-Invariant CCA Certificates for Replay-Free Continual Multimodal Learning
- Link: OpenReview
Bilateral Information-aware Test-time Adaptation for Vision-Language Models
- Link: OpenReview
Contamination Detection for VLMs Using Multi‑Modal Semantic Perturbations
- Link: OpenReview
PRISM: Enhancing PRotein Inverse Folding through Fine- Grained Retrieval on Structure-Sequence Multimodal Representations
- Link: OpenReview
Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning
- Link: OpenReview
Bridging Radiology and Pathology Foundation Models via Concept-Based Multimodal Co-Adaptation
- Link: OpenReview
Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis
- Link: OpenReview
Structural Prognostic Event Modeling for Multimodal Cancer Survival Analysis
- Link: OpenReview
MASAM: Multimodal Adaptive Sharpness-Aware Minimization for Heterogeneous Data Fusion
- Link: OpenReview
Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL
- Link: OpenReview
OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
- Link: OpenReview
TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models
- Link: OpenReview
BOLT: Decision‑Aligned Distillation and Budget-Aware Routing for Constrained Multimodal QA on Robots
- Link: OpenReview
JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
- Link: OpenReview
HAMLET: Switch Your Vision-Language-Action Model into a History-Aware Policy
- Link: OpenReview
AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild
- Link: OpenReview
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
- Link: OpenReview
Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies
- Link: OpenReview
WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
- Link: OpenReview
AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing
- Link: OpenReview
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
- Link: OpenReview
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
- Link: OpenReview
Tug-of-War No More: Harmonizing Accuracy and Robustness in Vision-Language Models via Stability-Aware Task Vector Merging
- Link: OpenReview
Figma2Code: Automating Multimodal Design to Code in the Wild
- Link: OpenReview
Web-CogReasoner: Towards Multimodal Knowledge-Induced Cognitive Reasoning for Web Agents
- Link: OpenReview
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
- Link: OpenReview
No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning
- Link: OpenReview
2669. SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation
- Topics: Audio & Speech
Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning
- Link: OpenReview
VaseVQA-3D: Benchmarking 3D VLMs on Ancient Greek Pottery
- Link: OpenReview
K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge
- Link: OpenReview
Reconstruction Alignment Improves Unified Multimodal Models
- Link: OpenReview
MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
- Link: OpenReview
MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning
- Link: OpenReview
OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging
- Link: OpenReview
Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
- Link: OpenReview
MULTIMODALITY AS SUPERVISION: SELF-SUPERVISED SPECIALIZATION TO THE TEST ENVIRONMENT VIA MULTIMODALITY
- Link: OpenReview
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
- Link: OpenReview
Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
- Link: OpenReview
Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
- Link: OpenReview
Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory
- Link: OpenReview
Calibrated Information Bottleneck for Trusted Multi-modal Clustering
- Link: OpenReview
Demystifying Supervision Data Generalization in Multimodal LMs
- Link: OpenReview
Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations
- Link: OpenReview
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
- Link: OpenReview
Multimodal Dataset Distillation Made Simple by Prototype-Guided Data Synthesis
- Link: OpenReview
When Large Multimodal Models Confront Evolving Knowledge: Challenges and Explorations
- Link: OpenReview
Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models
- Link: OpenReview
JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA
- Link: OpenReview
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
- Link: OpenReview
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
- Link: OpenReview
Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
- Link: OpenReview
WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models
- Link: OpenReview
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
- Link: OpenReview
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
- Link: OpenReview
MotionSight: Boosting Fine-Grained Motion Understanding in Multimodal LLMs
- Link: OpenReview
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
- Link: OpenReview
Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization
- Link: OpenReview
WebWatcher: Breaking New Frontiers of Vision-Language Deep Research Agent
- Link: OpenReview
AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions
- Link: OpenReview
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
- Link: OpenReview
IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video?
- Link: OpenReview
Reasoning-Driven Multimodal LLM for Domain Generalization
- Link: OpenReview
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
- Link: OpenReview
EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models
- Link: OpenReview
Safeguarding Multimodal Knowledge Copyright in the RAG-as-a-Service Environment
- Link: OpenReview
Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models
- Link: OpenReview
Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models
- Link: OpenReview
Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs
- Link: OpenReview
SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
- Link: OpenReview
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
- Link: OpenReview
CoNavBench: Collaborative Long-Horizon Vision-Language Navigation Benchmark
- Link: OpenReview
Long-range Modeling and Processing of Multimodal Event Sequences
- Link: OpenReview
PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits
- Link: OpenReview
MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks
- Link: OpenReview
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
- Link: OpenReview
Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
- Link: OpenReview
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
- Link: OpenReview
Urban Socio-Semantic Segmentation with Vision-Language Reasoning
- Link: OpenReview
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
- Link: OpenReview
SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports
- Link: OpenReview
Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models
- Link: OpenReview
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
- Link: OpenReview
DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage
- Link: OpenReview
OmniMouse: Scaling properties of multi-modal, multi-task Brain Models on 150B Neural Tokens
- Link: OpenReview
ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows
- Link: OpenReview
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
- Link: OpenReview
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
- Link: OpenReview
SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence
- Link: OpenReview
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
- Link: OpenReview
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
- Link: OpenReview
PHyCLIP: -Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning
- Link: OpenReview
Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization
- Link: OpenReview
Enhanced Continual Learning of Vision-Language Models with Model Fusion
- Link: OpenReview
Beyond Text-Only: Towards Multimodal Table Retrieval in Open-World
- Link: OpenReview
Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation
- Link: OpenReview
Teaching VLMs to Admit Uncertainty in OCR from Lossy Visual Inputs
- Link: OpenReview
RAR: Reversing Visual Attention Re-Sinking for Unlocking Potential in Multimodal Large Language Models
- Link: OpenReview
VL-JEPA: Joint Embedding Predictive Architecture for Vision-language
- Link: OpenReview
Revisiting Multimodal Positional Encoding in Vision–Language Models
- Link: OpenReview
Thinking as Society: Multi-Social-Agent Self-Distillation for Multimodal Misinformation Detection
- Link: OpenReview
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
- Link: OpenReview
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
- Link: OpenReview
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
- Link: OpenReview
Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
- Link: OpenReview
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
- Link: OpenReview
Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
- Link: OpenReview
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- Link: OpenReview
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
- Link: OpenReview
CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
- Link: OpenReview
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
- Link: OpenReview
Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering
- Link: OpenReview
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
- Link: OpenReview
VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- Link: OpenReview
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
- Link: OpenReview
Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning
- Link: OpenReview
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
- Link: OpenReview
Plug, Play, and Fortify: A Low-Cost Module for Robust Multimodal Image Understanding Models
- Link: OpenReview
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
- Link: OpenReview
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
- Link: OpenReview
Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
- Link: OpenReview
ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping
- Link: OpenReview
MobileCLIP2: Improving Multi-Modal Reinforced Training
- Link: OpenReview
3932. Towards Improved Sentence Representations using Token Graphs
- Topics: Graph Neural Networks, Graphs & Combinatorial
Transferable and Stealthy Adversarial Attacks on Large Vision-Language Models
- Link: OpenReview
Identifying Robust Neural Pathways: Few-Shot Adversarial Mask Tuning for Vision-Language Models
- Link: OpenReview
Revisiting Confidence Calibration for Misclassification Detection in VLMs
- Link: OpenReview
Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models
- Link: OpenReview
Pay Less Attention to Function Words for Free Robustness of Vision-Language Models
- Link: OpenReview
Fed-Duet: Dual Expert-Orchestrated Framework for Continual Federated Vision-Language Learning
- Link: OpenReview
Naming to Learn: Class Incremental Learning for Vision-Language Model with Unlabeled Data
- Link: OpenReview
CP-Agent: Context‑Aware Multimodal Reasoning for Cellular Morphological Profiling under Chemical Perturbations
- Link: OpenReview
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
- Link: OpenReview
U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding
- Link: OpenReview
MedLesionVQA: A Multimodal Benchmark Emulating Clinical Visual Diagnosis for Body Surface Health
- Link: OpenReview
OmniField: Conditioned Neural Fields for Robust Multimodal Spatiotemporal Learning
- Link: OpenReview
Map as a Prompt: Learning Multi-Modal Spatial-Signal Foundation Models for Cross-scenario Wireless Localization
- Link: OpenReview
Robust Fine-tuning of Vision-Language-Action Robot Policies via Parameter Merging
- Link: OpenReview
VLMgineer: Vision-Language Models as Robotic Toolsmiths
- Link: OpenReview
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
- Link: OpenReview
Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
- Link: OpenReview
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
- Link: OpenReview
Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-Language Navigation
- Link: OpenReview
Scaling Large Vision-Language Model RL Training via Efficient Load Balancing
- Link: OpenReview
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
- Link: OpenReview
CerebraGloss: Instruction-Tuning a Large Vision-Language Model for Fine-Grained Clinical EEG Interpretation
- Link: OpenReview
CogMoE: Signal-Quality–Guided Multimodal MoE for Cognitive Load Prediction
- Link: OpenReview
Rethinking Causal Mask Attention for Vision-Language Inference
- Link: OpenReview
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
- Link: OpenReview
Reducing Semantic Mismatch in Brain-to-Text Decoding Through Personalized Multimodal Masking
- Link: OpenReview
RMFlow: Refined Mean Flow by a Noise-Injection Step for Multimodal Generation
- Link: OpenReview
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
- Link: OpenReview
CircuitNet 3.0: A Multi-Modal Dataset with Task-Oriented Augmentation for AI-Driven Circuit Design
- Link: OpenReview
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
- Link: OpenReview
AttTok: Marrying Attribute Tokens with Generative Pre-trained Vision-Language Models towards Medical Image Understanding
- Link: OpenReview
BaseReward: A Strong Baseline for Multimodal Reward Model
- Link: OpenReview
Beyond DAGs: A Latent Partial Causal Model for Multimodal Learning
- Link: OpenReview
MRMR: A Realistic and Expert-Level Multidisciplinary Benchmark for Reasoning-Intensive Multimodal Retrieval
- Link: OpenReview
LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
- Link: OpenReview
Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- Link: OpenReview
Disentanglement of Variations with Multimodal Generative Modeling
- Link: OpenReview
Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models
- Link: OpenReview
PCLR: Progressively Compressed LoRA for Multimodal Continual Instruction Tuning
- Link: OpenReview
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
- Link: OpenReview
ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
- Link: OpenReview
DTP: Delta-Guided Two Stage Pruning for Mamba-based Multimodal Large Language Models
- Link: OpenReview
Constraint Matters: Multi-Modal Representation for Reducing Mixed-Integer Linear programming
- Link: OpenReview
iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models
- Link: OpenReview
SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
- Link: OpenReview
DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
- Link: OpenReview
Perception-Aware Policy Optimization for Multimodal Reasoning
- Link: OpenReview
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
- Link: OpenReview
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
- Link: OpenReview
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
- Link: OpenReview
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
- Link: OpenReview
MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- Link: OpenReview
Flatness Guided Test-Time Adaptation for Vision-Language Models
- Link: OpenReview
FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models
- Link: OpenReview
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
- Link: OpenReview
Knowledge Exchange with Confidence: Cost-Effective LLM Integration for Reliable and Efficient Visual Question Answering
- Link: OpenReview
Can Vision-Language Models Answer Face to Face Questions in the Real-World?
- Link: OpenReview
MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
- Link: OpenReview
LINK: Learning Instance-level Knowledge from Vision-Language Models for Human-Object Interaction Detection
- Link: OpenReview
Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models
- Link: OpenReview
UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
- Link: OpenReview
Sequential Information Bottleneck Fusion: Towards Robust and Generalizable Multi-Modal Brain Tumor Segmentation
- Link: OpenReview
Discrete Latent Features Ablate Adversarial Attack: A Robust Prompt Tuning Framework for VLMs
- Link: OpenReview
ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks
- Link: OpenReview
Adaptive Logit Adjustment for Debiasing Multimodal Language Models
- Link: OpenReview
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
- Link: OpenReview
Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models
- Link: OpenReview
Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots
- Link: OpenReview
A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models
- Link: OpenReview
Co-LoRA: Collaborative Model Personalization on Heterogeneous Multi-Modal Clients
- Link: OpenReview
Histopathology-Genomics Multi-modal Structural Representation Learning for Data-Efficient Precision Oncology
- Link: OpenReview
Learning multimodal dictionary decompositions with group-sparse autoencoders
- Link: OpenReview
Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
- Link: OpenReview
TAMMs: Change Understanding and Forecasting in Satellite Image Time Series with Temporal-Aware Multimodal Models
- Link: OpenReview
MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- Link: OpenReview
Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play
- Link: OpenReview
Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Link: OpenReview
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
- Link: OpenReview
MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization
- Link: OpenReview
Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts
- Link: OpenReview
LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection
- Link: OpenReview
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
- Link: OpenReview
Asynchronous Matching with Dynamic Sampling for Multimodal Dataset Distillation
- Link: OpenReview
Why Keep Your Doubts to Yourself? Trading Visual Uncertainties among Vision-Language Models
- Link: OpenReview
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
- Link: OpenReview
One Patch Doesn’t Fit All: Adaptive Patching for Native-Resolution Multimodal Large Language Models
- Link: OpenReview
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
- Link: OpenReview
EVLP: Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
- Link: OpenReview
Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning
- Link: OpenReview