R
Published on

ICLR 2026 — Multi-modal & Vision-Language

Multi-modal & Vision-Language

390 papers (0 oral)

Learning with Dual-level Noisy Correspondence for Multi-modal Entity Alignment

Multimodal Aligned Semantic Knowledge for Unpaired Image-text Matching

Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction–Reasoning Synergy

MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Models for Embodied Task Planning

Extending Sequence Length is Not All You Need: Effective Integration of Multimodal Signals for Gene Expression Prediction

Generative Universal Verifier as Multimodal Meta-Reasoner

MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

A Scalable Distributed Framework for Multimodal GigaVoxel Image Registration

ContextNav: Towards Agentic Multimodal In-Context Learning

20. SVD Provably Denoises Nearest Neighbor Data

  • Topics: Other / Unclassified

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

40. Taming Polysemanticity in LLMs: Theory-Grounded Feature Recovery via Sparse Autoencoders

  • Topics: LLMs & Foundation Models, Interpretability & Mechanistic Interpretability, Theory & Deep Learning Theory

UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings

VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?

Culture In a Frame: C3^3B as a Comic-Based Benchmark for Multimodal Culturally Awareness

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning

Spotlight on Token Perception for Multimodal Reinforcement Learning

Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World

SiMO: Single-Modality-Operable Multimodal Collaborative Perception

Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving

Unleashing Perception-Time Scaling to Multimodal Reasoning Models

VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Video

Unified Multi-Modal Interactive and Reactive 3D Motion Generation via Rectified Flow

Revisual-R1: Advancing Multimodal Reasoning From Optimized Cold Start to Staged Reinforcement Learning

MergeTune: Continued Fine-Tuning of Vision-Language Models

IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs

Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking

VisualPRM400K: An Effective Dataset for Training Multimodal Process Reward Models

MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs

U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs

Efficient Multimodal Spatial Reasoning via Dynamic and Asymmetric Routing

Unveiling the Cognitive Compass: Theory-of-Mind–Guided Multimodal Emotion Reasoning

PIRN: Prototypical-based Intra-modal Reconstruction with Normality Communication for Multi-modal Anomaly Detection.

Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection

Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?

Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models

GRAM-DTI: Adaptive Multimodal Representation Learning for Drug–Target Interaction Prediction

PoinnCARE: Hyperbolic Multi-Modal Learning for Enzyme Classification

Joint Adaptation of Uni-modal Foundation Models for Multi-modal Alzheimer's Disease Diagnosis

Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs

A Structured, Tagged, and Localized Visual Question Answering Dataset with Full Sentence Answers and Scene Graphs for Chest X-ray Images

FETAL-GAUGE: A BENCHMARK FOR ASSESSING VISION-LANGUAGE MODELS IN FETAL ULTRASOUND

villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models

Vision-Language-Action Instruction Tuning: From Understanding to Manipulation

Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning

QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization

Unified Vision-Language-Action Model

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

Towards Multimodal Time Series Anomaly Detection with Semantic Alignment and Condensed Interaction

Aurora: Towards Universal Generative Multimodal Time Series Forecasting

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

Multimodal Policy Internalization for Conversational Agents

Think Then Embed: Generative Context Improves Multimodal Embedding

TINY BUT MIGHTY: A SOFTWARE-HARDWARE CO- DESIGN APPROACH FOR EFFICIENT MULTIMODAL IN- FERENCE ON BATTERY-POWERED SMALL DEVICES

MIAM: Modality Imbalance-Aware Masking for Multimodal Ecological Applications

Enhancing Vision-Language Model with Unmasked Token Alignment

821. AB-UPT: Scaling Neural CFD Surrogates for High- Fidelity Automotive Aerodynamics Simulations via Anchored- Branched Universal Physics Transformers

  • Topics: LLMs & Foundation Models

822. Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

  • Topics: Diffusion Models & Generative AI, Computer Vision, Efficiency & Compression

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

Multimodal Dataset Distillation via Phased Teacher Models

Supporting Multimodal Intermediate Fusion with Informatic Constraint and Distribution Coherence

Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering

MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models

PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense

DeepEyesV2: Toward Agentic Multimodal Model

Hallucination-aware Intermediate Representation Edit in Large Vision-Language Models

ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Models

Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models

Divide, Harmonize, Then Conquer It: Shooting Multi-Commodity Flow Problems with Multimodal Language Models

Empowering Small VLMs to Think with Dynamic Memorization and Exploration

LLaVAction: evaluating and training multi-modal large language models for action understanding

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

StreamingVLM: Real-Time Understanding for Infinite Video Streams

VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning

GranViT: A Fine-Grained Vision Model For Autoregressive Multimodal Large Language Models

TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

SpaCE-Eval: A Benchmark for Real-World Multi-Modal Reasoning

Inference-Time Dynamic Modality Selection for Incomplete Multimodal Classification

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

Multimodal Classification via Total Correlation Maximization

Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models

VLM-Guided Adaptive Negative Prompting for Creative Generation

CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning

No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers

RoRE: Rotary Ray Embedding for Generalised Multi-Modal Scene Understanding

MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models

GaussianFusion: Unified 3D Gaussian Representation for Multi-Modal Fusion Perception

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

ScaleCap: Scalable Image Captioning via Dual-Modality Debiasing

Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models

Pulp Motion: Framing-aware multimodal camera and human motion generation

Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding

Knowledge Externalization: Reversible Unlearning and Modular Retrieval in Multimodal Large Language Models

ICYM2^2I: The illusion of multimodal informativeness under missingness

MathNet: A Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

Preserve and Sculpt: Manifold-Aligned Fine-tuning of Vision-Language Models for Few-Shot Learning

Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model

OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis

CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework

Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting

CitySeeker: How Do VLMs Explore Embodied Urban Navigation with Implicit Human Needs?

VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation

Verifier-free Test-Time Sampling for Vision-Language-Action Models

Chart Deep Research in LVLMs via Parallel Relative Policy Optimization

OpenFly: A COMPREHENSIVE PLATFORM FOR AERIAL VISION-LANGUAGE NAVIGATION

Hybrid Training for Vision-Language-Action Models

HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denosing Diffusion Process

VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models

X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

Spatially Guided Training for Vision-Language-Action Model

PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts

MindMix: A Multimodal Foundation Model for Auditory Perception Decoding via Deep Neural-Acoustic Alignment

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

AutoGPS: Automated Geometry Problem Solving via Multimodal Formalization and Deductive Reasoning

Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

SketchThinker-R1: Towards Efficient Sketch-Style Reasoning in Large Multimodal Models

MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer

CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Vision-Language Model

R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning

Building Massively Multimodal Foundation Models with Interaction-aware Mixture-of-Experts

Prompt-Robust Vision-Language Models via Meta-Finetuning

Post-hoc Probabilistic Vision-Language Models

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

Delving into Spectral Clustering with Vision-Language Representations

Efficient Test-Time Scaling for Small Vision-Language Models

SURGE: Surprise-Guided Token Reduction for Efficient Video Understanding with VLMs

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

Long-tailed Test-Time Adaptation for Vision-Language Models

Imitating the Truth: Attention-aware Truth-Guided Enhancement for Hallucination Mitigation in Large Vision-Language Models

TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models

pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models

InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models

Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking

Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence

LLMs as Rules Oracles: Exploring Real-World Multimodal Reasoning in Tabletop Strategy Game Environments

Detecting Temporal Misalignment Attacks in Multimodal Fusion for Autonomous Driving

MIMIC-Bench: Exploring the User-Like Thinking and Mimicking Capabilities of Multimodal Large Language Models

Mitigating Hallucination in Vision-Language Model with Depth and Spatial-aware Key-Value Refinement

Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning

RLAP-CLIP: Continual Multimodal Learning with Prototype Adaptation and Difficulty-Aware Routing

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

TableDART: Dynamic Adaptive Multi-Modal Routing for Table Understanding

AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification

Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning

Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning

Label-Free Mitigation of Spurious Correlations in VLMs using Sparse Autoencoders

VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety

Pi-CCA: Prompt-Invariant CCA Certificates for Replay-Free Continual Multimodal Learning

Bilateral Information-aware Test-time Adaptation for Vision-Language Models

Contamination Detection for VLMs Using Multi‑Modal Semantic Perturbations

PRISM: Enhancing PRotein Inverse Folding through Fine- Grained Retrieval on Structure-Sequence Multimodal Representations

Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning

Bridging Radiology and Pathology Foundation Models via Concept-Based Multimodal Co-Adaptation

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Structural Prognostic Event Modeling for Multimodal Cancer Survival Analysis

MASAM: Multimodal Adaptive Sharpness-Aware Minimization for Heterogeneous Data Fusion

Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models

BOLT: Decision‑Aligned Distillation and Budget-Aware Routing for Constrained Multimodal QA on Robots

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

HAMLET: Switch Your Vision-Language-Action Model into a History-Aware Policy

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies

WMPO: World Model-based Policy Optimization for Vision-Language-Action Models

AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

Tug-of-War No More: Harmonizing Accuracy and Robustness in Vision-Language Models via Stability-Aware Task Vector Merging

Figma2Code: Automating Multimodal Design to Code in the Wild

Web-CogReasoner: Towards Multimodal Knowledge-Induced Cognitive Reasoning for Web Agents

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning

2669. SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

  • Topics: Audio & Speech

Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning

VaseVQA-3D: Benchmarking 3D VLMs on Ancient Greek Pottery

K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge

Reconstruction Alignment Improves Unified Multimodal Models

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation

MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing

MULTIMODALITY AS SUPERVISION: SELF-SUPERVISED SPECIALIZATION TO THE TEST ENVIRONMENT VIA MULTIMODALITY

OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling

Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs

Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

Calibrated Information Bottleneck for Trusted Multi-modal Clustering

Demystifying Supervision Data Generalization in Multimodal LMs

Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations

ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models

Multimodal Dataset Distillation Made Simple by Prototype-Guided Data Synthesis

When Large Multimodal Models Confront Evolving Knowledge: Challenges and Explorations

Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models

JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA

Part-X-MLLM: Part-aware 3D Multimodal Large Language Model

Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks

Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models

MotionSight: Boosting Fine-Grained Motion Understanding in Multimodal LLMs

Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization

Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization

WebWatcher: Breaking New Frontiers of Vision-Language Deep Research Agent

AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions

IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning

IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video?

Reasoning-Driven Multimodal LLM for Domain Generalization

Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment

EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models

Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models

Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs

SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

CoNavBench: Collaborative Long-Horizon Vision-Language Navigation Benchmark

Long-range Modeling and Processing of Multimodal Event Sequences

PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

Urban Socio-Semantic Segmentation with Vision-Language Reasoning

Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models

SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports

Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models

AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization

DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage

OmniMouse: Scaling properties of multi-modal, multi-task Brain Models on 150B Neural Tokens

ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning

SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models

PHyCLIP: ℓ1\ell_1-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning

Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization

Enhanced Continual Learning of Vision-Language Models with Model Fusion

Beyond Text-Only: Towards Multimodal Table Retrieval in Open-World

Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation

Teaching VLMs to Admit Uncertainty in OCR from Lossy Visual Inputs

RAR: Reversing Visual Attention Re-Sinking for Unlocking Potential in Multimodal Large Language Models

VL-JEPA: Joint Embedding Predictive Architecture for Vision-language

Revisiting Multimodal Positional Encoding in Vision–Language Models

Thinking as Society: Multi-Social-Agent Self-Distillation for Multimodal Misinformation Detection

PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction

Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning

Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs

Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models

Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning

NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language

Plug, Play, and Fortify: A Low-Cost Module for Robust Multimodal Image Understanding Models

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models

Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models

ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping

MobileCLIP2: Improving Multi-Modal Reinforced Training

3932. Towards Improved Sentence Representations using Token Graphs

  • Topics: Graph Neural Networks, Graphs & Combinatorial

Transferable and Stealthy Adversarial Attacks on Large Vision-Language Models

Identifying Robust Neural Pathways: Few-Shot Adversarial Mask Tuning for Vision-Language Models

Revisiting Confidence Calibration for Misclassification Detection in VLMs

Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

Fed-Duet: Dual Expert-Orchestrated Framework for Continual Federated Vision-Language Learning

Naming to Learn: Class Incremental Learning for Vision-Language Model with Unlabeled Data

CP-Agent: Context‑Aware Multimodal Reasoning for Cellular Morphological Profiling under Chemical Perturbations

Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

MedLesionVQA: A Multimodal Benchmark Emulating Clinical Visual Diagnosis for Body Surface Health

OmniField: Conditioned Neural Fields for Robust Multimodal Spatiotemporal Learning

Map as a Prompt: Learning Multi-Modal Spatial-Signal Foundation Models for Cross-scenario Wireless Localization

Robust Fine-tuning of Vision-Language-Action Robot Policies via Parameter Merging

VLMgineer: Vision-Language Models as Robotic Toolsmiths

Self-Improving Vision-Language-Action Models with Data Generation via Residual RL

Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance

Uncertainty-Aware Gaussian Map for Vision-Language Navigation

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-Language Navigation

Scaling Large Vision-Language Model RL Training via Efficient Load Balancing

MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning

CerebraGloss: Instruction-Tuning a Large Vision-Language Model for Fine-Grained Clinical EEG Interpretation

CogMoE: Signal-Quality–Guided Multimodal MoE for Cognitive Load Prediction

Rethinking Causal Mask Attention for Vision-Language Inference

SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation

Reducing Semantic Mismatch in Brain-to-Text Decoding Through Personalized Multimodal Masking

RMFlow: Refined Mean Flow by a Noise-Injection Step for Multimodal Generation

ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning

CircuitNet 3.0: A Multi-Modal Dataset with Task-Oriented Augmentation for AI-Driven Circuit Design

On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations

AttTok: Marrying Attribute Tokens with Generative Pre-trained Vision-Language Models towards Medical Image Understanding

BaseReward: A Strong Baseline for Multimodal Reward Model

Beyond DAGs: A Latent Partial Causal Model for Multimodal Learning

MRMR: A Realistic and Expert-Level Multidisciplinary Benchmark for Reasoning-Intensive Multimodal Retrieval

LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence

Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer

Disentanglement of Variations with Multimodal Generative Modeling

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

PCLR: Progressively Compressed LoRA for Multimodal Continual Instruction Tuning

MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos

ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis

DTP: Delta-Guided Two Stage Pruning for Mamba-based Multimodal Large Language Models

Constraint Matters: Multi-Modal Representation for Reducing Mixed-Integer Linear programming

iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models

SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs

DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking

Perception-Aware Policy Optimization for Multimodal Reasoning

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models

More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models

MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents

Flatness Guided Test-Time Adaptation for Vision-Language Models

FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models

InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models

Knowledge Exchange with Confidence: Cost-Effective LLM Integration for Reliable and Efficient Visual Question Answering

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse

Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models

UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing

Sequential Information Bottleneck Fusion: Towards Robust and Generalizable Multi-Modal Brain Tumor Segmentation

Discrete Latent Features Ablate Adversarial Attack: A Robust Prompt Tuning Framework for VLMs

ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks

Adaptive Logit Adjustment for Debiasing Multimodal Language Models

VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models

Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots

A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models

Co-LoRA: Collaborative Model Personalization on Heterogeneous Multi-Modal Clients

Histopathology-Genomics Multi-modal Structural Representation Learning for Data-Efficient Precision Oncology

Learning multimodal dictionary decompositions with group-sparse autoencoders

Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation

TAMMs: Change Understanding and Forecasting in Satellite Image Time Series with Temporal-Aware Multimodal Models

MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow

Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play

Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization

Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

Asynchronous Matching with Dynamic Sampling for Multimodal Dataset Distillation

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties among Vision-Language Models

VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models

One Patch Doesn’t Fit All: Adaptive Patching for Native-Resolution Multimodal Large Language Models

To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models

EVLP: Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning

Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning