- Published on
ACL 2026 — Multimodal & Vision-Language
Multimodal & Vision-Language
281 papers Links not yet available — ACL proceedings pending on ACL Anthology.
- MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
- FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation
- Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
- MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
- XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI Collaboration
- VALU: A Benchmark for Video Anomaly Temporal Localization and Understanding at Multiple Semantic Levels
- CoreGaze: Core Subgraph-Driven Visual Gaze Diffusion for Training-Free Referring Multimodal Large Language Models
- RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification
- Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
- Act as you think: Reinforcing Consistent Reasoning in Medical Visual Question Answering
- Using Perspectival Words Is Harder Than Vocabulary Words for Humans —and Even More So for Multimodal Language Models
- Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
- APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention
- AraVQA: Building a New Arabic Factoid Visual Question Answering Dataset from Wikipedia
- MMCLIP: Cross-Modal Attention Masked Modelling for Medical Language-Image Pre-Training
- LaMI: Augmenting Large Language Models via Late Multi-Image Fusion
- Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding
- Open Your Model’s Eyes: Video and Context-Aware Multimodal Backchannel Prediction
- Bringing Real-World Relations into Video Generation with Graph-Structured Knowledge
- Dynamic Emotion and Personality Profiling for Multimodal Deception Detection
- Stable Language Guidance for Vision–Language–Action Models
- Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions
- Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
- Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
- Multi-Granularity Semantic Revision for Large Language Model Distillation
- Simple-VGC: Enhancing Visual Grounding in Multimodal Reasoning via Adaptive Tool Composition
- MSEarth: A Multimodal Benchmark for Earth Science Phenomenon Discovery with MLLMs
- DPDV: Dual-Pathway and Dual-View Representation Learning for Bridging Information Asymmetry in Text-Video Retrieval
- G-Cap: A Game Character Caption Generator
- GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance
- Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection
- Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
- Editing the Moving World: Model Editing for Video LLMs
- Bridging the Sensory Gap: Visual Injection for Taxonomy Completion
- UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
- What’s Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews
- Visually-Guided Policy Optimization for Multimodal Reasoning
- Two Streams, One Sarcasm: Orthogonal Expert Tuning for Holistic Multimodal Sarcasm Understanding
- VideoPro: Adaptive Program Reasoning for Long Video Understanding
- DART: Disambiguation-Aware Reasoning for Video-guided Machine Translation
- GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
- Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
- Protecting multimodal large language models against misleading visualizations
- HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
- Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
- Z3D: Zero-Shot 3D Visual Grounding from Images
- Is this chart lying to me? Automating the detection of misleading visualizations
- Visual Attention Reasoning via Hierarchical Search and Self-Verification
- VFA: Empoweing Multilingual MLLMs via Vision-Free Adaptation
- KCVR: Knowledge-Centric Video Reconstruction for Structured Pedagogical Summarization via Dynamic Graph Planning
- CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
- VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
- UMMF: Protecting Copyright of Large Vision-Language Models through Unlearning-based Multimodal Memorization Fingerprint
- SGPVT: Self-Generated Proximal Visual Tokens for Mitigating Proximal Collateral Damage in MLLM Unlearning
- “I See What You Did There”: Can Large Vision-Language Models Understand Multimodal Puns?
- Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs
- MT³: A Synergistic Multi-Task RL Framework for Specializing MLLMs in Text Image Machine Translation
- FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
- MuSe: Multi-Stage Graph Reasoning via Vision-Language Models
- From Experts to Bases: Orthogonal Subspace Mixture for Continual Multimodal Instruction Tuning
- Unified Thinker: A General Reasoning Core for Image Generation
- Visual and Memory–Augmented Soccer Commentary Generation
- Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
- EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence
- How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study
- Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
- Vector Calligrapher: Generating Scalable Vector Graphics via Structured Linguistic Supervision
- DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
- ProgressLM: Towards Progress Reasoning in Vision-Language Models
- Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
- From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
- MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
- Diffusion-CAM: Faithful Visual Explanations for dMLLMs
- From Form to Logic: Masked Reconstruction and Reasoning Distillation for Short Video Fake News Detection
- Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
- Rethinking Table Pruning in TableQA: From Sequential Revisions to Gold Trajectory-Supervised Parallel Search
- HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
- Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
- Vista-LLM: Decoupled Query-Guided Visual Token Pruning for Efficient Long-Video Large Language Models
- Scaling Law for Multimodal Large Language Model Supervised Fine-Tuning
- CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?
- DORA: A Dual-Objective Reinforcement Learning Framework for Effective and Efficient Multimodal Agentic Search
- Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision
- FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
- From Charts to Code: A Hierarchical Benchmark for Multimodal Models
- Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
- UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision
- Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks
- When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
- Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model Explanations
- MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems
- SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
- When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias
- VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models
- SynthAgent: Adapting Web Agents with Synthetic Supervision
- More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
- LAD-RAG: Layout-aware Dynamic RAG for Visually-Rich Document Understanding
- Listening Like Humans: Semantics-Guided Noise-Robust Multimodal Speech Recognition
- Cross-Modal Taxonomic Generalization in (Vision-) Language Models
- MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
- Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering
- SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
- From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration
- LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models
- Reference Attack: A New Cross-Modal Jailbreaking Attack against Multimodal Large Language Models
- SAGE: Synergistic Adaptive Gating of Experts for Hateful Video Detection
- HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering
- Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
- ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
- Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
- Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
- MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction
- Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
- MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
- Zero-Shot Multimodal Retrieval with Multi-Scale Contextual Representations
- Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning
- VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition
- Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning
- GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
- Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
- Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
- USB: A COMPREHENSIVE AND UNIFIED SAFETY EVALUATION BENCHMARK FOR MULTIMODAL LARGE LANGUAGE MODELS
- AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images
- MMAC: A Multilingual, Multimodal Alignment Framework for Cultural Grounding Evaluation
- Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
- BoYaEval: Evaluating Multimodal Large Language Models on Understanding Ancient Chinese Musical Scores
- Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
- MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
- MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents
- Steganography Beyond Pixels: Reimagining Image Steganography as Cross-Modal Linguistic Communication
- Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
- Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning
- See2Refine: Vision-Language Feedback Improves LLM-Based eHMI Action Designers
- BiMol-Diff: A Unified Diffusion Framework for Molecular Generation and Captioning
- PEAP: Proactive Embodied Action Sequence Planning with Joint Understanding of Vision and Audio Perception
- MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
- VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck
- See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
- VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training
- Looking Beyond the One: Operationalizing and Eliciting Visual Ambiguity in VLLMs
- JanusMM: A Benchmark for Self-Deprecation Understanding in Real-World Multimodal Conversations
- Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
- TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval
- Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement
- VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
- EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention
- Chart-MRAG: Benchmarking Multimodal Retrieval Augmented Generation on Chart-based Documents
- ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
- Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision
- Jailbreaking Multimodal Large Language Models using Multi-Clip Video
- CogEvolve: A Multimodal Benchmark for Evaluating Relational Reasoning in Semantic Extension
- VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval
- Mixture-of-Experts with Intermediate CTC Supervision for Accented Speech Recognition
- Beyond Surface Features: Advancing Medical Vision-Language Alignment via Dynamic Evidence-Guided Preference Optimization
- Cat-MoD: Accelerating Multimodal Alignment via Caption Token Guided Asymmetric Mixture-of-Depths
- MPBoCo: Multimodal Prompt-based Boundary-enhanced Continual Framework for Joint Entity and Relation Extraction
- When More Words Say Less: Decoupling Length and Specificity in Image Description Evaluation
- AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
- Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
- DocLens: A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
- LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
- Beyond Single View: A Comprehensive Benchmark for Medical Multimodal Large Language Models on Multi-Image Understanding
- Video-MMMU: Evaluating Knowledge Acquisition from Multidisciplinary Professional Videos
- Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
- MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
- VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision
- VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation Agents
- Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval
- Benchmarking Deflection and Hallucination in Large Vision-Language Models
- MagicBench: Diagnosing Visual Agency Loss and Semantic Dependency in Multimodal LLMs
- Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection
- FactVerse: A Benchmark for Factual Consistency in Interleaved Image–Text Generation
- Latent Attention Denoising: A Training-Free Energy-Based Framework for Mitigating Hallucinations in Vision-Language Models
- SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
- DIXITWORLD: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
- MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation
- Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
- Think before Go: Hierarchical Reasoning for Image-goal Navigation
- Zero-shot Jianzi Recognition as Structured Visual Information Extraction in Open Compositional Symbolic Systems
- Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline
- Beyond the Panorama: Training-Free Hierarchical Perception-Reasoning for Fine-Grained Vision in MLLMs
- OSCBench: Benchmarking Object State Change in Text-to-Video Generation
- MirrorCAPTCHA: Wild CAPTCHA, Wild Distribution, Wild Web-based Platform Meet Multimodal LLM Agents
- Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
- MIND Your Reasoning: A Meta-Cognitive Intuitive-Reflective Network for Dual-Reasoning in Multimodal Stance Detection
- QA-MoE: Towards a Continuous Reliability Spectrum with Quality-Aware Mixture of Experts for Robust Multimodal Sentiment Analysis
- Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision
- Diagnosing Spatial Consistency across Perspectives and Viewpoints in Large Vision-Language Models
- Multimodal Large Language Models for Multi-Subject In-Context Image Generation
- VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
- MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Knowledge Poisoning Attacks
- Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image Models
- Evaluating Visual Narrative Coherence in Story Visualization via Diversified Storylines
- Improving the Distributional Alignment of LLMs using Supervision
- GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
- L2Dir: Integrating L₂-Norm and Directional Alignment for Unsupervised Contrastive Representation Learning in Multimodal Retrieval
- CityVG: Contrastive Fine-Tuning and Reward-Based Chain-of-Thought Reasoning for Zero-Shot City-Scale 3D Visual Grounding
- Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
- KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering
- SOAR: Supervision from Observation for Agentic Reinforcement Learning
- Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation
- ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization
- MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
- VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
- Flow-Based Page Unique Semantic Mapping Architecture for Document Visual Question Answering
- Probing Audio-Visual Reasoning in Multimodal Language Models through the Lens of Audio
- The Side Effects of Being Smart: Safety Risks in MLLMs’ Multi-Image Reasoning
- From Detection to Understanding: Multi-Turn Reasoning for Video Misinformation Analysis
- VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
- Glyph: Scaling Context Windows via Visual-Text Compression
- DiVE: Decoupling Intra-layer Visual Evidence for Mitigating Hallucinations in Large Vision-Language Models
- MARD: Module-Aware Reasoning Distillation for Language Models with Adaptive Supervision
- Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards
- Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation
- When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
- ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment
- Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
- v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
- EmoS: A High‑Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding
- HowToNarrate: A General-Domain Benchmark for Synchronized Video Narration with External Knowledge
- Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language Models
- Mitigating Safety Context Amnesia in Multimodal Reasoning Models via Intent-Guided Safety Reasoning
- Figure It Out: Improve the Frontier of Reasoning with Executable Visual States
- AttnPO: Attention-Guided Process Supervision for Efficient Reasoning
- Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
- Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
- Afri-MCQA: Multimodal Cultural Question Answering for African Languages
- E-ViC: Reasoning Beyond Text via Embodied Visual Chain for Spatial Intelligence
- MessToClean: Evidence-Grounded Structure-Preserving Reconstruction for Real-World Degraded Exam Paper Images
- GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap
- Emotion-Wheel-Guided Audio-Referred Text Representation for Multimodal Emotion Recognition in Conversation
- LongVideoAgent: Multi-Agent Reasoning with Long Videos
- MirrorQA: Benchmarking Multimodal LLMs on Mirror-Orientation Reasoning
- Tiny Scales, Great Challenges: The Limits of Multimodal LLMs in Scale Recognition
- M³-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
- Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
- Beyond Static Alignment: Adaptive Arbitration for Semantic Incongruence in Semi-Supervised Multimodal Sentiment Analysis
- The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form–Meaning Mapping
- From Competition to Synergy: Unlocking Reinforcement Learning for Subject-Driven Image Generation
- Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation
- Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
- Multimodal Safety Evaluation in Generative Agent Social Simulations
- SafeMT: Multi-turn Safety for Multimodal Language Models
- Lightweight and Faithful Visual Condition Checking in Behavior Trees via Expert-Regularized Reinforcement Learning
- Prosody as Supervision: Bridging the Non-Verbal–Verbal for Multilingual Speech Emotion Recognition
- Mechanisms of Prompt-Induced Hallucination in Vision–Language Models
- VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking
- AV-Dialog: Spoken Dialogue Models with Audio-Visual Input
- A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
- ViLL-E: Video LLM Embeddings for Retrieval
- Locate and Explain: Joint Multimodal Emotion Cause Extraction and Summarization in Conversation
- ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services
- FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs
- Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
- POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
- Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding
- Automatic and Reliable Evaluation for Academic Caption-to-Figure Generation with LMMs
- INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
- When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models
- Benchmarking Fine-Grained Error Detection in Multimodal Reasoning
- SciMDR: Advancing Scientific Multimodal Document Reasoning
- VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
- I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing
- MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
- Revealing the Seen, Imagining the Beyond: A Survey of Image-Grounded Chain-of-Thought Reasoning in Multimodal LLMs
- OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Models
- Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
- Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
- Perception, Understanding and Reasoning: A Multimodal Benchmark for Video Fake News Detection
- Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective
- Mind’s Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
- CEBC: Conformal Evidence-Bounded Control for Low-Hallucination Vision–Language Generation
- Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
- From Words to Pixels: A Comprehensive Survey on Large Language Models in Visual Segmentation
- Agentic Very Long Video Understanding
- Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
- DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
- LOTUS: Evolving Multimodal Unlearning via Hyperbolic Entailment and Lorentz Transport
- MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
- REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
- MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation