R
Published on

ACL 2026 — Multimodal & Vision-Language

Multimodal & Vision-Language

281 papers Links not yet available — ACL proceedings pending on ACL Anthology.

  • MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
  • FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation
  • Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
  • MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
  • XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI Collaboration
  • VALU: A Benchmark for Video Anomaly Temporal Localization and Understanding at Multiple Semantic Levels
  • CoreGaze: Core Subgraph-Driven Visual Gaze Diffusion for Training-Free Referring Multimodal Large Language Models
  • RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification
  • Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
  • Act as you think: Reinforcing Consistent Reasoning in Medical Visual Question Answering
  • Using Perspectival Words Is Harder Than Vocabulary Words for Humans —and Even More So for Multimodal Language Models
  • Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
  • APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention
  • AraVQA: Building a New Arabic Factoid Visual Question Answering Dataset from Wikipedia
  • MMCLIP: Cross-Modal Attention Masked Modelling for Medical Language-Image Pre-Training
  • LaMI: Augmenting Large Language Models via Late Multi-Image Fusion
  • Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding
  • Open Your Model’s Eyes: Video and Context-Aware Multimodal Backchannel Prediction
  • Bringing Real-World Relations into Video Generation with Graph-Structured Knowledge
  • Dynamic Emotion and Personality Profiling for Multimodal Deception Detection
  • Stable Language Guidance for Vision–Language–Action Models
  • Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions
  • Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
  • Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
  • Multi-Granularity Semantic Revision for Large Language Model Distillation
  • Simple-VGC: Enhancing Visual Grounding in Multimodal Reasoning via Adaptive Tool Composition
  • MSEarth: A Multimodal Benchmark for Earth Science Phenomenon Discovery with MLLMs
  • DPDV: Dual-Pathway and Dual-View Representation Learning for Bridging Information Asymmetry in Text-Video Retrieval
  • G-Cap: A Game Character Caption Generator
  • GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance
  • Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection
  • Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
  • Editing the Moving World: Model Editing for Video LLMs
  • Bridging the Sensory Gap: Visual Injection for Taxonomy Completion
  • UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
  • What’s Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews
  • Visually-Guided Policy Optimization for Multimodal Reasoning
  • Two Streams, One Sarcasm: Orthogonal Expert Tuning for Holistic Multimodal Sarcasm Understanding
  • VideoPro: Adaptive Program Reasoning for Long Video Understanding
  • DART: Disambiguation-Aware Reasoning for Video-guided Machine Translation
  • GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
  • Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
  • Protecting multimodal large language models against misleading visualizations
  • HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
  • Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
  • Z3D: Zero-Shot 3D Visual Grounding from Images
  • Is this chart lying to me? Automating the detection of misleading visualizations
  • Visual Attention Reasoning via Hierarchical Search and Self-Verification
  • VFA: Empoweing Multilingual MLLMs via Vision-Free Adaptation
  • KCVR: Knowledge-Centric Video Reconstruction for Structured Pedagogical Summarization via Dynamic Graph Planning
  • CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
  • VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
  • UMMF: Protecting Copyright of Large Vision-Language Models through Unlearning-based Multimodal Memorization Fingerprint
  • SGPVT: Self-Generated Proximal Visual Tokens for Mitigating Proximal Collateral Damage in MLLM Unlearning
  • “I See What You Did There”: Can Large Vision-Language Models Understand Multimodal Puns?
  • Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs
  • MT³: A Synergistic Multi-Task RL Framework for Specializing MLLMs in Text Image Machine Translation
  • FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
  • MuSe: Multi-Stage Graph Reasoning via Vision-Language Models
  • From Experts to Bases: Orthogonal Subspace Mixture for Continual Multimodal Instruction Tuning
  • Unified Thinker: A General Reasoning Core for Image Generation
  • Visual and Memory–Augmented Soccer Commentary Generation
  • Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
  • EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence
  • How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study
  • Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
  • Vector Calligrapher: Generating Scalable Vector Graphics via Structured Linguistic Supervision
  • DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
  • ProgressLM: Towards Progress Reasoning in Vision-Language Models
  • Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
  • From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
  • MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
  • Diffusion-CAM: Faithful Visual Explanations for dMLLMs
  • From Form to Logic: Masked Reconstruction and Reasoning Distillation for Short Video Fake News Detection
  • Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
  • Rethinking Table Pruning in TableQA: From Sequential Revisions to Gold Trajectory-Supervised Parallel Search
  • HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
  • Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
  • Vista-LLM: Decoupled Query-Guided Visual Token Pruning for Efficient Long-Video Large Language Models
  • Scaling Law for Multimodal Large Language Model Supervised Fine-Tuning
  • CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?
  • DORA: A Dual-Objective Reinforcement Learning Framework for Effective and Efficient Multimodal Agentic Search
  • Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision
  • FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
  • From Charts to Code: A Hierarchical Benchmark for Multimodal Models
  • Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
  • UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision
  • Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks
  • When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
  • Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model Explanations
  • MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems
  • SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
  • When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias
  • VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models
  • SynthAgent: Adapting Web Agents with Synthetic Supervision
  • More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
  • LAD-RAG: Layout-aware Dynamic RAG for Visually-Rich Document Understanding
  • Listening Like Humans: Semantics-Guided Noise-Robust Multimodal Speech Recognition
  • Cross-Modal Taxonomic Generalization in (Vision-) Language Models
  • MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
  • Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering
  • SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
  • From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration
  • LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models
  • Reference Attack: A New Cross-Modal Jailbreaking Attack against Multimodal Large Language Models
  • SAGE: Synergistic Adaptive Gating of Experts for Hateful Video Detection
  • HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering
  • Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
  • ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
  • Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
  • Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
  • MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction
  • Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
  • MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
  • Zero-Shot Multimodal Retrieval with Multi-Scale Contextual Representations
  • Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning
  • VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition
  • Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning
  • GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
  • Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
  • Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
  • USB: A COMPREHENSIVE AND UNIFIED SAFETY EVALUATION BENCHMARK FOR MULTIMODAL LARGE LANGUAGE MODELS
  • AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images
  • MMAC: A Multilingual, Multimodal Alignment Framework for Cultural Grounding Evaluation
  • Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
  • BoYaEval: Evaluating Multimodal Large Language Models on Understanding Ancient Chinese Musical Scores
  • Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
  • MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
  • MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents
  • Steganography Beyond Pixels: Reimagining Image Steganography as Cross-Modal Linguistic Communication
  • Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
  • Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning
  • See2Refine: Vision-Language Feedback Improves LLM-Based eHMI Action Designers
  • BiMol-Diff: A Unified Diffusion Framework for Molecular Generation and Captioning
  • PEAP: Proactive Embodied Action Sequence Planning with Joint Understanding of Vision and Audio Perception
  • MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
  • VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck
  • See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
  • VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training
  • Looking Beyond the One: Operationalizing and Eliciting Visual Ambiguity in VLLMs
  • JanusMM: A Benchmark for Self-Deprecation Understanding in Real-World Multimodal Conversations
  • Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
  • TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval
  • Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement
  • VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
  • EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention
  • Chart-MRAG: Benchmarking Multimodal Retrieval Augmented Generation on Chart-based Documents
  • ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
  • Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision
  • Jailbreaking Multimodal Large Language Models using Multi-Clip Video
  • CogEvolve: A Multimodal Benchmark for Evaluating Relational Reasoning in Semantic Extension
  • VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval
  • Mixture-of-Experts with Intermediate CTC Supervision for Accented Speech Recognition
  • Beyond Surface Features: Advancing Medical Vision-Language Alignment via Dynamic Evidence-Guided Preference Optimization
  • Cat-MoD: Accelerating Multimodal Alignment via Caption Token Guided Asymmetric Mixture-of-Depths
  • MPBoCo: Multimodal Prompt-based Boundary-enhanced Continual Framework for Joint Entity and Relation Extraction
  • When More Words Say Less: Decoupling Length and Specificity in Image Description Evaluation
  • AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
  • Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
  • DocLens: A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
  • LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
  • Beyond Single View: A Comprehensive Benchmark for Medical Multimodal Large Language Models on Multi-Image Understanding
  • Video-MMMU: Evaluating Knowledge Acquisition from Multidisciplinary Professional Videos
  • Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
  • MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
  • VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision
  • VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation Agents
  • Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval
  • Benchmarking Deflection and Hallucination in Large Vision-Language Models
  • MagicBench: Diagnosing Visual Agency Loss and Semantic Dependency in Multimodal LLMs
  • Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection
  • FactVerse: A Benchmark for Factual Consistency in Interleaved Image–Text Generation
  • Latent Attention Denoising: A Training-Free Energy-Based Framework for Mitigating Hallucinations in Vision-Language Models
  • SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
  • DIXITWORLD: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
  • MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation
  • Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
  • Think before Go: Hierarchical Reasoning for Image-goal Navigation
  • Zero-shot Jianzi Recognition as Structured Visual Information Extraction in Open Compositional Symbolic Systems
  • Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline
  • Beyond the Panorama: Training-Free Hierarchical Perception-Reasoning for Fine-Grained Vision in MLLMs
  • OSCBench: Benchmarking Object State Change in Text-to-Video Generation
  • MirrorCAPTCHA: Wild CAPTCHA, Wild Distribution, Wild Web-based Platform Meet Multimodal LLM Agents
  • Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
  • MIND Your Reasoning: A Meta-Cognitive Intuitive-Reflective Network for Dual-Reasoning in Multimodal Stance Detection
  • QA-MoE: Towards a Continuous Reliability Spectrum with Quality-Aware Mixture of Experts for Robust Multimodal Sentiment Analysis
  • Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision
  • Diagnosing Spatial Consistency across Perspectives and Viewpoints in Large Vision-Language Models
  • Multimodal Large Language Models for Multi-Subject In-Context Image Generation
  • VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
  • MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Knowledge Poisoning Attacks
  • Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image Models
  • Evaluating Visual Narrative Coherence in Story Visualization via Diversified Storylines
  • Improving the Distributional Alignment of LLMs using Supervision
  • GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
  • L2Dir: Integrating L₂-Norm and Directional Alignment for Unsupervised Contrastive Representation Learning in Multimodal Retrieval
  • CityVG: Contrastive Fine-Tuning and Reward-Based Chain-of-Thought Reasoning for Zero-Shot City-Scale 3D Visual Grounding
  • Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
  • KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering
  • SOAR: Supervision from Observation for Agentic Reinforcement Learning
  • Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation
  • ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization
  • MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
  • VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
  • Flow-Based Page Unique Semantic Mapping Architecture for Document Visual Question Answering
  • Probing Audio-Visual Reasoning in Multimodal Language Models through the Lens of Audio
  • The Side Effects of Being Smart: Safety Risks in MLLMs’ Multi-Image Reasoning
  • From Detection to Understanding: Multi-Turn Reasoning for Video Misinformation Analysis
  • VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
  • Glyph: Scaling Context Windows via Visual-Text Compression
  • DiVE: Decoupling Intra-layer Visual Evidence for Mitigating Hallucinations in Large Vision-Language Models
  • MARD: Module-Aware Reasoning Distillation for Language Models with Adaptive Supervision
  • Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards
  • Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation
  • When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
  • ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment
  • Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
  • v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
  • EmoS: A High‑Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding
  • HowToNarrate: A General-Domain Benchmark for Synchronized Video Narration with External Knowledge
  • Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language Models
  • Mitigating Safety Context Amnesia in Multimodal Reasoning Models via Intent-Guided Safety Reasoning
  • Figure It Out: Improve the Frontier of Reasoning with Executable Visual States
  • AttnPO: Attention-Guided Process Supervision for Efficient Reasoning
  • Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
  • Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
  • Afri-MCQA: Multimodal Cultural Question Answering for African Languages
  • E-ViC: Reasoning Beyond Text via Embodied Visual Chain for Spatial Intelligence
  • MessToClean: Evidence-Grounded Structure-Preserving Reconstruction for Real-World Degraded Exam Paper Images
  • GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap
  • Emotion-Wheel-Guided Audio-Referred Text Representation for Multimodal Emotion Recognition in Conversation
  • LongVideoAgent: Multi-Agent Reasoning with Long Videos
  • MirrorQA: Benchmarking Multimodal LLMs on Mirror-Orientation Reasoning
  • Tiny Scales, Great Challenges: The Limits of Multimodal LLMs in Scale Recognition
  • M³-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
  • Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
  • Beyond Static Alignment: Adaptive Arbitration for Semantic Incongruence in Semi-Supervised Multimodal Sentiment Analysis
  • The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form–Meaning Mapping
  • From Competition to Synergy: Unlocking Reinforcement Learning for Subject-Driven Image Generation
  • Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation
  • Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
  • Multimodal Safety Evaluation in Generative Agent Social Simulations
  • SafeMT: Multi-turn Safety for Multimodal Language Models
  • Lightweight and Faithful Visual Condition Checking in Behavior Trees via Expert-Regularized Reinforcement Learning
  • Prosody as Supervision: Bridging the Non-Verbal–Verbal for Multilingual Speech Emotion Recognition
  • Mechanisms of Prompt-Induced Hallucination in Vision–Language Models
  • VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking
  • AV-Dialog: Spoken Dialogue Models with Audio-Visual Input
  • A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
  • ViLL-E: Video LLM Embeddings for Retrieval
  • Locate and Explain: Joint Multimodal Emotion Cause Extraction and Summarization in Conversation
  • ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services
  • FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs
  • Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
  • POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
  • Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding
  • Automatic and Reliable Evaluation for Academic Caption-to-Figure Generation with LMMs
  • INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
  • When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models
  • Benchmarking Fine-Grained Error Detection in Multimodal Reasoning
  • SciMDR: Advancing Scientific Multimodal Document Reasoning
  • VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
  • I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing
  • MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
  • Revealing the Seen, Imagining the Beyond: A Survey of Image-Grounded Chain-of-Thought Reasoning in Multimodal LLMs
  • OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Models
  • Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
  • Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
  • Perception, Understanding and Reasoning: A Multimodal Benchmark for Video Fake News Detection
  • Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective
  • Mind’s Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
  • CEBC: Conformal Evidence-Bounded Control for Low-Hallucination Vision–Language Generation
  • Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
  • From Words to Pixels: A Comprehensive Survey on Large Language Models in Visual Segmentation
  • Agentic Very Long Video Understanding
  • Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
  • DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
  • LOTUS: Evolving Multimodal Unlearning via Hyperbolic Entailment and Lorentz Transport
  • MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
  • REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
  • MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation