R
Published on

ICLR 2026 — Computer Vision

Computer Vision

816 papers (0 oral)

Universal Inverse Distillation for Matching Models with Real-Data Supervision (No GANs)

Neon: Negative Extrapolation From Self-Training Improves Image Generation

Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment

Depth Anything 3: Recovering the Visual Space from Any Views

Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator

DepthLM: Metric Depth from Vision Language Models

Multimodal Aligned Semantic Knowledge for Unpaired Image-text Matching

Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction–Reasoning Synergy

MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Models for Embodied Task Planning

Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation

Visual Planning: Let's Think Only with Images

NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale

Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

Seeing Through the Brain: New Insights from Decoding Visual Stimuli with fMRI

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

Visual symbolic mechanisms: Emergent symbol processing in Vision Language Models

A Scalable Distributed Framework for Multimodal GigaVoxel Image Registration

FlashWorld: High-quality 3D Scene Generation within Seconds

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

MADFormer\textit{MADFormer}: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation

10. ARINBEV: Bird's-Eye View Layout Estimation with Conditional Autoregressive Model

  • Topics: LLMs & Foundation Models

I-DRUID: Layout to image generation via instance-disentangled representation and unpaired data

SatDreamer360: Multiview-Consistent Generation of Ground-Level Scenes from Satellite Imagery

Story-Iter: A Training-free Iterative Paradigm for Long Story Visualization

FlowAlign: Trajectory-Regularized, Inversion-Free Flow-based Image Editing

Long-Text-to-Image Generation via Compositional Prompt Decomposition

Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?

Turbo-DDCM: Fast and Flexible Zero-Shot Diffusion-Based Image Compression

Features Emerge as Discrete States: The First Application of SAEs to 3D Representations

ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks

LearnIR: Learnable Posterior Sampling for Real-World Image Restoration

Learning Unified Representation of 3D Gaussian Splatting

CIAR: Interval-based Collaborative Decoding for Image Generation Acceleration

Analyzing the Training Dynamics of Image Restoration Transformers: A Revisit to Layer Normalization

ChronoEdit: Towards Temporal Reasoning for In-Context Image Editing and World Simulation

Pixel-Perfect Puppetry: Precision-Guided Enhancement for Face Image and Video Editing

Cross-ControlNet: Training-Free Fusion of Multiple Conditions for Text-to-Image Generation

Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation

SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment

SurfSplat: Conquering Feedforward 2D Gaussian Splatting with Surface Continuity Priors

Dens3R: A Foundation Model for 3D Geometry Prediction

AssetFormer: Modular 3D Assets Generation with Autoregressive Transformer

UniSplat: Unified Spatio-Temporal Fusion via 3D Latent Scaffolds for Dynamic Driving Scene Reconstruction

π3\pi^3: Permutation-Equivariant Visual Geometry Learning

Mono4DGS-HDR: High Dynamic Range 4D Gaussian Splatting from Alternating-exposure Monocular Videos

VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding

GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

Provably Accelerated Imaging with Restarted Inertia and Score-based Image Priors

Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving

VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning

Unified Multi-Modal Interactive and Reactive 3D Motion Generation via Rectified Flow

Revisual-R1: Advancing Multimodal Reasoning From Optimized Cold Start to Staged Reinforcement Learning

MergeTune: Continued Fine-Tuning of Vision-Language Models

IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs

Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking

VisualPRM400K: An Effective Dataset for Training Multimodal Process Reward Models

QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining

UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation

SPR2^2Q: Static Priority-based Rectifier Routing Quantization for Image Super-Resolution

Enhancing Multi-Image Understanding through Delimiter Token Scaling

PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment

Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing

Exploring the Potential of Encoder-free Architectures in 3D LMMs

ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning

You Point, I Learn: Online Adaptation of Interactive Segmentation Models for Handling Distribution Shifts in Medical Imaging

Detective SAM: Adaptive AI-Image Forgery Localization

Unveiling Perceptual Artifacts: A Fine-Grained Benchmark for Interpretable AI-Generated Image Detection

Towards Reliable Detection of Empty Space: Conditional Marked Point Processes for Object Detection

DVLA-RL: Dual-Level Vision–Language Alignment with Reinforcement Learning Gating for Few-Shot Learning

Vulcan: Crafting Compact Class-Specific Vision Transformers For Edge Intelligence

OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation

Seeing Through Words: Controlling Visual Retrieval Quality with Language Models

gen2seg: Generative Models Enable Generalizable Instance Segmentation

Content-Aware Mamba for Learned Image Compression

SceneTransporter: Optimal Transport-Guided Compositional Latent Diffusion for Single-Image Structured 3D Scene Generation

From Sparse to Dense: Spatio-Temporal Fusion for Multi-View 3D Human Pose Estimation with DenseWarper

Rethinking Expressivity and Degradation-Awareness in Attention for All-in-One Blind Image Restoration

Privacy Beyond Pixels: Latent Anonymization for Privacy-Preserving Video Understanding

Follow-Your-Preference: Towards Preference-Aligned Image Inpainting

Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding

Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation

Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models

Continual Unlearning for Text-to-Image Diffusion Models: A Regularization Perspective

VisCoder2: Building Multi-Language Visualization Coding Agents

Vision Language Models are Biased

MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs

Truthfulness Despite Weak Supervision: Evaluating and Training LLMs Using Peer Prediction

Assessing Robustness via Score-Based Adversarial Image Generation

414. Towards Anomaly-Aware Pre-Training and Fine-Tuning for Graph Anomaly Detection

  • Topics: LLMs & Foundation Models, Graph Neural Networks, Graphs & Combinatorial

GeoDiv: Framework for Measuring Geographical Diversity in Text-to-Image Models

STEDiff: Revealing the Spatial and Temporal Redundancy of Backdoor Attacks in Text-to-Image Diffusion Models

VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models

Enhancing Image-Conditional Coverage in Segmentation: Adaptive Thresholding via Differentiable Miscoverage Loss

Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?

CGSA: Class-Guided Slot-Aware Adaptation for Source-Free Object Detection

Test-time Domain Generalization for Image Super-resolution

Dual-Kernel Adapter: Expanding Spatial Horizons for Data-Constrained Medical Image Analysis

Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models

CryoSplat: Gaussian Splatting for Cryo-EM Homogeneous Reconstruction

Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs

A Structured, Tagged, and Localized Visual Question Answering Dataset with Full Sentence Answers and Scene Graphs for Chest X-ray Images

FETAL-GAUGE: A BENCHMARK FOR ASSESSING VISION-LANGUAGE MODELS IN FETAL ULTRASOUND

villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models

Vision-Language-Action Instruction Tuning: From Understanding to Manipulation

PEERING INTO THE UNKNOWN: ACTIVE VIEW SELECTION WITH NEURAL UNCERTAINTY MAPS FOR 3D RECONSTRUCTION

RAP: 3D Rasterization Augmented End-to-End Planning

Interleave-VLA: Enhancing Robot Manipulation with Image-Text Interleaved Instructions

QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization

Unified Vision-Language-Action Model

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow

Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Method

OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation

ORCaS: Unsupervised Depth Completion via Occluded Region Completion as Supervision

PerfGuard: A Performance-Aware Agent for Visual Content Generation

Taming Hierarchical Image Coding Optimization: A Spectral Regularization Perspective

PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation

PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models

Bridging Degradation Discrimination and Generation for Universal Image Restoration

SpatiaLab: Can Vision–Language Models Perform Spatial Reasoning in the Wild?

FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark

SELF-HARMONY: LEARNING TO HARMONIZE SELF-SUPERVISION AND SELF-PLAY IN TEST-TIME REINFORCEMENT LEARNING

Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention

Stroke3D: Lifting 2D strokes into rigged 3D model via latent diffusion models

Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion

Stretching Beyond the Obvious: A Gradient-Free Framework to Unveil the Hidden Landscape of Visual Invariance

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

Autoregressive Visual Decoding from EEG Signals

Model-Guided Microstimulation Steers Primate Visual Behavior

SEED: Towards More Accurate Semantic Evaluation for Visual Brain Decoding

Learning Brain Representation with Hierarchical Visual Embeddings

Inducing Dyslexia in Vision Language Models

Uncertainty-Aware 3D Reconstruction for Dynamic Underwater Scenes

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

Enhancing Vision-Language Model with Unmasked Token Alignment

821. AB-UPT: Scaling Neural CFD Surrogates for High- Fidelity Automotive Aerodynamics Simulations via Anchored- Branched Universal Physics Transformers

  • Topics: LLMs & Foundation Models

822. Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

  • Topics: Diffusion Models & Generative AI, Computer Vision, Efficiency & Compression

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

FastVGGT: Fast Visual Geometry Transformer

Curvature-Guided Task Synergy for Skeleton based Temporal Action Segmentation

WithAnyone: Toward Controllable and ID Consistent Image Generation

SIGMA-Gen: Structure and Identity Guided Multi-Subject Assembly for Image Generation

Follow-Your-Shape: Shape-Aware Image Editing via Trajectory-Guided Region Control

VMDiff: Visual Mixing Diffusion for Limitless Cross-Object Synthesis

Autoregressive Image Generation with Randomized Parallel Decoding

Culture in Action: Evaluating Text-to-Image Models through Social Activities

AutoDV: An End-to-End Deep Learning Model for High-Dimensional Data Visualization

Weight Space Representation Learning on Diverse NeRF Architectures

VQ-Transplant: Efficient VQ-Module Integration for Pre-trained Visual Tokenizers

ImageRAG: Dynamic Image Retrieval for Reference-Guided Image Generation

CTRL&SHIFT: High-quality Geometry-Aware Object Manipulation in Visual Generation

DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models

SSG: Scaled Spatial Guidance for Multi-Scale Visual Autoregressive Generation

FreeAdapt: Unleashing Diffusion Priors for Ultra-High-Definition Image Restoration

LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization

Dragging with Geometry: From Pixels to Geometry-Guided Image Editing

Does FLUX Already Know How to Perform Physically Plausible Image Composition?

SuperF: Neural Implicit Fields for Multi-Image Super-Resolution

Escaping Low-Rank Traps: Interpretable Visual Concept Learning via Implicit Vector Quantization

Learnable Sparsity for Vision Generative Models

Spatially Informed Autoencoders for Interpretable Visual Representation Learning

Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering

NGS-Marker: Robust Native Watermarking for 3D Gaussian Splatting

One2Scene: Geometric Consistent Explorable 3D Scene Generation from a Single Image

TTT3R: 3D Reconstruction as Test-Time Training

FullPart: Generating each 3D Part at Full Resolution

Interference-Isolated Elastic Weight Consolidation and Knowledge Calibration for Incremental Object Detection

Variation-aware Flexible 3D Gaussian Editing

Augmented Radiance Field: A General Framework for Enhanced Gaussian Splatting

Stylos: Multi-View 3D Stylization with Single-Forward Gaussian Splatting

Signal Structure-Aware Gaussian Splatting for Large-Scale Scene Reconstruction

ULTRA-360: Unconstrained Dataset for Large-scale Temporal 3D Reconstruction across Altitudes and Omnidirectional Views

Hallucination-aware Intermediate Representation Edit in Large Vision-Language Models

ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Models

Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

Omni-IML: Towards Unified Interpretable Image Manipulation Localization

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning

GranViT: A Fine-Grained Vision Model For Autoregressive Multimodal Large Language Models

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

Grounding or Guessing? Visual Signals for Detecting Hallucinations in Sign Language Translation

MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition

Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers

Composition-Grounded Data Synthesis for Visual Reasoning

EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark

GaussianFusion: Unified 3D Gaussian Representation for Multi-Modal Fusion Perception

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

ScaleCap: Scalable Image Captioning via Dual-Modality Debiasing

Hierarchical Prototype Learning for Semantic Segmentation

QPrompt-R1: Real-Time Reasoning for Domain-Generalized Semantic Segmentation via Group-Relative Query Alignment

CARL: Camera-Agnostic Representation Learning for Spectral Image Analysis

ELViS: Efficient Visual Similarity from Local Descriptors that Generalizes Across Domains

DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection

SpikeStereoNet: A Brain-Inspired Framework for Stereo Depth Estimation from Spike Streams

Pose Prior Learner: Unsupervised Categorical Prior Learning for Pose Estimation

Pose-RFT: Aligning MLLMs for 3D Pose Generation via Hybrid Action Reinforcement Fine-Tuning

Benchmarking Open-ended Segmentation

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

GenCape: Structure-Inductive Generative Modeling for Category-Agnostic Pose Estimation

Inlier-Centric Post-Training Quantization for Object Detection Models

PointRePar : SpatioTemporal Point Relation Parsing for Robust Category-Unified 3D Tracking

FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring

Splat and Distill: Augmenting Teachers with Feed-Forward 3D Reconstruction For 3D-Aware Distillation

Unsupervised Representation Learning for 3D Mesh Parameterization with Semantic and Visibility Objectives

Consistent Text-to-Image Generation via Scene De-Contextualization

Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models

DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

HoloPart: Generative 3D Part Amodal Segmentation

From Sure" to Sorry": Detecting Jailbreak in Large Vision Language Model via JailNeurons

Enabling True Global Perception in State Space Models for Visual Tasks

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

Preserve and Sculpt: Manifold-Aligned Fine-tuning of Vision-Language Models for Few-Shot Learning

Decomposition of Concept-Level Rules in Visual Scenes

Medical thinking with multiple images

Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs

Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model

GAGA: Gaussianity-Aware Gaussian Approximation for Efficient 3D Molecular Generation

Exploring Interpretability for Visual Prompt Tuning with Cross-layer Concepts

Improving 2D Diffusion Models for 3D Medical Imaging with Inter‑Slice Consistent Stochasticity

VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation

SpikePingpong: Spike Vision-based Fast-Slow Pingpong Robot System

Verifier-free Test-Time Sampling for Vision-Language-Action Models

OpenFly: A COMPREHENSIVE PLATFORM FOR AERIAL VISION-LANGUAGE NAVIGATION

Hybrid Training for Vision-Language-Action Models

HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denosing Diffusion Process

VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models

CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving

Entropy-Monitored Kernelized Token Distillation for Audio-Visual Compression

X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model

ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs

Thyme: Think Beyond Images

Spatially Guided Training for Vision-Language-Action Model

SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation

Decoding Dynamic Visual Experience from Calcium Imaging via Cell-Pattern-Aware Pretraining

CloDS: Visual-Only Unsupervised Cloth Dynamics Learning in Unknown Conditions

LaVCa: LLM-assisted Visual Cortex Captioning

We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning

Unified Vision–Language Modeling via Concept Space Alignment

Closing the Safety Gap: Surgical Concept Erasure in Visual Autoregressive Models

AMLRIS: Alignment-aware Masked Learning for Referring Image Segmentation

Nano3D: A Training-Free Approach for Efficient 3D Editing Without Masks

PAT3D: Physics-Augmented Text-to-3D Scene Generation

Hierarchical Value-Decomposed Offline Reinforcement Learning for Whole-Body Control

Frequency-aware Dynamic Gaussian Splatting

SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes

MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer

CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Vision-Language Model

HFSTI-Net: Hierarchical Frequency-spatial-temporal Interactions for Video Polyp Segmentation

Spatial Structure and Selective Text Jointly Facilitate Image Clustering

Durian: Dual Reference Image-Guided Portrait Animation with Attribute Transfer

ToProVAR: Efficient Visual Autoregressive Modeling via Tri-Dimensional Entropy-Aware Semantic Analysis and Sparsity Optimization

Data Provenance for Image Auto-Regressive Generation

Token-Efficient Item Representation via Images for LLM Recommender Systems

TINKER: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization

Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models

EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model

SiNGER: A Clearer Voice Distills Vision Transformers Further

Purrception: Variational Flow Matching for Vector-Quantized Image Generation

Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection

Locality-Attending Vision Transformer

Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training

PQGAN: Product-Quantised Image Representation for High-Quality Image Synthesis

3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation

BAR: Refactor the Basis of Autoregressive Visual Generation

CLoD-GS: Continuous Level-of-Detail via 3D Gaussian Splatting

Active Learning of 3D Gaussian Splatting with Consistent Region Partition and Robust Pose Estimation

A Step to Decouple Optimization in 3DGS

VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision–Language Models

Uncertainty Matters in Dynamic Gaussian Splatting for Monocular 4D Reconstruction

CylinderSplat: 3D Gaussian Splatting with Cylindrical Triplanes for Panoramic Novel View Synthesis

G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior

SkyEvents: A Large-Scale Event-enhanced UAV Dataset for Robust 3D Scene Reconstruction

PD2^{2}GS: Part-Level Decoupling and Continuous Deformation of Articulated Objects via Gaussian Splatting

NOVA3R: Non-pixel-aligned Visual Transformer for Amodal 3D Reconstruction

ETGS: Explicit Thermodynamics Gaussian Splatting for Dynamic Thermal Reconstruction

Prompt-Robust Vision-Language Models via Meta-Finetuning

Implicit 4D Gaussian Splatting for Fast Motion with Large Inter-Frame Displacements

Condition Matters in Full-head 3D GANs

All That Glitters Is Not Gold: Key-Secured 3D Secrets within 3D Gaussian Splatting

COMPASS: Robust Feature Conformal Prediction for Medical Segmentation Metrics

UFO-4D: Unposed Feedforward 4D Reconstruction from Two Images

D2^2GS: Depth-and-Density Guided Gaussian Splatting for Stable and Accurate Sparse-View Reconstruction

Post-hoc Probabilistic Vision-Language Models

Hyden: A Hybrid Dual-Path Encoder for Monocular Geometry of High-resolution Images

Secondary Motion-Aware 3D Clothed Gaussian Avatars from Monocular Videos

Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation

CoMem: Compositional Concept-Graph Memory for Vision–Language Adaptation

Delving into Spectral Clustering with Vision-Language Representations

Efficient Test-Time Scaling for Small Vision-Language Models

SURGE: Surprise-Guided Token Reduction for Efficient Video Understanding with VLMs

Beyond Text-to-Image: Liberating Generation with a Unified Discrete Diffusion Model

Omni-View: Unlocking How Generation Facilitates Understanding in Unified 3D Model based on Multiview images

Automatic Image-Level Morphological Trait Annotation for Organismal Images

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

Long-tailed Test-Time Adaptation for Vision-Language Models

Imitating the Truth: Attention-aware Truth-Guided Enhancement for Hallucination Mitigation in Large Vision-Language Models

EdgeCape: Edge Weight Prediction For Category-Agnostic Pose Estimation

Boosting Medical Visual Understanding From Multi-Granular Language Learning

pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models

Mordal: Automated Pretrained Model Selection for Vision Language Models

Reversible Primitive–Composition Alignment for Continual Vision–Language Learning

Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking

Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence

DaVinci: Reinforcing Visual-Structural Syntax in MLLMs for Generalized Scientific Diagram Parsing

The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss

To View Transform or Not to View Transform: NeRF-based Pre-training Perspective

Mitigating Hallucination in Vision-Language Model with Depth and Spatial-aware Key-Value Refinement

Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning

Uni-CoT: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

K-Prism: A Knowledge-Guided and Prompt Integrated Universal Medical Image Segmentation Model

Cross-Timestep: 3D Diffusion Model with Trans-temporal Memory LSTM and Adaptive Priori Decoding Strategy for Medical Segmentation

S3OD: Towards Generalizable Salient Object Detection with Synthetic Data

WOW-Seg: A Word-free Open World Segmentation Model

ASCIIEval: Benchmarking Models' Visual Perception in Text Strings via ASCII Art

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

FSOD-VFM: Few-Shot Object Detection with Vision Foundation Models and Graph Diffusion

DiVE-k: DIFFERENTIAL VISUAL REASONING FOR FINE-GRAINED IMAGE RECOGNITION

VisionLaw: Inferring Interpretable Intrinsic Dynamics from Visual Observations via Bilevel Optimization

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

3DSMT: A Hybrid Spiking Mamba-Transformer for Point Cloud Analysis

Point-Focused Attention Meets Context-Scan State Space: Robust Biological Visual Perception for Point Cloud Representation

Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images

Divergence-Free Neural Networks with Application to Image Denoising

OD3^3: Optimization-free Dataset Distillation for Object Detection

BioTamperNet: Affinity-Guided State-Space Model Detecting Tampered Biomedical Images

SPWOOD: Sparse Partial Weakly-Supervised Oriented Object Detection

Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification

Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning

Sample Reward Soups: Query-efficient Multi-Reward Guidance for Text-to-Image Diffusion Models

Diverse Text-to-Image Generation via Contrastive Noise Optimization

Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models

VPI-Bench: Visual Prompt Injection Attacks for Computer-Use Agents

CompMarkGS: Robust Watermarking for Compressed 3D Gaussian Splatting

Bilateral Information-aware Test-time Adaptation for Vision-Language Models

Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

MAVEN: A Mesh-Aware Volumetric Encoding Network for Simulating 3D Flexible Deformation

ArtVIP: Articulated Digital Assets of Visual Realism, Modular Interaction, and Physical Fidelity for Robot Learning

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

Flash-Mono: Feed-Forward Accelerated Gaussian Splatting Monocular SLAM

MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning

TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

HAMLET: Switch Your Vision-Language-Action Model into a History-Aware Policy

VITA: Vision-to-Action Flow Matching Policy

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

Unsupervised Learning of Efficient Exploration: Pre-training Adaptive Policies via Self-Imposed Goals

ViPO: Visual Preference Optimization at Scale

WMPO: World Model-based Policy Optimization for Vision-Language-Action Models

Latent Visual Reasoning

DispViT: Direct Stereo Disparity Regression with a Single-Stream Vision Transformer

Image Quality Assessment for Embodied AI

PCPO: Proportionate Credit Policy Optimization for Preference Alignment of Image Generation Models

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

WavePolyp: Video Polyp Segmentation via Hierarchical Wavelet-Based Feature Aggregation and Inter-Frame Divergence Perception

Tug-of-War No More: Harmonizing Accuracy and Robustness in Vision-Language Models via Stability-Aware Task Vector Merging

3DCS: Datasets and Benchmark for Evaluating Conformational Sensitivity in Molecular Representations

Only Brains Align with Brains: Cross-Region Alignment Patterns Expose Limits of Normative Models

Low-Pass Filtering Improves Behavioral Alignment of Vision Models

Bayesian Test-Time Adaptation via Dirichlet feature projection and GMM-Driven Inference for Motor Imagery EEG Decoding

Functional MRI Time Series Generation via Wavelet-Based Image Transform and Spectral Flow Matching for Brain Disorder Identification

Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction

No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning

2669. SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

  • Topics: Audio & Speech

Product of Experts for Visual Generation

Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning

OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning

Self-Improving Loops for Visual Robotic Planning

Enhancing Visual Token Representations for Video Large Language Models via Training-free Spatial-Temporal Pooling and Gridding

VaseVQA-3D: Benchmarking 3D VLMs on Ancient Greek Pottery

YoNoSplat: You Only Need One Model for Feedforward 3D Gaussian Splatting

WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark

ReLi3D: Relightable Multi-view 3D Reconstruction with Disentangled Illumination

Do 3D Large Language Models Really Understand 3D Spatial Relationships?

FaSTA*: Fast-Slow Toolpath Agent with Subroutine Mining for Efficient Multi-turn Image Editing

K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge

Object Fidelity Diffusion for Remote Sensing Image Generation

Next Visual Granularity Generation

MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning

SketchingReality: From Freehand Scene Sketches to Photorealistic Images

RefAny3D: 3D Asset-Referenced Diffusion Models for Image Generation

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

VINCIE: Unlocking In-context Image Editing from Video

DragFlow: Unleashing DiT Priors with Region-Based Supervision for Drag Editing

Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation

CLAP: Unsupervised 3D Representation Learning for Fusion 3D Perception via Curvature Sampling and Prototype Learning

DiffVax: Optimization-Free Image Immunization Against Diffusion-Based Editing

MotionWeaver: Holistic 4D-Anchored Framework for Multi-Humanoid Image Animation

Condition Errors Refinement in Autoregressive Image Generation with Diffusion Loss

Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing

MULTIMODALITY AS SUPERVISION: SELF-SUPERVISED SPECIALIZATION TO THE TEST ENVIRONMENT VIA MULTIMODALITY

MoCa: Modeling Object Consistency for 3D Camera Control in Video Generation

ACCORD: Alleviating Concept Coupling through Dependence Regularization for Text-to-Image Diffusion Personalization

From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation

reAR: Rethinking Visual Autoregressive Models via Token-wise Consistency Regularization

There and Back Again: On the relation between Noise and Image Inversions in Diffusion Models

LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution

Preserve and Personalize: Personalized Text-to-Image Diffusion Models without Distributional Drift

ReconViaGen: Towards Accurate Multi-view 3D Object Reconstruction via Generation

ComGS: Efficient 3D Object-Scene Composition via Surface Octahedral Probes

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

BigMaQ: A Big Macaque Motion and Animation Dataset Bridging Image and 3D Pose Representations

Direct Reward Fine-Tuning on Poses for Single Image to 3D Human in the Wild

Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing

MoE-GS: Mixture of Experts for Dynamic Gaussian Splatting

Beyond Visual Reconstruction Quality: Object Perception-aware 3D Gaussian Splatting for Autonomous Driving

PatchRefiner V2: Fast and Lightweight Real-Domain High-Resolution Metric Depth Estimation

CogniMap3D: Cognitive 3D Mapping and Rapid Retrieval

Rethinking Consistent Multi-Label Classification Under Inexact Supervision

SSD-GS: Scattering and Shadow Decomposition for Relightable 3D Gaussian Splatting

Open-Set Semantic Gaussian Splatting SLAM with Expandable Representation

Gradient-Direction-Aware Density Control for 3D Gaussian Splatting

DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

SAM-Veteran: An MLLM-Based Human-like SAM Agent for Reasoning Segmentation

Thicker and Quicker: The Jumbo Token for Fast Plain Vision Transformers

ViMo: A Generative Visual GUI World Model for App Agents

Demystifying Supervision Data Generalization in Multimodal LMs

Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations

ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models

HierLoc: Hyperbolic Entity Embeddings for Hierarchical Visual Geolocation

ExpVid: A Benchmark for Experiment Video Understanding & Reasoning

Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models

JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA

Part-X-MLLM: Part-aware 3D Multimodal Large Language Model

Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks

FakeXplain: AI-Generated Image Detection via Human-Aligned Grounded Reasoning

Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation

H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows

SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs

WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models

Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization

WebWatcher: Breaking New Frontiers of Vision-Language Deep Research Agent

AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions

Decomposed Attention Fusion in MLLMs for Training-free Video Reasoning Segmentation

TABLET: A Large-Scale Dataset for Robust Visual Table Understanding

SCoT: Teaching 3D-LLMs to Think Spatially with Million-scale CoT Annotations

VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration

IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning

CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos

FOCUS: Efficient Keyframe Selection for Long Video Understanding

OVSeg3R: Learn Open-vocabulary Instance Segmentation from 2D via 3D Reconstruction

Let's Split Up: Zero-Shot Classifier Edits for Fine-Grained Video Understanding

Interpretable 3D Neural Object Volumes for Robust Conceptual Reasoning

QueryStream: Advancing Streaming Video Understanding with Query-Aware Pruning and Proactive Response

Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment

UniRestorer: Universal Image Restoration via Adaptively Estimating Image Degradation at Proper Granularity

Parameterization-Based Dataset Distillation of 3D Point Clouds through Learnable Shape Morphing

CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation

Anime-Ready: Controllable 3D Anime Character Generation with Body-Aligned Component-Wise Garment Modeling

LiFR-Seg: Anytime High-Frame-Rate Segmentation via Event-Guided Propagation

DETR-ViP: Detection Transformer with Robust Discriminative Visual Prompts

VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip

WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction

Output Supervision Can Obfuscate the Chain of Thought

RelayFormer: A Unified Local-Global Attention Framework for Scalable Image and Video Manipulation Localization

Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs

VUDG: A Dataset for Video Understanding Domain Generalization

Block Recurrent Dynamics in Vision Transformers

Station2Radar: Query‑Conditioned Gaussian Splatting for Precipitation Field

DeepPrim: a Physics-Driven 3D Short-term Weather Forecaster via Primitive Equation Learning

PathChat-SegR1: Reasoning Segmentation in Pathology via SO-GRPO

P3D: Highly Scalable 3D Neural Surrogates for Physics Simulations with Global Context

OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning

FASTer: Toward Powerful and Efficient Autoregressive Vision–Language–Action Models with Learnable Action Tokenizer and Block-wise Decoding

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

Sparse Imagination for Efficient Visual World Model Planning

EquAct: An SE(3)-Equivariant Multi-Task Transformer for 3D Robotic Manipulation

CoNavBench: Collaborative Long-Horizon Vision-Language Navigation Benchmark

AsyncBEV: Cross-modal flow alignment in Asynchronous 3D Object Detection

3D-aware Disentangled Representation for Compositional Reinforcement Learning

Entropy Regularizing Activation: Boosting Continuous Control, Large Language Models, and Image Classification with Activation as Entropy Constraints

When would Vision-Proprioception Policies Fail in Robotic Manipulation?

PINFDiT: Energy-Based Physics-Informed Diffusion Transformers for General-purpose Time Series Tasks

Fracture-GS: Dynamic Fracture Simulation with Physics-Integrated Gaussian Splatting

Mobile-GS: Real-time Gaussian Splatting for Mobile Devices

Advancing Complex Video Object Segmentation via Progressive Concept Construction

PixelCraft: A Multi-Agent system for High-Fidelity Visual Reasoning on Structured Images

GoT-R1: Unleashing Reasoning Capability of Autoregressive Visual Generation with Reinforcement Learning

SigLIP-HD by Fine-to-Coarse Supervision

Zeros can be Informative: Masked Binary U-Net for Image Segmentation on Tensor Cores

Falcon: Fast Proximal Linearization of Normalized Cuts for Unsupervised Image Segmentation

TAVAE: A VAE with Adaptable Priors Explains Contextual Modulation in the Visual Cortex

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs

Local Success Does Not Compose: Benchmarking Large Language Models for Compositional Formal Verification

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

Urban Socio-Semantic Segmentation with Vision-Language Reasoning

Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models

Visual Compositional Tuning

Visual Prompt-Agnostic Evolution

Point-MoE: Large-Scale Multi-Dataset Training with Mixture-of-Experts for 3D Semantic Segmentation

Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models

AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization

Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation

InfoScan: Information-Efficient Visual Scanning via Resource-Adaptive Walks

EA3D: Event-Augmented 3D Diffusion for Generalizable Novel View Synthesis

SpikeGen: Decoupled “Rods and Cones” Visual Representation Processing with Latent Generative Framework

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models

PICS: Pairwise Image Compositing with Spatial Interactions

DistillKac: Few-Step Image Generation via Damped Wave Equations

Constantly Improving Image Models Need Constantly Improving Benchmarks

Temporal Slowness in Central Vision Drives Semantic Object Learning

MVAR: Visual Autoregressive Modeling with Scale and Spatial Markovian Conditioning

W-EDIT: A Wavelet-Based Frequency-Aware Framework for Text-Driven Image Editing

VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis

IC-Custom: Diverse Image Customization via In-Context Learning

Visual Autoregressive Modeling for Instruction-Guided Image Editing

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

PHyCLIP: ℓ1\ell_1-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning

VIRTUE: Visual-Interactive Text-Image Universal Embedder

Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis

Learning an Image Editing Model without Image Editing Pairs

RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning

EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling

PICABench: How Far are We from Physical Realistic Image Editing?

Enhanced Continual Learning of Vision-Language Models with Model Fusion

Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings

ReDDiT: Rehashing Noise for Discrete Visual Generation

Directional Textual Inversion for Personalized Text-to-Image Generation

GIR-Bench: Versatile Benchmark for Generating Images with Reasoning

FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction

ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing

Generalized Compressed Sensing for Image Reconstruction with Diffusion Probabilistic Models

3760. In-Context Learning of Temporal Point Processes with Foundation Inference Models

  • Topics: Efficiency & Compression

FieryGS: In-the-Wild Fire Synthesis with Physics-Integrated Gaussian Splatting

A Scene is Worth a Thousand Features: Feed-Forward Camera Localization from a Collection of Image Features

MEGS^2: Memory-Efficient Gaussian Splatting via Spherical Gaussians and Unified Pruning

StreamSplat: Towards Online Dynamic 3D Reconstruction from Uncalibrated Video Streams

DreamCS: Geometry-Aware Text-to-3D Generation with Unpaired 3D Reward Supervision

FastAvatar: Towards Unified and Fast 3D Avatar Reconstruction with Large Gaussian Reconstruction Transformers

Densemarks: Learning Canonical Embeddings for Human Heads Images via Point Tracks

Towards Physically Executable 3D Gaussian for Embodied Navigation

Distractor-free Generalizable 3D Gaussian Splatting

Neural Compression of 3D Meshes using Sparse Implicit Representation

ReSplat: Degradation-agnostic Feed-forward Gaussian Splatting via Self-guided Residual Diffusion

Color3D: Controllable and Consistent 3D Colorization with Personalized Colorizer

Teaching VLMs to Admit Uncertainty in OCR from Lossy Visual Inputs

Revisiting [CLS] and Patch Token Interaction in Vision Transformers

RAR: Reversing Visual Attention Re-Sinking for Unlocking Potential in Multimodal Large Language Models

ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations

VL-JEPA: Joint Embedding Predictive Architecture for Vision-language

Revisiting Multimodal Positional Encoding in Vision–Language Models

Towards Text-Mask Consistency in Medical Image Segmentation

Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions

Divid: Disentangled Spatial-Temporal Modeling within LLMs for Temporally Grounded Video Understanding

VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations

V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction

Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

A Training-Free Framework for Long Video Understanding via Video-Query-Options Similarity

Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes

MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites

ProxyThinker: Test-Time Guidance through Small Visual Reasoners

RayI2P: Learning Rays for Image-to-Point Cloud Registration

OmniCVR: A Benchmark for Omni-Composed Video Retrieval with Vision, Audio, and Text

PTNET: A PROPOSAL-CENTRIC TRANSFORMER NET- WORK FOR 3D OBJECT DETECTION

Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation

CircuitSense: A Hierarchical MLLM Benchmark Bridging Visual Comprehension and Symbolic Reasoning in Engineering Design Process

EventFlash: Towards Efficient MLLMs for Event-Based Vision

PAGE-4D: Disentangled Pose and Geometry Estimation for VGGT-4D Perception

Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

3D Aware Region Prompted Vision Language Model

Foundation Visual Encoders Are Secretly Few-Shot Anomaly Detectors

NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language

Plug, Play, and Fortify: A Low-Cost Module for Robust Multimodal Image Understanding Models

Language-guided Open-world Video Anomaly Detection under Weak Supervision

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models

VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning

PartSAM: A Scalable Promptable Part Segmentation Model Trained on Native 3D Data

Object-Centric Refinement for Enhanced Zero-Shot Segmentation

Adaptive Augmentation-Aware Latent Learning for Robust LiDAR Semantic Segmentation

Rethinking Model Calibration through Spectral Entropy Regularization in Medical Image Segmentation

GOOD: Geometry-guided Out-of-Distribution Modeling for Open-set Test-time Adaptation in Point Cloud Semantic Segmentation

Text-Aware Image Restoration with Diffusion Models

Pixel3DMM: Versatile Screen-Space Priors for Single-Image 3D Face Reconstruction

InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning

Learning Domain-Aware Task Prompt Representations for Multi-Domain All-in-One Image Restoration

Energy-oriented Diffusion Bridge for Image Restoration with Foundational Diffusion Models

DNOD: Deformable Neural Operators for Object Detection in SAR Images

3989. Reasoning Scaffolding: Distilling the Flow of Thought from LLMs

  • Topics: LLMs & Foundation Models

Autoregressive-based Progressive Coding for Ultra-Low Bitrate Image Compression

Transferable and Stealthy Adversarial Attacks on Large Vision-Language Models

Identifying Robust Neural Pathways: Few-Shot Adversarial Mask Tuning for Vision-Language Models

Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

Fed-Duet: Dual Expert-Orchestrated Framework for Continual Federated Vision-Language Learning

Composer: A Search Framework for Hybrid Neural Architecture Design

Naming to Learn: Class Incremental Learning for Vision-Language Model with Unlabeled Data

DRIFT: Decompose, Retrieve, Illustrate, then Formalize Theorems

Feature segregation by signed weights in artificial vision systems and biological models

PoseX: AI Defeats Physics-based Methods on Protein Ligand Cross-Docking

Training Dynamics of Learning 3D-Rotational Equivariance

4171. Explaining Grokking and Information Bottleneck through Neural Collapse Emergence

  • Topics: Interpretability & Mechanistic Interpretability, Theory & Deep Learning Theory

RIDER: 3D RNA Inverse Design with Reinforcement Learning-Guided Diffusion

CryoLVM: Self-supervised Learning from Cryo-EM Density Maps with Large Vision Models

Random Anchors with Low-rank Decorrelated Learning: A Minimalist Pipeline for Class-Incremental Medical Image Classification

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning

MedLesionVQA: A Multimodal Benchmark Emulating Clinical Visual Diagnosis for Body Surface Health

Search Self-Play: Pushing the Frontier of Agent Capability without Supervision

Robust Fine-tuning of Vision-Language-Action Robot Policies via Parameter Merging

All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation

M3^3E: Continual Vision-and-Language Navigation via Mixture of Macro and Micro Experts

VLMgineer: Vision-Language Models as Robotic Toolsmiths

Self-Improving Vision-Language-Action Models with Data Generation via Residual RL

VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing

Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance

Uncertainty-Aware Gaussian Map for Vision-Language Navigation

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-Language Navigation

Capturing Visual Environment Structure Correlates with Control Performance

Compositional Visual Planning via Inference-Time Diffusion Scaling

Scaling Large Vision-Language Model RL Training via Efficient Load Balancing

MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning

Efficient Degradation-agnostic Image Restoration via Channel-Wise Functional Decomposition and Manifold Regularization

How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images

SpatialHand: Generative Object Manipulation from 3D Prespective

The Human Brain as a Dynamic Mixture of Expert Models in Video Understanding

Towards Interpretable Visual Decoding with Attention to Brain Representations

CerebraGloss: Instruction-Tuning a Large Vision-Language Model for Fine-Grained Clinical EEG Interpretation

InclusiveVidPose: Bridging the Pose Estimation Gap for Individuals with Limb Deficiencies in Video-Based Motion

The Less You Depend, The More You Learn: Synthesizing Novel Views from Sparse, Unposed Images without Any 3D Knowledge

A Cognitive Process-Inspired Architecture for Subject-Agnostic Brain Visual Decoding

Rethinking Causal Mask Attention for Vision-Language Inference

BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment

CoDA: Agentic Systems for Collaborative Data Visualization

SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation

Deforming Videos to Masks: Flow Matching for Referring Video Segmentation

SynCoGen: Synthesizable 3D Molecule Generation via Joint Reaction and Coordinate Modeling

Reconciling Visual Perception and Generation in Diffusion Models

Disco: Densely-overlapping Cell Instance Segmentation via Adjacency-aware Collaborative Coloring

Visual Jigsaw Post-Training Improves MLLMs

Pyramid Patchification Flow for Visual Generation

On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations

Cross-Modal Redundancy and the Geometry of Vision–Language Embeddings

AttTok: Marrying Attribute Tokens with Generative Pre-trained Vision-Language Models towards Medical Image Understanding

SketchEvo: Leveraging Drawing Dynamics for Enhanced Image Synthesis

Consis-GCPO: Consistency-Preserving Group Causal Preference Optimization for Vision Customization

From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization

CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation

Cartridges: Lightweight and general-purpose long context representations via self-study

Group Critical-token Policy Optimization for Autoregressive Image Generation

Continuous Space-Time Video Super-Resolution with 3D Fourier Fields

Arbitrary-Shaped Image Generation via Spherical Neural Field Diffusion

Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

Unified 3D Scene Understanding Through Physical World Modeling

From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation

PI-Light: Physics-Inspired Diffusion for Full-Image Relighting

TIGaussian: Disentangle Gaussians for Spatial-Awared Text-Image-3D Alignment

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

RegionE: Adaptive Region-Aware Generation for Efficient Image Editing

SoftCFG: Uncertainty-guided Stable Guidance for Visual Autoregressive Model

FastGHA: Generalized Few-Shot 3D Gaussian Head Avatars with Real-Time Animation

CoDi: Subject-Consistent and Pose-Diverse Text-to-Image Generation

Latent Wavelet Diffusion For Ultra High-Resolution Image Synthesis

One-Step Flow for Image Super-Resolution with Tunable Fidelity-Realism Trade-offs

Disentangled Hierarchical VAE for 3D Human-Human Interaction Generation

Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed Individuals

Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts

Charts Are Not Images: On the Challenges of Scientific Chart Editing

Geometric Image Editing via Effects-Sensitive In-Context Inpainting with Diffusion Transformers

Retain and Adapt: Auto-Balanced Model Editing for Open-Vocabulary Object Detection under Domain Shifts

Aligned Novel View Image and Geometry Synthesis via Cross-modal Attention Instillation

CONSIGN: Conformal Segmentation Informed by Spatial Groupings via Decomposition

STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer

From Tokens to Nodes: Semantic-Guided Motion Control for Dynamic 3D Gaussian Splatting

Quantized Visual Geometry Grounded Transformer

ODE-GS: Latent ODEs for Dynamic Scene Extrapolation with 3D Gaussian Splatting

A^2TG: Adaptive Anisotropic Textured Gaussians for Efficient 3D Scene Representation

Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image

IncVGGT: Incremental VGGT for Memory-Bounded Long-Range 3D Reconstruction

3DGEER: 3D Gaussian Rendering Made Exact and Efficient for Generic Cameras

Streaming Visual Geometry Transformer

pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning

ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis

ViTSP: A Vision Language Models Guided Framework for Solving Large-Scale Traveling Salesman Problems

FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding

iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models

OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds

VGR: Visual Grounded Reasoning

Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models

More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models

UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding

WIMFRIS: WIndow Mamba Fusion and Parameter Efficient Tuning for Referring Image Segmentation

PoSh: Using Scene Graphs to Guide LLMs-as-a-Judge for Detailed Image Descriptions

Faster Vision Transformers with Adaptive Patches

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

Flatness Guided Test-Time Adaptation for Vision-Language Models

FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models

InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models

RegionReasoner: Region-Grounded Multi-Round Visual Reasoning

Knowledge Exchange with Confidence: Cost-Effective LLM Integration for Reliable and Efficient Visual Question Answering

VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

Efficient-SAM2: Accelerating SAM2 with Object-Aware Visual Encoding and Memory Retrieval

MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse

LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models

ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding

Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

Sequential Information Bottleneck Fusion: Towards Robust and Generalizable Multi-Modal Brain Tumor Segmentation

GeoPurify: A Data-Efficient Geometric Distillation Framework for Open-Vocabulary 3D Segmentation

Johnson-Lindenstrauss Lemma Guided Network for Efficient 3D Medical Segmentation

All Patches Matter, More Patches Better: Enhance AI-Generated Image Detection via Panoptic Patch Learning

HSIC Bottleneck for Cross-Generator and Domain-Incremental Synthetic Image Detection

Part-level Semantic-guided Contrastive Learning for Fine-grained Visual Classification

No Pixel Left Behind: A Detail-Preserving Architecture for Robust High-Resolution AI-Generated Image Detection

RestoreVAR: Visual Autoregressive Generation for All-in-One Image Restoration

LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale Diffusion Transformer

FARTrack: Fast Autoregressive Visual Tracking with High Performance

QuaMo: Quaternion Motions for Vision-based 3D Human Kinematics Capture

Fore-Mamba3D: Mamba-based Foreground-Enhanced Encoding for 3D Object Detection

Video Scene Segmentation with Genre and Duration Signals

RobustSpring: Benchmarking Robustness to Image Corruptions for Optical Flow, Scene Flow and Stereo

Self-Guided Low Light Object Detection Framework

Seeing Through the PRISM: Compound & Controllable Restoration of Scientific Images

Training-Free Reward-Guided Image Editing via Trajectory Optimal Control

CardioComposer: Leveraging Differentiable Geometry for Compositional Control of Anatomical Diffusion Models

Towards Scalable Oversight via Partitioned Human Supervision

SERUM: Simple, Efficient, Robust, and Unifying Marking for Diffusion-based Image Generation

Physics-Inspired All-Pair Interaction Learning for 3D Dynamics Modeling

VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models

Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models

Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots

A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models

CHAMMI-75: Pre-training multi-channel models with heterogeneous microscopy images

Exploiting Low-Dimensional Manifold of Features for Few-Shot Whole Slide Image Classification

PA3FF:Learning Part-Aware Dense 3D Feature Field For Generalizable Articulated Object Manipulation

Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation

Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints

SAGE: Spatial-visual Adaptive Graph Exploration for Efficient Visual Place Recognition

DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning

TAMMs: Change Understanding and Forecasting in Satellite Image Time Series with Temporal-Aware Multimodal Models

LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision

IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction

Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception

PreferThinker: Reasoning-based Personalized Image Preference Assessment

Repurposing Synthetic Data for Fine-grained Search Agent Supervision

StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models

A tale of two tails: Preferred and anti-preferred natural stimuli in visual cortex

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

Guidance Matters: Rethinking the Evaluation Pitfall for Text-to-Image Generation

Brain-IT: Image Reconstruction from fMRI via Brain-Interaction Transformer

MindPilot: Closed-loop Visual Stimulation Optimization for Brain Modulation with EEG-guided Diffusion

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties among Vision-Language Models

MICLIP: Learning to Interpret Representation in Vision Models

VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models

Mango-GS: Enhancing Spatio-Temporal Consistency in Dynamic Scenes Reconstruction using Multi-Frame Node-Guided 4D Gaussian Splatting

To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models

Test-Time Optimization of 3D Point Cloud LLM via Manifold-Aware In-Context Guidance and Refinement

A High Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation

SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling

Interleaving Reasoning for Better Text-to-Image Generation

Modeling the Density of Pixel-level Self-supervised Embeddings for Unsupervised Pathology Segmentation in Medical CT

EVLP: Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning

VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution

Can Vision–Language Models Assess Graphic Design Aesthetics? A Benchmark, Evaluation, and Dataset Perspective.

JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs