- Published on
CVPR 2026 — Low-Level Vision & Image Processing
Low-Level Vision & Image Processing
359 papers
1. White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation
- Link: Open Access
- arXiv: 2605.19613
2. An Efficient Token Compression Framework for Visual Object Tracking
- Link: Open Access
- arXiv: 2605.08329
3. SPEGC: Continual Test-Time Adaptation via Semantic-Prompt-Enhanced Graph Clustering for Medical Image Segmentation
- Link: Open Access
- arXiv: 2603.11492
4. OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancement
- Link: Open Access
- arXiv: 2603.26188
5. The Surprising Effectiveness of Noise Pretraining for Implicit Neural Representations
- Link: Open Access
- arXiv: 2603.29034
6. RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting
- Link: Open Access
- arXiv: 2605.18263
7. GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compression
- Link: Open Access
8. Polarization State Tracing for Reflection Removal and Color-Consistent Reconstruction
- Link: Open Access
9. Rectifying Latent Space for Generative Single-Image Reflection Removal
- Link: Open Access
- arXiv: 2512.06358
10. NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration
- Link: Open Access
- arXiv: 2601.09823
11. AstraNav-Memory: Contexts Compression for Long Memory
- Link: Open Access
- arXiv: 2512.21627
12. FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching
- Link: Open Access
13. Residual Diffusion Bridge Model for Image Restoration
- Link: Open Access
- arXiv: 2510.23116
14. Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments
- Link: Open Access
- arXiv: 2604.12625
15. MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting
- Link: Open Access
16. Leveraging Multispectral Sensors for Color Correction in Mobile Cameras
- Link: Open Access
- arXiv: 2512.08441
17. Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs
- Link: Open Access
18. Reflection Separation from a Single Image via Joint Latent Diffusion
- Link: Open Access
19. LuxRemix: Lighting Decomposition and Remixing for Indoor Scenes
- Link: Open Access
20. MMDIR: Multimodal Instruction-Driven Framework for Mixed-Degradation Document Image Restoration
- Link: Open Access
21. MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prior
- Link: Open Access
22. ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects
- Link: Open Access
- arXiv: 2603.24912
23. Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder
- Link: Open Access
- arXiv: 2512.12229
24. MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models
- Link: Open Access
25. MRI Contrast Enhancement Kinetics World Model
- Link: Open Access
- arXiv: 2602.19285
26. IR-HGP: Physically-Aware Gaussian Inverse Rendering for High-Illumination Scenes via Generative Priors
- Link: Open Access
27. Towards Generalized Representations for Low-Light Understanding: When Signal Constancy Meets Semantic Enrichment
- Link: Open Access
28. FedSDR: Federated Graph Learning with Structural Noise Detection and Reconstruction
- Link: Open Access
29. Retrieve-to-Restore: Efficient All-in-One Image Restoration with a Retrieval-Based Degradation Bank
- Link: Open Access
30. Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration
- Link: Open Access
31. Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
- Link: Open Access
- arXiv: 2511.19221
32. Perceptual Neural Video Compression with Color Separation and Rank Chain
- Link: Open Access
33. CoLoR: The Devil is in Scene Coordinate Regression for Large-Scale Visual Localization
- Link: Open Access
34. BHCast: Unlocking Black Hole Plasma Dynamics from a Single Blurry Image with Long-Term Forecasting
- Link: Open Access
- arXiv: 2603.26777
35. FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacement
- Link: Open Access
- arXiv: 2511.18346
36. REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
- Link: Open Access
- arXiv: 2511.13026
37. Probabilistic Discrepancy Learning for Roadside LiDAR Scene Completion
- Link: Open Access
38. FM-Steer: Enhance Generalist Policies with Value-Guided Cascaded Denoising
- Link: Open Access
39. Disco-GS: Gaussian Splatting in Dynamic Color Lighting
- Link: Open Access
40. Beyond the Static-World: Lifelong Learning for All-in-One Medical Image Restoration
- Link: Open Access
41. A Combination of Noise and Bilateral Filters Achieve Supralinear and Scalable Adversarial Robustness in CNNs
- Link: Open Access
42. Time Without Time: Pseudo-Temporal Representation for Space-Time Super-Resolution
- Link: Open Access
43. Language Does Matter for Cross-Domain Few-Shot Visual Feature Enhancement
- Link: Open Access
44. Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding
- Link: Open Access
- arXiv: 2512.10548
45. VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression
- Link: Open Access
- arXiv: 2512.15701
46. Unblur-SLAM: Dense Neural SLAM for Blurry Inputs
- Link: Open Access
- arXiv: 2603.26810
47. GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution
- Link: Open Access
- arXiv: 2603.16769
48. Diffusion-Based Native Adversarial Synthesis for Enhanced Medical Segmentation Generalization
- Link: Open Access
49. Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion
- Link: Open Access
- arXiv: 2604.05780
50. RawMetaDiff: Unlocking Extreme Darkness from Dual-Exposure RAW with Meta-Guided Diffusion
- Link: Open Access
51. FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution
- Link: Open Access
- arXiv: 2512.22647
52. CoLC: Communication-Efficient Collaborative Perception with LiDAR Completion
- Link: Open Access
- arXiv: 2603.00682
53. UDAPose: Unsupervised Domain Adaptation for Low-Light Human Pose Estimation
- Link: Open Access
- arXiv: 2604.10485
54. Physically Inspired Gaussian Splatting for HDR Novel View Synthesis
- Link: Open Access
- arXiv: 2603.28020
55. GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditions
- Link: Open Access
- arXiv: 2603.14789
56. Black-Box Domain Adaptation for Object Detection with Retention-Driven Knowledge Compression
- Link: Open Access
57. FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model
- Link: Open Access
- arXiv: 2512.09282
58. Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstruction
- Link: Open Access
- arXiv: 2604.15941
59. R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment
- Link: Open Access
- arXiv: 2603.10578
60. Discovering Adaptive Task Dependencies for Efficient Multi-Task Representation Compression
- Link: Open Access
61. MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
- Link: Open Access
- arXiv: 2605.22269
62. Towards High-resolution and Disentangled Reference-based Sketch Colorization
- Link: Open Access
- arXiv: 2603.05971
63. DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation
- Link: Open Access
- arXiv: 2602.22549
64. XPaintNet: An eXtreme Lightweight Framework for Stereoscopic Conversion without Inpainting Network
- Link: Open Access
65. TextOVSR: Text-Guided Real-World Opera Video Super-Resolution
- Link: Open Access
- arXiv: 2603.15153
66. 3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image
- Link: Open Access
- arXiv: 2604.04406
67. LiDAS: Lighting-driven Dynamic Active Sensing for Nighttime Perception
- Link: Open Access
68. MambaSIC: Mamba-based Stereo Image Compression with Bi-directional Multi-reference Entropy Model
- Link: Open Access
69. Adaptive Learned Image Compression with Graph Neural Networks
- Link: Open Access
- arXiv: 2603.25316
70. ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models
- Link: Open Access
- arXiv: 2605.11435
71. HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images
- Link: Open Access
- arXiv: 2603.02210
72. GFRRN: Explore the Gaps in Single Image Reflection Removal
- Link: Open Access
- arXiv: 2602.22695
73. ShreddingNet: Coarse-to-Fine Restoration for Multi-Source Shredded Manuscripts
- Link: Open Access
74. Differentiable Adaptive 4D Structured Illumination for Joint Capture of Shape and Reflectance
- Link: Open Access
- arXiv: 2605.06214
75. Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devices
- Link: Open Access
76. Clair Obscur: an Illumination-Aware Method for Real-World Image Vectorization
- Link: Open Access
- arXiv: 2511.20034
77. PhotoFramer: Multi-modal Image Composition Instruction
- Link: Open Access
- arXiv: 2512.00993
78. Unpaired Image Deraining Using Reward-Guided Self-Reinforcement Strategy
- Link: Open Access
- arXiv: 2605.00719
79. Image Guides Images: Consistent Video Amodal Completion with Rectified In-Context Exemplar Guidance
- Link: Open Access
80. HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation
- Link: Open Access
- arXiv: 2603.10128
81. ConsistCompose: Unified Multimodal Layout Control for Image Composition
- Link: Open Access
- arXiv: 2511.18333
82. Gyro-based Deep Video Deblurring
- Link: Open Access
83. Similarity-Consistent Likelihood Diffusion enables Hidden Person Detection from Wall Reflections
- Link: Open Access
84. CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning
- Link: Open Access
85. Adaptive Anisotropic Gaussian Splatting for Multi-contrast MRI Arbitrary-Scale Super-Resolution with Anatomy Guidance
- Link: Open Access
86. Rethinking Knowledge Transfer in Image Quality Assessment: A Perceptual Preference Structure Alignment Perspective
- Link: Open Access
87. Illumination-Consistent Human-Scene Reconstruction from Monocular Video
- Link: Open Access
88. CASR: A Robust Cyclic Framework for Arbitrary Large-Scale Super-Resolution with Distribution Alignment and Self-Similarity Awareness
- Link: Open Access
- arXiv: 2602.22159
89. SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
- Link: Open Access
- arXiv: 2512.22170
90. Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing
- Link: Open Access
- arXiv: 2603.22466
91. Label-Free Cross-Task LoRA Merging with Null-Space Compression
- Link: Open Access
- arXiv: 2603.26317
92. Bidirectional Normalizing Flow: From Data to Noise and Back
- Link: Open Access
- arXiv: 2512.10953
93. What Matters in Practical Learned Image Compression
- Link: Open Access
- arXiv: 2605.05148
94. UAVLight: A Benchmark for Illumination-Robust 3D Reconstruction in Unmanned Aerial Vehicle (UAV) Scenes
- Link: Open Access
- arXiv: 2511.21565
95. SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2512.02172
96. Unified Primitive Proxies for Structured Shape Completion
- Link: Open Access
- arXiv: 2601.00759
97. LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistency
- Link: Open Access
- arXiv: 2602.18735
98. COPE: Consistent Occlusion and Prompt Enhancement Network for Occluded Person Re-identification
- Link: Open Access
99. ReflexSplit: Single Image Reflection Separation via Layer Fusion-Separation
- Link: Open Access
- arXiv: 2601.17468
100. Shedding Light on VLN Robustness: A Black-box Framework for Indoor Lighting-based Adversarial Attack
- Link: Open Access
- arXiv: 2511.13132
101. LightMover: Generative Light Movement with Color and Intensity Controls
- Link: Open Access
- arXiv: 2603.27209
102. VoDaSuRe: A Large-Scale Dataset Revealing Domain Shift in Volumetric Super-Resolution
- Link: Open Access
103. TouchDream: 3D Object Completion through Imagined Touch
- Link: Open Access
104. eRetinexGS: Retinex Modeling for Low-Light Scene Enhancement via Event Streams and 3D Gaussian Splatting
- Link: Open Access
105. EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
- Link: Open Access
- arXiv: 2604.17087
106. CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
- Link: Open Access
- arXiv: 2512.19554
107. Event-based Motion Deblurring with Unpaired Data
- Link: Open Access
108. Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
- Link: Open Access
- arXiv: 2604.03653
109. Thermal Diffusion Matters: Infrared Spatial-Temporal Video Super-Resolution through Heat Conduction Priors
- Link: Open Access
110. TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion
- Link: Open Access
- arXiv: 2512.00300
111. Dual Band Thermal Videography: Separating Time-Varying Reflection and Emission Near Ambient Conditions
- Link: Open Access
- arXiv: 2509.11334
112. Time-Specialized Event-Image Alignment for Blur-to-Video Decomposition
- Link: Open Access
113. Bayesian Decomposition and Semantic Completion for Few-shot Semantic Segmentation
- Link: Open Access
114. STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction
- Link: Open Access
- arXiv: 2603.20284
115. UniRain: Unified Image Deraining with RAG-based Dataset Distillation and Multi-objective Reweighted Optimization
- Link: Open Access
- arXiv: 2603.03967
116. UniComp: Rethinking Video Compression Through Informational Uniqueness
- Link: Open Access
- arXiv: 2512.03575
117. Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generation
- Link: Open Access
118. Dual Graph Regularized Deep Unfolding Network for Guided Depth Map Super-resolution
- Link: Open Access
119. WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
- Link: Open Access
- arXiv: 2512.02536
120. NaTex: Seamless Texture Generation as Latent Color Diffusion
- Link: Open Access
- arXiv: 2511.16317
121. HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution
- Link: Open Access
- arXiv: 2511.13175
122. Suppressing Non-Semantic Noise in Masked Image Modeling Representations
- Link: Open Access
123. OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
- Link: Open Access
- arXiv: 2511.14582
124. DarkAct: A RGB-Thermal Dataset and Fusion Framework for Multimodal Low-Light Action Recognition
- Link: Open Access
125. ShadowDraw: From Any Object to Shadow-Drawing Compositional Art
- Link: Open Access
- arXiv: 2512.05110
126. Event-Illumination Collaborative Low-light Image Enhancement with a High-resolution Real-world Dataset
- Link: Open Access
- arXiv: 2605.22186
127. UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
- Link: Open Access
- arXiv: 2603.11320
128. CanonCGT: Reference-Based Color Grading via Canonical Pivot Representation
- Link: Open Access
129. Towards Unified Human Perception and Machine Understanding: Token Flow Guided Compression Framework
- Link: Open Access
130. Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
- Link: Open Access
- arXiv: 2507.07685
131. DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos
- Link: Open Access
- arXiv: 2604.12270
132. From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition
- Link: Open Access
- arXiv: 2511.20996
133. HOPS: Hierarchical Open-vocabulary Part Segmentation with Attention-Aware Filtering and Affinity-Guided Enhancement
- Link: Open Access
134. Zero-Shot Depth Completion with Vision-Language Model
- Link: Open Access
135. Rosetta Stone For Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generation
- Link: Open Access
136. FreqSIC: Frequency-aware Stereo Image Compression with Bi-directional Checkerboard Context Model
- Link: Open Access
137. Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
- Link: Open Access
- arXiv: 2512.00891
138. Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework
- Link: Open Access
- arXiv: 2604.02877
139. Restore, Assess, Repeat: A Unified Framework for Iterative Image Restoration
- Link: Open Access
- arXiv: 2603.26385
140. Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment
- Link: Open Access
141. Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection
- Link: Open Access
- arXiv: 2603.24030
142. DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution
- Link: Open Access
- arXiv: 2603.22271
143. OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective
- Link: Open Access
- arXiv: 2512.20770
144. Revisiting Learning with Noisy Labels: Active Forgetting and Noise Suppression
- Link: Open Access
145. SPE-MVS: Spatial Position Encoding Enhanced Multi-View Stereo with Monocular Depth Priors
- Link: Open Access
146. Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention
- Link: Open Access
- arXiv: 2603.21957
147. PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restoration
- Link: Open Access
148. PolarGuide-GSDR: 3D Gaussian Splatting Driven by Polarization Priors and Deferred Reflection for Real-World Reflective Scenes
- Link: Open Access
- arXiv: 2512.02664
149. Seeing Through the Noise: Improving Infrared Small Target Detection and Segmentation from Noise Suppression Perspective
- Link: Open Access
- arXiv: 2508.06878
150. SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation
- Link: Open Access
- arXiv: 2605.22658
151. CARD: Correlation Aware Restoration with Diffusion
- Link: Open Access
152. DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment
- Link: Open Access
- arXiv: 2603.22125
153. Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos
- Link: Open Access
- arXiv: 2603.00938
154. Spectral Super-Resolution via Adversarial Unfolding and Data-Driven Spectrum Regularization: From Multispectral Satellite Data to NASA Hyperspectral Image
- Link: Open Access
- arXiv: 2603.00920
155. VENI: Variational Encoder for Natural Illumination
- Link: Open Access
- arXiv: 2601.14079
156. Gradient Knows Best: Mixed-Precision Quantization via Gradient-Guided Bit Allocation for Super-Resolution
- Link: Open Access
157. DVAR: Dynamic Visual Autoregressive Modeling for Image Super-Resolution
- Link: Open Access
158. REVIVE 3D: Refinement via Encoded Voluminous Inflated prior for Volume Enhancement
- Link: Open Access
- arXiv: 2604.27504
159. Degradation-Consistent Test-Time Adaptation for All-in-One Image Restoration
- Link: Open Access
160. VOSR: A Vision-Only Generative Model for Image Super-Resolution
- Link: Open Access
- arXiv: 2604.03225
161. Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding
- Link: Open Access
- arXiv: 2601.07298
162. M^3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- Link: Open Access
163. EI-Part:Explode for Completion and Implode for Refinement
- Link: Open Access
- arXiv: 2603.14021
164. LaRP: Efficient Multi-View Inpainting with Latent Reprojection Priors
- Link: Open Access
165. UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression
- Link: Open Access
- arXiv: 2509.25934
166. Toward Real-world Infrared Image Super-Resolution: A Unified Autoregressive Framework and Benchmark Dataset
- Link: Open Access
- arXiv: 2603.04745
167. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- Link: Open Access
- arXiv: 2511.14152
168. ELVIS: Enhance Low-Light for Video Instance Segmentation in the Dark
- Link: Open Access
- arXiv: 2512.01495
169. HFR and HDR Video from Multi-Attenuated Spikes Using a Rapidly Rotating SpokeND Filter
- Link: Open Access
170. StreamingTOM: Streaming Token Compression for Efficient Video Understanding
- Link: Open Access
- arXiv: 2510.18269
171. Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization
- Link: Open Access
- arXiv: 2603.14750
172. VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation
- Link: Open Access
- arXiv: 2604.13596
173. X-Part: High Fidelity And Structure Coherent Shape Decomposition And Completion
- Link: Open Access
174. Learning Spatial-Temporal Consistency for 3D Semantic Scene Completion
- Link: Open Access
175. Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression
- Link: Open Access
- arXiv: 2603.27383
176. : Low-Light Dynamic Gaussian Splatting
- Link: Open Access
177. PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors
- Link: Open Access
- arXiv: 2601.17470
178. Global-Graph Guided and Local-Graph Weighted Contrastive Learning for Unified Clustering on Incomplete and Noise Multi-View Data
- Link: Open Access
- arXiv: 2512.21516
179. Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction
- Link: Open Access
- arXiv: 2605.14569
180. FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration
- Link: Open Access
- arXiv: 2511.14099
181. Self-supervised Dynamic Heterogeneous Degradation Modeling for Unified Zero-Shot Image Restoration
- Link: Open Access
182. Generative Diffusion Priors for 3D Mapping of the Dark Universe
- Link: Open Access
183. ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement
- Link: Open Access
- arXiv: 2512.13303
184. Hybrid Agents for Image Restoration
- Link: Open Access
- arXiv: 2503.10120
185. From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
- Link: Open Access
- arXiv: 2511.07738
186. AceTone: Bridging Words and Colors for Conditional Image Grading
- Link: Open Access
- arXiv: 2604.00530
187. A Supervised Multi-task Framework for Joint cryo-ET Restoration Enabled by Generative Physical Simulation
- Link: Open Access
188. Seeing through Light and Darkness: Sensor-Physics Grounded Deblurring HDR NeRF from Single-Exposure Images and Events
- Link: Open Access
- arXiv: 2601.15475
189. DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution
- Link: Open Access
190. CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning
- Link: Open Access
- arXiv: 2604.01634
191. PatchScene: Patch-based Voxel Diffusion Model for Large-Scale Scene Completion
- Link: Open Access
192. Lighting in Motion: Spatiotemporal HDR Lighting Estimation
- Link: Open Access
- arXiv: 2512.13597
193. AdaRadar: Rate Adaptive Spectral Compression for Radar-based Perception
- Link: Open Access
- arXiv: 2603.17979
194. Lighting-grounded Video Generation with Renderer-based Agent Reasoning
- Link: Open Access
- arXiv: 2604.07966
195. 2-Shots in the Dark: Low-Light Denoising with Minimal Data Acquisition
- Link: Open Access
196. UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
- Link: Open Access
- arXiv: 2512.06750
197. FastGaMer: Efficient GainMap Learning for Practical Inverse Tone Mapping
- Link: Open Access
198. NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darkness
- Link: Open Access
- arXiv: 2603.20005
199. Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression
- Link: Open Access
- arXiv: 2604.10546
200. ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval
- Link: Open Access
- arXiv: 2604.20358
201. Seeing Through Blur: Tackling Defocus in Spike-Based Imaging
- Link: Open Access
202. Dynamic Exposure Burst Image Restoration
- Link: Open Access
- arXiv: 2603.21784
203. Block-based Learned Image Compression without Blocking Artifacts
- Link: Open Access
204. FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution
- Link: Open Access
- arXiv: 2512.01390
205. VSRELL: A Simple Baseline for Video Super-Resolution and Enhancement in Low-Light Environment
- Link: Open Access
206. One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
- Link: Open Access
- arXiv: 2511.17138
207. ColorFLUX: A Structure-Color Decoupling Framework for Old Photo Colorization
- Link: Open Access
- arXiv: 2603.28162
208. Factorize, Reconstruct, Enhance: A Unified Framework for Multimodal Sentiment Analysis
- Link: Open Access
209. Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering
- Link: Open Access
210. EMR-Diff: Edge-aware Multimodal Residual Diffusion Model for Hyperspectral Image Super-resolution
- Link: Open Access
211. Lumosaic: Hyperspectral Video via Active Illumination and Coded-Exposure Pixels
- Link: Open Access
- arXiv: 2602.22140
212. TokenLight: Precise Lighting Control in Images using Attribute Tokens
- Link: Open Access
213. InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting
- Link: Open Access
- arXiv: 2603.23463
214. RAW-Domain Degradation Models for Realistic Smartphone Super-Resolution
- Link: Open Access
- arXiv: 2603.12493
215. DarkShake-DVS: Event-based Human Action Recognition under Low-light and Shaking Camera Conditions
- Link: Open Access
216. ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
- Link: Open Access
- arXiv: 2511.22625
217. PromptEnhancer: Taming Your Rewriter for Text-to-Image Generation via Fine-Grained Reward
- Link: Open Access
218. Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling
- Link: Open Access
219. Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors
- Link: Open Access
- arXiv: 2604.14563
220. ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation
- Link: Open Access
221. YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection
- Link: Open Access
- arXiv: 2512.23273
222. ApET: Approximation-Error Guided Token Compression for Efficient VLMs
- Link: Open Access
- arXiv: 2602.19870
223. Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models
- Link: Open Access
- arXiv: 2603.27558
224. See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
- Link: Open Access
225. Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
- Link: Open Access
226. LightRR: A Lightweight Network for Single Image Reflection Removal
- Link: Open Access
227. OMoBlur: An Object Motion Blur Dataset and Benchmark for Real-World Local Motion Deblurring
- Link: Open Access
228. Scan Clusters, Not Pixels: A Cluster-Centric Paradigm for Efficient Ultra-high-definition Image Restoration
- Link: Open Access
- arXiv: 2602.21917
229. UCAN: Unified Convolutional Attention Network for Expansive Receptive Fields in Lightweight Super-Resolution
- Link: Open Access
- arXiv: 2603.11680
230. Learning Latent Proxies for Controllable Single-Image Relighting
- Link: Open Access
- arXiv: 2603.15555
231. DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
- Link: Open Access
- arXiv: 2603.13162
232. DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer
- Link: Open Access
- arXiv: 2605.15682
233. PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis
- Link: Open Access
- arXiv: 2604.04576
234. Dark3R: Learning Structure from Motion in the Dark
- Link: Open Access
- arXiv: 2603.05330
235. ShiftLUT: Spatial Shift Enhanced Look-Up Tables for Efficient Image Restoration
- Link: Open Access
- arXiv: 2603.00906
236. Beyond the Ground Truth: Enhanced Supervision for Image Restoration
- Link: Open Access
- arXiv: 2512.03932
237. What Is It Like to Be a Noise? An Entropy-based Gaussian Noise Regularization for Diffusion Models
- Link: Open Access
238. HDR-VLM: HDR-Domain Adaptation of VLMs and Preference-Aligned Quality Assessment for HDR Video Color Grading
- Link: Open Access
239. Deconstructing the Failure of Ideal Noise Correction: A Three-Pillar Diagnosis
- Link: Open Access
- arXiv: 2603.12997
240. Temporal Representation Enhancement (TRE): Learning to Forget Dominant Patterns for Enhanced Temporal Spiking Features
- Link: Open Access
241. Dynamic Label Noise Suppression with Optimal Teacher Pool for Facial Expression Recognition
- Link: Open Access
242. It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models
- Link: Open Access
243. Generative Video Compression with One-Dimensional Latent Representation
- Link: Open Access
- arXiv: 2603.15302
244. Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency
- Link: Open Access
245. LRHDR: Learning Representation-enhanced HDR Video Reconstruction
- Link: Open Access
246. Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation
- Link: Open Access
- arXiv: 2603.05929
247. CADC: Content Adaptive Diffusion-Based Generative Image Compression
- Link: Open Access
- arXiv: 2602.21591
248. BoostSLT: Boosting Sign Language Translation via a Plug-and-Play Diffusion-Based Semantic Enhancer
- Link: Open Access
249. MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation
- Link: Open Access
250. Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement
- Link: Open Access
- arXiv: 2512.08535
251. Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
- Link: Open Access
- arXiv: 2510.21590
252. Beyond Ground-Truth: Leveraging Image Quality Priors for Real-World Image Restoration
- Link: Open Access
- arXiv: 2603.29773
253. Hybrid Token Compression for Vision-Language Models
- Link: Open Access
- arXiv: 2512.08240
254. LumiMotion: Improving Gaussian Relighting with Scene Dynamics
- Link: Open Access
255. STAR: Test-Time Adaptation Can Enhance Universal Prompt Learning for Vision-Language Models
- Link: Open Access
256. Enhancing Unregistered Hyperspectral Image Super-Resolution via Unmixing-based Abundance Fusion Learning
- Link: Open Access
- arXiv: 2603.07918
257. See Through the Noise: Improving Domain Generalization in Gaze Estimation
- Link: Open Access
- arXiv: 2604.16562
258. UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration
- Link: Open Access
- arXiv: 2507.23685
259. STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution
- Link: Open Access
- arXiv: 2511.18786
260. Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding
- Link: Open Access
- arXiv: 2603.15167
261. IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-Resolution
- Link: Open Access
262. MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality
- Link: Open Access
- arXiv: 2603.26071
263. Real-Time Neural Video Compression with Unified Intra and Inter Coding
- Link: Open Access
- arXiv: 2510.14431
264. UniLight: A Unified Representation for Lighting
- Link: Open Access
- arXiv: 2512.04267
265. Back to Basics: Let Denoising Generative Models Denoise
- Link: Open Access
- arXiv: 2511.13720
266. SDUIE: Semi-Supervised Diffusion for Underwater Image Enhancement with Quant-Text Dual Control
- Link: Open Access
267. Edge-Focused Super-Resolution for Omnidirectional Images with Spherical Geometric Augmentation
- Link: Open Access
268. Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression
- Link: Open Access
- arXiv: 2603.03615
269. Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
- Link: Open Access
- arXiv: 2604.08147
270. Hyper-PCN: Hypergraph-Based Point Cloud Completion via High-Order Correlation Modeling
- Link: Open Access
271. SketchRevive: Fine-Grained Pixel-to-Vector Sketch Completion with Diffusion-Prior-Guided Multimodal LLMs
- Link: Open Access
272. ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
- Link: Open Access
273. GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers
- Link: Open Access
- arXiv: 2604.20715
274. POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modeling
- Link: Open Access
- arXiv: 2512.13192
275. Bi-Bridge: Bidirectional Diffusion Bridges for Low-Light Image Enhancement
- Link: Open Access
276. SANER: Switchable Adapter with Non-parametric Enhanced Routing for Person De-Reidentification
- Link: Open Access
277. Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution
- Link: Open Access
- arXiv: 2508.16557
278. Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinex
- Link: Open Access
- arXiv: 2604.10359
279. Generative Neural Video Compression via Video Diffusion Prior
- Link: Open Access
- arXiv: 2512.05016
280. ELiC: Efficient LiDAR Geometry Compression via Cross-Bit-depth Feature Propagation and Bag-of-Encoders
- Link: Open Access
- arXiv: 2511.14070
281. Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning
- Link: Open Access
- arXiv: 2605.06092
282. Spatio-Temporal Difference Guided Motion Deblurring with the Complementary Vision Sensor
- Link: Open Access
- arXiv: 2604.10554
283. Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correction
- Link: Open Access
- arXiv: 2603.00149
284. GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation
- Link: Open Access
285. EarlyTom: Early Token Compression Completes Fast Video Understanding
- Link: Open Access
286. TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment
- Link: Open Access
- arXiv: 2604.12012
287. Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features
- Link: Open Access
- arXiv: 2511.16928
288. TANGO: Text-Anchored Guided Optimization for Robust Fine-tuning Vision-Language Models under Label Noise
- Link: Open Access
289. Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity
- Link: Open Access
- arXiv: 2603.10990
290. Physics-Guided Multistep Deformation Reversal for Ancient Bamboo Slip Restoration
- Link: Open Access
291. Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors
- Link: Open Access
292. Learned Image Compression via Sparse Attention and Adaptive Frequency
- Link: Open Access
293. BluRef: Unsupervised Image Deblurring with Dense-Matching References
- Link: Open Access
- arXiv: 2603.14176
294. IrisFP: Adversarial-Example-based Model Fingerprinting with Enhanced Uniqueness and Robustness
- Link: Open Access
- arXiv: 2603.24996
295. ExpoCM: Exposure-Aware One-Step Generative Single-Image HDR Reconstruction
- Link: Open Access
- arXiv: 2605.02464
296. DNF-SR: Dual-Input and Negative-Aware Feature Fine-Tuning for Real-World Image Super-Resolution
- Link: Open Access
297. Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Framework
- Link: Open Access
- arXiv: 2604.13994
298. Color-Encoded Illumination for High-Speed Volumetric Scene Reconstruction
- Link: Open Access
- arXiv: 2604.26920
299. Nonlinear Color Transfer via Learnable Bezier Flows
- Link: Open Access
300. Motion-Aware Animatable Gaussian Avatars Deblurring
- Link: Open Access
- arXiv: 2411.16758
301. Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution
- Link: Open Access
- arXiv: 2512.14061
302. OLATverse: A Large-scale Real-world Object Dataset with Precise Lighting Control
- Link: Open Access
- arXiv: 2511.02483
303. FedMOP: Achieving Enhanced Privacy and Performance in Federated Learning via Momentum Orthogonal Projection
- Link: Open Access
304. Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization
- Link: Open Access
- arXiv: 2605.08054
305. SR3R: Rethinking Super-Resolution 3D Reconstruction With Feed-Forward Gaussian Splatting
- Link: Open Access
- arXiv: 2602.24020
306. AdaSFormer: Adaptive Serialized Transformers for Monocular Semantic Scene Completion from Indoor Environments
- Link: Open Access
- arXiv: 2603.25494
307. EfficientVPR: Toward Efficient Visual Place Recognition via Scene-Aware Prompt Tuning and Adaptive Feature Enhancement
- Link: Open Access
308. Relightable Holoported Characters: Capturing and Relighting Dynamic Human Performance from Sparse Views
- Link: Open Access
- arXiv: 2512.00255
309. Denoise and Align: Towards Source-Free UDA for Robust Panoramic Semantic Segmentation
- Link: Open Access
- arXiv: 2603.25131
310. Compressed-Domain-Aware Online Video Super-Resolution
- Link: Open Access
- arXiv: 2603.07694
311. Noise-Aware Few-Shot Learning through Bi-directional Multi-View Prompt Alignment
- Link: Open Access
- arXiv: 2603.11617
312. Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis
- Link: Open Access
- arXiv: 2604.12518
313. FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution
- Link: Open Access
- arXiv: 2603.02692
314. Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detection
- Link: Open Access
- arXiv: 2512.17514
315. BiEvLight: Bi-level Learning of Task-Aware Event Refinement for Low-Light Image Enhancement
- Link: Open Access
- arXiv: 2603.04975
316. Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach
- Link: Open Access
- arXiv: 2511.16786
317. Simple but Effective Triplet-Based Compression Strategies for Compact Visual Localization
- Link: Open Access
318. AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
- Link: Open Access
- arXiv: 2605.07308
319. Smoothing the Score Function to Enhance Generalization in Diffusion Models
- Link: Open Access
320. HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restoration
- Link: Open Access
- arXiv: 2512.03345
321. F^2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modeling
- Link: Open Access
322. mmWaveFlow: Unified Enhancement and Generation of mmWave Human Point Clouds
- Link: Open Access
323. Bridging the Perception Gap in Image Super-Resolution Evaluation
- Link: Open Access
- arXiv: 2503.13074
324. Ultra-Fast Neural Video Compression
- Link: Open Access
325. EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decompositio
- Link: Open Access
326. IEBGL:An Interpretability-Enhanced Brain Graph Learning Framework with LLM-Instructed Topology and Literature-Augmented Semantics
- Link: Open Access
327. DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer
- Link: Open Access
328. Convexity-Aware Noise Calibration: A Self-Supervised Framework for Noise-Level-Unknown Image Denoising
- Link: Open Access
329. Large-scale Robust Enhanced Ensemble Clustering via Outlier Decoupling
- Link: Open Access
330. Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representations
- Link: Open Access
331. Taming Noise-Induced Prototype Degradation for Privacy-Preserving Personalized Federated Fine-Tuning
- Link: Open Access
- arXiv: 2604.27833
332. Disentangled Textual Priors for Diffusion-based Image Super-Resolution
- Link: Open Access
- arXiv: 2603.07430
333. TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution
- Link: Open Access
334. BiGain: Unified Token Compression for Joint Generation and Classification
- Link: Open Access
- arXiv: 2603.12240
335. EthoCLIP: Ontology-Enhanced Video-Language Pretraining for Animal Behavior Understanding
- Link: Open Access
336. RL-ScanIQA: Reinforcement-Learned Scanpaths for Blind 360deg Image Quality Assessment
- Link: Open Access
337. TrajTok: Learning Trajectory Tokens Enhances Video Understanding
- Link: Open Access
338. IAFMNet: Information-Aware Feature Modulation for Efficient Super-Resolution
- Link: Open Access
339. FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolution
- Link: Open Access
- arXiv: 2510.12747
340. UCMNet: Uncertainty-Aware Context Memory Network for Under-Display Camera Image Restoration
- Link: Open Access
- arXiv: 2604.00381
341. Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation
- Link: Open Access
- arXiv: 2602.03595
342. Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection
- Link: Open Access
- arXiv: 2509.03113
343. VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions
- Link: Open Access
- arXiv: 2603.23495
344. Distributed Image Compression with Multimodal Side Information at Extremely Low Bitrates
- Link: Open Access
- arXiv: 2605.22061
345. SunFaded: Illumination-Aware Gaussian Splatting for Dark Scenes with Camera-Mounted Active Lighting
- Link: Open Access
346. PHAC: Promptable Human Amodal Completion
- Link: Open Access
- arXiv: 2603.14741
347. Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Models
- Link: Open Access
- arXiv: 2507.18534
348. Adapting In-context Generation for Enhanced Composed Image Retrieval
- Link: Open Access
349. CoD: A Diffusion Foundation Model for Image Compression
- Link: Open Access
- arXiv: 2511.18706
350. Benchmarking Endoscopic Surgical Image Restoration and Beyond
- Link: Open Access
- arXiv: 2505.19161
351. Multi-modal Frequency Decomposition Network for Semantic Scene Completion
- Link: Open Access
352. Language-Guided One-Step Diffusion Model for Nighttime Flare Removal
- Link: Open Access
353. EpiAgent: An Agent-Centric System for Ancient Inscription Restoration
- Link: Open Access
- arXiv: 2604.09367
354. Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning
- Link: Open Access
- arXiv: 2603.04870
355. Alert-CLIP: Abnormality-aware Latent-Enhanced Representation Tuning of CLIP for Video Anomaly Detection
- Link: Open Access
356. MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition
- Link: Open Access
- arXiv: 2512.07348
357. PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusion
- Link: Open Access
358. SelfHVD: Self-Supervised Handheld Video Deblurring
- Link: Open Access
- arXiv: 2508.08605
359. Life-IQA: Boosting Blind Image Quality Assessment through GCN-enhanced Layer Interaction and MoE-based Feature Decoupling
- Link: Open Access