R
Published on

CVPR 2026 — Low-Level Vision & Image Processing

Low-Level Vision & Image Processing

359 papers

1. White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation

2. An Efficient Token Compression Framework for Visual Object Tracking

3. SPEGC: Continual Test-Time Adaptation via Semantic-Prompt-Enhanced Graph Clustering for Medical Image Segmentation

4. OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancement

5. The Surprising Effectiveness of Noise Pretraining for Implicit Neural Representations

6. RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting

7. GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compression

8. Polarization State Tracing for Reflection Removal and Color-Consistent Reconstruction

9. Rectifying Latent Space for Generative Single-Image Reflection Removal

10. NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration

11. AstraNav-Memory: Contexts Compression for Long Memory

12. FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching

13. Residual Diffusion Bridge Model for Image Restoration

14. Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments

15. MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting

16. Leveraging Multispectral Sensors for Color Correction in Mobile Cameras

17. Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs

18. Reflection Separation from a Single Image via Joint Latent Diffusion

19. LuxRemix: Lighting Decomposition and Remixing for Indoor Scenes

20. MMDIR: Multimodal Instruction-Driven Framework for Mixed-Degradation Document Image Restoration

21. MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prior

22. ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects

23. Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder

24. MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

25. MRI Contrast Enhancement Kinetics World Model

26. IR-HGP: Physically-Aware Gaussian Inverse Rendering for High-Illumination Scenes via Generative Priors

27. Towards Generalized Representations for Low-Light Understanding: When Signal Constancy Meets Semantic Enrichment

28. FedSDR: Federated Graph Learning with Structural Noise Detection and Reconstruction

29. Retrieve-to-Restore: Efficient All-in-One Image Restoration with a Retrieval-Based Degradation Bank

30. Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration

31. Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving

32. Perceptual Neural Video Compression with Color Separation and Rank Chain

33. CoLoR: The Devil is in Scene Coordinate Regression for Large-Scale Visual Localization

34. BHCast: Unlocking Black Hole Plasma Dynamics from a Single Blurry Image with Long-Term Forecasting

35. FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacement

36. REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding

37. Probabilistic Discrepancy Learning for Roadside LiDAR Scene Completion

38. FM-Steer: Enhance Generalist Policies with Value-Guided Cascaded Denoising

39. Disco-GS: Gaussian Splatting in Dynamic Color Lighting

40. Beyond the Static-World: Lifelong Learning for All-in-One Medical Image Restoration

41. A Combination of Noise and Bilateral Filters Achieve Supralinear and Scalable Adversarial Robustness in CNNs

42. Time Without Time: Pseudo-Temporal Representation for Space-Time Super-Resolution

43. Language Does Matter for Cross-Domain Few-Shot Visual Feature Enhancement

45. VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

46. Unblur-SLAM: Dense Neural SLAM for Blurry Inputs

47. GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution

48. Diffusion-Based Native Adversarial Synthesis for Enhanced Medical Segmentation Generalization

49. Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion

50. RawMetaDiff: Unlocking Extreme Darkness from Dual-Exposure RAW with Meta-Guided Diffusion

51. FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution

52. CoLC: Communication-Efficient Collaborative Perception with LiDAR Completion

53. UDAPose: Unsupervised Domain Adaptation for Low-Light Human Pose Estimation

54. Physically Inspired Gaussian Splatting for HDR Novel View Synthesis

55. GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditions

56. Black-Box Domain Adaptation for Object Detection with Retention-Driven Knowledge Compression

57. FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model

58. Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstruction

59. R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment

60. Discovering Adaptive Task Dependencies for Efficient Multi-Task Representation Compression

61. MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering

62. Towards High-resolution and Disentangled Reference-based Sketch Colorization

63. DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation

64. XPaintNet: An eXtreme Lightweight Framework for Stereoscopic Conversion without Inpainting Network

65. TextOVSR: Text-Guided Real-World Opera Video Super-Resolution

66. 3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image

67. LiDAS: Lighting-driven Dynamic Active Sensing for Nighttime Perception

68. MambaSIC: Mamba-based Stereo Image Compression with Bi-directional Multi-reference Entropy Model

69. Adaptive Learned Image Compression with Graph Neural Networks

70. ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models

71. HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images

72. GFRRN: Explore the Gaps in Single Image Reflection Removal

73. ShreddingNet: Coarse-to-Fine Restoration for Multi-Source Shredded Manuscripts

74. Differentiable Adaptive 4D Structured Illumination for Joint Capture of Shape and Reflectance

75. Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devices

76. Clair Obscur: an Illumination-Aware Method for Real-World Image Vectorization

77. PhotoFramer: Multi-modal Image Composition Instruction

78. Unpaired Image Deraining Using Reward-Guided Self-Reinforcement Strategy

79. Image Guides Images: Consistent Video Amodal Completion with Rectified In-Context Exemplar Guidance

80. HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation

81. ConsistCompose: Unified Multimodal Layout Control for Image Composition

82. Gyro-based Deep Video Deblurring

83. Similarity-Consistent Likelihood Diffusion enables Hidden Person Detection from Wall Reflections

84. CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning

85. Adaptive Anisotropic Gaussian Splatting for Multi-contrast MRI Arbitrary-Scale Super-Resolution with Anatomy Guidance

86. Rethinking Knowledge Transfer in Image Quality Assessment: A Perceptual Preference Structure Alignment Perspective

87. Illumination-Consistent Human-Scene Reconstruction from Monocular Video

88. CASR: A Robust Cyclic Framework for Arbitrary Large-Scale Super-Resolution with Distribution Alignment and Self-Similarity Awareness

89. SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

90. Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing

91. Label-Free Cross-Task LoRA Merging with Null-Space Compression

92. Bidirectional Normalizing Flow: From Data to Noise and Back

93. What Matters in Practical Learned Image Compression

94. UAVLight: A Benchmark for Illumination-Robust 3D Reconstruction in Unmanned Aerial Vehicle (UAV) Scenes

95. SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting

96. Unified Primitive Proxies for Structured Shape Completion

97. LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistency

98. COPE: Consistent Occlusion and Prompt Enhancement Network for Occluded Person Re-identification

99. ReflexSplit: Single Image Reflection Separation via Layer Fusion-Separation

100. Shedding Light on VLN Robustness: A Black-box Framework for Indoor Lighting-based Adversarial Attack

101. LightMover: Generative Light Movement with Color and Intensity Controls

102. VoDaSuRe: A Large-Scale Dataset Revealing Domain Shift in Volumetric Super-Resolution

103. TouchDream: 3D Object Completion through Imagined Touch

104. eRetinexGS: Retinex Modeling for Low-Light Scene Enhancement via Event Streams and 3D Gaussian Splatting

105. EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling

106. CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning

107. Event-based Motion Deblurring with Unpaired Data

108. Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

109. Thermal Diffusion Matters: Infrared Spatial-Temporal Video Super-Resolution through Heat Conduction Priors

110. TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion

111. Dual Band Thermal Videography: Separating Time-Varying Reflection and Emission Near Ambient Conditions

112. Time-Specialized Event-Image Alignment for Blur-to-Video Decomposition

113. Bayesian Decomposition and Semantic Completion for Few-shot Semantic Segmentation

114. STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction

115. UniRain: Unified Image Deraining with RAG-based Dataset Distillation and Multi-objective Reweighted Optimization

116. UniComp: Rethinking Video Compression Through Informational Uniqueness

117. Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generation

118. Dual Graph Regularized Deep Unfolding Network for Guided Depth Map Super-resolution

119. WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

120. NaTex: Seamless Texture Generation as Latent Color Diffusion

121. HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution

122. Suppressing Non-Semantic Noise in Masked Image Modeling Representations

123. OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models

124. DarkAct: A RGB-Thermal Dataset and Fusion Framework for Multimodal Low-Light Action Recognition

125. ShadowDraw: From Any Object to Shadow-Drawing Compositional Art

126. Event-Illumination Collaborative Low-light Image Enhancement with a High-resolution Real-world Dataset

127. UniCompress: Token Compression for Unified Vision-Language Understanding and Generation

128. CanonCGT: Reference-Based Color Grading via Canonical Pivot Representation

129. Towards Unified Human Perception and Machine Understanding: Token Flow Guided Compression Framework

130. Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought

131. DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos

132. From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition

133. HOPS: Hierarchical Open-vocabulary Part Segmentation with Attention-Aware Filtering and Affinity-Guided Enhancement

134. Zero-Shot Depth Completion with Vision-Language Model

135. Rosetta Stone For Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generation

136. FreqSIC: Frequency-aware Stereo Image Compression with Bi-directional Checkerboard Context Model

137. Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

138. Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework

139. Restore, Assess, Repeat: A Unified Framework for Iterative Image Restoration

140. Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment

141. Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

142. DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution

143. OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective

144. Revisiting Learning with Noisy Labels: Active Forgetting and Noise Suppression

145. SPE-MVS: Spatial Position Encoding Enhanced Multi-View Stereo with Monocular Depth Priors

146. Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

147. PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restoration

148. PolarGuide-GSDR: 3D Gaussian Splatting Driven by Polarization Priors and Deferred Reflection for Real-World Reflective Scenes

149. Seeing Through the Noise: Improving Infrared Small Target Detection and Segmentation from Noise Suppression Perspective

150. SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation

151. CARD: Correlation Aware Restoration with Diffusion

152. DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

153. Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos

154. Spectral Super-Resolution via Adversarial Unfolding and Data-Driven Spectrum Regularization: From Multispectral Satellite Data to NASA Hyperspectral Image

155. VENI: Variational Encoder for Natural Illumination

156. Gradient Knows Best: Mixed-Precision Quantization via Gradient-Guided Bit Allocation for Super-Resolution

157. DVAR: Dynamic Visual Autoregressive Modeling for Image Super-Resolution

158. REVIVE 3D: Refinement via Encoded Voluminous Inflated prior for Volume Enhancement

159. Degradation-Consistent Test-Time Adaptation for All-in-One Image Restoration

160. VOSR: A Vision-Only Generative Model for Image Super-Resolution

161. Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

162. M^3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

163. EI-Part:Explode for Completion and Implode for Refinement

164. LaRP: Efficient Multi-View Inpainting with Latent Reprojection Priors

165. UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression

166. Toward Real-world Infrared Image Super-Resolution: A Unified Autoregressive Framework and Benchmark Dataset

167. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion

168. ELVIS: Enhance Low-Light for Video Instance Segmentation in the Dark

169. HFR and HDR Video from Multi-Attenuated Spikes Using a Rapidly Rotating SpokeND Filter

170. StreamingTOM: Streaming Token Compression for Efficient Video Understanding

171. Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization

172. VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation

173. X-Part: High Fidelity And Structure Coherent Shape Decomposition And Completion

174. Learning Spatial-Temporal Consistency for 3D Semantic Scene Completion

175. Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression

176. L2DGSL^{2}DGS: Low-Light Dynamic Gaussian Splatting

177. PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors

178. Global-Graph Guided and Local-Graph Weighted Contrastive Learning for Unified Clustering on Incomplete and Noise Multi-View Data

179. Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction

180. FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration

181. Self-supervised Dynamic Heterogeneous Degradation Modeling for Unified Zero-Shot Image Restoration

182. Generative Diffusion Priors for 3D Mapping of the Dark Universe

183. ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

184. Hybrid Agents for Image Restoration

185. From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training

186. AceTone: Bridging Words and Colors for Conditional Image Grading

187. A Supervised Multi-task Framework for Joint cryo-ET Restoration Enabled by Generative Physical Simulation

188. Seeing through Light and Darkness: Sensor-Physics Grounded Deblurring HDR NeRF from Single-Exposure Images and Events

189. DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution

190. CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

191. PatchScene: Patch-based Voxel Diffusion Model for Large-Scale Scene Completion

192. Lighting in Motion: Spatiotemporal HDR Lighting Estimation

193. AdaRadar: Rate Adaptive Spectral Compression for Radar-based Perception

194. Lighting-grounded Video Generation with Renderer-based Agent Reasoning

195. 2-Shots in the Dark: Low-Light Denoising with Minimal Data Acquisition

196. UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement

197. FastGaMer: Efficient GainMap Learning for Practical Inverse Tone Mapping

198. NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darkness

199. Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression

200. ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval

201. Seeing Through Blur: Tackling Defocus in Spike-Based Imaging

202. Dynamic Exposure Burst Image Restoration

203. Block-based Learned Image Compression without Blocking Artifacts

204. FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution

205. VSRELL: A Simple Baseline for Video Super-Resolution and Enhancement in Low-Light Environment

206. One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution

207. ColorFLUX: A Structure-Color Decoupling Framework for Old Photo Colorization

208. Factorize, Reconstruct, Enhance: A Unified Framework for Multimodal Sentiment Analysis

209. Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering

210. EMR-Diff: Edge-aware Multimodal Residual Diffusion Model for Hyperspectral Image Super-resolution

211. Lumosaic: Hyperspectral Video via Active Illumination and Coded-Exposure Pixels

212. TokenLight: Precise Lighting Control in Images using Attribute Tokens

213. InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting

214. RAW-Domain Degradation Models for Realistic Smartphone Super-Resolution

215. DarkShake-DVS: Event-based Human Action Recognition under Low-light and Shaking Camera Conditions

216. ReasonEdit: Towards Reasoning-Enhanced Image Editing Models

217. PromptEnhancer: Taming Your Rewriter for Text-to-Image Generation via Fine-Grained Reward

218. Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling

219. Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors

220. ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation

221. YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection

222. ApET: Approximation-Error Guided Token Compression for Efficient VLMs

223. Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

224. See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

225. Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

226. LightRR: A Lightweight Network for Single Image Reflection Removal

227. OMoBlur: An Object Motion Blur Dataset and Benchmark for Real-World Local Motion Deblurring

228. Scan Clusters, Not Pixels: A Cluster-Centric Paradigm for Efficient Ultra-high-definition Image Restoration

229. UCAN: Unified Convolutional Attention Network for Expansive Receptive Fields in Lightweight Super-Resolution

230. Learning Latent Proxies for Controllable Single-Image Relighting

231. DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression

232. DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer

233. PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis

234. Dark3R: Learning Structure from Motion in the Dark

235. ShiftLUT: Spatial Shift Enhanced Look-Up Tables for Efficient Image Restoration

236. Beyond the Ground Truth: Enhanced Supervision for Image Restoration

237. What Is It Like to Be a Noise? An Entropy-based Gaussian Noise Regularization for Diffusion Models

238. HDR-VLM: HDR-Domain Adaptation of VLMs and Preference-Aligned Quality Assessment for HDR Video Color Grading

239. Deconstructing the Failure of Ideal Noise Correction: A Three-Pillar Diagnosis

240. Temporal Representation Enhancement (TRE): Learning to Forget Dominant Patterns for Enhanced Temporal Spiking Features

241. Dynamic Label Noise Suppression with Optimal Teacher Pool for Facial Expression Recognition

242. It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models

243. Generative Video Compression with One-Dimensional Latent Representation

244. Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency

245. LRHDR: Learning Representation-enhanced HDR Video Reconstruction

246. Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation

247. CADC: Content Adaptive Diffusion-Based Generative Image Compression

248. BoostSLT: Boosting Sign Language Translation via a Plug-and-Play Diffusion-Based Semantic Enhancer

249. MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation

250. Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement

251. Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance

252. Beyond Ground-Truth: Leveraging Image Quality Priors for Real-World Image Restoration

253. Hybrid Token Compression for Vision-Language Models

254. LumiMotion: Improving Gaussian Relighting with Scene Dynamics

255. STAR: Test-Time Adaptation Can Enhance Universal Prompt Learning for Vision-Language Models

256. Enhancing Unregistered Hyperspectral Image Super-Resolution via Unmixing-based Abundance Fusion Learning

257. See Through the Noise: Improving Domain Generalization in Gaze Estimation

258. UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration

259. STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

260. Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding

261. IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-Resolution

262. MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality

263. Real-Time Neural Video Compression with Unified Intra and Inter Coding

264. UniLight: A Unified Representation for Lighting

265. Back to Basics: Let Denoising Generative Models Denoise

266. SDUIE: Semi-Supervised Diffusion for Underwater Image Enhancement with Quant-Text Dual Control

267. Edge-Focused Super-Resolution for Omnidirectional Images with Spherical Geometric Augmentation

268. Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression

269. Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning

270. Hyper-PCN: Hypergraph-Based Point Cloud Completion via High-Order Correlation Modeling

271. SketchRevive: Fine-Grained Pixel-to-Vector Sketch Completion with Diffusion-Prior-Guided Multimodal LLMs

272. ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

273. GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

274. POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modeling

275. Bi-Bridge: Bidirectional Diffusion Bridges for Low-Light Image Enhancement

276. SANER: Switchable Adapter with Non-parametric Enhanced Routing for Person De-Reidentification

277. Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution

278. Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinex

279. Generative Neural Video Compression via Video Diffusion Prior

280. ELiC: Efficient LiDAR Geometry Compression via Cross-Bit-depth Feature Propagation and Bag-of-Encoders

281. Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning

282. Spatio-Temporal Difference Guided Motion Deblurring with the Complementary Vision Sensor

283. Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correction

284. GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation

285. EarlyTom: Early Token Compression Completes Fast Video Understanding

286. TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

287. Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features

288. TANGO: Text-Anchored Guided Optimization for Robust Fine-tuning Vision-Language Models under Label Noise

289. Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity

290. Physics-Guided Multistep Deformation Reversal for Ancient Bamboo Slip Restoration

291. Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

292. Learned Image Compression via Sparse Attention and Adaptive Frequency

293. BluRef: Unsupervised Image Deblurring with Dense-Matching References

294. IrisFP: Adversarial-Example-based Model Fingerprinting with Enhanced Uniqueness and Robustness

295. ExpoCM: Exposure-Aware One-Step Generative Single-Image HDR Reconstruction

296. DNF-SR: Dual-Input and Negative-Aware Feature Fine-Tuning for Real-World Image Super-Resolution

297. Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Framework

298. Color-Encoded Illumination for High-Speed Volumetric Scene Reconstruction

299. Nonlinear Color Transfer via Learnable Bezier Flows

300. Motion-Aware Animatable Gaussian Avatars Deblurring

301. Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution

302. OLATverse: A Large-scale Real-world Object Dataset with Precise Lighting Control

303. FedMOP: Achieving Enhanced Privacy and Performance in Federated Learning via Momentum Orthogonal Projection

304. Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization

305. SR3R: Rethinking Super-Resolution 3D Reconstruction With Feed-Forward Gaussian Splatting

306. AdaSFormer: Adaptive Serialized Transformers for Monocular Semantic Scene Completion from Indoor Environments

307. EfficientVPR: Toward Efficient Visual Place Recognition via Scene-Aware Prompt Tuning and Adaptive Feature Enhancement

308. Relightable Holoported Characters: Capturing and Relighting Dynamic Human Performance from Sparse Views

309. Denoise and Align: Towards Source-Free UDA for Robust Panoramic Semantic Segmentation

310. Compressed-Domain-Aware Online Video Super-Resolution

311. Noise-Aware Few-Shot Learning through Bi-directional Multi-View Prompt Alignment

312. Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis

313. FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution

314. Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detection

315. BiEvLight: Bi-level Learning of Task-Aware Event Refinement for Low-Light Image Enhancement

316. Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach

317. Simple but Effective Triplet-Based Compression Strategies for Compact Visual Localization

318. AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models

319. Smoothing the Score Function to Enhance Generalization in Diffusion Models

320. HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restoration

321. F^2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modeling

322. mmWaveFlow: Unified Enhancement and Generation of mmWave Human Point Clouds

323. Bridging the Perception Gap in Image Super-Resolution Evaluation

324. Ultra-Fast Neural Video Compression

325. EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decompositio

326. IEBGL:An Interpretability-Enhanced Brain Graph Learning Framework with LLM-Instructed Topology and Literature-Augmented Semantics

327. DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer

328. Convexity-Aware Noise Calibration: A Self-Supervised Framework for Noise-Level-Unknown Image Denoising

329. Large-scale Robust Enhanced Ensemble Clustering via Outlier Decoupling

330. Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representations

331. Taming Noise-Induced Prototype Degradation for Privacy-Preserving Personalized Federated Fine-Tuning

332. Disentangled Textual Priors for Diffusion-based Image Super-Resolution

333. TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution

334. BiGain: Unified Token Compression for Joint Generation and Classification

335. EthoCLIP: Ontology-Enhanced Video-Language Pretraining for Animal Behavior Understanding

336. RL-ScanIQA: Reinforcement-Learned Scanpaths for Blind 360deg Image Quality Assessment

337. TrajTok: Learning Trajectory Tokens Enhances Video Understanding

338. IAFMNet: Information-Aware Feature Modulation for Efficient Super-Resolution

339. FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolution

340. UCMNet: Uncertainty-Aware Context Memory Network for Under-Display Camera Image Restoration

341. Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation

342. Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection

343. VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions

344. Distributed Image Compression with Multimodal Side Information at Extremely Low Bitrates

345. SunFaded: Illumination-Aware Gaussian Splatting for Dark Scenes with Camera-Mounted Active Lighting

346. PHAC: Promptable Human Amodal Completion

347. Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Models

348. Adapting In-context Generation for Enhanced Composed Image Retrieval

349. CoD: A Diffusion Foundation Model for Image Compression

350. Benchmarking Endoscopic Surgical Image Restoration and Beyond

351. Multi-modal Frequency Decomposition Network for Semantic Scene Completion

352. Language-Guided One-Step Diffusion Model for Nighttime Flare Removal

353. EpiAgent: An Agent-Centric System for Ancient Inscription Restoration

354. Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning

355. Alert-CLIP: Abnormality-aware Latent-Enhanced Representation Tuning of CLIP for Video Anomaly Detection

356. MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition

357. PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusion

358. SelfHVD: Self-Supervised Handheld Video Deblurring

359. Life-IQA: Boosting Blind Image Quality Assessment through GCN-enhanced Layer Interaction and MoE-based Feature Decoupling