- Published on
CVPR 2026 — Diffusion Models
Diffusion Models
397 papers
1. Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models
- Link: Open Access
- arXiv: 2604.09227
2. Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Models
- Link: Open Access
- arXiv: 2604.16481
3. Ultra Diffusion Poser: Diffusion-Based Human Motion Tracking from Sparse Inertial Sensors and Ranging-based Between-sensor Distances
- Link: Open Access
4. Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning
- Link: Open Access
- arXiv: 2512.24146
5. VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery
- Link: Open Access
- arXiv: 2602.19180
6. AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion
- Link: Open Access
- arXiv: 2604.17818
7. Accelerating Diffusion via Hybrid Data-Pipeline Parallelism Based on Conditional Guidance Scheduling
- Link: Open Access
- arXiv: 2602.21760
8. StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
- Link: Open Access
- arXiv: 2512.22065
9. LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
- Link: Open Access
- arXiv: 2505.16933
10. When Local Rules Create Global Order: Self-Organized Representation Learning for Latent Diffusion Models
- Link: Open Access
11. MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer
- Link: Open Access
12. Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning
- Link: Open Access
- arXiv: 2505.20107
13. Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
- Link: Open Access
- arXiv: 2512.16615
14. FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching
- Link: Open Access
15. Residual Diffusion Bridge Model for Image Restoration
- Link: Open Access
- arXiv: 2510.23116
16. I'm a Map! Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers
- Link: Open Access
17. GeoRK2: Geometry-Guided Runge-Kutta Integration for Diffusion Transformer Acceleration
- Link: Open Access
18. Reflection Separation from a Single Image via Joint Latent Diffusion
- Link: Open Access
19. Guiding a Diffusion Transformer with the Internal Dynamics of Itself
- Link: Open Access
- arXiv: 2512.24176
20. MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prior
- Link: Open Access
21. Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework
- Link: Open Access
- arXiv: 2605.07429
22. Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers
- Link: Open Access
- arXiv: 2601.14959
23. Coordinate Denoising for Non-Equilibrium Molecular Representation Learning
- Link: Open Access
24. Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching
- Link: Open Access
- arXiv: 2604.18623
25. A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- Link: Open Access
- arXiv: 2511.19004
26. MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models
- Link: Open Access
27. GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
- Link: Open Access
- arXiv: 2511.18729
28. Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers
- Link: Open Access
- arXiv: 2603.05769
29. Pantheon360: Taming Digital Twin Generation via 3D-Aware 360deg Video Diffusion
- Link: Open Access
30. Correspondence-Attention Alignment for Multi-View Diffusion Models
- Link: Open Access
- arXiv: 2512.03045
31. MotionHiFlow: Text-to-Motion via Hierarchical Flow Matching
- Link: Open Access
- arXiv: 2604.23264
32. Semantic-Adaptive Diffusion for Dynamic Spatiotemporal Fusion
- Link: Open Access
33. Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration
- Link: Open Access
34. BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers
- Link: Open Access
- arXiv: 2603.09582
35. One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers
- Link: Open Access
36. ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization
- Link: Open Access
- arXiv: 2602.19575
37. FM-Steer: Enhance Generalist Policies with Value-Guided Cascaded Denoising
- Link: Open Access
38. FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation
- Link: Open Access
- arXiv: 2512.03520
39. Splatent: Splatting Diffusion Latents for Novel View Synthesis
- Link: Open Access
40. Diffusion-Based Native Adversarial Synthesis for Enhanced Medical Segmentation Generalization
- Link: Open Access
41. SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers
- Link: Open Access
- arXiv: 2604.01826
42. GenErase: Generalizable and Semantically-Aware Concept Erasure in Diffusion Models
- Link: Open Access
43. RawMetaDiff: Unlocking Extreme Darkness from Dual-Exposure RAW with Meta-Guided Diffusion
- Link: Open Access
44. C-LaV: Conditional Latent Velocity Field Denoising for Weather-Robust LiDAR Place Recognition
- Link: Open Access
45. MatMart: Material Reconstruction of 3D Objects via Diffusion
- Link: Open Access
- arXiv: 2511.18900
46. SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models
- Link: Open Access
- arXiv: 2507.12156
47. DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching
- Link: Open Access
- arXiv: 2602.05449
48. DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation
- Link: Open Access
- arXiv: 2602.23165
49. 3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion
- Link: Open Access
- arXiv: 2511.19117
50. Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
- Link: Open Access
- arXiv: 2512.00677
51. Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation
- Link: Open Access
- arXiv: 2603.04803
52. Towards Human-Imperceptible Backdoor Attacks on Text-to-Image Diffusion Models
- Link: Open Access
53. ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control
- Link: Open Access
54. Occluded Human Body Capture with Frequency Domain Denoising Prior
- Link: Open Access
55. MaxMark: High-Capacity Diffusion-Native Watermarking via Robust and Invertible Latent Embedding
- Link: Open Access
56. CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance
- Link: Open Access
- arXiv: 2603.03281
57. FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs
- Link: Open Access
58. Towards an Incremental Unified Multimodal Anomaly Detection: Augmenting Multimodal Denoising From an Information Bottleneck Perspective
- Link: Open Access
- arXiv: 2603.02629
59. DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers
- Link: Open Access
- arXiv: 2602.16968
60. DiffusionFF: A Diffusion-based Framework for Joint Face Forgery Detection and Fine-Grained Artifact Localization
- Link: Open Access
- arXiv: 2508.01873
61. Diffusion Guided Chain-of-Vision for Large Autoregressive Vision Models
- Link: Open Access
62. Stable Mean Flow: Lyapunov-Inspired One-Step Flow Matching
- Link: Open Access
63. Heterogeneous Decentralized Diffusion Models
- Link: Open Access
- arXiv: 2603.06741
64. Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
- Link: Open Access
- arXiv: 2512.00961
65. GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matching
- Link: Open Access
66. DMGD: Train-Free Dataset Distillation with Semantic-Distribution Matching in Diffusion Models
- Link: Open Access
- arXiv: 2605.03877
67. DRM: Diffusion-based Reward Model With Step-wise Guidance
- Link: Open Access
68. Diff4Splat: Repurposing Video Diffusion Models for Dynamic Scene Generation
- Link: Open Access
69. Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
- Link: Open Access
- arXiv: 2512.07480
70. ManifoldGD: Training-Free Hierarchical Manifold Guidance for Diffusion-Based Dataset Distillation
- Link: Open Access
- arXiv: 2602.23295
71. Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
- Link: Open Access
- arXiv: 2604.05497
72. ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models
- Link: Open Access
- arXiv: 2605.11435
73. FUSER: Feed-Forward Multiview 3D Registration Transformer and SE(3) Diffusion Refinement
- Link: Open Access
- arXiv: 2512.09373
74. Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devices
- Link: Open Access
75. MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation
- Link: Open Access
- arXiv: 2603.29029
76. COT-FM: Cluster-wise Optimal Transport Flow Matching
- Link: Open Access
- arXiv: 2603.13395
77. LF-BVN: Blind-View Network for Self-Supervised Light Field Denoising
- Link: Open Access
78. Test-time Sparsity for Extreme Fast Action Diffusion
- Link: Open Access
- arXiv: 2605.13316
79. Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression
- Link: Open Access
- arXiv: 2603.10470
80. Similarity-Consistent Likelihood Diffusion enables Hidden Person Detection from Wall Reflections
- Link: Open Access
81. Frequency-Aware Flow Matching for High-Quality Image Generation
- Link: Open Access
- arXiv: 2604.15521
82. LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models
- Link: Open Access
- arXiv: 2605.19729
83. Region-Adaptive Sampling for Diffusion Transformers
- Link: Open Access
- arXiv: 2502.10389
84. DABO: Difficulty-Aware Bayesian Optimization with Diffusion-Learned Priors
- Link: Open Access
85. Advancing Image Classification with Discrete Diffusion Classification Modeling
- Link: Open Access
86. CoopDiff: A Diffusion-Guided Approach for Cooperation under Corruptions
- Link: Open Access
- arXiv: 2603.01688
87. VMonarch: Efficient Video Diffusion Transformers with Structured Attention
- Link: Open Access
- arXiv: 2601.22275
88. Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking
- Link: Open Access
89. SignPR: A Progressive Vector-Quantized Diffusion Framework for Sign Language Production
- Link: Open Access
90. PureProof: Diffusion-Resistant Black-box Targeted Attack on Large Vision-Language Models
- Link: Open Access
91. MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation
- Link: Open Access
- arXiv: 2502.01572
92. Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping
- Link: Open Access
- arXiv: 2603.20755
93. DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers
- Link: Open Access
- arXiv: 2505.21541
94. Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
- Link: Open Access
- arXiv: 2604.03653
95. EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation
- Link: Open Access
- arXiv: 2604.01421
96. Thermal Diffusion Matters: Infrared Spatial-Temporal Video Super-Resolution through Heat Conduction Priors
- Link: Open Access
97. Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features
- Link: Open Access
- arXiv: 2603.20012
98. GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
- Link: Open Access
- arXiv: 2510.22319
99. Efficient Weighted Sampling via Score-based Generative Models
- Link: Open Access
100. Reasoning Diffusion for Unpaired Test Time Out-of-distribution Text-Image to Video Generation
- Link: Open Access
101. ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models
- Link: Open Access
- arXiv: 2602.12640
102. Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers
- Link: Open Access
- arXiv: 2511.16156
103. Dual Ascent Diffusion for Inverse Problems
- Link: Open Access
- arXiv: 2505.17353
104. AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis
- Link: Open Access
- arXiv: 2603.08021
105. MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation
- Link: Open Access
106. Streaming Diffusion Model for Fast Infrared and Visible Video Fusion
- Link: Open Access
107. WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
- Link: Open Access
- arXiv: 2512.02536
108. NaTex: Seamless Texture Generation as Latent Color Diffusion
- Link: Open Access
- arXiv: 2511.16317
109. PhyOceanCast: Global Ocean Forecasting with Physics-Informed Diffusion
- Link: Open Access
110. SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching
- Link: Open Access
- arXiv: 2602.24208
111. HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution
- Link: Open Access
- arXiv: 2511.13175
112. Self-Diffusion Driven Blind Imaging
- Link: Open Access
- arXiv: 2510.27439
113. Delta Rectified Flow Sampling for Text-to-Image Editing
- Link: Open Access
- arXiv: 2509.05342
114. Zero-Shot Image Denoising via Hybrid Prior-Guided Pseudo Sample Generation
- Link: Open Access
115. Training-free Mixed-Resolution Latent Upsampling for Spatially Accelerated Diffusion Transformers
- Link: Open Access
- arXiv: 2507.08422
116. InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models
- Link: Open Access
- arXiv: 2504.05662
117. Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping
- Link: Open Access
- arXiv: 2601.15288
118. Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
- Link: Open Access
- arXiv: 2511.18281
119. Few-shot Acoustic Synthesis with Multimodal Flow Matching
- Link: Open Access
- arXiv: 2603.19176
120. Anatomica: Localized Control over Geometric and Topological Properties for Anatomical Diffusion Models
- Link: Open Access
- arXiv: 2511.20587
121. D-FOSA: Dual-Diffusion Guided EEG-to-Image Reconstruction with Frequency-Oriented Semantic Alignment
- Link: Open Access
122. Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimation
- Link: Open Access
- arXiv: 2603.16340
123. L3DR: 3D-aware LiDAR Diffusion and Rectification
- Link: Open Access
- arXiv: 2602.19064
124. Semantic Derivative Flow: Graph-Guided Diffusion for Controllable Instance Interactions
- Link: Open Access
125. Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment
- Link: Open Access
126. DRiffusion: Draft-and-Refine Process Parallelizes Diffusion Models with Ease
- Link: Open Access
- arXiv: 2603.25872
127. PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning
- Link: Open Access
- arXiv: 2601.12901
128. Unifying Precise Keyframes and Semantic Control via Multi-level Diffusion
- Link: Open Access
129. DiffuView: Multi-View Diffusion Pretraining for 3D Aware Robotic Manipulation
- Link: Open Access
130. Learning from Noisy Supervision: A Denoising-Debiasing Framework for Weakly Supervised Video Anomaly Detection
- Link: Open Access
131. CG-Floor: Centroid-Guided Diffusion for Large-Scale Floorplan Generation
- Link: Open Access
132. Guiding a Diffusion Model by Swapping Its Tokens
- Link: Open Access
- arXiv: 2604.08048
133. Next-Scale Prediction: A Self-Supervised Approach for Real-World Image Denoising
- Link: Open Access
- arXiv: 2512.21038
134. When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models
- Link: Open Access
- arXiv: 2604.08546
135. Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers
- Link: Open Access
- arXiv: 2604.21592
136. CARD: Correlation Aware Restoration with Diffusion
- Link: Open Access
137. DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment
- Link: Open Access
- arXiv: 2603.22125
138. Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Diffusion Transformers
- Link: Open Access
139. Exploring Conditions for Diffusion Models in Robotic Control
- Link: Open Access
- arXiv: 2510.15510
140. SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models
- Link: Open Access
- arXiv: 2602.18993
141. Prototype-Guided Concept Erasure in Diffusion Models
- Link: Open Access
- arXiv: 2603.08271
142. HSI-GPT2: A Dual-Granularity Large Motion Reasoning Model with Diffusion Refinement for Human-Scene Interaction
- Link: Open Access
143. InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior
- Link: Open Access
- arXiv: 2511.14208
144. All-in-One Slider for Attribute Manipulation in Diffusion Models
- Link: Open Access
- arXiv: 2508.19195
145. GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusion
- Link: Open Access
- arXiv: 2602.22862
146. ProcessMaker: A Generalized Process Visualization Framework with Adaptive Sequence Steps on Diffusion Transformers
- Link: Open Access
147. NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers
- Link: Open Access
- arXiv: 2503.09242
148. PoseD-Flow: Versatile and Guided Flow Matching Model of Human Pose
- Link: Open Access
149. Masked-Diffusion Autoencoders for 3D Medical Vision Representation Learning
- Link: Open Access
150. Flow Matching for Multimodal Distributions
- Link: Open Access
151. InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- Link: Open Access
- arXiv: 2512.07410
152. From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolution
- Link: Open Access
- arXiv: 2601.07462
153. TAlignDiff: Automatic Tooth Alignment assisted by Diffusion-based Transformation Learning
- Link: Open Access
- arXiv: 2508.04565
154. LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
- Link: Open Access
- arXiv: 2508.01617
155. MicroFM: Physics-guided Flow Matching for Isotropic Microscopy Reconstruction
- Link: Open Access
156. Flowception: Temporally Expansive Flow Matching for Video Generation
- Link: Open Access
- arXiv: 2512.11438
157. Steering Where to Diffuse: Generative Modeling of Phenotypic Response Simulation with Steered Diffusion Bridge
- Link: Open Access
158. UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching
- Link: Open Access
159. Unsupervised Multi-Scale Segmentation of 3D Subcellular World with Stable Diffusion Foundation Model
- Link: Open Access
160. LiDAR-to-4DRadar Diffusion Bridge via Cross-Modal Alignment and Translation in Latent Space
- Link: Open Access
161. GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
- Link: Open Access
- arXiv: 2512.02505
162. Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
- Link: Open Access
- arXiv: 2603.26211
163. PAD-Hand: Physics-Aware Diffusion for Hand Motion Recovery
- Link: Open Access
- arXiv: 2603.26068
164. Rethinking Visual Rearrangement from A Diffusion Perspective
- Link: Open Access
165. Unsupervised Monocular 3D Keypoint Discovery from Multi-View Diffusion Priors
- Link: Open Access
- arXiv: 2507.12336
166. WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- Link: Open Access
- arXiv: 2512.06112
167. Unified Number-Free Text-to-Motion Generation Via Flow Matching
- Link: Open Access
- arXiv: 2603.27040
168. Learning to Learn Weight Generation via Local Consistency Diffusion
- Link: Open Access
- arXiv: 2502.01117
169. Generative Diffusion Priors for 3D Mapping of the Dark Universe
- Link: Open Access
170. Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study
- Link: Open Access
- arXiv: 2605.09622
171. High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning
- Link: Open Access
- arXiv: 2503.22179
172. PixelDiT: Pixel Diffusion Transformers for Image Generation
- Link: Open Access
- arXiv: 2511.20645
173. Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?
- Link: Open Access
- arXiv: 2605.15855
174. Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models
- Link: Open Access
175. Nestwork: Conditional 3D Furnished House Layout Generation through Latent Heterogeneous Graph Diffusion
- Link: Open Access
176. PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
- Link: Open Access
- arXiv: 2511.18801
177. DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution
- Link: Open Access
178. PatchScene: Patch-based Voxel Diffusion Model for Large-Scale Scene Completion
- Link: Open Access
179. BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation
- Link: Open Access
180. MMCP-GEN: A Modality-Extensible Diffusion Language Model for Conditional Protein Sequence Generation
- Link: Open Access
181. IMS3: Breaking Distributional Aggregation in Diffusion-Based Dataset Distillation
- Link: Open Access
- arXiv: 2603.13960
182. Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers
- Link: Open Access
- arXiv: 2601.06338
183. 2-Shots in the Dark: Low-Light Denoising with Minimal Data Acquisition
- Link: Open Access
184. MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations
- Link: Open Access
- arXiv: 2602.18792
185. EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Head
- Link: Open Access
186. OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery
- Link: Open Access
- arXiv: 2603.27645
187. NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darkness
- Link: Open Access
- arXiv: 2603.20005
188. VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale
- Link: Open Access
- arXiv: 2604.12159
189. Spatial-Spectral Residuals Informed Diffusion Neural Operator for Pan-sharpening
- Link: Open Access
190. Your Latent Mask is Wrong: Pixel-Equivalent Latent Compositing for Diffusion Models
- Link: Open Access
- arXiv: 2512.05198
191. FMPose3D: monocular 3D pose estimation via flow matching
- Link: Open Access
- arXiv: 2602.05755
192. FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution
- Link: Open Access
- arXiv: 2512.01390
193. One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
- Link: Open Access
- arXiv: 2511.17138
194. SpotEdit: Selective Region Editing in Diffusion Transformers
- Link: Open Access
- arXiv: 2512.22323
195. DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis
- Link: Open Access
- arXiv: 2602.23022
196. LeapAlign: Post-training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories
- Link: Open Access
- arXiv: 2604.15311
197. EMR-Diff: Edge-aware Multimodal Residual Diffusion Model for Hyperspectral Image Super-resolution
- Link: Open Access
198. VDFE: Difference-Aware 3D Scene Editing with Non-Intrusive Video Diffusion Priors for Multi-View Consistency and Efficiency
- Link: Open Access
199. InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting
- Link: Open Access
- arXiv: 2603.23463
200. Pixel Motion Diffusion is What We Need for Robot Control
- Link: Open Access
- arXiv: 2509.22652
201. Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models
- Link: Open Access
- arXiv: 2603.25994
202. Probabilistic Precipitation Nowcasting with Rectified Flow Transformers
- Link: Open Access
203. When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance
- Link: Open Access
- arXiv: 2602.20880
204. Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning
- Link: Open Access
205. GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping
- Link: Open Access
206. Beyond Missing Modalities: Hypergraph Conditioned Diffusion for Uncertainty-Aware Multimodal Emotion Recognition
- Link: Open Access
207. DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
- Link: Open Access
- arXiv: 2603.13162
208. DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer
- Link: Open Access
- arXiv: 2605.15682
209. PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis
- Link: Open Access
- arXiv: 2604.04576
210. From Events to Clarity: The Event-Guided Diffusion Framework for Dehazing
- Link: Open Access
- arXiv: 2511.11944
211. Visual Diffusion Models are Geometric Solvers
- Link: Open Access
- arXiv: 2510.21697
212. Image Diffusion Preview with Consistency Solver
- Link: Open Access
- arXiv: 2512.13592
213. Efficient and Training-Free Single-Image Diffusion Models
- Link: Open Access
214. Reviving ConvNeXt for Efficient Convolutional Diffusion Models
- Link: Open Access
- arXiv: 2603.09408
215. ReCoFuse: Ultra-Robust Image Fusion via Restorative Multi-Modal Diffusion Reciprocal Coupling
- Link: Open Access
216. The Drift Kernel: Why Diffusion Models Change Even When Told Not To
- Link: Open Access
217. Accelerating Autoregressive Video Diffusion via History-Guided Cache and Residual Correction
- Link: Open Access
218. Personalized Federated Training of Diffusion Models with Privacy Guarantees
- Link: Open Access
219. What Is It Like to Be a Noise? An Entropy-based Gaussian Noise Regularization for Diffusion Models
- Link: Open Access
220. DDT: Decoupled Diffusion Transformer
- Link: Open Access
- arXiv: 2504.05741
221. Structure-to-Intensity Diffusion for Adverse-Weather LiDAR Generation
- Link: Open Access
222. DeltaQuant: 4-bit Video Diffusion Models with Spatiotemporal Delta Smoothing
- Link: Open Access
223. Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU Parallelism
- Link: Open Access
224. VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation
- Link: Open Access
225. HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
- Link: Open Access
- arXiv: 2511.19965
226. PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories
- Link: Open Access
227. ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers
- Link: Open Access
- arXiv: 2601.04342
228. PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion
- Link: Open Access
- arXiv: 2602.12769
229. It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models
- Link: Open Access
230. Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation
- Link: Open Access
- arXiv: 2604.19141
231. Mitigating The Distribution Shift of Diffusion-based Dataset Distillation
- Link: Open Access
232. Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
- Link: Open Access
- arXiv: 2512.04926
233. Diffusion Probe: Generated Image Result Prediction Using CNN Probes
- Link: Open Access
- arXiv: 2602.23783
234. Cross-modal Representation Learning for Diffusion-generated Image Detection
- Link: Open Access
235. CADC: Content Adaptive Diffusion-Based Generative Image Compression
- Link: Open Access
- arXiv: 2602.21591
236. BoostSLT: Boosting Sign Language Translation via a Plug-and-Play Diffusion-Based Semantic Enhancer
- Link: Open Access
237. ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
- Link: Open Access
- arXiv: 2512.01426
238. REACH: Explicit Recovery Behavior for Diffusion Policies
- Link: Open Access
239. ShapeAR: Generating Editable Shape Layers via Autoregressive Diffusion
- Link: Open Access
240. Roots Beneath the Cut: Uncovering the Risk of Concept Revival in Pruning-Based Unlearning for Diffusion Models
- Link: Open Access
- arXiv: 2603.06640
241. Causality in Video Diffusers is Separable from Denoising
- Link: Open Access
- arXiv: 2602.10095
242. SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
- Link: Open Access
- arXiv: 2601.17830
243. DiP: Taming Diffusion Models in Pixel Space
- Link: Open Access
- arXiv: 2511.18822
244. Diffusion Mental Averages
- Link: Open Access
- arXiv: 2603.29239
245. GROW: Watermark Generation with Progressive Guidance for Diffusion Models
- Link: Open Access
246. Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
- Link: Open Access
- arXiv: 2603.19232
247. UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration
- Link: Open Access
- arXiv: 2507.23685
248. STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution
- Link: Open Access
- arXiv: 2511.18786
249. A Temporal and Content Co-Awareness Latent Diffusion for Controllable Hand Image Generation
- Link: Open Access
250. IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-Resolution
- Link: Open Access
251. Few-Step Diffusion Sampling Through Instance-Aware Discretizations
- Link: Open Access
- arXiv: 2603.17671
252. MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality
- Link: Open Access
- arXiv: 2603.26071
253. Diff-SemiER: Transparency-Aware Adaptive Fusion Diffusion Model with Generative Prior for Semi-Transparent Eyeglasses Removal
- Link: Open Access
254. Hierarchical Codec Diffusion for Video-to-Speech Generation
- Link: Open Access
- arXiv: 2604.15923
255. RebRL: Reinforcing Discrete Visual Diffusion Models with Rebalanced Timestep Credits
- Link: Open Access
256. Back to Basics: Let Denoising Generative Models Denoise
- Link: Open Access
- arXiv: 2511.13720
257. SDUIE: Semi-Supervised Diffusion for Underwater Image Enhancement with Quant-Text Dual Control
- Link: Open Access
258. Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration
- Link: Open Access
- arXiv: 2603.01623
259. Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving
- Link: Open Access
260. TC-Pade: Trajectory-Consistent Pade Approximation for Diffusion Acceleration
- Link: Open Access
261. Red-teaming Retrieval-Augmented Diffusion Models via Poisoning Knowledge Bases
- Link: Open Access
262. Causal Motion Diffusion Models for Autoregressive Motion Generation
- Link: Open Access
- arXiv: 2602.22594
263. Forensic-Friendly Image Manipulation via Controllable Latent Diffusion
- Link: Open Access
264. Towards Fine-Grained Attribution: Instance-Aware Preference Optimization for Aligning Diffusion Models
- Link: Open Access
265. CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis
- Link: Open Access
266. Making Training-Free Diffusion Segmentors Scale with the Generative Power
- Link: Open Access
- arXiv: 2603.06178
267. SketchRevive: Fine-Grained Pixel-to-Vector Sketch Completion with Diffusion-Prior-Guided Multimodal LLMs
- Link: Open Access
268. GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers
- Link: Open Access
- arXiv: 2604.20715
269. BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models
- Link: Open Access
- arXiv: 2512.12080
270. Bi-Bridge: Bidirectional Diffusion Bridges for Low-Light Image Enhancement
- Link: Open Access
271. PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models
- Link: Open Access
- arXiv: 2602.20583
272. LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration
- Link: Open Access
- arXiv: 2602.20497
273. Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache
- Link: Open Access
- arXiv: 2602.22654
274. GPFlow: Gaussian Prototype Probability Flow for Unsupervised Multi-Modal Anomaly Detection
- Link: Open Access
275. RAPID: Reusing Attention Sparsity with Inter-step Adaptation for Efficient Video Diffusion
- Link: Open Access
276. Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation
- Link: Open Access
- arXiv: 2603.19158
277. Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution
- Link: Open Access
- arXiv: 2508.16557
278. Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers
- Link: Open Access
- arXiv: 2603.10744
279. DBMSolver: A Training-free Diffusion Bridge Sampler for High-Quality Image-to-Image Translation
- Link: Open Access
- arXiv: 2605.05889
280. HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction
- Link: Open Access
- arXiv: 2605.16873
281. OrthoFuse: Training-free Riemannian Fusion of Orthogonal Style-Concept Adapters for Diffusion Models
- Link: Open Access
- arXiv: 2604.05183
282. Generative Neural Video Compression via Video Diffusion Prior
- Link: Open Access
- arXiv: 2512.05016
283. Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models
- Link: Open Access
284. Guiding Token-Sparse Diffusion Models
- Link: Open Access
- arXiv: 2601.01608
285. ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation
- Link: Open Access
- arXiv: 2601.15221
286. Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correction
- Link: Open Access
- arXiv: 2603.00149
287. SpeeDiff: Scalable Pixel-Anchored End-to-End Latent Diffusion Model
- Link: Open Access
288. KLIP: Localized Distribution Shift Detection via KL-Divergence with Diffusion Priors in Inverse Problems
- Link: Open Access
289. D2Cache: Second-Order Delta Caching for Higher Video Diffusion Acceleration
- Link: Open Access
290. Content-Aware Dynamic Patchification for Efficient Video Diffusion
- Link: Open Access
291. MusicInfuser: Making Video Diffusion Listen and Dance
- Link: Open Access
292. Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
- Link: Open Access
- arXiv: 2512.10954
293. Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
- Link: Open Access
- arXiv: 2511.20889
294. Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features
- Link: Open Access
- arXiv: 2511.16928
295. Scale Space Diffusion
- Link: Open Access
- arXiv: 2603.08709
296. HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing
- Link: Open Access
297. Focal-General Diffusion Model with Semantic Consistent Guidance for Sign Language Production
- Link: Open Access
298. Unleashing Stealthy Backdoor Pandemic by Infecting a Single Diffusion Model
- Link: Open Access
299. Taming Generative Diffusion Model for Task-Oriented Infrared Imaging
- Link: Open Access
300. Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models
- Link: Open Access
- arXiv: 2604.26365
301. ResCa: Residual Caching for Diffusion Transformers Acceleration
- Link: Open Access
302. PnP-CM: Consistency Models as Plug-and-Play Priors for Inverse Problems
- Link: Open Access
- arXiv: 2509.22736
303. Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Framework
- Link: Open Access
- arXiv: 2604.13994
304. DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- Link: Open Access
- arXiv: 2511.19365
305. Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution
- Link: Open Access
- arXiv: 2512.14061
306. Landscape-Awareness for Geometric View Diffusion Model
- Link: Open Access
- arXiv: 2605.19865
307. RenderFlow: Single-Step Neural Rendering via Flow Matching
- Link: Open Access
- arXiv: 2601.06928
308. RDF-MIG: A Robust Diffusion Framework for Masked Image Generation to Augment Semantic Segmentation and Change Detection
- Link: Open Access
309. Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization
- Link: Open Access
- arXiv: 2605.08054
310. CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration
- Link: Open Access
- arXiv: 2603.20741
311. Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
- Link: Open Access
- arXiv: 2510.18457
312. TM-BSN: Triangular-Masked Blind-Spot Network for Real-World Self-Supervised Image Denoising
- Link: Open Access
- arXiv: 2604.04484
313. Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals
- Link: Open Access
- arXiv: 2510.27684
314. IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation
- Link: Open Access
315. Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
- Link: Open Access
- arXiv: 2512.14008
316. Spatiotemporal Pyramid Flow Matching for Climate Emulation
- Link: Open Access
- arXiv: 2512.02268
317. Property-Informed Diffusion-Based Text-to-Microstructure Generation
- Link: Open Access
318. Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance
- Link: Open Access
- arXiv: 2603.20584
319. See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
- Link: Open Access
- arXiv: 2602.20951
320. DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior
- Link: Open Access
- arXiv: 2604.17195
321. DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
- Link: Open Access
- arXiv: 2603.04239
322. ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion
- Link: Open Access
- arXiv: 2601.16148
323. Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep
- Link: Open Access
- arXiv: 2603.24260
324. DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction
- Link: Open Access
- arXiv: 2603.03265
325. Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models
- Link: Open Access
- arXiv: 2512.22324
326. TAP: A Token-Adaptive Predictor Framework for Training-Free Diffusion Acceleration
- Link: Open Access
- arXiv: 2603.03792
327. SpiralDiff: Spiral Diffusion with LoRA for RGB-to-RAW Conversion Across Cameras
- Link: Open Access
- arXiv: 2603.14885
328. GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesis
- Link: Open Access
- arXiv: 2603.01010
329. TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models
- Link: Open Access
- arXiv: 2603.17828
330. SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer
- Link: Open Access
- arXiv: 2603.07057
331. Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models
- Link: Open Access
- arXiv: 2601.04068
332. Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
- Link: Open Access
- arXiv: 2510.14981
333. From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstruction
- Link: Open Access
- arXiv: 2503.17788
334. FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution
- Link: Open Access
- arXiv: 2603.02692
335. Learning Straight Flows: Variational Flow Matching for Efficient Generation
- Link: Open Access
- arXiv: 2511.17583
336. Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers
- Link: Open Access
- arXiv: 2511.18673
337. MORE-STEM: Long-Short MemOry REcall and Spatio-TEmporal Consistency Model for Query-Driven 3D/4D Point Cloud Segmentation
- Link: Open Access
338. Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model
- Link: Open Access
- arXiv: 2603.26357
339. Toward Early Quality Assessment of Text-to-Image Diffusion Models
- Link: Open Access
- arXiv: 2603.02829
340. Sampling-Aware Quantization for Diffusion Models
- Link: Open Access
- arXiv: 2505.02242
341. Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamics
- Link: Open Access
342. Smoothing the Score Function to Enhance Generalization in Diffusion Models
- Link: Open Access
343. Bi-directional Autoregressive Diffusion for Large Complex Motion Interpolation
- Link: Open Access
344. SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models
- Link: Open Access
- arXiv: 2507.14811
345. Diffusion with a Linguistic Compass: Steering the Generation of Clinically Plausible Future sMRI Representations for Early MCI Conversion Prediction
- Link: Open Access
- arXiv: 2506.05428
346. Statistical Characteristic-Guided Denoising for Rapid High-Resolution Transmission Electron Microscopy Imaging
- Link: Open Access
- arXiv: 2603.18834
347. GDRO: Group-level Reward Post-training Suitable for Diffusion Models
- Link: Open Access
- arXiv: 2601.02036
348. Guiding Diffusion Models with Fine-Grained Conditions and Semantics-Preserving Sampling for One-Shot Federated Learning
- Link: Open Access
349. Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation
- Link: Open Access
350. 2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching
- Link: Open Access
- arXiv: 2506.05398
351. Latent Diffusion Inversion Requires Understanding the Latent Space
- Link: Open Access
- arXiv: 2511.20592
352. CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think
- Link: Open Access
- arXiv: 2603.18991
353. RecTok: Reconstruction Distillation along Rectified Flow
- Link: Open Access
- arXiv: 2512.13421
354. EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decompositio
- Link: Open Access
355. Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)
- Link: Open Access
- arXiv: 2603.25977
356. Learnability-Guided Diffusion for Dataset Distillation
- Link: Open Access
357. Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models
- Link: Open Access
- arXiv: 2603.21085
358. Iris: Integrating Language into Diffusion-based Monocular Depth Estimation
- Link: Open Access
- arXiv: 2411.16750
359. Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer
- Link: Open Access
- arXiv: 2509.24899
360. DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer
- Link: Open Access
361. RegionRoute: Regional Style Transfer with Diffusion Model
- Link: Open Access
- arXiv: 2602.19254
362. Convexity-Aware Noise Calibration: A Self-Supervised Framework for Noise-Level-Unknown Image Denoising
- Link: Open Access
363. FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching
- Link: Open Access
- arXiv: 2605.05077
364. SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion
- Link: Open Access
- arXiv: 2603.27573
365. Diffusion Sampling Path Tells More: An Efficient Plug-and-Play Strategy for Sample Filtering
- Link: Open Access
- arXiv: 2505.23343
366. Disentangled Textual Priors for Diffusion-based Image Super-Resolution
- Link: Open Access
- arXiv: 2603.07430
367. Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios
- Link: Open Access
- arXiv: 2604.08922
368. TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution
- Link: Open Access
369. PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment
- Link: Open Access
- arXiv: 2510.00430
370. dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models
- Link: Open Access
- arXiv: 2512.19433
371. FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolution
- Link: Open Access
- arXiv: 2510.12747
372. Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimization
- Link: Open Access
373. UniPercept: A Unified Diffusion Model for Generalizable Visual Perception
- Link: Open Access
374. Elucidating the SNR-t Bias of Diffusion Probabilistic Models
- Link: Open Access
- arXiv: 2604.16044
375. Reward Sharpness-Aware Fine-Tuning for Diffusion Models
- Link: Open Access
- arXiv: 2603.21175
376. Accelerating Diffusion Model Training under Minimal Budgets: A Condensation-Based Perspective
- Link: Open Access
- arXiv: 2507.05914
377. GrOCE : Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models
- Link: Open Access
378. Low-Rank Residual Diffusion Models
- Link: Open Access
379. Outlier-Robust Diffusion Solvers for Inverse Problems
- Link: Open Access
- arXiv: 2605.09477
380. Guiding Diffusion Models with Semantically Degraded Conditions
- Link: Open Access
- arXiv: 2603.10780
381. FINE: Factorizing Knowledge for Initialization of Variable-sized Diffusion Models
- Link: Open Access
- arXiv: 2409.19289
382. Semantic Alignment for Pose-Invariant Identity Preserving Diffusion
- Link: Open Access
383. CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion
- Link: Open Access
- arXiv: 2602.19140
384. Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation
- Link: Open Access
- arXiv: 2603.22509
385. Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Models
- Link: Open Access
- arXiv: 2507.18534
386. CoD: A Diffusion Foundation Model for Image Compression
- Link: Open Access
- arXiv: 2511.18706
387. StableMTL: Repurposing Latent Diffusion Models for Multi-Task Learning from Partially Annotated Synthetic Datasets
- Link: Open Access
- arXiv: 2506.08013
388. SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation
- Link: Open Access
- arXiv: 2604.03134
389. Language-Guided One-Step Diffusion Model for Nighttime Flare Removal
- Link: Open Access
390. GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction
- Link: Open Access
- arXiv: 2602.24161
391. When Lines Meet Textures: Spatial-Frequency Aligned Diffusion Features for Cross-Sparsity Correspondence
- Link: Open Access
392. Routing on Demand: DSNet for Efficient Progressive Point Cloud Denoising
- Link: Open Access
393. NS-Diff: Fluid Navier-Stokes Guided Video Diffusion via Reinforcement Learning
- Link: Open Access
394. Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning
- Link: Open Access
- arXiv: 2603.04870
395. High-Fidelity Virtual Try-On beyond Paired Data Scarcity via Diffusion-based Cycle-Consistent Learning
- Link: Open Access
396. PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusion
- Link: Open Access
397. RFDM: Residual Flow Diffusion Models for Video Editing
- Link: Open Access