R
Published on

CVPR 2026 — Diffusion Models

Diffusion Models

397 papers

1. Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models

2. Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Models

3. Ultra Diffusion Poser: Diffusion-Based Human Motion Tracking from Sparse Inertial Sensors and Ranging-based Between-sensor Distances

4. Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning

5. VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

6. AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion

7. Accelerating Diffusion via Hybrid Data-Pipeline Parallelism Based on Conditional Guidance Scheduling

8. StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

9. LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning

10. When Local Rules Create Global Order: Self-Organized Representation Learning for Latent Diffusion Models

11. MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer

12. Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning

13. Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers

14. FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching

15. Residual Diffusion Bridge Model for Image Restoration

16. I'm a Map! Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers

17. GeoRK2: Geometry-Guided Runge-Kutta Integration for Diffusion Transformer Acceleration

18. Reflection Separation from a Single Image via Joint Latent Diffusion

19. Guiding a Diffusion Transformer with the Internal Dynamics of Itself

20. MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prior

21. Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework

22. Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers

23. Coordinate Denoising for Non-Equilibrium Molecular Representation Learning

24. Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching

25. A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

26. MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

27. GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving

28. Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers

29. Pantheon360: Taming Digital Twin Generation via 3D-Aware 360deg Video Diffusion

30. Correspondence-Attention Alignment for Multi-View Diffusion Models

31. MotionHiFlow: Text-to-Motion via Hierarchical Flow Matching

32. Semantic-Adaptive Diffusion for Dynamic Spatiotemporal Fusion

33. Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration

34. BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers

35. One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers

36. ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization

37. FM-Steer: Enhance Generalist Policies with Value-Guided Cascaded Denoising

38. FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation

39. Splatent: Splatting Diffusion Latents for Novel View Synthesis

40. Diffusion-Based Native Adversarial Synthesis for Enhanced Medical Segmentation Generalization

41. SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers

42. GenErase: Generalizable and Semantically-Aware Concept Erasure in Diffusion Models

43. RawMetaDiff: Unlocking Extreme Darkness from Dual-Exposure RAW with Meta-Guided Diffusion

44. C-LaV: Conditional Latent Velocity Field Denoising for Weather-Robust LiDAR Place Recognition

45. MatMart: Material Reconstruction of 3D Objects via Diffusion

46. SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models

47. DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching

48. DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

49. 3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion

50. Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer

51. Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation

52. Towards Human-Imperceptible Backdoor Attacks on Text-to-Image Diffusion Models

53. ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

54. Occluded Human Body Capture with Frequency Domain Denoising Prior

55. MaxMark: High-Capacity Diffusion-Native Watermarking via Robust and Invertible Latent Embedding

56. CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

57. FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs

58. Towards an Incremental Unified Multimodal Anomaly Detection: Augmenting Multimodal Denoising From an Information Bottleneck Perspective

59. DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers

60. DiffusionFF: A Diffusion-based Framework for Joint Face Forgery Detection and Fine-Grained Artifact Localization

61. Diffusion Guided Chain-of-Vision for Large Autoregressive Vision Models

62. Stable Mean Flow: Lyapunov-Inspired One-Step Flow Matching

63. Heterogeneous Decentralized Diffusion Models

64. Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

65. GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matching

66. DMGD: Train-Free Dataset Distillation with Semantic-Distribution Matching in Diffusion Models

67. DRM: Diffusion-based Reward Model With Step-wise Guidance

68. Diff4Splat: Repurposing Video Diffusion Models for Dynamic Scene Generation

69. Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance

70. ManifoldGD: Training-Free Hierarchical Manifold Guidance for Diffusion-Based Dataset Distillation

71. Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

72. ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models

73. FUSER: Feed-Forward Multiview 3D Registration Transformer and SE(3)N^N Diffusion Refinement

74. Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devices

75. MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

76. COT-FM: Cluster-wise Optimal Transport Flow Matching

77. LF-BVN: Blind-View Network for Self-Supervised Light Field Denoising

78. Test-time Sparsity for Extreme Fast Action Diffusion

79. Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression

80. Similarity-Consistent Likelihood Diffusion enables Hidden Person Detection from Wall Reflections

81. Frequency-Aware Flow Matching for High-Quality Image Generation

82. LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models

83. Region-Adaptive Sampling for Diffusion Transformers

84. DABO: Difficulty-Aware Bayesian Optimization with Diffusion-Learned Priors

85. Advancing Image Classification with Discrete Diffusion Classification Modeling

86. CoopDiff: A Diffusion-Guided Approach for Cooperation under Corruptions

87. VMonarch: Efficient Video Diffusion Transformers with Structured Attention

88. Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking

89. SignPR: A Progressive Vector-Quantized Diffusion Framework for Sign Language Production

90. PureProof: Diffusion-Resistant Black-box Targeted Attack on Large Vision-Language Models

91. MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation

92. Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping

93. DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers

94. Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

95. EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

96. Thermal Diffusion Matters: Infrared Spatial-Temporal Video Super-Resolution through Heat Conduction Priors

97. Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features

98. GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping

99. Efficient Weighted Sampling via Score-based Generative Models

100. Reasoning Diffusion for Unpaired Test Time Out-of-distribution Text-Image to Video Generation

101. ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models

102. Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers

103. Dual Ascent Diffusion for Inverse Problems

104. AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

105. MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation

106. Streaming Diffusion Model for Fast Infrared and Visible Video Fusion

107. WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

108. NaTex: Seamless Texture Generation as Latent Color Diffusion

109. PhyOceanCast: Global Ocean Forecasting with Physics-Informed Diffusion

110. SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching

111. HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution

112. Self-Diffusion Driven Blind Imaging

113. Delta Rectified Flow Sampling for Text-to-Image Editing

114. Zero-Shot Image Denoising via Hybrid Prior-Guided Pseudo Sample Generation

115. Training-free Mixed-Resolution Latent Upsampling for Spatially Accelerated Diffusion Transformers

116. InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models

117. Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping

118. Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation

119. Few-shot Acoustic Synthesis with Multimodal Flow Matching

120. Anatomica: Localized Control over Geometric and Topological Properties for Anatomical Diffusion Models

121. D2^2-FOSA: Dual-Diffusion Guided EEG-to-Image Reconstruction with Frequency-Oriented Semantic Alignment

122. Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimation

123. L3DR: 3D-aware LiDAR Diffusion and Rectification

124. Semantic Derivative Flow: Graph-Guided Diffusion for Controllable Instance Interactions

125. Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment

126. DRiffusion: Draft-and-Refine Process Parallelizes Diffusion Models with Ease

127. PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning

128. Unifying Precise Keyframes and Semantic Control via Multi-level Diffusion

129. DiffuView: Multi-View Diffusion Pretraining for 3D Aware Robotic Manipulation

130. Learning from Noisy Supervision: A Denoising-Debiasing Framework for Weakly Supervised Video Anomaly Detection

131. CG-Floor: Centroid-Guided Diffusion for Large-Scale Floorplan Generation

132. Guiding a Diffusion Model by Swapping Its Tokens

133. Next-Scale Prediction: A Self-Supervised Approach for Real-World Image Denoising

134. When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

135. Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers

136. CARD: Correlation Aware Restoration with Diffusion

137. DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

138. Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Diffusion Transformers

139. Exploring Conditions for Diffusion Models in Robotic Control

140. SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models

141. Prototype-Guided Concept Erasure in Diffusion Models

142. HSI-GPT2: A Dual-Granularity Large Motion Reasoning Model with Diffusion Refinement for Human-Scene Interaction

143. InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior

144. All-in-One Slider for Attribute Manipulation in Diffusion Models

145. GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusion

146. ProcessMaker: A Generalized Process Visualization Framework with Adaptive Sequence Steps on Diffusion Transformers

147. NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers

148. PoseD-Flow: Versatile and Guided Flow Matching Model of Human Pose

149. Masked-Diffusion Autoencoders for 3D Medical Vision Representation Learning

150. Flow Matching for Multimodal Distributions

151. InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs

152. From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolution

153. TAlignDiff: Automatic Tooth Alignment assisted by Diffusion-based Transformation Learning

154. LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding

155. MicroFM: Physics-guided Flow Matching for Isotropic Microscopy Reconstruction

156. Flowception: Temporally Expansive Flow Matching for Video Generation

157. Steering Where to Diffuse: Generative Modeling of Phenotypic Response Simulation with Steered Diffusion Bridge

158. UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching

159. Unsupervised Multi-Scale Segmentation of 3D Subcellular World with Stable Diffusion Foundation Model

160. LiDAR-to-4DRadar Diffusion Bridge via Cross-Modal Alignment and Translation in Latent Space

161. GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding

162. Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

163. PAD-Hand: Physics-Aware Diffusion for Hand Motion Recovery

164. Rethinking Visual Rearrangement from A Diffusion Perspective

165. Unsupervised Monocular 3D Keypoint Discovery from Multi-View Diffusion Priors

166. WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving

167. Unified Number-Free Text-to-Motion Generation Via Flow Matching

168. Learning to Learn Weight Generation via Local Consistency Diffusion

169. Generative Diffusion Priors for 3D Mapping of the Dark Universe

170. Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

171. High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning

172. PixelDiT: Pixel Diffusion Transformers for Image Generation

173. Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

174. Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models

175. Nestwork: Conditional 3D Furnished House Layout Generation through Latent Heterogeneous Graph Diffusion

176. PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

177. DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution

178. PatchScene: Patch-based Voxel Diffusion Model for Large-Scale Scene Completion

179. BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation

180. MMCP-GEN: A Modality-Extensible Diffusion Language Model for Conditional Protein Sequence Generation

181. IMS3: Breaking Distributional Aggregation in Diffusion-Based Dataset Distillation

182. Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

183. 2-Shots in the Dark: Low-Light Denoising with Minimal Data Acquisition

184. MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations

185. EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Head

186. OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery

187. NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darkness

188. VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale

189. Spatial-Spectral Residuals Informed Diffusion Neural Operator for Pan-sharpening

190. Your Latent Mask is Wrong: Pixel-Equivalent Latent Compositing for Diffusion Models

191. FMPose3D: monocular 3D pose estimation via flow matching

192. FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution

193. One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution

194. SpotEdit: Selective Region Editing in Diffusion Transformers

195. DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis

196. LeapAlign: Post-training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

197. EMR-Diff: Edge-aware Multimodal Residual Diffusion Model for Hyperspectral Image Super-resolution

198. VDFE: Difference-Aware 3D Scene Editing with Non-Intrusive Video Diffusion Priors for Multi-View Consistency and Efficiency

199. InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting

200. Pixel Motion Diffusion is What We Need for Robot Control

201. Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models

202. Probabilistic Precipitation Nowcasting with Rectified Flow Transformers

203. When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance

204. Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning

205. GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping

206. Beyond Missing Modalities: Hypergraph Conditioned Diffusion for Uncertainty-Aware Multimodal Emotion Recognition

207. DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression

208. DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer

209. PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis

210. From Events to Clarity: The Event-Guided Diffusion Framework for Dehazing

211. Visual Diffusion Models are Geometric Solvers

212. Image Diffusion Preview with Consistency Solver

213. Efficient and Training-Free Single-Image Diffusion Models

214. Reviving ConvNeXt for Efficient Convolutional Diffusion Models

215. ReCoFuse: Ultra-Robust Image Fusion via Restorative Multi-Modal Diffusion Reciprocal Coupling

216. The Drift Kernel: Why Diffusion Models Change Even When Told Not To

217. Accelerating Autoregressive Video Diffusion via History-Guided Cache and Residual Correction

218. Personalized Federated Training of Diffusion Models with Privacy Guarantees

219. What Is It Like to Be a Noise? An Entropy-based Gaussian Noise Regularization for Diffusion Models

220. DDT: Decoupled Diffusion Transformer

221. Structure-to-Intensity Diffusion for Adverse-Weather LiDAR Generation

222. DeltaQuant: 4-bit Video Diffusion Models with Spatiotemporal Delta Smoothing

223. Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU Parallelism

224. VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

225. HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning

226. PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories

227. ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers

228. PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion

229. It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models

230. Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation

231. Mitigating The Distribution Shift of Diffusion-based Dataset Distillation

232. Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion

233. Diffusion Probe: Generated Image Result Prediction Using CNN Probes

234. Cross-modal Representation Learning for Diffusion-generated Image Detection

235. CADC: Content Adaptive Diffusion-Based Generative Image Compression

236. BoostSLT: Boosting Sign Language Translation via a Plug-and-Play Diffusion-Based Semantic Enhancer

237. ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers

238. REACH: Explicit Recovery Behavior for Diffusion Policies

239. ShapeAR: Generating Editable Shape Layers via Autoregressive Diffusion

240. Roots Beneath the Cut: Uncovering the Risk of Concept Revival in Pruning-Based Unlearning for Diffusion Models

241. Causality in Video Diffusers is Separable from Denoising

242. SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training

243. DiP: Taming Diffusion Models in Pixel Space

244. Diffusion Mental Averages

245. GROW: Watermark Generation with Progressive Guidance for Diffusion Models

246. Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

247. UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration

248. STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

249. A Temporal and Content Co-Awareness Latent Diffusion for Controllable Hand Image Generation

250. IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-Resolution

251. Few-Step Diffusion Sampling Through Instance-Aware Discretizations

252. MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality

253. Diff-SemiER: Transparency-Aware Adaptive Fusion Diffusion Model with Generative Prior for Semi-Transparent Eyeglasses Removal

254. Hierarchical Codec Diffusion for Video-to-Speech Generation

255. RebRL: Reinforcing Discrete Visual Diffusion Models with Rebalanced Timestep Credits

256. Back to Basics: Let Denoising Generative Models Denoise

257. SDUIE: Semi-Supervised Diffusion for Underwater Image Enhancement with Quant-Text Dual Control

258. Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration

259. Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving

260. TC-Pade: Trajectory-Consistent Pade Approximation for Diffusion Acceleration

261. Red-teaming Retrieval-Augmented Diffusion Models via Poisoning Knowledge Bases

262. Causal Motion Diffusion Models for Autoregressive Motion Generation

263. Forensic-Friendly Image Manipulation via Controllable Latent Diffusion

264. Towards Fine-Grained Attribution: Instance-Aware Preference Optimization for Aligning Diffusion Models

265. CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis

266. Making Training-Free Diffusion Segmentors Scale with the Generative Power

267. SketchRevive: Fine-Grained Pixel-to-Vector Sketch Completion with Diffusion-Prior-Guided Multimodal LLMs

268. GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

269. BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

270. Bi-Bridge: Bidirectional Diffusion Bridges for Low-Light Image Enhancement

271. PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models

272. LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration

273. Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache

274. GPFlow: Gaussian Prototype Probability Flow for Unsupervised Multi-Modal Anomaly Detection

275. RAPID: Reusing Attention Sparsity with Inter-step Adaptation for Efficient Video Diffusion

276. Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation

277. Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution

278. Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers

279. DBMSolver: A Training-free Diffusion Bridge Sampler for High-Quality Image-to-Image Translation

280. HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction

281. OrthoFuse: Training-free Riemannian Fusion of Orthogonal Style-Concept Adapters for Diffusion Models

282. Generative Neural Video Compression via Video Diffusion Prior

283. Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models

284. Guiding Token-Sparse Diffusion Models

285. ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation

286. Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correction

287. SpeeDiff: Scalable Pixel-Anchored End-to-End Latent Diffusion Model

288. KLIP: Localized Distribution Shift Detection via KL-Divergence with Diffusion Priors in Inverse Problems

289. D2Cache: Second-Order Delta Caching for Higher Video Diffusion Acceleration

290. Content-Aware Dynamic Patchification for Efficient Video Diffusion

291. MusicInfuser: Making Video Diffusion Listen and Dance

292. Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration

293. Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

294. Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features

295. Scale Space Diffusion

296. HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing

297. Focal-General Diffusion Model with Semantic Consistent Guidance for Sign Language Production

298. Unleashing Stealthy Backdoor Pandemic by Infecting a Single Diffusion Model

299. Taming Generative Diffusion Model for Task-Oriented Infrared Imaging

300. Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models

301. ResCa: Residual Caching for Diffusion Transformers Acceleration

302. PnP-CM: Consistency Models as Plug-and-Play Priors for Inverse Problems

303. Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Framework

304. DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation

305. Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution

306. Landscape-Awareness for Geometric View Diffusion Model

307. RenderFlow: Single-Step Neural Rendering via Flow Matching

308. RDF-MIG: A Robust Diffusion Framework for Masked Image Generation to Augment Semantic Segmentation and Change Detection

309. Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization

310. CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration

311. Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

312. TM-BSN: Triangular-Masked Blind-Spot Network for Real-World Self-Supervised Image Denoising

313. Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals

314. IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation

315. Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

316. Spatiotemporal Pyramid Flow Matching for Climate Emulation

317. Property-Informed Diffusion-Based Text-to-Microstructure Generation

318. Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance

319. See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis

320. DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior

321. DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers

322. ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion

323. Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

324. DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction

325. Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models

326. TAP: A Token-Adaptive Predictor Framework for Training-Free Diffusion Acceleration

327. SpiralDiff: Spiral Diffusion with LoRA for RGB-to-RAW Conversion Across Cameras

328. GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesis

329. TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models

330. SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer

331. Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models

332. Coupled Diffusion Sampling for Training-Free Multi-View Image Editing

333. From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstruction

334. FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution

335. Learning Straight Flows: Variational Flow Matching for Efficient Generation

336. Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers

337. MORE-STEM: Long-Short MemOry REcall and Spatio-TEmporal Consistency Model for Query-Driven 3D/4D Point Cloud Segmentation

338. Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model

339. Toward Early Quality Assessment of Text-to-Image Diffusion Models

340. Sampling-Aware Quantization for Diffusion Models

341. Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamics

342. Smoothing the Score Function to Enhance Generalization in Diffusion Models

343. Bi-directional Autoregressive Diffusion for Large Complex Motion Interpolation

344. SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models

345. Diffusion with a Linguistic Compass: Steering the Generation of Clinically Plausible Future sMRI Representations for Early MCI Conversion Prediction

346. Statistical Characteristic-Guided Denoising for Rapid High-Resolution Transmission Electron Microscopy Imaging

347. GDRO: Group-level Reward Post-training Suitable for Diffusion Models

348. Guiding Diffusion Models with Fine-Grained Conditions and Semantics-Preserving Sampling for One-Shot Federated Learning

349. Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

350. 2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching

351. Latent Diffusion Inversion Requires Understanding the Latent Space

352. CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think

353. RecTok: Reconstruction Distillation along Rectified Flow

354. EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decompositio

355. Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)

356. Learnability-Guided Diffusion for Dataset Distillation

357. Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models

358. Iris: Integrating Language into Diffusion-based Monocular Depth Estimation

359. Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer

360. DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer

361. RegionRoute: Regional Style Transfer with Diffusion Model

362. Convexity-Aware Noise Calibration: A Self-Supervised Framework for Noise-Level-Unknown Image Denoising

363. FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching

364. SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

365. Diffusion Sampling Path Tells More: An Efficient Plug-and-Play Strategy for Sample Filtering

366. Disentangled Textual Priors for Diffusion-based Image Super-Resolution

367. Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios

368. TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution

369. PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

370. dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

371. FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolution

372. Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimization

373. UniPercept: A Unified Diffusion Model for Generalizable Visual Perception

374. Elucidating the SNR-t Bias of Diffusion Probabilistic Models

375. Reward Sharpness-Aware Fine-Tuning for Diffusion Models

376. Accelerating Diffusion Model Training under Minimal Budgets: A Condensation-Based Perspective

377. GrOCE : Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models

378. Low-Rank Residual Diffusion Models

379. Outlier-Robust Diffusion Solvers for Inverse Problems

380. Guiding Diffusion Models with Semantically Degraded Conditions

381. FINE: Factorizing Knowledge for Initialization of Variable-sized Diffusion Models

382. Semantic Alignment for Pose-Invariant Identity Preserving Diffusion

383. CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion

384. Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation

385. Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Models

386. CoD: A Diffusion Foundation Model for Image Compression

387. StableMTL: Repurposing Latent Diffusion Models for Multi-Task Learning from Partially Annotated Synthetic Datasets

388. SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation

389. Language-Guided One-Step Diffusion Model for Nighttime Flare Removal

390. GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction

391. When Lines Meet Textures: Spatial-Frequency Aligned Diffusion Features for Cross-Sparsity Correspondence

392. Routing on Demand: DSNet for Efficient Progressive Point Cloud Denoising

393. NS-Diff: Fluid Navier-Stokes Guided Video Diffusion via Reinforcement Learning

394. Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning

395. High-Fidelity Virtual Try-On beyond Paired Data Scarcity via Diffusion-based Cycle-Consistent Learning

396. PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusion

397. RFDM: Residual Flow Diffusion Models for Video Editing