R
Published on

CVPR 2026 — Generative Models & Image Synthesis

Generative Models & Image Synthesis

905 papers

1. DirectFisheye-GS: Enabling Native Fisheye Input in Gaussian Splatting with Cross-View Joint Optimization

2. GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling

3. Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models

4. Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Models

5. REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting

6. Physical Simulator In-the-Loop Video Generation

7. Functional Mean Flow in Hilbert Space

8. The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment

9. Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

10. HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views

11. Bidirectional Query-Driven Generation of Parametric CAD Sketch

12. PhysIR-Splat: Physically Consistent Thermal Infrared Radiative Transfer in 3D Gaussian Splatting

13. RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting

14. One-Shot Flow, Any-Time Frame: A Bidirectional Warping Framework for Event-Based Video Frame Interpolation

15. FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario

16. GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compression

17. Exploring Spatial Intelligence from a Generative Perspective

18. WaDi: Weight Direction-aware Distillation for One-step Image Synthesis

19. Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment

20. BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation

21. C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion

22. When Local Rules Create Global Order: Self-Organized Representation Learning for Latent Diffusion Models

23. MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer

24. Rectifying Latent Space for Generative Single-Image Reflection Removal

25. Refracting Reality: Generating Images with Realistic Transparent Objects

26. Decoupled Generative Modeling for Human-Object Interaction Synthesis

27. SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

28. Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

29. RetimeGS: Continuous-Time Reconstruction of 4D Gaussian Splatting

30. RAVEN: Erasing Invisible Watermarks via Novel View Synthesis

31. Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitives

32. FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching

33. IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting

34. Parallel Jacobi Decoding for Fast Autoregressive Image Generation

35. MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting

36. Repurposing 3D Generative Model for Autoregressive Layout Generation

37. WonderZoom: Multi-Scale 3D World Generation

38. MatLat: Material Latent Space for PBR Texture Generation

39. Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs

40. LiveGesture: Streamable Co-Speech Gesture Generation Model

41. Write Where It Matters: Policy-Guided Watermarks for 3D Gaussian Splatting

42. DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO

43. Self-Evaluation Unlocks Any-Step Text-to-Image Generation

44. Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists

45. Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction

46. Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models

47. GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering

48. NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks

49. VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

50. CAD-Refiner: A Unified Framework for CAD Generation and Iterative Editing

51. When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters

52. Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework

53. PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation

54. Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image

55. WildCap: Facial Albedo Capture in the Wild via Hybrid Inverse Rendering

56. Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching

57. A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

58. FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gain

59. IR-HGP: Physically-Aware Gaussian Inverse Rendering for High-Illumination Scenes via Generative Priors

60. GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving

61. The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation

62. Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers

63. Open the Motion Door: Atomic Motion Decomposition and Recomposition for Open-Vocabulary Motion Generation

64. Pantheon360: Taming Digital Twin Generation via 3D-Aware 360deg Video Diffusion

65. GeoDexGrasp: Geometry-aware Generation for Data-efficient and Physics-plausible Dexterous Grasping

66. CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing

67. BiOTPrompt: Bidirectional Optimal Transport Guided Prompting for Disease Evolution-aware Radiology Report Generation

68. Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model

69. Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

70. Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling

71. GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidance

72. MotionHiFlow: Text-to-Motion via Hierarchical Flow Matching

73. What Are You Doing? A Closer Look at Controllable Human Video Generation

74. Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learning

75. Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time Intervention

76. UZ3DVG: Unaided Zero-Shot 3D Visual Grounding with Generated Language Conditions

77. Your One-Stop Solution for AI-Generated Video Detection

78. IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework

79. FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacement

80. OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text

81. SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation

82. Visual Prototype Conditioned Focal Region Generation for UAV-Based Object Detection

83. Multi-Scale Local Speculative Decoding for Image Generation

84. SURF: Signature-Retained Fast Video Generation

85. OneHOI: Unifying Human-Object Interaction Generation and Editing

86. SemiGDA: Generative Dual-distribution Alignment for Semi-Supervised Medical Image Segmentation

87. DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance

88. FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation

89. GenMatter: Perceiving Physical Objects with Generative Matter Models

90. P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction

91. MeshSplatting: Differentiable Rendering with Opaque Meshes

92. CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling

93. Disco-GS: Gaussian Splatting in Dynamic Color Lighting

94. PureCC: Pure Learning for Text-to-Image Concept Customization

95. Transition Matching Distillation for Fast Video Generation

96. FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation

97. MeshRipple: Structured Autoregressive Generation of Artist-Meshes

98. Text-Image Conditioned 3D Generation

99. SV-GS: Sparse View 4D Reconstruction with Skeleton-Driven Gaussian Splatting

100. SharpTimeGS: Sharp and Stable Dynamic Gaussian Splatting via Lifespan Modulation

101. Splatent: Splatting Diffusion Latents for Novel View Synthesis

102. Benchmarking Single-Factor Physical Video-to-Audio Generation

103. MV2UV: Generating High-quality UV Texture Maps with Multiview Prompts

104. Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

105. SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time

106. Learning Hierarchical Hyperbolic Mixture Model for Part-aware 3D Generation

107. GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution

108. Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset

109. Yume1.5: A Text-Controlled Interactive World Generation Model

110. CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection

111. Tea-Adapter: Teacher Adapter for Efficient Conditional Generation

112. Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

113. Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing

114. TV2TV: A Unified Framework for Interleaved Language and Video Generation

115. Pose-Free Omnidirectional Gaussian Splatting for 360-Degree Videos with Consistent Depth Priors

116. SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers

117. Self-Paced and Self-Corrective Masked Prediction for Movie Trailer Generation

118. FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control

119. FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips

120. Intra-class Distribution-guided Generative Hashing with Neighbor Refinement for Cross-modal Retrieval

121. GVIS: Generative Vector Image Steganography

122. Physically Inspired Gaussian Splatting for HDR Novel View Synthesis

123. LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens

124. SparseSplat: Towards Applicable Feed-Forward 3D Gaussian Splatting with Pixel-Unaligned Prediction

125. E2EGS: Event-to-Edge Gaussian Splatting for Pose-Free 3D Reconstruction

126. FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generation

127. PGA: Prior-free Generative Attack for Practical No-box Scenario

128. Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images

129. OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning

130. Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner

131. PoseGaussian: 6D Pose Estimation for Unseen Objects via Sparse-View Object-Level 3D Gaussian Splatting

132. Simple Agents Outperform Experts in Biomedical Imaging Workflow Optimization

133. SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models

134. Real-Time Dynamic Scene Rendering with Controlled Compressibility and Contact Awareness

135. DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

136. SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

137. Energy-GS: Image Energy-guided Pose Alignment Gaussian Splatting with redesigned pose gradient flow

138. WildRayZer: Self-supervised Large View Synthesis in Dynamic Environments

139. Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution

140. IF-Prune: Information-Flow Guided Token Pruning for Efficient Vision-Language Models

141. RevINN: An End-to-End Invertible Neural Network for Reversible Adversarial Examples Generation

142. Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstruction

143. SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation

144. Lynx: Towards High-Fidelity Personalized Video Generation

145. Towards Human-Imperceptible Backdoor Attacks on Text-to-Image Diffusion Models

146. ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

147. Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization

148. Proxy-GS: Unified Occlusion Priors for Training and Inference in Structured 3D Gaussian Splatting

149. SAIDO: Generalizable Detection of AI-Generated Images via Scene-Aware and Importance-Guided Dynamic Optimization in Continual Learning

150. UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

151. Spatia: Video Generation with Updatable Spatial Memory

152. ORV: 4D Occupancy-centric Robot Video Generation

153. LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

154. DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation

155. GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning

156. Omni2Sound: Towards Unified Video-Text-to-Audio Generation

157. LogCD: Local-to-global Consistency Distillation for Few-step Image Generation

158. FlowComposer: Composable Flows for Compositional Zero-Shot Learning

159. UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

160. HySeg: Learning Generative Priors for Structure-Aware Remote Sensing Segmentation

161. FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs

162. VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping

163. NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity

164. Cross-Instance Gaussian Splatting Registration via Geometry-Aware Feature-Guided Alignment

165. MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis

166. ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions

167. AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization

168. Breaking the 3D Dataset Bottleneck: Fast Scalable Generation of Aligned 3D Assets from Scratch for Category 6D Pose Estimation and Robotic Grasping

169. Easy3E: Feed-Forward 3D Asset Editing via Rectified Voxel Flow

170. GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

171. Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation

172. OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

173. MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation

174. Stable Mean Flow: Lyapunov-Inspired One-Step Flow Matching

175. Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues

176. CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image

177. Language-Free Generative Editing from One Visual Example

178. EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization

179. GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matching

180. WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling

181. Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting

182. Learning Compact 3D Representations from Feed-Forward Novel View Synthesis

183. ShowUI-p: Flow-based Generative Models as GUI Dexterous Hands

184. FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation

185. GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Prediction

186. Diff4Splat: Repurposing Video Diffusion Models for Dynamic Scene Generation

187. OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation

188. Improving Controllable Generation: Faster Training and Better Performance via x0-Supervision

189. AdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLM

190. Visual-RRT: Finding Paths toward Visual-Goals via Differentiable Rendering

191. MAPo: Motion-Aware Partitioning of Deformable 3D Gaussian Splatting for High-Fidelity Dynamic Scene Reconstruction

192. EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

193. RaGS: Unleashing 3D Gaussian Splatting from 4D Radar and Monocular Cue for 3D Object Detection

194. A Debiased Reconstruction-based Framework for Training-Free Detection of AI-Generated Images

195. StyleTextGen: Style-Conditioned Multilingual Scene Text Generation

196. Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning

197. HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images

198. ClusterMark: Towards Robust Watermarking for Autoregressive Image Generators with Visual Token Clustering

199. Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models

200. MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Second

201. Affostruction: 3D Affordance Grounding with Generative Reconstruction

202. MatPedia: A Universal Generative Foundation for High-Fidelity Material Synthesis

203. Gaussian-Mixture Latent Flow for Stochastic 3D Human Motion Prediction

204. UnReflectAnything: RGB-Only Highlight Removal by Rendering Synthetic Specular Supervision

205. Exact-GS: Mathematically Rigorous and Accurate 3D Gaussian Splatting for 3D X-ray Reconstruction

206. SDGS: Spatial Difference Guided Gaussian Splatting for Simultaneous Localization and 3D Reconstruction

207. MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splatting

208. Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models

209. HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation

210. CoRoGS: Contextual Gaussian Splatting for Robust Large-Deviation View Synthesis

211. ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering

212. iSplat: Iterative Learning for Fine-Grained Gaussian Splatting

213. PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow

214. MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

215. 3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation

216. Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

217. EgoX: Egocentric Video Generation from a Single Exocentric Video

218. COT-FM: Cluster-wise Optimal Transport Flow Matching

219. PRIMU: Uncertainty Estimation for Novel Views in Gaussian Splatting from Primitive-Based Representations of Error and Coverage

220. CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion

221. ACPV-Net: All-Class Polygonal Vectorization for Seamless Vector Map Generation from Aerial Imagery

222. CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning

223. Adaptive Anisotropic Gaussian Splatting for Multi-contrast MRI Arbitrary-Scale Super-Resolution with Anatomy Guidance

224. DualSplat: Robust 3D Gaussian Splatting via Pseudo-Mask Bootstrapping from Reconstruction Failures

225. Enabling Supervised Learning of Generative Signatures for Generalized AI-Generated Images Detection

226. Efficient All-Pairs Correlation Volume Sampling for Optical Flow Estimation

227. AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References

228. MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture

229. Frequency-Aware Flow Matching for High-Quality Image Generation

230. EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing

231. DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning

232. FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance

233. LAMP: Language-Assisted Motion Planning for Controllable Video Generation

234. RADAR: VQ-VAE Decoder of VAR is a Good Student for Restoring Against Degradation by Acceleration

235. HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives

236. SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

237. VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis

238. MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

239. Scaling4D: Pushing the Frontier of Video Novel View Synthesis through Large-Scale Monocular Videos

240. Bidirectional Normalizing Flow: From Data to Noise and Back

241. 4C4D: 4 Camera 4D Gaussian Splatting

242. Scaling Zero-Shot Reference-to-Video Generation

243. Spectral-Geometric Neural Fields for Pose-Free LiDAR View Synthesis

244. SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting

245. RunawayEvil: Jailbreaking the Image-to-Video Generative Models

246. ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation

247. Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field

248. TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation

249. EchoVDiff: Cardiac-Cycle Echocardiography Video Generation from Arbitrary Single Frame

250. MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation

251. Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

252. LightMover: Generative Light Movement with Color and Intensity Controls

253. VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation

254. MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation

255. Distilling Unsigned Distance Function for Surface Reconstruction from 3D Gaussian Splatting

256. Say Cheese! Detail-Preserving Portrait Collection Generation via Natural Language Edits

257. Scalable Trajectory Generation for Whole-Body Mobile Manipulation

258. U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation

259. Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation

260. eRetinexGS: Retinex Modeling for Low-Light Scene Enhancement via Event Streams and 3D Gaussian Splatting

261. VideoMaMa: Mask-Guided Video Matting via Generative Prior

262. Ref4D-VideoBench: Four-Dimensional Reference-Based Evaluation of Text-to-Video Generative Models

263. Extend3D: Town-Scale 3D Generation

264. A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space

265. GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation

266. STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative

267. Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation

268. TIM: Temporal Decoupling with Iterative Mutual-Refinement Model for Longitudinal Radiology Report Generation

269. EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

270. VA-p: Variational Policy Alignment for Pixel-Aware Autoregressive Generation

271. GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models

272. Spherical Leech Quantization for Visual Tokenization and Generation

273. VAD-GS: Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes

274. TiViBench: Benchmarking Think-in-Video Reasoning for Video Generation

275. Z-Order Transformer for Feed-Forward Gaussian Splatting

276. TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion

277. VISTA: A Test-Time Self-Improving Video Generation Agent

278. Dynamic-Static Decomposition for Novel View Synthesis of Dynamic Scenes with Spiking Neurons

279. MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation

280. Not All Birds Look The Same: Identity-Preserving Generation For Birds

281. P-Flow: Prompting Visual Effects Generation

282. GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping

283. Efficient Weighted Sampling via Score-based Generative Models

284. FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters

285. HandX: Scaling Bimanual Motion and Interaction Generation

286. From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation

287. Reasoning Diffusion for Unpaired Test Time Out-of-distribution Text-Image to Video Generation

288. Disentangling to Re-couple: Resolving the Similarity-Controllability Paradox in Subject-Driven Text-to-Image Generation

289. PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and VLM-Guided Optimization

290. CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation

291. Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion

292. Unified Latent Space for Understanding and Generation via Semantic Auto-encoder

293. PHANTOM: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics

294. HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidance

295. STARFlow-V: End-to-End Video Generative Modeling with Autoregressive Normalizing Flows

296. Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning

297. FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing

298. ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models

299. EcoSplat: Efficiency-controllable Feed-forward 3D Gaussian Splatting from Multi-view Images

300. Rethinking Pose Refinement in 3D Gaussian Splatting under Pose Prior and Geometric Uncertainty

301. Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generation

302. EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

303. LATTICE: Democratize High-Fidelity 3D Generation at Scale

304. A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens

305. Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

306. MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation

307. RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation

308. UniVerse: Empower Unified Generation with Reasoning and Knowledge

309. FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing

310. MeanFlow Transformers with Representation Autoencoders

311. PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

312. Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation

313. NaTex: Seamless Texture Generation as Latent Color Diffusion

314. Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation

315. VecGlypher: Unified Vector Glyph Generation with Language Models

316. Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images

317. Dehallu3D: Hallucination-Mitigated 3D Generation from a Single Image via Cyclic View Consistency Refinement

318. TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering

319. TGTrack: Temporal Generative Learning for Unified Single Object Tracking

320. OrienPose: Orientation-Guided Novel View Synthesis for Single-Image Unseen Object Pose Estimation

321. DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training

322. EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation

323. Delta Rectified Flow Sampling for Text-to-Image Editing

324. ST4R-Splat: Spatio-Temporal Referring Segmentation in 4D Gaussian Splatting

325. Archon: A Unified Multimodal Model for Holistic Digital Human Generation

326. Zero-Shot Image Denoising via Hybrid Prior-Guided Pseudo Sample Generation

327. CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation

328. Humanoid Generative Pre-Training for Zero-Shot Motion Tracking

329. Stochastic Ray Tracing for the Reconstruction of 3D Gaussian Splatting

330. Fine-Grained GRPO for Precise Preference Alignment in Flow Models

331. Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding

332. FARMER: Flow AutoRegressive Transformer over Pixels

333. LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

334. Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation

335. Seeing What Matters: Visual Preference Policy Optimization for Visual Generation

336. RF4D:Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenes

337. Negative Binomial Variational Autoencoders for Overdispersed Latent Modeling

338. Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation

339. Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation

340. ThinkGen: Generalized Thinking for Visual Generation

341. Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow

342. Faster-GS: Analyzing and Improving Gaussian Splatting Optimization

343. Few-shot Acoustic Synthesis with Multimodal Flow Matching

344. UniCompress: Token Compression for Unified Vision-Language Understanding and Generation

345. Towards Unified Human Perception and Machine Understanding: Token Flow Guided Compression Framework

346. From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition

347. AeroDGS: Physically Consistent Dynamic Gaussian Splatting for Single-Sequence Aerial 4D Reconstruction

348. AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows

349. TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond

350. OntoAug: Rethinking Generative Data Augmentation via Ontology Guidance

351. Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generation

352. RewardFlow: Generate Images by Optimizing What You Reward

353. GenMask: Adapting DiT for Segmentation via Direct Mask Generation

354. Rosetta Stone For Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generation

355. Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation

356. Socratic-Geo: Synthetic Data Generation and Cross-Modal Geometric Reasoning via Multi-Agent Interaction

357. Stereo World Model: Camera-Guided Stereo Video Generation

358. Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction

359. REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

360. Semantic Derivative Flow: Graph-Guided Diffusion for Controllable Instance Interactions

361. VarSplat: Uncertainty-aware 3D Gaussian Splatting for Robust RGB-D SLAM

362. Reinforcement-Guided Synthetic Data Generation for Privacy-Sensitive Identity Recognition

363. Image Generation from Contextually-Contradictory Prompts

364. GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator

365. DiffBMP: Differentiable Rendering with Bitmap Primitives

366. SpeeDe3DGS: Speedy Deformable 3D Gaussian Splatting with Temporal Pruning and Motion Grouping

367. BUSSARD: Normalizing Flows for Bijective Universal Scene-Specific Anomalous Relationship Detection

368. AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence

369. FastGS: Training 3D Gaussian Splatting in 100 Seconds

370. Continual Learning for fMRI-Based Brain Disorder Diagnosis via Functional Connectivity Matrices Generative Replay

371. Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards

372. MR-RAG: Multimodal Relevance-Aware Retrieval-Augmented Generation for Medical Visual Question Answering

373. MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

374. NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code

375. Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface

376. CG-Floor: Centroid-Guided Diffusion for Large-Scale Floorplan Generation

377. LAOF: Robust Latent Action Learning with Optical Flow Constraints

378. MeshMosaic: Scaling Artist Mesh Generation via Local-to-Global Assembly

379. Seele: A Unified Acceleration Framework for Real-Time Gaussian Splatting on Mobile Devices

380. Gaussian Splatting-based Low-Rank Tensor Representation for Multi-Dimensional Image Recovery

381. FlowFixer: Towards Detail-Preserving Subject-Driven Generation

382. Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation

383. Eulerian Gaussian Splatting using Hashed Probability Pyramids

384. WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation

385. Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation

386. No Calibration, No Depth, No Problem: Cross-Sensor View Synthesis with 3D Consistency

387. OmniGen2: Towards Instruction-Aligned Multimodal Generation

388. TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis

389. BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

390. ExpPortrait: Expressive Portrait Generation via Personalized Representation

391. PolarGuide-GSDR: 3D Gaussian Splatting Driven by Polarization Priors and Deferred Reflection for Real-World Reflective Scenes

392. Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

393. No Way To Steal My Face: Proactive Defense Against Identity-Preserving Personalized Generation

394. GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting

395. Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers

396. 3D Gaussian Splatting at Arbitrary Resolutions with Compact Proxy Anchors

397. Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization

398. DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

399. VMD-FACT: A New Video Dataset and MLLM-based method for Detecting Realistic AI-Generated Video Misinformation

400. POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation

401. Geo2: Geometry-Guided Cross-view Geo-Localization and Image Synthesis

402. SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation

403. Generative Adversarial Perturbations with Cross-paradigm Transferability on Localized Crowd Counting

404. Next-Scale Autoregressive Models for Text-to-Motion Generation

405. TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts

406. HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

407. Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation

408. RAG-TP: A General Framework for Vehicle Trajectory Prediction via Retrieval-Augmented Generation

409. ShapeR: Robust Conditional 3D Shape Generation from Casual Captures

410. VideoRealBench: A Chain-of-Thought Realism Evaluation Benchmark for Generated Human-Centric Videos

411. gQIR: Generative Quanta Image Reconstruction

412. UniTEX: Universal High Fidelity Generative Texturing for 3D Shapes

413. ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

414. Layered 4D-Rotor Gaussian Splatting: A Compressed Representation for Long Dynamic Scenes

415. More Natural, More Real: Object-aware Gaussian Splatting for 3D Visual Decoding from Human Brain

416. SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

417. LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesis

418. Linear Image Generation by Synthesizing Exposure Brackets

419. Part2^{2}GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting

420. One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control

421. TWINGS: Thin Plate Splines Warp-aligned Initialization for Sparse-View Gaussian Splatting

422. VOSR: A Vision-Only Generative Model for Image Super-Resolution

423. DPGF-Net: Dual-Prior Guided Fusion Network for Joint Assessment of Perceptual Quality and Semantic Consistency in AI-Generated Images

424. DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation

425. PhysGS: Bayesian-Inferred Gaussian Splatting for Physical Property Estimation

426. AnchorSplat: Feed-Forward 3D Gaussian Splatting With 3D Geometric Priors

427. M^3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

428. Node-RF: Learning Generalized Continuous Space-Time Scene Dynamics with Neural ODE-based NeRFs

429. Geometry-Aware Cross-Modal Graph Alignment for Referring Segmentation in 3D Gaussian Splatting

430. Breaking Semantic Boundaries: Distribution-Guided Semantic Exploration for Creative Generation

431. Guardians of the Hair: Rescuing Soft Boundaries in Depth, Stereo, and Novel Views

432. Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation

433. PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards

434. Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

435. PoseAnything: General Pose-guided Video Generation with Part-aware Temporal Coherence

436. Muses: Designing, Composing, Generating Nonexistent Fantasy 3D Creatures without Training

437. SIMPLEPOSTER: A SIMPLE BASELINE FOR PRODUCT POSTER GENERATION

438. NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers

439. Temporal Equilibrium MeanFlow: Bridging the Scale Gap for One-Step Generation

440. PoseD-Flow: Versatile and Guided Flow Matching Model of Human Pose

441. Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation

442. TGT: Text-Grounded Trajectories for Locally Controlled Video Generation

443. Training-free Motion Factorization for Compositional Video Generation

444. ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Data

445. DSFlash: Comprehensive Panoptic Scene Graph Generation in Realtime

446. Generative Video Motion Editing with 3D Point Tracks

447. FLOW: Optimal Transport-Driven Feature Warping for Generalized Remote Physiological Measurement

448. MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving

449. Phrase-grounded APO for Improving Chest X-ray Report Generation

450. Flow Matching for Multimodal Distributions

451. ParkGaussian: Surround-view 3D Gaussian Splatting for Autonomous Parking

452. Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation

453. Unifying Language-Action Understanding and Generation for Autonomous Driving

454. HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation

455. Selectively Extracting and Injecting Visual Attributes into Text-to-Image Models

456. LoFA: Learning to Predict Personalized Prior for Fast Adaptation of Visual Generative Models

457. AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

458. Geometric-Photometric Event-based 3D Gaussian Ray Tracing

459. BA-GS: Bayesian Adaptive Gaussian Splatting for SFM-Free 3D Reconstruction

460. JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization

461. When Anonymity Breaks: Identifying Models Behind Text-to-Image Leaderboards

462. PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation

463. CoLoGen: Progressive Learning of Concept-Localization Duality for Unified Image Generation

464. Learning to Generate Highly Dynamic Videos using Synthetic Motion Data

465. MicroFM: Physics-guided Flow Matching for Isotropic Microscopy Reconstruction

466. HyperGaussians: High-Dimensional Gaussian Splatting for High-Fidelity Animatable Face Avatars

467. LumiX: Structured and Coherent Text-to-Intrinsic Generation

468. Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

469. Flowception: Temporally Expansive Flow Matching for Video Generation

470. DeRVOS: Decoupling Consistent Trajectory Generation and Multimodal Understanding for Referring Video Object Segmentation

471. Text-Driven 3D Hand Motion Generation from Sign Language Data

472. Steering Where to Diffuse: Generative Modeling of Phenotypic Response Simulation with Steered Diffusion Bridge

473. UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching

474. L2DGSL^{2}DGS: Low-Light Dynamic Gaussian Splatting

475. Native and Compact Structured Latents for 3D Generation

476. FilterGS: Traversal-Free Parallel Filtering and Adaptive Shrinking for Large-Scale LoD 3D Gaussian Splatting

477. Unsupervised Multi-Scale Segmentation of 3D Subcellular World with Stable Diffusion Foundation Model

478. SyncDreamer: Controllable and Expressive Avatar Generation Beyond the Talking Head

479. GenBreak: Red Teaming Text-to-Image Generation Using Large Language Models

480. Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods

481. FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models

482. CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization

483. Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

484. Towards Generalizable AI-Generated Image Detection via Image-Adaptive Prompt Learning

485. WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving

486. HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generation

487. HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation

488. Unified Number-Free Text-to-Motion Generation Via Flow Matching

489. From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimation

490. Learning to Learn Weight Generation via Local Consistency Diffusion

491. NI-Tex: Non-isometric Image-based Garment Texture Generation

492. Generative Diffusion Priors for 3D Mapping of the Dark Universe

493. StableMaterials: Enhancing Diversity in Material Generation via Semi-Supervised Learning

494. CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models

495. PixelDiT: Pixel Diffusion Transformers for Image Generation

496. BrepGaussian: CAD reconstruction from Multi-View Images with Gaussian Splatting

497. IGen: Scalable Data Generation for Robot Learning from Open-World Images

498. Turbo-GS: Accelerating 3D Gaussian Fitting for High-Resolution Radiance Fields

499. PerpetualWonder: Long-horizon Action-conditioned 4D Scene Generation

500. Dual-Level Hypergraph Generation for Addressing Feature Scarcity in Whole-Slide Image Classification

501. Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

502. Synthetic Curriculum Reinforces Compositional Text-to-Image Generation

503. Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models

504. A Supervised Multi-task Framework for Joint cryo-ET Restoration Enabled by Generative Physical Simulation

505. Nestwork: Conditional 3D Furnished House Layout Generation through Latent Heterogeneous Graph Diffusion

506. Lafite: A Generative Latent Field for 3D Native Texturing

507. PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

508. Plenoptic Video Generation

509. Seeing through Light and Darkness: Sensor-Physics Grounded Deblurring HDR NeRF from Single-Exposure Images and Events

510. AutoRegressive Generation with B-rep Holistic Token Sequence Representation

511. DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution

512. Enhancing Spatial Understanding in Image Generation via Reward Modeling

513. Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

514. GEM: Generating LiDAR World Model via Deformable Mamba

515. MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

516. SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

517. BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation

518. Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification

519. Self-Corrected Image Generation with Explainable Latent Rewards

520. GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Views

521. Hermite Radial Basis Function for Surface Reconstruction via Differentiable Rendering

522. MMCP-GEN: A Modality-Extensible Diffusion Language Model for Conditional Protein Sequence Generation

523. PPM-CLIP: Probabilistic Prompt Modeling for Generalizable AI-Generated Image Detection

524. DuoGen: Towards Autonomous Interleaved Multimodal Generation

525. Lighting-grounded Video Generation with Renderer-based Agent Reasoning

526. Grounded Latents for Entity-Centric 4D Scene Generation

527. DynamicsBoost: Dynamic Plausible Video Generation via Annotation-Free Continuation Preference Optimization

528. Hidden Dangers of Compositional Generation: Diagnosing Semantic Safety Failures in Text-to-Image Models

529. iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation

530. Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

531. ReLaGS: Relational Language Gaussian Splatting

532. EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Head

533. InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions

534. SG-LoRA: Semantic-guided LoRA Parameters Generation

535. Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

536. Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning

537. Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression

538. A Stitch in Time: Learning Procedural Workflow via Self-Supervised Plackett-Luce Ranking

539. RelightAnyone: A Generalized Relightable 3D Gaussian Head Model

540. SGS-Intrinsic: Semantic-Invariant Gaussian Splatting for Sparse-View Indoor Inverse Rendering

541. Charge: A Comprehensive Novel View Synthesis Benchmark and Dataset to Bind Them All

542. PhysGen: Physically Grounded 3D Shape Generation for Industrial Design

543. OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation

544. FMPose3D: monocular 3D pose estimation via flow matching

545. VABench: A Comprehensive Benchmark for Audio-Video Generation

546. x^2-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space

547. RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation

548. Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering

549. FastHybrid: Accelerating Hybrid Autoregressive Image Generation with Lookahead and Guided Decoding

550. FrankenMotion: Part-level Human Motion Generation and Composition

551. GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstruction

552. Grid Distillation: Compositional Image Distillation via Structured Generative Grids

553. ODGS-SLAM: Omnidirectional Gaussian Splatting SLAM

554. Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering

555. Confidence-Guided Multi-Scale Aggregation for Sparse-View High-Resolution 3D Gaussian Splatting

556. DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis

557. LeapAlign: Post-training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

558. UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection

559. I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models

560. RigMo: Unifying Rig and Motion Learning for Generative Animation

561. UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

562. HandWorld: Hand-Centric Unified Video Action Generation

563. Animator-Centric Skeleton Generation on Objects with Fine-Grained Details

564. Endless World: Real-Time 3D-Aware Long Video Generation

565. RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment

566. Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models

567. Self-Consistency for LLM-Based Motion Trajectory Generation and Verification

568. PromptEnhancer: Taming Your Rewriter for Text-to-Image Generation via Fine-Grained Reward

569. Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling

570. Generative Point Tracking and Forecasting

571. Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors

572. ViLearn: Accelerating Training Convergence of Image-to-3D Generation via Visibility Learning

573. Inference-time Physics Alignment of Video Generative Models with Latent World Models

574. Probabilistic Precipitation Nowcasting with Rectified Flow Transformers

575. PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentation

576. EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

577. Evaluating Generative Models via One-Dimensional Code Distributions

578. LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models

579. Robust3DGSW: Toward Robust Watermarking for Quantization-Aware 3D Gaussian Splatting

580. FlowPalm: Optical Flow Driven Non-Rigid Deformation for Geometrically Diverse Palmprint Generation

581. When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance

582. SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model

583. GHPT: Real-Time Relightable Gaussian Splatting using Hybrid Path Tracing

584. ULF-Loc: Unbiased Landmark Feature for Robust Visual Localization with 3D Gaussian Splatting

585. OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

586. Voxify3D: Pixel Art Meets Volumetric Rendering

587. SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation

588. 3D Gaussian Splatting with Self-Constrained Priors for High Fidelity Surface Reconstruction

589. PhysGaia: A Physics-aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesis

590. ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Senisng

591. SAGA: Source Attribution of Generative AI Videos

592. TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens

593. CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation

594. PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis

595. ReGenHOI: Unifying Reconstruction and Generation for 3D Human-Object Interaction Understanding

596. Masked Region Transformer for Layered Image Generation and Editing at Scale

597. ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

598. StyleDoctor: Towards Specialist Reward Model for Style-centric Generation Tasks

599. FlowMotion: Training-Free Flow Guidance for Video Motion Transfer

600. Resolving the Identity Crisis in Text-to-Image Generation

601. Detecting Compressed AI-Generated Images via Phase Spectrum Robustness

602. MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts

603. OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data

604. OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

605. PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation

606. Human Geometry Distribution for 3D Animation Generation

607. PhysVid: Physics Aware Local Conditioning for Generative Video Models

608. ArtLLM: Generating Articulated Assets via 3D LLM

609. Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splatting

610. Hint2Gen: Bridging Understanding and Generation via Code-structured Hints

611. Structure-to-Intensity Diffusion for Adverse-Weather LiDAR Generation

612. IDESplat: Iterative Depth Probability Estimation for Generalizable 3D Gaussian Splatting

613. LacTokGen: Latent Consistency Tokenizer for 1024-pixel Image Generation by 256 Tokens

614. MacTok: Robust Continuous Tokenization for Image Generation

615. Unified Camera Positional Encoding for Controlled Video Generation

616. VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

617. HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning

618. From None to All: Self-Supervised 3D Reconstruction via Novel View Synthesis

619. Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation

620. Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paper

621. OctoT2I: A Self-Evolving Agentic Text-to-Image Router

622. Generative Modeling of Weights: Generalization or Memorization?

623. MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment

624. MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

625. PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion

626. Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens

627. Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation

628. Towards Human-Like Robot Handwriting via Contour-Aware Generation

629. Generative Video Compression with One-Dimensional Latent Representation

630. ExPose: Reinforcing Video Generation Models for Extreme Pose Estimation

631. Gloria: Consistent Character Video Generation via Content Anchors

632. UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in RL

633. InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation

634. Prompt-Free Unknown Label Generation for Open World Detection in Remote Sensing

635. Diffusion Probe: Generated Image Result Prediction Using CNN Probes

636. Cross-modal Representation Learning for Diffusion-generated Image Detection

637. CAST: Context-Aware Dynamic Latent Space Transformation for Interactive Text-to-Image Retrieval

638. NeuROK: Generative 4D Neural Object Kinematics

639. Detecting AI-Generated Forgeries via Iterative Manifold Deviation Amplification

640. OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation

641. FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts

642. Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation

643. AutoDebias: An Automated Framework for Detecting and Mitigating Backdoor Biases in Text-to-Image Models

644. NVGS: Neural Visibility for Occlusion Culling in 3D Gaussian Splatting

645. CADC: Content Adaptive Diffusion-Based Generative Image Compression

646. MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation

647. From Rays to Projections: Better Inputs for Feed-Forward View Synthesis

648. Aligning Multi-Character Narrative Image Generation with Multi-Aspect Human Preferences

649. TokenSplat: Token-aligned 3D Gaussian Splatting for Feed-forward Pose-free Reconstruction

650. When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

651. PAMotion: Physics-Aware Motion Generation for Full-Body Interaction with Multiple Objects

652. Scaling View Synthesis Transformers

653. Think-Then-Generate: Structural Chain-of-Thought Reasoning for Consistent 3D Generation

654. OpenT2M: No-frill Motion Generation with Open-source, Large-scale, High-quality Data

655. Unified Personalized Understanding, Generating and Editing

656. OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning

657. When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators

658. AERGS-SLAM: Auto-Exposure-Robust Stereo 3D Gaussian Splatting SLAM

659. Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement

660. ShapeAR: Generating Editable Shape Layers via Autoregressive Diffusion

661. StreamDiT: Real-Time Streaming Text-to-Video Generation

662. Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

663. SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training

664. Urban-GS: A Unified 3D Gaussian Splatting Framework for Compact and High-Fidelity Aerial-to-Street Reconstruction

665. BrickNet: Graph-Backed Generative Brick Assembly

666. Adapter Shield: A Unified Framework with Built-in Authentication for Preventing Unauthorized Zero-Shot Image-to-Image Generation

667. SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

668. GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

669. Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillation

670. Mark4D: Temporally-Consistent Watermarking for 4D Gaussian Splatting

671. 3D Gaussian Splatting from Unposed Spike Stream

672. WaTeRFlow: Watermark Temporal Robustness via Flow Consistency

673. LoL: Longer than Longer, Scaling Video Generation to Hour

674. Markovian Scale Prediction: A New Era of Visual Autoregressive Generation

675. VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation

676. GROW: Watermark Generation with Progressive Guidance for Diffusion Models

677. Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

678. Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos

679. Your Classifier Can Do More: Towards Balancing the Gaps in Classification, Robustness, and Generation

680. FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories

681. Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation

682. SounDiT: Geo-Contextual Soundscape-to-Landscape Generation

683. A Difference-in-Difference Approach to Detecting AI-Generated Images

684. A Temporal and Content Co-Awareness Latent Diffusion for Controllable Hand Image Generation

685. HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

686. 3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds

687. Diff-SemiER: Transparency-Aware Adaptive Fusion Diffusion Model with Generative Prior for Semi-Transparent Eyeglasses Removal

688. Hierarchical Codec Diffusion for Video-to-Speech Generation

689. MaskDexGrasp: Generative Masked Modeling for Part-Aware Dexterous Grasp Synthesis

690. Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

691. U^2Flow: Uncertainty-Aware Unsupervised Optical Flow Estimation

692. Back to Basics: Let Denoising Generative Models Denoise

693. Transition Models: Rethinking the Generative Learning Objective

694. M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation

695. Progressive Neural Architecture Generation

696. CubeComposer: Spatio-Temporal Autoregressive 4K 360deg Video Generation from Perspective Video

697. Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation

698. 3D Space as a Scratchpad for Editable Text-to-Image Generation

699. Causal Motion Diffusion Models for Autoregressive Motion Generation

700. Making Training-Free Diffusion Segmentors Scale with the Generative Power

701. DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models

702. ELITE: Efficient Gaussian Head Avatar from a Monocular Video via Learned Initialization and Test-time Generative Adaptation

703. ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

704. MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAE

705. cryoSENSE: Compressive Sensing Enables High-throughput Microscopy with Sparse and Generative Priors on the Protein Cryo-EM Image Manifold

706. Stepwise Credit Assignment for GRPO on Flow-Matching Models

707. Improved Mean Flows: On the Challenges of Fastforward Generative Models

708. POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modeling

709. TagSplat: Topology-Aware Gaussian Splatting for Dynamic Mesh Modeling and Tracking

710. Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation

711. Dual-Granularity Memory for Efficient Video Generation

712. VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA

713. LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

714. Residual Connections Harm Generative Representation Learning

715. LangRef3DGS: Natural Language-Guided 3D Referential Segmentation from Partial Observations via 3D Gaussian Splatting

716. Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation

717. GPFlow: Gaussian Prototype Probability Flow for Unsupervised Multi-Modal Anomaly Detection

718. Flow Map Distillation Without Data

719. Unified Vector Floorplan Generation via Markup Representation

720. Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation

721. Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

722. DBMSolver: A Training-free Diffusion Bridge Sampler for High-Quality Image-to-Image Translation

723. Anti-I2V: Safeguarding your Photos from Malicious Image-to-video Generation

724. AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation

725. DriveLaW: Unifying Planning and Video Generation in a Latent Driving World

726. Generative Neural Video Compression via Video Diffusion Prior

727. BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation

728. Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

729. Learning Differentiable Hierarchies in 3D Gaussian Splatting

730. Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models

731. Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images

732. Circular-DPO: Aligning Multi-Stage 3D Generative Models via Preference Feedback Loop

733. Align Images Before You Generate

734. ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation

735. GS^2: Graph-based Spatial Distribution Optimization for Compact 3D Gaussian Splatting

736. GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation

737. PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation

738. CineBrain: A Large-Scale Multi-Modal Audiovisual Brain Dataset for Brain-Conditioned Video Generation

739. Scaling Up AI-Generated Image Detection with Generator-Aware Prototypes

740. ReaGEN: Adaptive Generation of Structured Chains-of-Thought for Efficient Multimodal Reasoning

741. WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

742. Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration

743. Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

744. Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity

745. FabricGen: Microstructure-Aware Woven Fabric Generation

746. FG-Portrait: 3D Flow Guided Editable Portrait Animation

747. MatchMask: Mask-Centric Generative Data Augmentation for Label-Scarce Semantic Segmentation

748. ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation

749. SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens

750. ExpoCM: Exposure-Aware One-Step Generative Single-Image HDR Reconstruction

751. Taming Generative Diffusion Model for Task-Oriented Infrared Imaging

752. Diversity over Uniformity: Rethinking Representation in Generated Image Detection

753. MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks

754. GOR-IS: 3D Gaussian Object Removal In the Intrinsic Space

755. Nonlinear Color Transfer via Learnable Bezier Flows

756. DreamOmni2: Multimodal Instruction-based Generation and Editing

757. Decision Boundary-aware Generation for Long-tailed Learning

758. DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation

759. Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling

760. FastEventDGS: Deformable Gaussian Splatting for Fast Dynamic Scenes from a Single Event Camera

761. RenderFlow: Single-Step Neural Rendering via Flow Matching

762. RDF-MIG: A Robust Diffusion Framework for Masked Image Generation to Augment Semantic Segmentation and Change Detection

763. Robo-SGG: Exploiting Layout-Oriented Normalization and Restitution Can Improve Robust Scene Graph Generation

764. 4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

765. HiDRA: Hierarchical Degradation Representation and Adaptation with Generative Priors for Enhancing Infrared Vision

766. Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization

767. CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration

768. StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation

769. EVLF: Early Vision-Language Fusion for Generative Dataset Distillation

770. SR3R: Rethinking Super-Resolution 3D Reconstruction With Feed-Forward Gaussian Splatting

771. IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation

772. MU-GeNeRF: Multi-view Uncertainty-guided Generalizable Neural Radiance Fields for Distractor-aware Scene

773. VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction

774. Mirai: Autoregressive Visual Generation Needs Foresight

775. Solving a Nonlinear Blind Inverse Problem for Tagged MRI with Physics and Deep Generative Priors

776. Spatiotemporal Pyramid Flow Matching for Climate Emulation

777. Match-and-Fuse: Consistent Generation from Unstructured Image Sets

778. MVInverse: Feed-forward Multiview Inverse Rendering in Seconds

779. MM-ACT: Learn from Multimodal Parallel Generation to Act

780. Property-Informed Diffusion-Based Text-to-Microstructure Generation

781. IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbations

782. ReFlow: Self-correction Motion Learning for Dynamic Scene Reconstruction

783. Is Bin Generation Indispensable? A Bin-Generation-Free Dataset Quantization via Semantic Perspective

784. SVBench: Evaluation of Video Generation Models on Social Reasoning

785. DiT-Distill: Open-Set Fine-Grained Retrieval via Generative Curriculum Knowledge

786. Mixture-of-Experts based Feature Decoupling for Open Vocabulary Scene Graph Generation

787. GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processes

788. Hear What Matters! Text-conditioned Selective Video-to-Audio Generation

789. SCIEval: Evaluating and Benchmarking the Faithfulness of Scientific Image Generation and Interpretation with Large Multimodal Models

790. SemLayer: Semantic-aware Generative Segmentation and Layer Construction for Abstract Icons

791. ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion

792. Plug-and-Play PDE Optimization for 3D Gaussian Splatting: Toward High-Quality Rendering and Reconstruction

793. Unified Customized Generation by Disentangled Reward Modeling

794. AeroGS: Scale-Aware Gaussian Splatting for Pose-Free Dynamic UAV Scene Reconstruction

795. Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motions

796. Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models

797. GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesis

798. Mixture of States: Routing Token-Level Dynamics for Multimodal Generation

799. GenTract: Generative Global Tractography

800. Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training

801. TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models

802. PhysHO: Physics-Based Dynamic 3D Gaussian Human and Object from Monocular Video

803. CaT-GS: Efficient 3DGS Rendering for Large-Scale Scenes with Inter-frame Caching and Tile Scheduling

804. SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation

805. Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models

806. Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation

807. Understanding, Accelerating, and Improving MeanFlow Training

808. PhyCo: Learning Controllable Physical Priors for Generative Motion

809. Learning Straight Flows: Variational Flow Matching for Efficient Generation

810. DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation

811. Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

812. ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation

813. Order Matters: 3D Shape Generation from Sequential VR Sketches

814. DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

815. Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation

816. RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

817. SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution

818. MotionMaster: Generalizable Text-Driven Motion Generation and Editing

819. Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model

820. Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation

821. Toward Early Quality Assessment of Text-to-Image Diffusion Models

822. Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization

823. Rethinking Glyph Spatial Information in Font Generation

824. Learning Long-term Motion Embeddings for Efficient Kinematics Generation

825. IVAAN: Instance-level Vision-Language Alignment via Attribute-Guided Text Prompts Generation for Nuclei Analysis

826. AdvFM: Lookahead Flow-Matching Velocity-Field Attacks for Imperceptible and Transferable Adversarial Examples

827. MLLMSplat: A 2D MLLM-Powered Framework for 3D Gaussian Splatting Understanding, Generation, and Editing

828. Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamics

829. TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction

830. Learning from Oblivion: Predicting Knowledge-Overflowed Weights via Retrodiction of Forgetting

831. EvoID: Reinforced Evolution for Identity-Preserving Video Generation

832. Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM

833. F^2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modeling

834. RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generation

835. PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation

836. Diffusion with a Linguistic Compass: Steering the Generation of Clinically Plausible Future sMRI Representations for Early MCI Conversion Prediction

837. MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation

838. CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation

839. mmWaveFlow: Unified Enhancement and Generation of mmWave Human Point Clouds

840. Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

841. MemFlow: A Lightweight Forward Memorizing Framework for Quick Domain Adaptive Feature Mapping

842. Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

843. RecTok: Reconstruction Distillation along Rectified Flow

844. PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction

845. AudioStory: Generating Long-Form Narrative Audio with Large Language Models

846. RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation

847. ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction

848. CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation

849. Personalized Longitudinal Medical Report Generation via Temporally-Aware Federated Adaptation

850. M4V: Multimodal Mamba for Efficient Text-to-Video Generation

851. PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting

852. SEA-Flow3D: Simplified, Efficient, and Accurate Scene Flow via Spatial Vector Sampling and Multi-scale Refinement

853. Bridging Privacy and Provenance: Traceable Virtual Identity Generation

854. Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representations

855. FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching

856. SketchFaceGS: Real-Time Sketch-Driven Face Editing and Generation with Gaussian Splatting

857. Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

858. Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

859. F2^2-Assist: Multi-Phase Fetal Growth Forecast and Report Generation from Ultrasound Examination

860. Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models

861. NG-GS: NeRF-guided 3D Gaussian Splatting Segmentation

862. PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes

863. BiGain: Unified Token Compression for Joint Generation and Classification

864. MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models

865. Agentic Retoucher for Text-To-Image Generation

866. OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens

867. GeneVAR: Causal MeanFlow for Autoregressive Gene-to-WSI Tile Synthesis

868. SAT-RRG: LLM-Guided Self-Adaptive Training for Radiology Report Generation with Token-Level Push-Pull Optimization

869. Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimization

870. DynFusion: Rethinking Condition Fusion for Adaptive Multi-Conditional Text-to-Image Generation

871. ChArtist: Generating Pictorial Charts with Unified Spatial and Subject Control

872. Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation

873. Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO

874. PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling

875. Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation

876. TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation

877. HierAmp: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillation

878. Layer Consistency Matters: Elegant Latent Transition Discrepancy for Generalizable Synthetic Image Detection

879. PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction

880. IncreFA: Breaking the Static Wall of Generative Model Attribution

881. GrOCE : Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models

882. ProgressiveAvatars: Progressive Animatable 3D Gaussian Avatars

883. GM-R^2: Generative Matching Learning for Unsupervised Geometric Representation and Registration

884. Cross-View Splatter: Feed-Forward View Synthesis with Georeferenced Images

885. Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

886. SunFaded: Illumination-Aware Gaussian Splatting for Dark Scenes with Camera-Mounted Active Lighting

887. Zero-shot Detection of AI-Generated Image via RAW-RGB Alignment

888. Thermal is Always Wild: Characterizing and Addressing Challenges in Thermal-Only Novel View Synthesis

889. AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

890. CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion

891. RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing

892. Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation

893. Adapting In-context Generation for Enhanced Composed Image Retrieval

894. CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration

895. Hierarchical Visual Relocalization with Nearest View Synthesis from Feature Gaussian Splatting

896. RemedyGS: Defend 3D Gaussian Splatting Against Computation Cost Attacks

897. SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation

898. UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents

899. PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting

900. Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning

901. Dropping Anchor and Spherical Harmonics for Sparse-view Gaussian Splatting

902. ARES: Unifying Asymmetric RGB-Event Stereo for Probabilistic Scene Flow Estimation

903. RFDM: Residual Flow Diffusion Models for Video Editing

904. Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videos

905. EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing