- Published on
CVPR 2026 — Generative Models & Image Synthesis
Generative Models & Image Synthesis
905 papers
1. DirectFisheye-GS: Enabling Native Fisheye Input in Gaussian Splatting with Cross-View Joint Optimization
- Link: Open Access
- arXiv: 2604.00648
2. GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling
- Link: Open Access
- arXiv: 2602.05202
3. Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models
- Link: Open Access
- arXiv: 2604.09227
4. Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Models
- Link: Open Access
- arXiv: 2604.16481
5. REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting
- Link: Open Access
- arXiv: 2511.17059
6. Physical Simulator In-the-Loop Video Generation
- Link: Open Access
- arXiv: 2603.06408
7. Functional Mean Flow in Hilbert Space
- Link: Open Access
- arXiv: 2511.12898
8. The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
- Link: Open Access
- arXiv: 2511.20614
9. Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning
- Link: Open Access
- arXiv: 2512.15693
10. HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views
- Link: Open Access
- arXiv: 2603.01099
11. Bidirectional Query-Driven Generation of Parametric CAD Sketch
- Link: Open Access
12. PhysIR-Splat: Physically Consistent Thermal Infrared Radiative Transfer in 3D Gaussian Splatting
- Link: Open Access
13. RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting
- Link: Open Access
- arXiv: 2605.18263
14. One-Shot Flow, Any-Time Frame: A Bidirectional Warping Framework for Event-Based Video Frame Interpolation
- Link: Open Access
15. FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario
- Link: Open Access
- arXiv: 2603.22102
16. GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compression
- Link: Open Access
17. Exploring Spatial Intelligence from a Generative Perspective
- Link: Open Access
- arXiv: 2604.20570
18. WaDi: Weight Direction-aware Distillation for One-step Image Synthesis
- Link: Open Access
- arXiv: 2603.08258
19. Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment
- Link: Open Access
20. BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation
- Link: Open Access
- arXiv: 2602.18873
21. C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion
- Link: Open Access
- arXiv: 2604.16680
22. When Local Rules Create Global Order: Self-Organized Representation Learning for Latent Diffusion Models
- Link: Open Access
23. MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer
- Link: Open Access
24. Rectifying Latent Space for Generative Single-Image Reflection Removal
- Link: Open Access
- arXiv: 2512.06358
25. Refracting Reality: Generating Images with Realistic Transparent Objects
- Link: Open Access
- arXiv: 2511.17340
26. Decoupled Generative Modeling for Human-Object Interaction Synthesis
- Link: Open Access
- arXiv: 2512.19049
27. SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
- Link: Open Access
- arXiv: 2603.22228
28. Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans
- Link: Open Access
- arXiv: 2603.11640
29. RetimeGS: Continuous-Time Reconstruction of 4D Gaussian Splatting
- Link: Open Access
- arXiv: 2603.13783
30. RAVEN: Erasing Invisible Watermarks via Novel View Synthesis
- Link: Open Access
- arXiv: 2601.08832
31. Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitives
- Link: Open Access
- arXiv: 2602.24136
32. FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching
- Link: Open Access
33. IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
- Link: Open Access
- arXiv: 2512.09663
34. Parallel Jacobi Decoding for Fast Autoregressive Image Generation
- Link: Open Access
35. MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting
- Link: Open Access
36. Repurposing 3D Generative Model for Autoregressive Layout Generation
- Link: Open Access
- arXiv: 2604.16299
37. WonderZoom: Multi-Scale 3D World Generation
- Link: Open Access
- arXiv: 2512.09164
38. MatLat: Material Latent Space for PBR Texture Generation
- Link: Open Access
- arXiv: 2512.17302
39. Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs
- Link: Open Access
40. LiveGesture: Streamable Co-Speech Gesture Generation Model
- Link: Open Access
- arXiv: 2604.10927
41. Write Where It Matters: Policy-Guided Watermarks for 3D Gaussian Splatting
- Link: Open Access
42. DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
- Link: Open Access
- arXiv: 2512.21514
43. Self-Evaluation Unlocks Any-Step Text-to-Image Generation
- Link: Open Access
- arXiv: 2512.22374
44. Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists
- Link: Open Access
- arXiv: 2603.09277
45. Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction
- Link: Open Access
46. Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models
- Link: Open Access
47. GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
- Link: Open Access
- arXiv: 2603.15616
48. NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks
- Link: Open Access
- arXiv: 2512.06251
49. VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations
- Link: Open Access
- arXiv: 2604.24885
50. CAD-Refiner: A Unified Framework for CAD Generation and Iterative Editing
- Link: Open Access
51. When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters
- Link: Open Access
- arXiv: 2602.21977
52. Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework
- Link: Open Access
- arXiv: 2605.07429
53. PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation
- Link: Open Access
- arXiv: 2603.29855
54. Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image
- Link: Open Access
- arXiv: 2603.05908
55. WildCap: Facial Albedo Capture in the Wild via Hybrid Inverse Rendering
- Link: Open Access
- arXiv: 2512.11237
56. Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching
- Link: Open Access
- arXiv: 2604.18623
57. A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- Link: Open Access
- arXiv: 2511.19004
58. FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gain
- Link: Open Access
- arXiv: 2511.21113
59. IR-HGP: Physically-Aware Gaussian Inverse Rendering for High-Illumination Scenes via Generative Priors
- Link: Open Access
60. GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving
- Link: Open Access
- arXiv: 2511.18729
61. The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
- Link: Open Access
- arXiv: 2511.20256
62. Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers
- Link: Open Access
- arXiv: 2603.05769
63. Open the Motion Door: Atomic Motion Decomposition and Recomposition for Open-Vocabulary Motion Generation
- Link: Open Access
64. Pantheon360: Taming Digital Twin Generation via 3D-Aware 360deg Video Diffusion
- Link: Open Access
65. GeoDexGrasp: Geometry-aware Generation for Data-efficient and Physics-plausible Dexterous Grasping
- Link: Open Access
66. CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
- Link: Open Access
- arXiv: 2512.13276
67. BiOTPrompt: Bidirectional Optimal Transport Guided Prompting for Disease Evolution-aware Radiology Report Generation
- Link: Open Access
68. Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model
- Link: Open Access
- arXiv: 2601.04033
69. Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation
- Link: Open Access
- arXiv: 2511.22690
70. Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
- Link: Open Access
- arXiv: 2512.12675
71. GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidance
- Link: Open Access
- arXiv: 2605.18252
72. MotionHiFlow: Text-to-Motion via Hierarchical Flow Matching
- Link: Open Access
- arXiv: 2604.23264
73. What Are You Doing? A Closer Look at Controllable Human Video Generation
- Link: Open Access
- arXiv: 2503.04666
74. Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learning
- Link: Open Access
- arXiv: 2602.20157
75. Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time Intervention
- Link: Open Access
- arXiv: 2511.22555
76. UZ3DVG: Unaided Zero-Shot 3D Visual Grounding with Generated Language Conditions
- Link: Open Access
77. Your One-Stop Solution for AI-Generated Video Detection
- Link: Open Access
- arXiv: 2601.11035
78. IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework
- Link: Open Access
- arXiv: 2603.09312
79. FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacement
- Link: Open Access
- arXiv: 2511.18346
80. OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
- Link: Open Access
- arXiv: 2604.04348
81. SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation
- Link: Open Access
- arXiv: 2512.03350
82. Visual Prototype Conditioned Focal Region Generation for UAV-Based Object Detection
- Link: Open Access
- arXiv: 2604.02966
83. Multi-Scale Local Speculative Decoding for Image Generation
- Link: Open Access
84. SURF: Signature-Retained Fast Video Generation
- Link: Open Access
- arXiv: 2603.21002
85. OneHOI: Unifying Human-Object Interaction Generation and Editing
- Link: Open Access
- arXiv: 2604.14062
86. SemiGDA: Generative Dual-distribution Alignment for Semi-Supervised Medical Image Segmentation
- Link: Open Access
- arXiv: 2604.23274
87. DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance
- Link: Open Access
- arXiv: 2512.10894
88. FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation
- Link: Open Access
- arXiv: 2603.01515
89. GenMatter: Perceiving Physical Objects with Generative Matter Models
- Link: Open Access
- arXiv: 2604.22160
90. P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction
- Link: Open Access
- arXiv: 2605.16925
91. MeshSplatting: Differentiable Rendering with Opaque Meshes
- Link: Open Access
- arXiv: 2512.06818
92. CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling
- Link: Open Access
- arXiv: 2510.20776
93. Disco-GS: Gaussian Splatting in Dynamic Color Lighting
- Link: Open Access
94. PureCC: Pure Learning for Text-to-Image Concept Customization
- Link: Open Access
- arXiv: 2603.07561
95. Transition Matching Distillation for Fast Video Generation
- Link: Open Access
- arXiv: 2601.09881
96. FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation
- Link: Open Access
- arXiv: 2512.03520
97. MeshRipple: Structured Autoregressive Generation of Artist-Meshes
- Link: Open Access
- arXiv: 2512.07514
98. Text-Image Conditioned 3D Generation
- Link: Open Access
- arXiv: 2603.21295
99. SV-GS: Sparse View 4D Reconstruction with Skeleton-Driven Gaussian Splatting
- Link: Open Access
- arXiv: 2601.00285
100. SharpTimeGS: Sharp and Stable Dynamic Gaussian Splatting via Lifespan Modulation
- Link: Open Access
- arXiv: 2602.02989
101. Splatent: Splatting Diffusion Latents for Novel View Synthesis
- Link: Open Access
102. Benchmarking Single-Factor Physical Video-to-Audio Generation
- Link: Open Access
103. MV2UV: Generating High-quality UV Texture Maps with Multiview Prompts
- Link: Open Access
- arXiv: 2603.15436
104. Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training
- Link: Open Access
- arXiv: 2603.16139
105. SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time
- Link: Open Access
- arXiv: 2512.25075
106. Learning Hierarchical Hyperbolic Mixture Model for Part-aware 3D Generation
- Link: Open Access
107. GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution
- Link: Open Access
- arXiv: 2603.16769
108. Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset
- Link: Open Access
- arXiv: 2511.15186
109. Yume1.5: A Text-Controlled Interactive World Generation Model
- Link: Open Access
110. CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection
- Link: Open Access
111. Tea-Adapter: Teacher Adapter for Efficient Conditional Generation
- Link: Open Access
112. Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos
- Link: Open Access
- arXiv: 2603.29036
113. Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
- Link: Open Access
- arXiv: 2601.05124
114. TV2TV: A Unified Framework for Interleaved Language and Video Generation
- Link: Open Access
- arXiv: 2512.05103
115. Pose-Free Omnidirectional Gaussian Splatting for 360-Degree Videos with Consistent Depth Priors
- Link: Open Access
- arXiv: 2603.23324
116. SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers
- Link: Open Access
- arXiv: 2604.01826
117. Self-Paced and Self-Corrective Masked Prediction for Movie Trailer Generation
- Link: Open Access
- arXiv: 2512.04426
118. FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control
- Link: Open Access
- arXiv: 2510.08527
119. FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips
- Link: Open Access
- arXiv: 2604.05731
120. Intra-class Distribution-guided Generative Hashing with Neighbor Refinement for Cross-modal Retrieval
- Link: Open Access
121. GVIS: Generative Vector Image Steganography
- Link: Open Access
122. Physically Inspired Gaussian Splatting for HDR Novel View Synthesis
- Link: Open Access
- arXiv: 2603.28020
123. LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens
- Link: Open Access
- arXiv: 2602.12370
124. SparseSplat: Towards Applicable Feed-Forward 3D Gaussian Splatting with Pixel-Unaligned Prediction
- Link: Open Access
- arXiv: 2604.03069
125. E2EGS: Event-to-Edge Gaussian Splatting for Pose-Free 3D Reconstruction
- Link: Open Access
- arXiv: 2603.14684
126. FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generation
- Link: Open Access
- arXiv: 2604.10512
127. PGA: Prior-free Generative Attack for Practical No-box Scenario
- Link: Open Access
128. Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images
- Link: Open Access
- arXiv: 2603.19766
129. OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning
- Link: Open Access
- arXiv: 2510.26213
130. Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner
- Link: Open Access
- arXiv: 2509.24979
131. PoseGaussian: 6D Pose Estimation for Unseen Objects via Sparse-View Object-Level 3D Gaussian Splatting
- Link: Open Access
132. Simple Agents Outperform Experts in Biomedical Imaging Workflow Optimization
- Link: Open Access
- arXiv: 2512.06006
133. SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models
- Link: Open Access
- arXiv: 2507.12156
134. Real-Time Dynamic Scene Rendering with Controlled Compressibility and Contact Awareness
- Link: Open Access
135. DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation
- Link: Open Access
- arXiv: 2602.23165
136. SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation
- Link: Open Access
- arXiv: 2604.03723
137. Energy-GS: Image Energy-guided Pose Alignment Gaussian Splatting with redesigned pose gradient flow
- Link: Open Access
138. WildRayZer: Self-supervised Large View Synthesis in Dynamic Environments
- Link: Open Access
- arXiv: 2601.10716
139. Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution
- Link: Open Access
- arXiv: 2603.10583
140. IF-Prune: Information-Flow Guided Token Pruning for Efficient Vision-Language Models
- Link: Open Access
141. RevINN: An End-to-End Invertible Neural Network for Reversible Adversarial Examples Generation
- Link: Open Access
142. Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstruction
- Link: Open Access
- arXiv: 2604.15941
143. SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation
- Link: Open Access
- arXiv: 2603.29186
144. Lynx: Towards High-Fidelity Personalized Video Generation
- Link: Open Access
- arXiv: 2509.15496
145. Towards Human-Imperceptible Backdoor Attacks on Text-to-Image Diffusion Models
- Link: Open Access
146. ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control
- Link: Open Access
147. Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization
- Link: Open Access
- arXiv: 2511.20647
148. Proxy-GS: Unified Occlusion Priors for Training and Inference in Structured 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2509.24421
149. SAIDO: Generalizable Detection of AI-Generated Images via Scene-Aware and Importance-Guided Dynamic Optimization in Continual Learning
- Link: Open Access
- arXiv: 2512.00539
150. UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
- Link: Open Access
- arXiv: 2512.07831
151. Spatia: Video Generation with Updatable Spatial Memory
- Link: Open Access
- arXiv: 2512.15716
152. ORV: 4D Occupancy-centric Robot Video Generation
- Link: Open Access
- arXiv: 2506.03079
153. LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference
- Link: Open Access
- arXiv: 2603.11605
154. DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation
- Link: Open Access
- arXiv: 2602.22549
155. GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning
- Link: Open Access
- arXiv: 2603.22687
156. Omni2Sound: Towards Unified Video-Text-to-Audio Generation
- Link: Open Access
- arXiv: 2601.02731
157. LogCD: Local-to-global Consistency Distillation for Few-step Image Generation
- Link: Open Access
158. FlowComposer: Composable Flows for Compositional Zero-Shot Learning
- Link: Open Access
- arXiv: 2603.16641
159. UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
- Link: Open Access
- arXiv: 2511.03334
160. HySeg: Learning Generative Priors for Structure-Aware Remote Sensing Segmentation
- Link: Open Access
161. FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs
- Link: Open Access
162. VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping
- Link: Open Access
- arXiv: 2511.13587
163. NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity
- Link: Open Access
- arXiv: 2604.09817
164. Cross-Instance Gaussian Splatting Registration via Geometry-Aware Feature-Guided Alignment
- Link: Open Access
- arXiv: 2603.21936
165. MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis
- Link: Open Access
- arXiv: 2512.04221
166. ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
- Link: Open Access
- arXiv: 2512.10286
167. AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization
- Link: Open Access
- arXiv: 2603.25118
168. Breaking the 3D Dataset Bottleneck: Fast Scalable Generation of Aligned 3D Assets from Scratch for Category 6D Pose Estimation and Robotic Grasping
- Link: Open Access
169. Easy3E: Feed-Forward 3D Asset Editing via Rectified Voxel Flow
- Link: Open Access
- arXiv: 2602.21499
170. GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
- Link: Open Access
- arXiv: 2512.23180
171. Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
- Link: Open Access
- arXiv: 2512.10949
172. OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation
- Link: Open Access
- arXiv: 2506.02015
173. MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation
- Link: Open Access
174. Stable Mean Flow: Lyapunov-Inspired One-Step Flow Matching
- Link: Open Access
175. Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues
- Link: Open Access
- arXiv: 2603.21138
176. CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image
- Link: Open Access
- arXiv: 2603.17779
177. Language-Free Generative Editing from One Visual Example
- Link: Open Access
- arXiv: 2603.25441
178. EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization
- Link: Open Access
- arXiv: 2603.21332
179. GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matching
- Link: Open Access
180. WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling
- Link: Open Access
- arXiv: 2512.07821
181. Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2512.15508
182. Learning Compact 3D Representations from Feed-Forward Novel View Synthesis
- Link: Open Access
183. ShowUI-p: Flow-based Generative Models as GUI Dexterous Hands
- Link: Open Access
184. FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation
- Link: Open Access
- arXiv: 2603.22054
185. GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Prediction
- Link: Open Access
- arXiv: 2603.21943
186. Diff4Splat: Repurposing Video Diffusion Models for Dynamic Scene Generation
- Link: Open Access
187. OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generation
- Link: Open Access
- arXiv: 2603.27637
188. Improving Controllable Generation: Faster Training and Better Performance via x0-Supervision
- Link: Open Access
189. AdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLM
- Link: Open Access
- arXiv: 2603.04908
190. Visual-RRT: Finding Paths toward Visual-Goals via Differentiable Rendering
- Link: Open Access
- arXiv: 2604.16388
191. MAPo: Motion-Aware Partitioning of Deformable 3D Gaussian Splatting for High-Fidelity Dynamic Scene Reconstruction
- Link: Open Access
- arXiv: 2508.19786
192. EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses
- Link: Open Access
- arXiv: 2511.18173
193. RaGS: Unleashing 3D Gaussian Splatting from 4D Radar and Monocular Cue for 3D Object Detection
- Link: Open Access
- arXiv: 2507.19856
194. A Debiased Reconstruction-based Framework for Training-Free Detection of AI-Generated Images
- Link: Open Access
195. StyleTextGen: Style-Conditioned Multilingual Scene Text Generation
- Link: Open Access
- arXiv: 2605.14708
196. Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
- Link: Open Access
- arXiv: 2511.20549
197. HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images
- Link: Open Access
- arXiv: 2603.02210
198. ClusterMark: Towards Robust Watermarking for Autoregressive Image Generators with Visual Token Clustering
- Link: Open Access
199. Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models
- Link: Open Access
- arXiv: 2511.16955
200. MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Second
- Link: Open Access
- arXiv: 2507.10065
201. Affostruction: 3D Affordance Grounding with Generative Reconstruction
- Link: Open Access
- arXiv: 2601.09211
202. MatPedia: A Universal Generative Foundation for High-Fidelity Material Synthesis
- Link: Open Access
- arXiv: 2511.16957
203. Gaussian-Mixture Latent Flow for Stochastic 3D Human Motion Prediction
- Link: Open Access
204. UnReflectAnything: RGB-Only Highlight Removal by Rendering Synthetic Specular Supervision
- Link: Open Access
- arXiv: 2512.09583
205. Exact-GS: Mathematically Rigorous and Accurate 3D Gaussian Splatting for 3D X-ray Reconstruction
- Link: Open Access
206. SDGS: Spatial Difference Guided Gaussian Splatting for Simultaneous Localization and 3D Reconstruction
- Link: Open Access
207. MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splatting
- Link: Open Access
- arXiv: 2603.29296
208. Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models
- Link: Open Access
- arXiv: 2605.12138
209. HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation
- Link: Open Access
- arXiv: 2603.10128
210. CoRoGS: Contextual Gaussian Splatting for Robust Large-Deviation View Synthesis
- Link: Open Access
211. ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
- Link: Open Access
- arXiv: 2511.22715
212. iSplat: Iterative Learning for Fine-Grained Gaussian Splatting
- Link: Open Access
213. PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow
- Link: Open Access
- arXiv: 2603.25738
214. MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation
- Link: Open Access
- arXiv: 2603.29029
215. 3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation
- Link: Open Access
- arXiv: 2602.03796
216. Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs
- Link: Open Access
- arXiv: 2510.00507
217. EgoX: Egocentric Video Generation from a Single Exocentric Video
- Link: Open Access
- arXiv: 2512.08269
218. COT-FM: Cluster-wise Optimal Transport Flow Matching
- Link: Open Access
- arXiv: 2603.13395
219. PRIMU: Uncertainty Estimation for Novel Views in Gaussian Splatting from Primitive-Based Representations of Error and Coverage
- Link: Open Access
- arXiv: 2508.02443
220. CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion
- Link: Open Access
221. ACPV-Net: All-Class Polygonal Vectorization for Seamless Vector Map Generation from Aerial Imagery
- Link: Open Access
- arXiv: 2603.16616
222. CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning
- Link: Open Access
223. Adaptive Anisotropic Gaussian Splatting for Multi-contrast MRI Arbitrary-Scale Super-Resolution with Anatomy Guidance
- Link: Open Access
224. DualSplat: Robust 3D Gaussian Splatting via Pseudo-Mask Bootstrapping from Reconstruction Failures
- Link: Open Access
- arXiv: 2604.21631
225. Enabling Supervised Learning of Generative Signatures for Generalized AI-Generated Images Detection
- Link: Open Access
226. Efficient All-Pairs Correlation Volume Sampling for Optical Flow Estimation
- Link: Open Access
227. AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References
- Link: Open Access
- arXiv: 2603.25188
228. MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
- Link: Open Access
- arXiv: 2512.19311
229. Frequency-Aware Flow Matching for High-Quality Image Generation
- Link: Open Access
- arXiv: 2604.15521
230. EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing
- Link: Open Access
- arXiv: 2602.15031
231. DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning
- Link: Open Access
- arXiv: 2601.16046
232. FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance
- Link: Open Access
- arXiv: 2603.12146
233. LAMP: Language-Assisted Motion Planning for Controllable Video Generation
- Link: Open Access
- arXiv: 2512.03619
234. RADAR: VQ-VAE Decoder of VAR is a Good Student for Restoring Against Degradation by Acceleration
- Link: Open Access
235. HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
- Link: Open Access
- arXiv: 2510.20822
236. SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
- Link: Open Access
- arXiv: 2512.22170
237. VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
- Link: Open Access
- arXiv: 2512.19243
238. MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
- Link: Open Access
- arXiv: 2602.19497
239. Scaling4D: Pushing the Frontier of Video Novel View Synthesis through Large-Scale Monocular Videos
- Link: Open Access
240. Bidirectional Normalizing Flow: From Data to Noise and Back
- Link: Open Access
- arXiv: 2512.10953
241. 4C4D: 4 Camera 4D Gaussian Splatting
- Link: Open Access
- arXiv: 2604.04063
242. Scaling Zero-Shot Reference-to-Video Generation
- Link: Open Access
- arXiv: 2512.06905
243. Spectral-Geometric Neural Fields for Pose-Free LiDAR View Synthesis
- Link: Open Access
- arXiv: 2603.12903
244. SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2512.02172
245. RunawayEvil: Jailbreaking the Image-to-Video Generative Models
- Link: Open Access
- arXiv: 2512.06674
246. ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation
- Link: Open Access
- arXiv: 2602.10113
247. Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field
- Link: Open Access
248. TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation
- Link: Open Access
- arXiv: 2602.19053
249. EchoVDiff: Cardiac-Cycle Echocardiography Video Generation from Arbitrary Single Frame
- Link: Open Access
250. MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation
- Link: Open Access
- arXiv: 2502.01572
251. Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context
- Link: Open Access
- arXiv: 2602.21929
252. LightMover: Generative Light Movement with Color and Intensity Controls
- Link: Open Access
- arXiv: 2603.27209
253. VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation
- Link: Open Access
- arXiv: 2601.02256
254. MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
- Link: Open Access
- arXiv: 2511.22989
255. Distilling Unsigned Distance Function for Surface Reconstruction from 3D Gaussian Splatting
- Link: Open Access
256. Say Cheese! Detail-Preserving Portrait Collection Generation via Natural Language Edits
- Link: Open Access
- arXiv: 2601.20511
257. Scalable Trajectory Generation for Whole-Body Mobile Manipulation
- Link: Open Access
- arXiv: 2604.12565
258. U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation
- Link: Open Access
- arXiv: 2602.23739
259. Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation
- Link: Open Access
- arXiv: 2601.01593
260. eRetinexGS: Retinex Modeling for Low-Light Scene Enhancement via Event Streams and 3D Gaussian Splatting
- Link: Open Access
261. VideoMaMa: Mask-Guided Video Matting via Generative Prior
- Link: Open Access
- arXiv: 2601.14255
262. Ref4D-VideoBench: Four-Dimensional Reference-Based Evaluation of Text-to-Video Generative Models
- Link: Open Access
263. Extend3D: Town-Scale 3D Generation
- Link: Open Access
- arXiv: 2603.29387
264. A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space
- Link: Open Access
- arXiv: 2511.10555
265. GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
- Link: Open Access
- arXiv: 2512.16811
266. STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative
- Link: Open Access
- arXiv: 2512.12372
267. Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
- Link: Open Access
- arXiv: 2605.17807
268. TIM: Temporal Decoupling with Iterative Mutual-Refinement Model for Longitudinal Radiology Report Generation
- Link: Open Access
269. EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation
- Link: Open Access
- arXiv: 2604.01421
270. VA-p: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
- Link: Open Access
271. GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
- Link: Open Access
- arXiv: 2511.11134
272. Spherical Leech Quantization for Visual Tokenization and Generation
- Link: Open Access
- arXiv: 2512.14697
273. VAD-GS: Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes
- Link: Open Access
274. TiViBench: Benchmarking Think-in-Video Reasoning for Video Generation
- Link: Open Access
- arXiv: 2511.13704
275. Z-Order Transformer for Feed-Forward Gaussian Splatting
- Link: Open Access
- arXiv: 2605.13465
276. TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion
- Link: Open Access
- arXiv: 2512.00300
277. VISTA: A Test-Time Self-Improving Video Generation Agent
- Link: Open Access
- arXiv: 2510.15831
278. Dynamic-Static Decomposition for Novel View Synthesis of Dynamic Scenes with Spiking Neurons
- Link: Open Access
279. MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation
- Link: Open Access
- arXiv: 2512.18766
280. Not All Birds Look The Same: Identity-Preserving Generation For Birds
- Link: Open Access
- arXiv: 2512.04485
281. P-Flow: Prompting Visual Effects Generation
- Link: Open Access
- arXiv: 2603.22091
282. GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
- Link: Open Access
- arXiv: 2510.22319
283. Efficient Weighted Sampling via Score-based Generative Models
- Link: Open Access
284. FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters
- Link: Open Access
- arXiv: 2603.01685
285. HandX: Scaling Bimanual Motion and Interaction Generation
- Link: Open Access
- arXiv: 2603.28766
286. From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
- Link: Open Access
287. Reasoning Diffusion for Unpaired Test Time Out-of-distribution Text-Image to Video Generation
- Link: Open Access
288. Disentangling to Re-couple: Resolving the Similarity-Controllability Paradox in Subject-Driven Text-to-Image Generation
- Link: Open Access
- arXiv: 2604.00849
289. PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and VLM-Guided Optimization
- Link: Open Access
290. CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation
- Link: Open Access
- arXiv: 2511.21309
291. Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- Link: Open Access
292. Unified Latent Space for Understanding and Generation via Semantic Auto-encoder
- Link: Open Access
293. PHANTOM: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics
- Link: Open Access
- arXiv: 2604.08503
294. HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidance
- Link: Open Access
- arXiv: 2604.04425
295. STARFlow-V: End-to-End Video Generative Modeling with Autoregressive Normalizing Flows
- Link: Open Access
296. Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning
- Link: Open Access
- arXiv: 2511.21136
297. FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing
- Link: Open Access
- arXiv: 2506.05046
298. ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models
- Link: Open Access
- arXiv: 2602.12640
299. EcoSplat: Efficiency-controllable Feed-forward 3D Gaussian Splatting from Multi-view Images
- Link: Open Access
- arXiv: 2512.18692
300. Rethinking Pose Refinement in 3D Gaussian Splatting under Pose Prior and Geometric Uncertainty
- Link: Open Access
- arXiv: 2603.16538
301. Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generation
- Link: Open Access
302. EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
- Link: Open Access
- arXiv: 2512.24731
303. LATTICE: Democratize High-Fidelity 3D Generation at Scale
- Link: Open Access
- arXiv: 2512.03052
304. A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens
- Link: Open Access
- arXiv: 2604.04913
305. Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy
- Link: Open Access
- arXiv: 2511.21579
306. MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation
- Link: Open Access
307. RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation
- Link: Open Access
- arXiv: 2603.03617
308. UniVerse: Empower Unified Generation with Reasoning and Knowledge
- Link: Open Access
309. FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing
- Link: Open Access
- arXiv: 2512.11395
310. MeanFlow Transformers with Representation Autoencoders
- Link: Open Access
- arXiv: 2511.13019
311. PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation
- Link: Open Access
- arXiv: 2603.22193
312. Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation
- Link: Open Access
313. NaTex: Seamless Texture Generation as Latent Color Diffusion
- Link: Open Access
- arXiv: 2511.16317
314. Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
- Link: Open Access
- arXiv: 2508.07901
315. VecGlypher: Unified Vector Glyph Generation with Language Models
- Link: Open Access
- arXiv: 2602.21461
316. Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images
- Link: Open Access
- arXiv: 2510.04225
317. Dehallu3D: Hallucination-Mitigated 3D Generation from a Single Image via Cyclic View Consistency Refinement
- Link: Open Access
318. TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
- Link: Open Access
- arXiv: 2602.20903
319. TGTrack: Temporal Generative Learning for Unified Single Object Tracking
- Link: Open Access
320. OrienPose: Orientation-Guided Novel View Synthesis for Single-Image Unseen Object Pose Estimation
- Link: Open Access
321. DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
- Link: Open Access
- arXiv: 2510.11712
322. EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
- Link: Open Access
- arXiv: 2603.12267
323. Delta Rectified Flow Sampling for Text-to-Image Editing
- Link: Open Access
- arXiv: 2509.05342
324. ST4R-Splat: Spatio-Temporal Referring Segmentation in 4D Gaussian Splatting
- Link: Open Access
325. Archon: A Unified Multimodal Model for Holistic Digital Human Generation
- Link: Open Access
326. Zero-Shot Image Denoising via Hybrid Prior-Guided Pseudo Sample Generation
- Link: Open Access
327. CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation
- Link: Open Access
- arXiv: 2602.06959
328. Humanoid Generative Pre-Training for Zero-Shot Motion Tracking
- Link: Open Access
329. Stochastic Ray Tracing for the Reconstruction of 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2603.23637
330. Fine-Grained GRPO for Precise Preference Alignment in Flow Models
- Link: Open Access
- arXiv: 2510.01982
331. Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding
- Link: Open Access
- arXiv: 2512.17817
332. FARMER: Flow AutoRegressive Transformer over Pixels
- Link: Open Access
- arXiv: 2510.23588
333. LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation
- Link: Open Access
- arXiv: 2510.08318
334. Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation
- Link: Open Access
- arXiv: 2511.19859
335. Seeing What Matters: Visual Preference Policy Optimization for Visual Generation
- Link: Open Access
- arXiv: 2511.18719
336. RF4D:Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenes
- Link: Open Access
337. Negative Binomial Variational Autoencoders for Overdispersed Latent Modeling
- Link: Open Access
- arXiv: 2508.05423
338. Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation
- Link: Open Access
- arXiv: 2604.03738
339. Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation
- Link: Open Access
- arXiv: 2511.18281
340. ThinkGen: Generalized Thinking for Visual Generation
- Link: Open Access
- arXiv: 2512.23568
341. Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow
- Link: Open Access
- arXiv: 2604.15809
342. Faster-GS: Analyzing and Improving Gaussian Splatting Optimization
- Link: Open Access
- arXiv: 2602.09999
343. Few-shot Acoustic Synthesis with Multimodal Flow Matching
- Link: Open Access
- arXiv: 2603.19176
344. UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
- Link: Open Access
- arXiv: 2603.11320
345. Towards Unified Human Perception and Machine Understanding: Token Flow Guided Compression Framework
- Link: Open Access
346. From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition
- Link: Open Access
- arXiv: 2511.20996
347. AeroDGS: Physically Consistent Dynamic Gaussian Splatting for Single-Sequence Aerial 4D Reconstruction
- Link: Open Access
- arXiv: 2602.22376
348. AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows
- Link: Open Access
- arXiv: 2511.22357
349. TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond
- Link: Open Access
- arXiv: 2512.02993
350. OntoAug: Rethinking Generative Data Augmentation via Ontology Guidance
- Link: Open Access
351. Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generation
- Link: Open Access
352. RewardFlow: Generate Images by Optimizing What You Reward
- Link: Open Access
- arXiv: 2604.08536
353. GenMask: Adapting DiT for Segmentation via Direct Mask Generation
- Link: Open Access
- arXiv: 2603.23906
354. Rosetta Stone For Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generation
- Link: Open Access
355. Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation
- Link: Open Access
- arXiv: 2511.17844
356. Socratic-Geo: Synthetic Data Generation and Cross-Modal Geometric Reasoning via Multi-Agent Interaction
- Link: Open Access
357. Stereo World Model: Camera-Guided Stereo Video Generation
- Link: Open Access
- arXiv: 2603.17375
358. Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction
- Link: Open Access
- arXiv: 2601.04090
359. REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting
- Link: Open Access
- arXiv: 2510.16410
360. Semantic Derivative Flow: Graph-Guided Diffusion for Controllable Instance Interactions
- Link: Open Access
361. VarSplat: Uncertainty-aware 3D Gaussian Splatting for Robust RGB-D SLAM
- Link: Open Access
- arXiv: 2603.09673
362. Reinforcement-Guided Synthetic Data Generation for Privacy-Sensitive Identity Recognition
- Link: Open Access
- arXiv: 2604.07884
363. Image Generation from Contextually-Contradictory Prompts
- Link: Open Access
- arXiv: 2506.01929
364. GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator
- Link: Open Access
- arXiv: 2603.25053
365. DiffBMP: Differentiable Rendering with Bitmap Primitives
- Link: Open Access
- arXiv: 2602.22625
366. SpeeDe3DGS: Speedy Deformable 3D Gaussian Splatting with Temporal Pruning and Motion Grouping
- Link: Open Access
- arXiv: 2506.07917
367. BUSSARD: Normalizing Flows for Bijective Universal Scene-Specific Anomalous Relationship Detection
- Link: Open Access
- arXiv: 2603.16645
368. AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence
- Link: Open Access
- arXiv: 2604.10579
369. FastGS: Training 3D Gaussian Splatting in 100 Seconds
- Link: Open Access
- arXiv: 2511.04283
370. Continual Learning for fMRI-Based Brain Disorder Diagnosis via Functional Connectivity Matrices Generative Replay
- Link: Open Access
- arXiv: 2604.14259
371. Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards
- Link: Open Access
- arXiv: 2603.00918
372. MR-RAG: Multimodal Relevance-Aware Retrieval-Augmented Generation for Medical Visual Question Answering
- Link: Open Access
373. MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
- Link: Open Access
- arXiv: 2512.03041
374. NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code
- Link: Open Access
- arXiv: 2603.00805
375. Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface
- Link: Open Access
- arXiv: 2512.19402
376. CG-Floor: Centroid-Guided Diffusion for Large-Scale Floorplan Generation
- Link: Open Access
377. LAOF: Robust Latent Action Learning with Optical Flow Constraints
- Link: Open Access
- arXiv: 2511.16407
378. MeshMosaic: Scaling Artist Mesh Generation via Local-to-Global Assembly
- Link: Open Access
- arXiv: 2509.19995
379. Seele: A Unified Acceleration Framework for Real-Time Gaussian Splatting on Mobile Devices
- Link: Open Access
380. Gaussian Splatting-based Low-Rank Tensor Representation for Multi-Dimensional Image Recovery
- Link: Open Access
- arXiv: 2511.14270
381. FlowFixer: Towards Detail-Preserving Subject-Driven Generation
- Link: Open Access
- arXiv: 2602.21402
382. Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
- Link: Open Access
- arXiv: 2510.10489
383. Eulerian Gaussian Splatting using Hashed Probability Pyramids
- Link: Open Access
384. WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation
- Link: Open Access
- arXiv: 2511.11434
385. Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation
- Link: Open Access
- arXiv: 2511.17282
386. No Calibration, No Depth, No Problem: Cross-Sensor View Synthesis with 3D Consistency
- Link: Open Access
- arXiv: 2602.23559
387. OmniGen2: Towards Instruction-Aligned Multimodal Generation
- Link: Open Access
- arXiv: 2506.18871
388. TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis
- Link: Open Access
- arXiv: 2511.18287
389. BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
- Link: Open Access
- arXiv: 2512.05076
390. ExpPortrait: Expressive Portrait Generation via Personalized Representation
- Link: Open Access
- arXiv: 2602.19900
391. PolarGuide-GSDR: 3D Gaussian Splatting Driven by Polarization Priors and Deferred Reflection for Real-World Reflective Scenes
- Link: Open Access
- arXiv: 2512.02664
392. Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation
- Link: Open Access
- arXiv: 2601.00664
393. No Way To Steal My Face: Proactive Defense Against Identity-Preserving Personalized Generation
- Link: Open Access
394. GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting
- Link: Open Access
- arXiv: 2509.22615
395. Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers
- Link: Open Access
- arXiv: 2604.21592
396. 3D Gaussian Splatting at Arbitrary Resolutions with Compact Proxy Anchors
- Link: Open Access
397. Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization
- Link: Open Access
- arXiv: 2510.14255
398. DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment
- Link: Open Access
- arXiv: 2603.22125
399. VMD-FACT: A New Video Dataset and MLLM-based method for Detecting Realistic AI-Generated Video Misinformation
- Link: Open Access
400. POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation
- Link: Open Access
- arXiv: 2604.24171
401. Geo2: Geometry-Guided Cross-view Geo-Localization and Image Synthesis
- Link: Open Access
402. SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation
- Link: Open Access
- arXiv: 2512.12193
403. Generative Adversarial Perturbations with Cross-paradigm Transferability on Localized Crowd Counting
- Link: Open Access
- arXiv: 2603.24821
404. Next-Scale Autoregressive Models for Text-to-Motion Generation
- Link: Open Access
- arXiv: 2604.03799
405. TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
- Link: Open Access
- arXiv: 2601.08881
406. HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis
- Link: Open Access
- arXiv: 2604.03305
407. Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
- Link: Open Access
- arXiv: 2511.16671
408. RAG-TP: A General Framework for Vehicle Trajectory Prediction via Retrieval-Augmented Generation
- Link: Open Access
409. ShapeR: Robust Conditional 3D Shape Generation from Casual Captures
- Link: Open Access
- arXiv: 2601.11514
410. VideoRealBench: A Chain-of-Thought Realism Evaluation Benchmark for Generated Human-Centric Videos
- Link: Open Access
411. gQIR: Generative Quanta Image Reconstruction
- Link: Open Access
- arXiv: 2602.20417
412. UniTEX: Universal High Fidelity Generative Texturing for 3D Shapes
- Link: Open Access
- arXiv: 2505.23253
413. ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
- Link: Open Access
- arXiv: 2512.05111
414. Layered 4D-Rotor Gaussian Splatting: A Compressed Representation for Long Dynamic Scenes
- Link: Open Access
415. More Natural, More Real: Object-aware Gaussian Splatting for 3D Visual Decoding from Human Brain
- Link: Open Access
416. SAGE: Scalable Agentic 3D Scene Generation for Embodied AI
- Link: Open Access
- arXiv: 2602.10116
417. LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesis
- Link: Open Access
- arXiv: 2603.20176
418. Linear Image Generation by Synthesizing Exposure Brackets
- Link: Open Access
- arXiv: 2604.21008
419. PartGS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2506.17212
420. One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control
- Link: Open Access
- arXiv: 2603.18093
421. TWINGS: Thin Plate Splines Warp-aligned Initialization for Sparse-View Gaussian Splatting
- Link: Open Access
- arXiv: 2605.22069
422. VOSR: A Vision-Only Generative Model for Image Super-Resolution
- Link: Open Access
- arXiv: 2604.03225
423. DPGF-Net: Dual-Prior Guided Fusion Network for Joint Assessment of Perceptual Quality and Semantic Consistency in AI-Generated Images
- Link: Open Access
424. DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation
- Link: Open Access
- arXiv: 2512.21867
425. PhysGS: Bayesian-Inferred Gaussian Splatting for Physical Property Estimation
- Link: Open Access
- arXiv: 2511.18570
426. AnchorSplat: Feed-Forward 3D Gaussian Splatting With 3D Geometric Priors
- Link: Open Access
- arXiv: 2604.07053
427. M^3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- Link: Open Access
428. Node-RF: Learning Generalized Continuous Space-Time Scene Dynamics with Neural ODE-based NeRFs
- Link: Open Access
- arXiv: 2603.12078
429. Geometry-Aware Cross-Modal Graph Alignment for Referring Segmentation in 3D Gaussian Splatting
- Link: Open Access
430. Breaking Semantic Boundaries: Distribution-Guided Semantic Exploration for Creative Generation
- Link: Open Access
431. Guardians of the Hair: Rescuing Soft Boundaries in Depth, Stereo, and Novel Views
- Link: Open Access
432. Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation
- Link: Open Access
- arXiv: 2512.03534
433. PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
- Link: Open Access
- arXiv: 2512.01236
434. Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation
- Link: Open Access
- arXiv: 2509.22496
435. PoseAnything: General Pose-guided Video Generation with Part-aware Temporal Coherence
- Link: Open Access
436. Muses: Designing, Composing, Generating Nonexistent Fantasy 3D Creatures without Training
- Link: Open Access
- arXiv: 2601.03256
437. SIMPLEPOSTER: A SIMPLE BASELINE FOR PRODUCT POSTER GENERATION
- Link: Open Access
- arXiv: 2605.08784
438. NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers
- Link: Open Access
- arXiv: 2503.09242
439. Temporal Equilibrium MeanFlow: Bridging the Scale Gap for One-Step Generation
- Link: Open Access
440. PoseD-Flow: Versatile and Guided Flow Matching Model of Human Pose
- Link: Open Access
441. Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation
- Link: Open Access
442. TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
- Link: Open Access
- arXiv: 2510.15104
443. Training-free Motion Factorization for Compositional Video Generation
- Link: Open Access
- arXiv: 2603.09104
444. ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Data
- Link: Open Access
- arXiv: 2604.01082
445. DSFlash: Comprehensive Panoptic Scene Graph Generation in Realtime
- Link: Open Access
- arXiv: 2603.10538
446. Generative Video Motion Editing with 3D Point Tracks
- Link: Open Access
- arXiv: 2512.02015
447. FLOW: Optimal Transport-Driven Feature Warping for Generalized Remote Physiological Measurement
- Link: Open Access
448. MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving
- Link: Open Access
- arXiv: 2602.20060
449. Phrase-grounded APO for Improving Chest X-ray Report Generation
- Link: Open Access
450. Flow Matching for Multimodal Distributions
- Link: Open Access
451. ParkGaussian: Surround-view 3D Gaussian Splatting for Autonomous Parking
- Link: Open Access
- arXiv: 2601.01386
452. Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation
- Link: Open Access
- arXiv: 2512.01677
453. Unifying Language-Action Understanding and Generation for Autonomous Driving
- Link: Open Access
- arXiv: 2603.01441
454. HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation
- Link: Open Access
- arXiv: 2511.21732
455. Selectively Extracting and Injecting Visual Attributes into Text-to-Image Models
- Link: Open Access
456. LoFA: Learning to Predict Personalized Prior for Fast Adaptation of Visual Generative Models
- Link: Open Access
- arXiv: 2512.08785
457. AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
- Link: Open Access
- arXiv: 2512.10943
458. Geometric-Photometric Event-based 3D Gaussian Ray Tracing
- Link: Open Access
- arXiv: 2512.18640
459. BA-GS: Bayesian Adaptive Gaussian Splatting for SFM-Free 3D Reconstruction
- Link: Open Access
460. JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization
- Link: Open Access
- arXiv: 2603.21208
461. When Anonymity Breaks: Identifying Models Behind Text-to-Image Leaderboards
- Link: Open Access
462. PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation
- Link: Open Access
- arXiv: 2503.14295
463. CoLoGen: Progressive Learning of Concept-Localization Duality for Unified Image Generation
- Link: Open Access
- arXiv: 2602.22150
464. Learning to Generate Highly Dynamic Videos using Synthetic Motion Data
- Link: Open Access
- arXiv: 2604.01666
465. MicroFM: Physics-guided Flow Matching for Isotropic Microscopy Reconstruction
- Link: Open Access
466. HyperGaussians: High-Dimensional Gaussian Splatting for High-Fidelity Animatable Face Avatars
- Link: Open Access
- arXiv: 2507.02803
467. LumiX: Structured and Coherent Text-to-Intrinsic Generation
- Link: Open Access
- arXiv: 2512.02781
468. Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models
- Link: Open Access
- arXiv: 2602.20981
469. Flowception: Temporally Expansive Flow Matching for Video Generation
- Link: Open Access
- arXiv: 2512.11438
470. DeRVOS: Decoupling Consistent Trajectory Generation and Multimodal Understanding for Referring Video Object Segmentation
- Link: Open Access
471. Text-Driven 3D Hand Motion Generation from Sign Language Data
- Link: Open Access
- arXiv: 2508.15902
472. Steering Where to Diffuse: Generative Modeling of Phenotypic Response Simulation with Steered Diffusion Bridge
- Link: Open Access
473. UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching
- Link: Open Access
474. : Low-Light Dynamic Gaussian Splatting
- Link: Open Access
475. Native and Compact Structured Latents for 3D Generation
- Link: Open Access
- arXiv: 2512.14692
476. FilterGS: Traversal-Free Parallel Filtering and Adaptive Shrinking for Large-Scale LoD 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2603.23891
477. Unsupervised Multi-Scale Segmentation of 3D Subcellular World with Stable Diffusion Foundation Model
- Link: Open Access
478. SyncDreamer: Controllable and Expressive Avatar Generation Beyond the Talking Head
- Link: Open Access
479. GenBreak: Red Teaming Text-to-Image Generation Using Large Language Models
- Link: Open Access
- arXiv: 2506.10047
480. Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods
- Link: Open Access
- arXiv: 2603.15026
481. FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models
- Link: Open Access
- arXiv: 2604.09651
482. CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
- Link: Open Access
- arXiv: 2603.06449
483. Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation
- Link: Open Access
- arXiv: 2603.23227
484. Towards Generalizable AI-Generated Image Detection via Image-Adaptive Prompt Learning
- Link: Open Access
- arXiv: 2508.01603
485. WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- Link: Open Access
- arXiv: 2512.06112
486. HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generation
- Link: Open Access
487. HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
- Link: Open Access
- arXiv: 2511.20520
488. Unified Number-Free Text-to-Motion Generation Via Flow Matching
- Link: Open Access
- arXiv: 2603.27040
489. From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimation
- Link: Open Access
490. Learning to Learn Weight Generation via Local Consistency Diffusion
- Link: Open Access
- arXiv: 2502.01117
491. NI-Tex: Non-isometric Image-based Garment Texture Generation
- Link: Open Access
- arXiv: 2511.18765
492. Generative Diffusion Priors for 3D Mapping of the Dark Universe
- Link: Open Access
493. StableMaterials: Enhancing Diversity in Material Generation via Semi-Supervised Learning
- Link: Open Access
- arXiv: 2406.09293
494. CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models
- Link: Open Access
- arXiv: 2604.16363
495. PixelDiT: Pixel Diffusion Transformers for Image Generation
- Link: Open Access
- arXiv: 2511.20645
496. BrepGaussian: CAD reconstruction from Multi-View Images with Gaussian Splatting
- Link: Open Access
- arXiv: 2602.21105
497. IGen: Scalable Data Generation for Robot Learning from Open-World Images
- Link: Open Access
- arXiv: 2512.01773
498. Turbo-GS: Accelerating 3D Gaussian Fitting for High-Resolution Radiance Fields
- Link: Open Access
499. PerpetualWonder: Long-horizon Action-conditioned 4D Scene Generation
- Link: Open Access
- arXiv: 2602.04876
500. Dual-Level Hypergraph Generation for Addressing Feature Scarcity in Whole-Slide Image Classification
- Link: Open Access
501. Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning
- Link: Open Access
- arXiv: 2604.06824
502. Synthetic Curriculum Reinforces Compositional Text-to-Image Generation
- Link: Open Access
- arXiv: 2511.18378
503. Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models
- Link: Open Access
504. A Supervised Multi-task Framework for Joint cryo-ET Restoration Enabled by Generative Physical Simulation
- Link: Open Access
505. Nestwork: Conditional 3D Furnished House Layout Generation through Latent Heterogeneous Graph Diffusion
- Link: Open Access
506. Lafite: A Generative Latent Field for 3D Native Texturing
- Link: Open Access
- arXiv: 2512.04786
507. PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
- Link: Open Access
- arXiv: 2511.18801
508. Plenoptic Video Generation
- Link: Open Access
- arXiv: 2601.05239
509. Seeing through Light and Darkness: Sensor-Physics Grounded Deblurring HDR NeRF from Single-Exposure Images and Events
- Link: Open Access
- arXiv: 2601.15475
510. AutoRegressive Generation with B-rep Holistic Token Sequence Representation
- Link: Open Access
- arXiv: 2601.16771
511. DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution
- Link: Open Access
512. Enhancing Spatial Understanding in Image Generation via Reward Modeling
- Link: Open Access
- arXiv: 2602.24233
513. Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors
- Link: Open Access
- arXiv: 2604.12309
514. GEM: Generating LiDAR World Model via Deformable Mamba
- Link: Open Access
- arXiv: 2605.07326
515. MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction
- Link: Open Access
- arXiv: 2604.01600
516. SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation
- Link: Open Access
- arXiv: 2603.19053
517. BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation
- Link: Open Access
518. Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification
- Link: Open Access
- arXiv: 2510.24078
519. Self-Corrected Image Generation with Explainable Latent Rewards
- Link: Open Access
- arXiv: 2603.24965
520. GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Views
- Link: Open Access
- arXiv: 2602.22571
521. Hermite Radial Basis Function for Surface Reconstruction via Differentiable Rendering
- Link: Open Access
522. MMCP-GEN: A Modality-Extensible Diffusion Language Model for Conditional Protein Sequence Generation
- Link: Open Access
523. PPM-CLIP: Probabilistic Prompt Modeling for Generalizable AI-Generated Image Detection
- Link: Open Access
524. DuoGen: Towards Autonomous Interleaved Multimodal Generation
- Link: Open Access
525. Lighting-grounded Video Generation with Renderer-based Agent Reasoning
- Link: Open Access
- arXiv: 2604.07966
526. Grounded Latents for Entity-Centric 4D Scene Generation
- Link: Open Access
527. DynamicsBoost: Dynamic Plausible Video Generation via Annotation-Free Continuation Preference Optimization
- Link: Open Access
528. Hidden Dangers of Compositional Generation: Diagnosing Semantic Safety Failures in Text-to-Image Models
- Link: Open Access
529. iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation
- Link: Open Access
- arXiv: 2511.20635
530. Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers
- Link: Open Access
- arXiv: 2601.06338
531. ReLaGS: Relational Language Gaussian Splatting
- Link: Open Access
- arXiv: 2603.17605
532. EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Head
- Link: Open Access
533. InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions
- Link: Open Access
- arXiv: 2602.06035
534. SG-LoRA: Semantic-guided LoRA Parameters Generation
- Link: Open Access
535. Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models
- Link: Open Access
- arXiv: 2603.06043
536. Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning
- Link: Open Access
- arXiv: 2605.13852
537. Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression
- Link: Open Access
- arXiv: 2604.10546
538. A Stitch in Time: Learning Procedural Workflow via Self-Supervised Plackett-Luce Ranking
- Link: Open Access
- arXiv: 2511.17805
539. RelightAnyone: A Generalized Relightable 3D Gaussian Head Model
- Link: Open Access
540. SGS-Intrinsic: Semantic-Invariant Gaussian Splatting for Sparse-View Indoor Inverse Rendering
- Link: Open Access
- arXiv: 2603.27516
541. Charge: A Comprehensive Novel View Synthesis Benchmark and Dataset to Bind Them All
- Link: Open Access
- arXiv: 2512.13639
542. PhysGen: Physically Grounded 3D Shape Generation for Industrial Design
- Link: Open Access
- arXiv: 2512.00422
543. OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation
- Link: Open Access
- arXiv: 2509.18600
544. FMPose3D: monocular 3D pose estimation via flow matching
- Link: Open Access
- arXiv: 2602.05755
545. VABench: A Comprehensive Benchmark for Audio-Video Generation
- Link: Open Access
- arXiv: 2512.09299
546. x^2-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space
- Link: Open Access
- arXiv: 2603.16671
547. RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation
- Link: Open Access
548. Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering
- Link: Open Access
549. FastHybrid: Accelerating Hybrid Autoregressive Image Generation with Lookahead and Guided Decoding
- Link: Open Access
550. FrankenMotion: Part-level Human Motion Generation and Composition
- Link: Open Access
- arXiv: 2601.10909
551. GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstruction
- Link: Open Access
- arXiv: 2603.20611
552. Grid Distillation: Compositional Image Distillation via Structured Generative Grids
- Link: Open Access
553. ODGS-SLAM: Omnidirectional Gaussian Splatting SLAM
- Link: Open Access
554. Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering
- Link: Open Access
555. Confidence-Guided Multi-Scale Aggregation for Sparse-View High-Resolution 3D Gaussian Splatting
- Link: Open Access
556. DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis
- Link: Open Access
- arXiv: 2602.23022
557. LeapAlign: Post-training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories
- Link: Open Access
- arXiv: 2604.15311
558. UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection
- Link: Open Access
- arXiv: 2604.21904
559. I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
- Link: Open Access
- arXiv: 2512.04660
560. RigMo: Unifying Rig and Motion Learning for Generative Animation
- Link: Open Access
- arXiv: 2601.06378
561. UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios
- Link: Open Access
- arXiv: 2511.18050
562. HandWorld: Hand-Centric Unified Video Action Generation
- Link: Open Access
563. Animator-Centric Skeleton Generation on Objects with Fine-Grained Details
- Link: Open Access
- arXiv: 2604.20539
564. Endless World: Real-Time 3D-Aware Long Video Generation
- Link: Open Access
- arXiv: 2512.12430
565. RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment
- Link: Open Access
- arXiv: 2603.00483
566. Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models
- Link: Open Access
- arXiv: 2603.25994
567. Self-Consistency for LLM-Based Motion Trajectory Generation and Verification
- Link: Open Access
- arXiv: 2603.29301
568. PromptEnhancer: Taming Your Rewriter for Text-to-Image Generation via Fine-Grained Reward
- Link: Open Access
569. Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling
- Link: Open Access
570. Generative Point Tracking and Forecasting
- Link: Open Access
571. Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors
- Link: Open Access
- arXiv: 2603.18782
572. ViLearn: Accelerating Training Convergence of Image-to-3D Generation via Visibility Learning
- Link: Open Access
573. Inference-time Physics Alignment of Video Generative Models with Latent World Models
- Link: Open Access
- arXiv: 2601.10553
574. Probabilistic Precipitation Nowcasting with Rectified Flow Transformers
- Link: Open Access
575. PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentation
- Link: Open Access
- arXiv: 2604.12113
576. EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation
- Link: Open Access
- arXiv: 2603.06014
577. Evaluating Generative Models via One-Dimensional Code Distributions
- Link: Open Access
- arXiv: 2603.08064
578. LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models
- Link: Open Access
- arXiv: 2601.14674
579. Robust3DGSW: Toward Robust Watermarking for Quantization-Aware 3D Gaussian Splatting
- Link: Open Access
580. FlowPalm: Optical Flow Driven Non-Rigid Deformation for Geometrically Diverse Palmprint Generation
- Link: Open Access
- arXiv: 2604.09989
581. When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance
- Link: Open Access
- arXiv: 2602.20880
582. SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model
- Link: Open Access
- arXiv: 2512.10957
583. GHPT: Real-Time Relightable Gaussian Splatting using Hybrid Path Tracing
- Link: Open Access
584. ULF-Loc: Unbiased Landmark Feature for Robust Visual Localization with 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2605.04730
585. OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
- Link: Open Access
- arXiv: 2512.07802
586. Voxify3D: Pixel Art Meets Volumetric Rendering
- Link: Open Access
- arXiv: 2512.07834
587. SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation
- Link: Open Access
- arXiv: 2602.23359
588. 3D Gaussian Splatting with Self-Constrained Priors for High Fidelity Surface Reconstruction
- Link: Open Access
- arXiv: 2603.19682
589. PhysGaia: A Physics-aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesis
- Link: Open Access
- arXiv: 2506.02794
590. ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Senisng
- Link: Open Access
591. SAGA: Source Attribution of Generative AI Videos
- Link: Open Access
- arXiv: 2511.12834
592. TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens
- Link: Open Access
- arXiv: 2604.15239
593. CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation
- Link: Open Access
- arXiv: 2512.23333
594. PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis
- Link: Open Access
- arXiv: 2604.04576
595. ReGenHOI: Unifying Reconstruction and Generation for 3D Human-Object Interaction Understanding
- Link: Open Access
596. Masked Region Transformer for Layered Image Generation and Editing at Scale
- Link: Open Access
597. ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2509.22225
598. StyleDoctor: Towards Specialist Reward Model for Style-centric Generation Tasks
- Link: Open Access
599. FlowMotion: Training-Free Flow Guidance for Video Motion Transfer
- Link: Open Access
- arXiv: 2603.06289
600. Resolving the Identity Crisis in Text-to-Image Generation
- Link: Open Access
- arXiv: 2510.01399
601. Detecting Compressed AI-Generated Images via Phase Spectrum Robustness
- Link: Open Access
602. MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts
- Link: Open Access
- arXiv: 2511.20415
603. OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data
- Link: Open Access
- arXiv: 2506.07565
604. OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2603.18510
605. PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
- Link: Open Access
- arXiv: 2601.16210
606. Human Geometry Distribution for 3D Animation Generation
- Link: Open Access
- arXiv: 2512.07459
607. PhysVid: Physics Aware Local Conditioning for Generative Video Models
- Link: Open Access
- arXiv: 2603.26285
608. ArtLLM: Generating Articulated Assets via 3D LLM
- Link: Open Access
- arXiv: 2603.01142
609. Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splatting
- Link: Open Access
- arXiv: 2603.02893
610. Hint2Gen: Bridging Understanding and Generation via Code-structured Hints
- Link: Open Access
611. Structure-to-Intensity Diffusion for Adverse-Weather LiDAR Generation
- Link: Open Access
612. IDESplat: Iterative Depth Probability Estimation for Generalizable 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2601.03824
613. LacTokGen: Latent Consistency Tokenizer for 1024-pixel Image Generation by 256 Tokens
- Link: Open Access
614. MacTok: Robust Continuous Tokenization for Image Generation
- Link: Open Access
- arXiv: 2603.29634
615. Unified Camera Positional Encoding for Controlled Video Generation
- Link: Open Access
- arXiv: 2512.07237
616. VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation
- Link: Open Access
617. HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
- Link: Open Access
- arXiv: 2511.19965
618. From None to All: Self-Supervised 3D Reconstruction via Novel View Synthesis
- Link: Open Access
- arXiv: 2603.27455
619. Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation
- Link: Open Access
- arXiv: 2603.02190
620. Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paper
- Link: Open Access
621. OctoT2I: A Self-Evolving Agentic Text-to-Image Router
- Link: Open Access
622. Generative Modeling of Weights: Generalization or Memorization?
- Link: Open Access
- arXiv: 2506.07998
623. MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
- Link: Open Access
- arXiv: 2509.21953
624. MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
- Link: Open Access
- arXiv: 2603.25108
625. PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion
- Link: Open Access
- arXiv: 2602.12769
626. Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens
- Link: Open Access
- arXiv: 2604.19954
627. Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation
- Link: Open Access
- arXiv: 2604.19141
628. Towards Human-Like Robot Handwriting via Contour-Aware Generation
- Link: Open Access
629. Generative Video Compression with One-Dimensional Latent Representation
- Link: Open Access
- arXiv: 2603.15302
630. ExPose: Reinforcing Video Generation Models for Extreme Pose Estimation
- Link: Open Access
631. Gloria: Consistent Character Video Generation via Content Anchors
- Link: Open Access
- arXiv: 2603.29931
632. UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in RL
- Link: Open Access
633. InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation
- Link: Open Access
- arXiv: 2603.05898
634. Prompt-Free Unknown Label Generation for Open World Detection in Remote Sensing
- Link: Open Access
635. Diffusion Probe: Generated Image Result Prediction Using CNN Probes
- Link: Open Access
- arXiv: 2602.23783
636. Cross-modal Representation Learning for Diffusion-generated Image Detection
- Link: Open Access
637. CAST: Context-Aware Dynamic Latent Space Transformation for Interactive Text-to-Image Retrieval
- Link: Open Access
638. NeuROK: Generative 4D Neural Object Kinematics
- Link: Open Access
639. Detecting AI-Generated Forgeries via Iterative Manifold Deviation Amplification
- Link: Open Access
- arXiv: 2602.18842
640. OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
- Link: Open Access
- arXiv: 2509.03498
641. FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
- Link: Open Access
- arXiv: 2603.19857
642. Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation
- Link: Open Access
- arXiv: 2604.20336
643. AutoDebias: An Automated Framework for Detecting and Mitigating Backdoor Biases in Text-to-Image Models
- Link: Open Access
644. NVGS: Neural Visibility for Occlusion Culling in 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2511.19202
645. CADC: Content Adaptive Diffusion-Based Generative Image Compression
- Link: Open Access
- arXiv: 2602.21591
646. MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation
- Link: Open Access
647. From Rays to Projections: Better Inputs for Feed-Forward View Synthesis
- Link: Open Access
- arXiv: 2601.05116
648. Aligning Multi-Character Narrative Image Generation with Multi-Aspect Human Preferences
- Link: Open Access
649. TokenSplat: Token-aligned 3D Gaussian Splatting for Feed-forward Pose-free Reconstruction
- Link: Open Access
- arXiv: 2603.00697
650. When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm
- Link: Open Access
- arXiv: 2603.24079
651. PAMotion: Physics-Aware Motion Generation for Full-Body Interaction with Multiple Objects
- Link: Open Access
652. Scaling View Synthesis Transformers
- Link: Open Access
- arXiv: 2602.21341
653. Think-Then-Generate: Structural Chain-of-Thought Reasoning for Consistent 3D Generation
- Link: Open Access
654. OpenT2M: No-frill Motion Generation with Open-source, Large-scale, High-quality Data
- Link: Open Access
- arXiv: 2603.18623
655. Unified Personalized Understanding, Generating and Editing
- Link: Open Access
- arXiv: 2601.06965
656. OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
- Link: Open Access
- arXiv: 2509.01644
657. When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators
- Link: Open Access
658. AERGS-SLAM: Auto-Exposure-Robust Stereo 3D Gaussian Splatting SLAM
- Link: Open Access
659. Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement
- Link: Open Access
- arXiv: 2512.08535
660. ShapeAR: Generating Editable Shape Layers via Autoregressive Diffusion
- Link: Open Access
661. StreamDiT: Real-Time Streaming Text-to-Video Generation
- Link: Open Access
- arXiv: 2507.03745
662. Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation
- Link: Open Access
- arXiv: 2603.00526
663. SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
- Link: Open Access
- arXiv: 2601.17830
664. Urban-GS: A Unified 3D Gaussian Splatting Framework for Compact and High-Fidelity Aerial-to-Street Reconstruction
- Link: Open Access
665. BrickNet: Graph-Backed Generative Brick Assembly
- Link: Open Access
- arXiv: 2604.22984
666. Adapter Shield: A Unified Framework with Built-in Authentication for Preventing Unauthorized Zero-Shot Image-to-Image Generation
- Link: Open Access
- arXiv: 2512.00075
667. SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls
- Link: Open Access
- arXiv: 2602.23956
668. GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
- Link: Open Access
- arXiv: 2512.12751
669. Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillation
- Link: Open Access
670. Mark4D: Temporally-Consistent Watermarking for 4D Gaussian Splatting
- Link: Open Access
671. 3D Gaussian Splatting from Unposed Spike Stream
- Link: Open Access
672. WaTeRFlow: Watermark Temporal Robustness via Flow Consistency
- Link: Open Access
- arXiv: 2512.19048
673. LoL: Longer than Longer, Scaling Video Generation to Hour
- Link: Open Access
- arXiv: 2601.16914
674. Markovian Scale Prediction: A New Era of Visual Autoregressive Generation
- Link: Open Access
- arXiv: 2511.23334
675. VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation
- Link: Open Access
- arXiv: 2604.10127
676. GROW: Watermark Generation with Progressive Guidance for Diffusion Models
- Link: Open Access
677. Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
- Link: Open Access
- arXiv: 2603.19232
678. Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos
- Link: Open Access
- arXiv: 2604.17749
679. Your Classifier Can Do More: Towards Balancing the Gaps in Classification, Robustness, and Generation
- Link: Open Access
- arXiv: 2505.19459
680. FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
- Link: Open Access
- arXiv: 2511.18834
681. Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation
- Link: Open Access
- arXiv: 2511.18919
682. SounDiT: Geo-Contextual Soundscape-to-Landscape Generation
- Link: Open Access
- arXiv: 2505.12734
683. A Difference-in-Difference Approach to Detecting AI-Generated Images
- Link: Open Access
- arXiv: 2602.23732
684. A Temporal and Content Co-Awareness Latent Diffusion for Controllable Hand Image Generation
- Link: Open Access
685. HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models
- Link: Open Access
- arXiv: 2604.10772
686. 3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds
- Link: Open Access
- arXiv: 2512.23042
687. Diff-SemiER: Transparency-Aware Adaptive Fusion Diffusion Model with Generative Prior for Semi-Transparent Eyeglasses Removal
- Link: Open Access
688. Hierarchical Codec Diffusion for Video-to-Speech Generation
- Link: Open Access
- arXiv: 2604.15923
689. MaskDexGrasp: Generative Masked Modeling for Part-Aware Dexterous Grasp Synthesis
- Link: Open Access
690. Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout
- Link: Open Access
- arXiv: 2511.20649
691. U^2Flow: Uncertainty-Aware Unsupervised Optical Flow Estimation
- Link: Open Access
692. Back to Basics: Let Denoising Generative Models Denoise
- Link: Open Access
- arXiv: 2511.13720
693. Transition Models: Rethinking the Generative Learning Objective
- Link: Open Access
- arXiv: 2509.04394
694. M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation
- Link: Open Access
- arXiv: 2509.23728
695. Progressive Neural Architecture Generation
- Link: Open Access
696. CubeComposer: Spatio-Temporal Autoregressive 4K 360deg Video Generation from Perspective Video
- Link: Open Access
697. Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation
- Link: Open Access
- arXiv: 2604.18168
698. 3D Space as a Scratchpad for Editable Text-to-Image Generation
- Link: Open Access
- arXiv: 2601.14602
699. Causal Motion Diffusion Models for Autoregressive Motion Generation
- Link: Open Access
- arXiv: 2602.22594
700. Making Training-Free Diffusion Segmentors Scale with the Generative Power
- Link: Open Access
- arXiv: 2603.06178
701. DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models
- Link: Open Access
- arXiv: 2512.01686
702. ELITE: Efficient Gaussian Head Avatar from a Monocular Video via Learned Initialization and Test-time Generative Adaptation
- Link: Open Access
- arXiv: 2601.10200
703. ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
- Link: Open Access
704. MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAE
- Link: Open Access
- arXiv: 2602.08961
705. cryoSENSE: Compressive Sensing Enables High-throughput Microscopy with Sparse and Generative Priors on the Protein Cryo-EM Image Manifold
- Link: Open Access
- arXiv: 2511.12931
706. Stepwise Credit Assignment for GRPO on Flow-Matching Models
- Link: Open Access
- arXiv: 2603.28718
707. Improved Mean Flows: On the Challenges of Fastforward Generative Models
- Link: Open Access
- arXiv: 2512.02012
708. POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modeling
- Link: Open Access
- arXiv: 2512.13192
709. TagSplat: Topology-Aware Gaussian Splatting for Dynamic Mesh Modeling and Tracking
- Link: Open Access
- arXiv: 2512.01329
710. Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
- Link: Open Access
- arXiv: 2503.10125
711. Dual-Granularity Memory for Efficient Video Generation
- Link: Open Access
712. VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA
- Link: Open Access
713. LottieGPT: Tokenizing Vector Animation for Autoregressive Generation
- Link: Open Access
- arXiv: 2604.11792
714. Residual Connections Harm Generative Representation Learning
- Link: Open Access
- arXiv: 2404.10947
715. LangRef3DGS: Natural Language-Guided 3D Referential Segmentation from Partial Observations via 3D Gaussian Splatting
- Link: Open Access
716. Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation
- Link: Open Access
- arXiv: 2603.20725
717. GPFlow: Gaussian Prototype Probability Flow for Unsupervised Multi-Modal Anomaly Detection
- Link: Open Access
718. Flow Map Distillation Without Data
- Link: Open Access
- arXiv: 2511.19428
719. Unified Vector Floorplan Generation via Markup Representation
- Link: Open Access
- arXiv: 2604.04859
720. Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation
- Link: Open Access
- arXiv: 2603.19158
721. Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
- Link: Open Access
- arXiv: 2512.21058
722. DBMSolver: A Training-free Diffusion Bridge Sampler for High-Quality Image-to-Image Translation
- Link: Open Access
- arXiv: 2605.05889
723. Anti-I2V: Safeguarding your Photos from Malicious Image-to-video Generation
- Link: Open Access
- arXiv: 2603.24570
724. AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation
- Link: Open Access
- arXiv: 2604.18348
725. DriveLaW: Unifying Planning and Video Generation in a Latent Driving World
- Link: Open Access
726. Generative Neural Video Compression via Video Diffusion Prior
- Link: Open Access
- arXiv: 2512.05016
727. BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation
- Link: Open Access
- arXiv: 2603.05921
728. Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control
- Link: Open Access
- arXiv: 2509.15130
729. Learning Differentiable Hierarchies in 3D Gaussian Splatting
- Link: Open Access
730. Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models
- Link: Open Access
731. Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images
- Link: Open Access
- arXiv: 2508.03643
732. Circular-DPO: Aligning Multi-Stage 3D Generative Models via Preference Feedback Loop
- Link: Open Access
733. Align Images Before You Generate
- Link: Open Access
734. ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation
- Link: Open Access
- arXiv: 2601.15221
735. GS^2: Graph-based Spatial Distribution Optimization for Compact 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2604.01884
736. GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation
- Link: Open Access
737. PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation
- Link: Open Access
- arXiv: 2506.21076
738. CineBrain: A Large-Scale Multi-Modal Audiovisual Brain Dataset for Brain-Conditioned Video Generation
- Link: Open Access
739. Scaling Up AI-Generated Image Detection with Generator-Aware Prototypes
- Link: Open Access
- arXiv: 2512.12982
740. ReaGEN: Adaptive Generation of Structured Chains-of-Thought for Efficient Multimodal Reasoning
- Link: Open Access
741. WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories
- Link: Open Access
- arXiv: 2603.02049
742. Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
- Link: Open Access
- arXiv: 2512.10954
743. Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
- Link: Open Access
- arXiv: 2511.20889
744. Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity
- Link: Open Access
- arXiv: 2603.10990
745. FabricGen: Microstructure-Aware Woven Fabric Generation
- Link: Open Access
- arXiv: 2603.07240
746. FG-Portrait: 3D Flow Guided Editable Portrait Animation
- Link: Open Access
- arXiv: 2603.23381
747. MatchMask: Mask-Centric Generative Data Augmentation for Label-Scarce Semantic Segmentation
- Link: Open Access
748. ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation
- Link: Open Access
- arXiv: 2512.16234
749. SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens
- Link: Open Access
- arXiv: 2602.07564
750. ExpoCM: Exposure-Aware One-Step Generative Single-Image HDR Reconstruction
- Link: Open Access
- arXiv: 2605.02464
751. Taming Generative Diffusion Model for Task-Oriented Infrared Imaging
- Link: Open Access
752. Diversity over Uniformity: Rethinking Representation in Generated Image Detection
- Link: Open Access
753. MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks
- Link: Open Access
- arXiv: 2603.11554
754. GOR-IS: 3D Gaussian Object Removal In the Intrinsic Space
- Link: Open Access
- arXiv: 2605.00498
755. Nonlinear Color Transfer via Learnable Bezier Flows
- Link: Open Access
756. DreamOmni2: Multimodal Instruction-based Generation and Editing
- Link: Open Access
757. Decision Boundary-aware Generation for Long-tailed Learning
- Link: Open Access
- arXiv: 2605.01468
758. DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- Link: Open Access
- arXiv: 2511.19365
759. Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling
- Link: Open Access
- arXiv: 2603.27665
760. FastEventDGS: Deformable Gaussian Splatting for Fast Dynamic Scenes from a Single Event Camera
- Link: Open Access
761. RenderFlow: Single-Step Neural Rendering via Flow Matching
- Link: Open Access
- arXiv: 2601.06928
762. RDF-MIG: A Robust Diffusion Framework for Masked Image Generation to Augment Semantic Segmentation and Change Detection
- Link: Open Access
763. Robo-SGG: Exploiting Layout-Oriented Normalization and Restitution Can Improve Robust Scene Graph Generation
- Link: Open Access
- arXiv: 2504.12606
764. 4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models
- Link: Open Access
- arXiv: 2511.19836
765. HiDRA: Hierarchical Degradation Representation and Adaptation with Generative Priors for Enhancing Infrared Vision
- Link: Open Access
766. Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization
- Link: Open Access
- arXiv: 2605.08054
767. CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration
- Link: Open Access
- arXiv: 2603.20741
768. StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
- Link: Open Access
- arXiv: 2512.09363
769. EVLF: Early Vision-Language Fusion for Generative Dataset Distillation
- Link: Open Access
- arXiv: 2603.07476
770. SR3R: Rethinking Super-Resolution 3D Reconstruction With Feed-Forward Gaussian Splatting
- Link: Open Access
- arXiv: 2602.24020
771. IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation
- Link: Open Access
772. MU-GeNeRF: Multi-view Uncertainty-guided Generalizable Neural Radiance Fields for Distractor-aware Scene
- Link: Open Access
- arXiv: 2604.17965
773. VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
- Link: Open Access
- arXiv: 2511.23386
774. Mirai: Autoregressive Visual Generation Needs Foresight
- Link: Open Access
- arXiv: 2601.14671
775. Solving a Nonlinear Blind Inverse Problem for Tagged MRI with Physics and Deep Generative Priors
- Link: Open Access
- arXiv: 2603.00882
776. Spatiotemporal Pyramid Flow Matching for Climate Emulation
- Link: Open Access
- arXiv: 2512.02268
777. Match-and-Fuse: Consistent Generation from Unstructured Image Sets
- Link: Open Access
- arXiv: 2511.22287
778. MVInverse: Feed-forward Multiview Inverse Rendering in Seconds
- Link: Open Access
779. MM-ACT: Learn from Multimodal Parallel Generation to Act
- Link: Open Access
- arXiv: 2512.00975
780. Property-Informed Diffusion-Based Text-to-Microstructure Generation
- Link: Open Access
781. IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbations
- Link: Open Access
- arXiv: 2602.18831
782. ReFlow: Self-correction Motion Learning for Dynamic Scene Reconstruction
- Link: Open Access
- arXiv: 2604.01561
783. Is Bin Generation Indispensable? A Bin-Generation-Free Dataset Quantization via Semantic Perspective
- Link: Open Access
784. SVBench: Evaluation of Video Generation Models on Social Reasoning
- Link: Open Access
- arXiv: 2512.21507
785. DiT-Distill: Open-Set Fine-Grained Retrieval via Generative Curriculum Knowledge
- Link: Open Access
786. Mixture-of-Experts based Feature Decoupling for Open Vocabulary Scene Graph Generation
- Link: Open Access
787. GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processes
- Link: Open Access
- arXiv: 2604.02915
788. Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
- Link: Open Access
- arXiv: 2512.02650
789. SCIEval: Evaluating and Benchmarking the Faithfulness of Scientific Image Generation and Interpretation with Large Multimodal Models
- Link: Open Access
790. SemLayer: Semantic-aware Generative Segmentation and Layer Construction for Abstract Icons
- Link: Open Access
- arXiv: 2603.24039
791. ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion
- Link: Open Access
- arXiv: 2601.16148
792. Plug-and-Play PDE Optimization for 3D Gaussian Splatting: Toward High-Quality Rendering and Reconstruction
- Link: Open Access
- arXiv: 2509.13938
793. Unified Customized Generation by Disentangled Reward Modeling
- Link: Open Access
794. AeroGS: Scale-Aware Gaussian Splatting for Pose-Free Dynamic UAV Scene Reconstruction
- Link: Open Access
795. Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motions
- Link: Open Access
- arXiv: 2512.08500
796. Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models
- Link: Open Access
- arXiv: 2512.22324
797. GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesis
- Link: Open Access
- arXiv: 2603.01010
798. Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
- Link: Open Access
- arXiv: 2511.12207
799. GenTract: Generative Global Tractography
- Link: Open Access
- arXiv: 2511.13183
800. Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training
- Link: Open Access
- arXiv: 2603.25706
801. TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models
- Link: Open Access
- arXiv: 2603.17828
802. PhysHO: Physics-Based Dynamic 3D Gaussian Human and Object from Monocular Video
- Link: Open Access
803. CaT-GS: Efficient 3DGS Rendering for Large-Scale Scenes with Inter-frame Caching and Tile Scheduling
- Link: Open Access
804. SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation
- Link: Open Access
- arXiv: 2506.23690
805. Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models
- Link: Open Access
- arXiv: 2601.04068
806. Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation
- Link: Open Access
- arXiv: 2511.21185
807. Understanding, Accelerating, and Improving MeanFlow Training
- Link: Open Access
- arXiv: 2511.19065
808. PhyCo: Learning Controllable Physical Priors for Generative Motion
- Link: Open Access
- arXiv: 2604.28169
809. Learning Straight Flows: Variational Flow Matching for Efficient Generation
- Link: Open Access
- arXiv: 2511.17583
810. DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation
- Link: Open Access
- arXiv: 2508.07341
811. Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Link: Open Access
- arXiv: 2511.04570
812. ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
- Link: Open Access
- arXiv: 2511.00511
813. Order Matters: 3D Shape Generation from Sequential VR Sketches
- Link: Open Access
- arXiv: 2512.04761
814. DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation
- Link: Open Access
- arXiv: 2603.20470
815. Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation
- Link: Open Access
- arXiv: 2512.06158
816. RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations
- Link: Open Access
- arXiv: 2602.22013
817. SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution
- Link: Open Access
- arXiv: 2603.08536
818. MotionMaster: Generalizable Text-Driven Motion Generation and Editing
- Link: Open Access
819. Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model
- Link: Open Access
- arXiv: 2603.26357
820. Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation
- Link: Open Access
821. Toward Early Quality Assessment of Text-to-Image Diffusion Models
- Link: Open Access
- arXiv: 2603.02829
822. Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization
- Link: Open Access
- arXiv: 2601.01483
823. Rethinking Glyph Spatial Information in Font Generation
- Link: Open Access
824. Learning Long-term Motion Embeddings for Efficient Kinematics Generation
- Link: Open Access
- arXiv: 2604.11737
825. IVAAN: Instance-level Vision-Language Alignment via Attribute-Guided Text Prompts Generation for Nuclei Analysis
- Link: Open Access
826. AdvFM: Lookahead Flow-Matching Velocity-Field Attacks for Imperceptible and Transferable Adversarial Examples
- Link: Open Access
827. MLLMSplat: A 2D MLLM-Powered Framework for 3D Gaussian Splatting Understanding, Generation, and Editing
- Link: Open Access
828. Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamics
- Link: Open Access
829. TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction
- Link: Open Access
- arXiv: 2511.12578
830. Learning from Oblivion: Predicting Knowledge-Overflowed Weights via Retrodiction of Forgetting
- Link: Open Access
- arXiv: 2508.05059
831. EvoID: Reinforced Evolution for Identity-Preserving Video Generation
- Link: Open Access
832. Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM
- Link: Open Access
- arXiv: 2604.22339
833. F^2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modeling
- Link: Open Access
834. RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generation
- Link: Open Access
- arXiv: 2604.03454
835. PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation
- Link: Open Access
- arXiv: 2603.24078
836. Diffusion with a Linguistic Compass: Steering the Generation of Clinically Plausible Future sMRI Representations for Early MCI Conversion Prediction
- Link: Open Access
- arXiv: 2506.05428
837. MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation
- Link: Open Access
838. CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation
- Link: Open Access
- arXiv: 2511.22863
839. mmWaveFlow: Unified Enhancement and Generation of mmWave Human Point Clouds
- Link: Open Access
840. Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
- Link: Open Access
- arXiv: 2512.04678
841. MemFlow: A Lightweight Forward Memorizing Framework for Quick Domain Adaptive Feature Mapping
- Link: Open Access
- arXiv: 2402.14598
842. Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation
- Link: Open Access
843. RecTok: Reconstruction Distillation along Rectified Flow
- Link: Open Access
- arXiv: 2512.13421
844. PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction
- Link: Open Access
- arXiv: 2604.08125
845. AudioStory: Generating Long-Form Narrative Audio with Large Language Models
- Link: Open Access
- arXiv: 2508.20088
846. RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation
- Link: Open Access
- arXiv: 2603.11106
847. ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction
- Link: Open Access
- arXiv: 2604.13746
848. CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation
- Link: Open Access
- arXiv: 2601.15408
849. Personalized Longitudinal Medical Report Generation via Temporally-Aware Federated Adaptation
- Link: Open Access
- arXiv: 2602.19668
850. M4V: Multimodal Mamba for Efficient Text-to-Video Generation
- Link: Open Access
851. PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting
- Link: Open Access
- arXiv: 2605.11520
852. SEA-Flow3D: Simplified, Efficient, and Accurate Scene Flow via Spatial Vector Sampling and Multi-scale Refinement
- Link: Open Access
853. Bridging Privacy and Provenance: Traceable Virtual Identity Generation
- Link: Open Access
854. Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representations
- Link: Open Access
855. FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching
- Link: Open Access
- arXiv: 2605.05077
856. SketchFaceGS: Real-Time Sketch-Driven Face Editing and Generation with Gaussian Splatting
- Link: Open Access
- arXiv: 2604.19202
857. Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
- Link: Open Access
858. Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation
- Link: Open Access
- arXiv: 2602.02401
859. F-Assist: Multi-Phase Fetal Growth Forecast and Report Generation from Ultrasound Examination
- Link: Open Access
860. Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
- Link: Open Access
- arXiv: 2512.15347
861. NG-GS: NeRF-guided 3D Gaussian Splatting Segmentation
- Link: Open Access
- arXiv: 2604.14706
862. PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes
- Link: Open Access
- arXiv: 2506.19117
863. BiGain: Unified Token Compression for Joint Generation and Classification
- Link: Open Access
- arXiv: 2603.12240
864. MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models
- Link: Open Access
- arXiv: 2511.20629
865. Agentic Retoucher for Text-To-Image Generation
- Link: Open Access
- arXiv: 2601.02046
866. OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens
- Link: Open Access
- arXiv: 2603.02138
867. GeneVAR: Causal MeanFlow for Autoregressive Gene-to-WSI Tile Synthesis
- Link: Open Access
868. SAT-RRG: LLM-Guided Self-Adaptive Training for Radiology Report Generation with Token-Level Push-Pull Optimization
- Link: Open Access
869. Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimization
- Link: Open Access
870. DynFusion: Rethinking Condition Fusion for Adaptive Multi-Conditional Text-to-Image Generation
- Link: Open Access
871. ChArtist: Generating Pictorial Charts with Unified Spatial and Subject Control
- Link: Open Access
- arXiv: 2603.14209
872. Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation
- Link: Open Access
- arXiv: 2603.21864
873. Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
- Link: Open Access
- arXiv: 2511.16669
874. PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling
- Link: Open Access
- arXiv: 2512.04784
875. Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation
- Link: Open Access
- arXiv: 2503.22172
876. TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation
- Link: Open Access
877. HierAmp: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillation
- Link: Open Access
- arXiv: 2603.06932
878. Layer Consistency Matters: Elegant Latent Transition Discrepancy for Generalizable Synthetic Image Detection
- Link: Open Access
- arXiv: 2603.10598
879. PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction
- Link: Open Access
880. IncreFA: Breaking the Static Wall of Generative Model Attribution
- Link: Open Access
- arXiv: 2604.17736
881. GrOCE : Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models
- Link: Open Access
882. ProgressiveAvatars: Progressive Animatable 3D Gaussian Avatars
- Link: Open Access
- arXiv: 2603.16447
883. GM-R^2: Generative Matching Learning for Unsupervised Geometric Representation and Registration
- Link: Open Access
884. Cross-View Splatter: Feed-Forward View Synthesis with Georeferenced Images
- Link: Open Access
- arXiv: 2605.19656
885. Chain of Event-Centric Causal Thought for Physically Plausible Video Generation
- Link: Open Access
- arXiv: 2603.09094
886. SunFaded: Illumination-Aware Gaussian Splatting for Dark Scenes with Camera-Mounted Active Lighting
- Link: Open Access
887. Zero-shot Detection of AI-Generated Image via RAW-RGB Alignment
- Link: Open Access
888. Thermal is Always Wild: Characterizing and Addressing Challenges in Thermal-Only Novel View Synthesis
- Link: Open Access
- arXiv: 2603.20448
889. AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation
- Link: Open Access
- arXiv: 2603.28366
890. CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion
- Link: Open Access
- arXiv: 2602.19140
891. RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing
- Link: Open Access
- arXiv: 2602.19753
892. Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation
- Link: Open Access
- arXiv: 2603.22509
893. Adapting In-context Generation for Enhanced Composed Image Retrieval
- Link: Open Access
894. CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration
- Link: Open Access
- arXiv: 2604.05689
895. Hierarchical Visual Relocalization with Nearest View Synthesis from Feature Gaussian Splatting
- Link: Open Access
- arXiv: 2603.29185
896. RemedyGS: Defend 3D Gaussian Splatting Against Computation Cost Attacks
- Link: Open Access
- arXiv: 2511.22147
897. SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation
- Link: Open Access
- arXiv: 2604.03134
898. UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents
- Link: Open Access
- arXiv: 2512.09435
899. PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting
- Link: Open Access
- arXiv: 2510.27680
900. Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning
- Link: Open Access
- arXiv: 2603.04870
901. Dropping Anchor and Spherical Harmonics for Sparse-view Gaussian Splatting
- Link: Open Access
- arXiv: 2602.20933
902. ARES: Unifying Asymmetric RGB-Event Stereo for Probabilistic Scene Flow Estimation
- Link: Open Access
903. RFDM: Residual Flow Diffusion Models for Video Editing
- Link: Open Access
904. Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videos
- Link: Open Access
- arXiv: 2603.25058
905. EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- Link: Open Access
- arXiv: 2512.11715