R
Published on

CVPR 2026 — 3D Vision & Depth

3D Vision & Depth

719 papers

1. DirectFisheye-GS: Enabling Native Fisheye Input in Gaussian Splatting with Cross-View Joint Optimization

2. PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning

3. REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting

4. HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views

5. SRGCD: Stability-Driven Region Growth Framework for 3D Change Detection

6. SAM 3D Body: Robust Full-Body Human Mesh Recovery

7. VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

8. PhysIR-Splat: Physically Consistent Thermal Infrared Radiative Transfer in 3D Gaussian Splatting

9. Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization

10. RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting

11. FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario

12. MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Label

13. CrossHOI: Learning Cross-View Representations for Monocular 3D Human-Object Interaction Reconstruction

14. GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compression

15. ForeHOI: Feed-forward 3D Object Reconstruction from Daily Hand-Object Interaction Videos

16. Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision

17. BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation

18. EG-3DVG: Expression and Geometry Aware Grounding Decoder for 3D Visual Grounding

19. C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion

20. MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer

21. Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning

22. Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction

23. RetimeGS: Continuous-Time Reconstruction of 4D Gaussian Splatting

24. Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopy

25. Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitives

26. Paparazzo: Active Mapping of Moving 3D Objects

27. QueryMe: Query-Driven Open-Vocabulary 3D Object Affordances Grounding from Multimodal Evidence

28. DENALI: A Dataset Enabling Non-Line-of-Sight Spatial Reasoning with Low-Cost LiDARs

29. OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery

30. MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting

31. 3D-Aware Multi-Task Learning with Cross-View Correlations for Dense Scene Understanding

32. Repurposing 3D Generative Model for Autoregressive Layout Generation

33. RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations

34. WonderZoom: Multi-Scale 3D World Generation

35. GeoFree-CoSeg: Unsupervised Point Cloud-Image Cross-Modal Co-Segmentation Without Geometric Alignment

36. Any Resolution Any Geometry: From Multi-View To Multi-Patch

37. LoG3D: Ultra-High-Resolution 3D Shape Modeling via Local-to-Global Partitioning

38. PercHead: Perceptual Head Model for Single-Image 3D Head Reconstruction & Editing

39. LiteSense: Lifting Lightweight ToF with RGB for High-Resolution Metric Depth Estimation

40. Write Where It Matters: Policy-Guided Watermarks for 3D Gaussian Splatting

41. TerraSeg: Self-Supervised Ground Segmentation for Any LiDAR

42. Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists

43. Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

44. OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness

45. S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs

46. STAvatar: Soft Binding and Temporal Density Control for Monocular 3D Head Avatars Reconstruction

47. PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization

48. Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image

49. MGDHand: Multi-Granularity Prior-to-Inertial Distillation Framework for Sequential 3D Hand Pose Estimation from Sparse IMUs

50. A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

51. STAR-R1: Multi-View Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs

52. Pantheon360: Taming Digital Twin Generation via 3D-Aware 360deg Video Diffusion

53. Correspondence-Attention Alignment for Multi-View Diffusion Models

54. Geometry-Guided 3D Visual Token Pruning for Video-Language Models

55. Residual Primitive Fitting of 3D Shapes with SuperFrusta

56. Anti-Degradation Lifelong Multi-View Clustering

57. ReScene4D: Temporally Consistent Semantic Instance Segmentation of Evolving Indoor 3D Scenes

58. GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidance

59. An Instance-Centric Panoptic Occupancy Prediction Benchmark for Autonomous Driving

60. FHAvatar: Fast and High-Fidelity Reconstruction of Face-and-Hair Composable 3D Head Avatar from Few Casual Captures

61. UZ3DVG: Unaided Zero-Shot 3D Visual Grounding with Generated Language Conditions

62. U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences

63. ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation

64. Probabilistic Discrepancy Learning for Roadside LiDAR Scene Completion

65. FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation

66. P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction

67. MeshSplatting: Differentiable Rendering with Opaque Meshes

68. CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling

69. Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo

70. Disco-GS: Gaussian Splatting in Dynamic Color Lighting

71. Back to Point: Exploring Point-Language Models for Zero-Shot 3D Anomaly Detection

72. MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videos

73. Bootstrapping Multi-view Learning for Test-time Noisy Correspondence

74. Aesthetic Camera Viewpoint Suggestion with 3D Aesthetic Field

75. MeshRipple: Structured Autoregressive Generation of Artist-Meshes

76. Text-Image Conditioned 3D Generation

77. SV-GS: Sparse View 4D Reconstruction with Skeleton-Driven Gaussian Splatting

78. Think 360deg: Beyond Depth: Evaluating the Width-centric Reasoning Capability of MLLMs

79. ORBIT: Benchmarking SfM in the Wild with 360deg Video

80. SMV-EAR: Bring Spatiotemporal Multi-View Representation Learning into Efficient Event-Based Action Recognition

81. SharpTimeGS: Sharp and Stable Dynamic Gaussian Splatting via Lifespan Modulation

82. Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction

83. GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation

84. MV2UV: Generating High-quality UV Texture Maps with Multiview Prompts

85. Pip-Stereo: Progressive Iterations Pruner for Iterative Optimization based Stereo Matching

86. Learning Hierarchical Hyperbolic Mixture Model for Part-aware 3D Generation

87. Unblur-SLAM: Dense Neural SLAM for Blurry Inputs

88. Direction-aware 3D Large Multimodal Models

89. Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes

90. Lifting Unlabeled Internet-level Data for 3D Scene Understanding

91. UST-Hand: An Uncertainty-aware Spatiotemporal Point Cloud Interaction Network for 3D Self-supervised Hand Pose Estimation

92. Learnability-Driven Submodular Optimization for Active Roadside 3D Detection

93. Bootstrap Dynamic-Aware 3D Visual Representation for Scalable Robot Learning

94. CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation

95. Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion

96. Pose-Free Omnidirectional Gaussian Splatting for 360-Degree Videos with Consistent Depth Priors

97. ObjectMorpher: 3D-Aware Image Editing via Deformable 3DGS

98. NimbusGS: Unified 3D Scene Reconstruction under Hybrid Weather

99. C-LaV: Conditional Latent Velocity Field Denoising for Weather-Robust LiDAR Place Recognition

100. CoLC: Communication-Efficient Collaborative Perception with LiDAR Completion

101. FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips

102. Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning

103. Physically Inspired Gaussian Splatting for HDR Novel View Synthesis

104. ManifoldNeuS: Manifold-aware View Optimizability for Pose-Free Neural Surface Reconstruction

105. MatMart: Material Reconstruction of 3D Objects via Diffusion

106. SparseSplat: Towards Applicable Feed-Forward 3D Gaussian Splatting with Pixel-Unaligned Prediction

107. E2EGS: Event-to-Edge Gaussian Splatting for Pose-Free 3D Reconstruction

108. FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generation

109. PoseGaussian: 6D Pose Estimation for Unseen Objects via Sparse-View Object-Level 3D Gaussian Splatting

110. ResiHMR: Residual-Limb Aware Single-Image 3D Human Mesh Recovery for Individuals with Limb Loss

111. Neural Distribution Prior for LiDAR Out-of-Distribution Detection

112. HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models

113. EfficientMonoHair: Fast Strand-Level Reconstruction from Monocular Video via Multi-View Direction Fusion

114. Learning Coordinate-based Convolutional Kernels for Continuous SE(3) Equivariant and Efficient Point Cloud Analysis

115. Energy-GS: Image Energy-guided Pose Alignment Gaussian Splatting with redesigned pose gradient flow

116. SGSoft: Learning Fused Semantic-Geometric Features for 3D Shape Correspondence via Template-Guided Soft Signals

117. Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstruction

118. E-3DPSM: A State Machine for Event-based Egocentric 3D Human Pose Estimation

119. Proxy-GS: Unified Occlusion Priors for Training and Inference in Structured 3D Gaussian Splatting

120. AnyPcc: Compressing Any Point Cloud with a Single Universal Model

121. ORV: 4D Occupancy-centric Robot Video Generation

122. SCE-SLAM: Scale-Consistent Monocular SLAM via Scene Coordinate Embeddings

123. OneOcc: Semantic Occupancy Prediction for Legged Robots with a Single Panoramic Camera

124. XPaintNet: An eXtreme Lightweight Framework for Stereoscopic Conversion without Inpainting Network

125. PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understanding

126. TACO: Task-Aware Contrastive Learning for Joint LiDAR Localization and 3D Object Detection

127. VesMamba: 3D Pulmonary Vessel Segmentation from CT images via Mamba with Structural Perception and Scale-aware Filtering

128. ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation

129. Plug-and-Play Incomplete Multi-View Clustering via Janus-Faced Affinity Learning with Topology Harmonization

130. SHOW3D: Capturing Scenes of 3D Hands and Objects in the Wild

131. Cross-Instance Gaussian Splatting Registration via Geometry-Aware Feature-Guided Alignment

132. MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction

133. Breaking the 3D Dataset Bottleneck: Fast Scalable Generation of Aligned 3D Assets from Scratch for Category 6D Pose Estimation and Robotic Grasping

134. Easy3E: Feed-Forward 3D Asset Editing via Rectified Voxel Flow

135. Query2Uncertainty: Robust Uncertainty Quantification and Calibration for 3D Object Detection under Distribution Shift

136. PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistency

137. Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge

138. GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

139. R3-PCQA: Ray-Reprojection-Reinforcement for No-Reference 3D Point Cloud Quality Assessment

140. Learning Anchor in Dual Orthogonal Space for Fast Multi-view Clustering

141. Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation

142. MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation

143. 3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image

144. CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image

145. EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization

146. Enhancing Hands in 3D Whole-Body Pose Estimation with Conditional Hands Modulator

147. Material Magic Wand: Material-Aware Grouping of 3D Parts in Untextured Meshes

148. LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalization

149. Unsupervised 3d Motion Estimation Using Event Camera

150. Selfi: Self-improving Reconstruction Engine via 3D Geometric Feature Alignment

151. Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting

152. Learning Compact 3D Representations from Feed-Forward Novel View Synthesis

153. SceneTok: A Compressed, Diffusable Token Space for 3D Scenes

154. MAPo: Motion-Aware Partitioning of Deformable 3D Gaussian Splatting for High-Fidelity Dynamic Scene Reconstruction

155. EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

156. RaGS: Unleashing 3D Gaussian Splatting from 4D Radar and Monocular Cue for 3D Object Detection

157. High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategy

158. Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling

159. MambaSIC: Mamba-based Stereo Image Compression with Bi-directional Multi-reference Entropy Model

160. ProOOD: Prototype-Guided Out-of-Distribution 3D Occupancy Prediction

161. FUSER: Feed-Forward Multiview 3D Registration Transformer and SE(3)N^N Diffusion Refinement

162. PointCSP: Cross-Sample Semantic Propagation and Stability Preservation in Self-Supervised Point Cloud Learning

163. SeeGroup: Multi-Layer Depth Estimation of Transparent Surfaces via Self-Determined Grouping

164. Affostruction: 3D Affordance Grounding with Generative Reconstruction

165. Gaussian-Mixture Latent Flow for Stochastic 3D Human Motion Prediction

166. MD2E: Modeling Depth-to-Edge Cues for Monocular Metric Depth Estimation

167. Omni-3DEdit: Generalized Versatile 3D Editing in One-Pass

168. AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers

169. Exact-GS: Mathematically Rigorous and Accurate 3D Gaussian Splatting for 3D X-ray Reconstruction

170. SDGS: Spatial Difference Guided Gaussian Splatting for Simultaneous Localization and 3D Reconstruction

171. MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splatting

172. Real-Time Multimodal Fingertip Contact Detection via Depth and Motion Fusion for Vision-Based Human-Computer Interaction

173. Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds

174. CoRoGS: Contextual Gaussian Splatting for Robust Large-Deviation View Synthesis

175. iSplat: Iterative Learning for Fine-Grained Gaussian Splatting

176. 3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation

177. KASALv2: Fully Automatic 3D Rotational Symmetry Classification and Axis Localization

178. Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection

179. PRIMU: Uncertainty Estimation for Novel Views in Gaussian Splatting from Primitive-Based Representations of Error and Coverage

180. CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion

181. PromptStereo: Zero-Shot Stereo Matching via Structure and Motion Prompts

182. Bezier Degradation Modeling for LiDAR-based Human Motion Capture

183. Adaptive Anisotropic Gaussian Splatting for Multi-contrast MRI Arbitrary-Scale Super-Resolution with Anatomy Guidance

184. DualSplat: Robust 3D Gaussian Splatting via Pseudo-Mask Bootstrapping from Reconstruction Failures

185. PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image

186. S2^2-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

187. MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer

188. 4C4D: 4 Camera 4D Gaussian Splatting

189. CROWn: A Unified Framework for Anti-Aliased Downsampling and Phase-Calibrated Fusion in 3D Medical Segmentation

190. G2^2VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning

191. UAVLight: A Benchmark for Illumination-Robust 3D Reconstruction in Unmanned Aerial Vehicle (UAV) Scenes

192. Spectral-Geometric Neural Fields for Pose-Free LiDAR View Synthesis

193. E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training

194. RPGFusion: 4D Radar Prior-Guided Multi-Modal Fusion for 3D Detection

195. SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model

196. Universal 3D Shape Matching via Coarse-to-Fine Language Guidance

197. SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting

198. SO(3)-Equivariant ViT-Adapter for Data-Efficient Zero-Shot Sim-to-Real Indoor Panoramic Depth Estimation

199. Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Prediction

200. Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field

201. Radiance Meshes for Volumetric Reconstruction

202. LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistency

203. AIMDepth: Asymmetric Image-Event Mamba for Monocular Depth Estimation

204. Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

205. VoDaSuRe: A Large-Scale Dataset Revealing Domain Shift in Volumetric Super-Resolution

206. TokenHand: Discrete Token Representation for Efficient Hand Mesh Reconstruction

207. Distilling Unsigned Distance Function for Surface Reconstruction from 3D Gaussian Splatting

208. TouchDream: 3D Object Completion through Imagined Touch

209. eRetinexGS: Retinex Modeling for Low-Light Scene Enhancement via Event Streams and 3D Gaussian Splatting

210. The Midas Touch for Metric Depth

211. Vinedresser3D: Towards Agentic Text-guided 3D Editing

212. Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perception

213. TeHOR: Text-Guided 3D Human and Object Reconstruction with Textures

214. Extend3D: Town-Scale 3D Generation

215. GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation

216. PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View Reasoning

217. VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection

218. UniPR: Unified Object-level Real-to-Sim Perception and Reconstruction from a Single Stereo Pair

219. How Much 3D Do Video Foundation Models Encode?

220. 3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects

221. VAD-GS: Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes

222. Z-Order Transformer for Feed-Forward Gaussian Splatting

223. DepthFocus: Controllable Depth Estimation for See-Through Scenes

224. Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching

225. Representing 3D Faces with Learnable B-Spline Volumes

226. TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion

227. Geometric-Aware Hypergraph Reasoning for Novel Class Discovery in Point Cloud Segmentation

228. RARE: Learn to RAnk and REtrieve for Monocular 3D Object Detection

229. CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation

230. DynamicTree: Interactive Real Tree Animation via Sparse Voxel Spectrum

231. Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion

232. Talking Together: Synthesizing Co-Located 3D Conversations from Audio

233. Learning Multi-View Spatial Reasoning from Cross-View Relations

234. HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidance

235. Prospective Dynamic 3D MRI Reconstruction via Latent-Space Motion Tracking from Single Measurement

236. PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstruction

237. STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction

238. Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation

239. Seeing through boxes: Non-Line-of-Sight 3D Reconstruction from Radar Signals

240. SCAPO: Self-Supervised Category-Level Articulated Pose Estimation from a Single 3D Observation

241. Generalizable Structure-Aware Keypoint Correspondence for Category-Unified 3D Single Object Tracking

242. EcoSplat: Efficiency-controllable Feed-forward 3D Gaussian Splatting from Multi-view Images

243. Dr.Occ: Depth- and Region-Guided 3D Occupancy from Surround-View Cameras for Autonomous Driving

244. Rethinking Pose Refinement in 3D Gaussian Splatting under Pose Prior and Geometric Uncertainty

245. Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models

246. Grounded 3D-Aware Spatial Vision-Language Modeling

247. LATTICE: Democratize High-Fidelity 3D Generation at Scale

248. Dual Graph Regularized Deep Unfolding Network for Guided Depth Map Super-resolution

249. Illustrator's Depth: Monocular Layer Index Prediction for Image Decomposition

250. OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding

251. ZipMap: Linear-Time Stateful 3D Reconstruction via Test-Time Training

252. Dehallu3D: Hallucination-Mitigated 3D Generation from a Single Image via Cyclic View Consistency Refinement

253. VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement

254. QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy

255. MV-TAP: Tracking Any Point in Multi-View Videos

256. MHopReg: Efficient Hierarchical Multi-Hop Graph Search for Point Cloud Registration

257. EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

258. ST4R-Splat: Spatio-Temporal Referring Segmentation in 4D Gaussian Splatting

259. Aligning Text, Images and 3D Structure Token-by-Token

260. LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving

261. CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation

262. Stochastic Ray Tracing for the Reconstruction of 3D Gaussian Splatting

263. FUN REC * Reconstructing Functional 3D Scenes from Egocentric Interaction Videos

264. Task-Driven Implicit Representations for Automated Design of LiDAR Systems

265. Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

266. MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentation

267. Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding

268. Faster-GS: Analyzing and Improving Gaussian Splatting Optimization

269. MooCap: A Multi-View Benchmark for Cow-Object-Human Interaction and Behavior Dynamics

270. Geometry-Aligned and Anomaly-Aware Reconstruction for 3D Anomaly Detection

271. TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos

272. FluidGaussian: Propagating Simulation-Based Uncertainty Toward Functionally-Intelligent 3D Reconstruction

273. DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos

274. AeroDGS: Physically Consistent Dynamic Gaussian Splatting for Single-Sequence Aerial 4D Reconstruction

275. SMVRT: Implicit Human 3D Modeling Using Sparse Multi-View Volumetric Reconstruction with Transformer Fusion

276. AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows

277. Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generation

278. Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimation

279. Captain Safari: A World Engine with Pose-Aligned 3D Memory

280. TopoMA: Topology-Guided Multi-Agent Dense RGB 3D Reconstruction via Distributed Inference

281. CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

282. I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners

283. Zero-Shot Depth Completion with Vision-Language Model

284. FreqSIC: Frequency-aware Stereo Image Compression with Bi-directional Checkerboard Context Model

285. Stereo World Model: Camera-Guided Stereo Video Generation

286. MS^2Gait: A Multi-Scale Spatio-Temporal Fusion Network for LiDAR-based Gait Recognition

287. Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction

288. REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

289. Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation

290. L3DR: 3D-aware LiDAR Diffusion and Rectification

291. VarSplat: Uncertainty-aware 3D Gaussian Splatting for Robust RGB-D SLAM

292. Faithful Contouring: Near-Lossless 3D Voxel Representation Free from Iso-surface

293. GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator

294. ShelfOcc: Native 3D Supervision beyond LiDAR for Vision-Based Occupancy Estimation

295. SpeeDe3DGS: Speedy Deformable 3D Gaussian Splatting with Temporal Pruning and Motion Grouping

296. FastGS: Training 3D Gaussian Splatting in 100 Seconds

297. Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing

298. OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective

299. Spatial-SAM: Spatially Consistent 3D Electron Microscopy Segmentation with SDF Memory and Semi-Supervised Learning

300. Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes

301. NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code

302. Unleashing the Power of Chain-of-Prediction for Monocular 3D Object Detection

303. DiffuView: Multi-View Diffusion Pretraining for 3D Aware Robotic Manipulation

304. Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface

305. PromptDepth: Efficient and Promptable Geometric 3D Vision Model for Embodied Intelligence

306. PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems

307. RecEdit-Drive: 3D Reconstruction-Guided Spatiotemporal Video Editing for Autonomous Driving Scenes

308. Particulate: Feed-Forward 3D Object Articulation

309. Ego-1K - A Large-Scale Multiview Video Dataset for Egocentric Vision

310. Seeing Depth Through Frequency and Motion: A Progressive Training Paradigm for Monocular Depth Estimation

311. MeshMosaic: Scaling Artist Mesh Generation via Local-to-Global Assembly

312. Seele: A Unified Acceleration Framework for Real-Time Gaussian Splatting on Mobile Devices

313. Gaussian Splatting-based Low-Rank Tensor Representation for Multi-Dimensional Image Recovery

314. Efficient Encoder-Free Fourier-based 3D Large Multimodal Model

315. Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction

316. Eulerian Gaussian Splatting using Hashed Probability Pyramids

317. SemLT3D: Semantic-Guided Expert Distillation for Camera-only Long-Tailed 3D Object Detection

318. Where, What, Why: Toward Explainable 3D-GS Watermarking

319. SPE-MVS: Spatial Position Encoding Enhanced Multi-View Stereo with Monocular Depth Priors

320. No Calibration, No Depth, No Problem: Cross-Sensor View Synthesis with 3D Consistency

321. Hybrid Robust Collaborative Perception with LiDAR-4D Radar Fusion under Adverse Weather Conditions

322. CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

323. PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restoration

324. Human Interaction-Aware 3D Reconstruction from a Single Image

325. PolarGuide-GSDR: 3D Gaussian Splatting Driven by Polarization Priors and Deferred Reflection for Real-World Reflective Scenes

326. Parallelised Differentiable Straightest Geodesics for 3D Meshes

327. Fusion of Depth and Semantics for Probabilistic Floorplan Localization

328. GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting

329. From 3D Pose to Prose: Biomechanics-Grounded Vision-Language Coaching

330. 3D-IDE: 3D Implicit Depth Emergent

331. 3D Gaussian Splatting at Arbitrary Resolutions with Compact Proxy Anchors

332. Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation

333. Expanding mmWave Datasets for Human Pose Estimation with Unlabeled Data and LiDAR Datasets

334. MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

335. PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

336. GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentation

337. Volumetric Functional Maps

338. QD-PCQA: Quality-Aware Domain Adaptation for Point Cloud Quality Assessment

339. HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

340. ShapeR: Robust Conditional 3D Shape Generation from Casual Captures

341. MatSpray: Fusing 2D Material World Knowledge on 3D Geometry

342. UniTEX: Universal High Fidelity Generative Texturing for 3D Shapes

343. Cluster-aware Anchor Learning for Multi-View Clustering

344. Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration

345. Fast Markov Random Field Optimisation for Topologically Noisy 3D Shape Matching

346. 3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience

347. GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidance

348. Layered 4D-Rotor Gaussian Splatting: A Compressed Representation for Long Dynamic Scenes

349. More Natural, More Real: Object-aware Gaussian Splatting for 3D Visual Decoding from Human Brain

350. Real2Sim2Real: RetinalDepth-64K for Depth Estimation in Posterior Segment Ophthalmic Surgery

351. Learning 3D Shape Fidelity Metric from Real-world Distortions

352. SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

353. Part2^{2}GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting

354. PE3R: Perception-Efficient 3D Reconstruction

355. TWINGS: Thin Plate Splines Warp-aligned Initialization for Sparse-View Gaussian Splatting

356. Intrinsic Image Fusion for Multi-View 3D Material Reconstruction

357. PhysGS: Bayesian-Inferred Gaussian Splatting for Physical Property Estimation

358. GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

359. Underground Plant Exploration: Non-Destructive 3D Root Assessment with GPR Based on Point Graph Neural Network

360. AnchorSplat: Feed-Forward 3D Gaussian Splatting With 3D Geometric Priors

361. CoSMo3D: Open-World Promptable 3D Semantic Segmentation through LLM-Guided Canonical Spatial Modeling

362. Node-RF: Learning Generalized Continuous Space-Time Scene Dynamics with Neural ODE-based NeRFs

363. LaRP: Efficient Multi-View Inpainting with Latent Reprojection Priors

364. Geometry-Aware Cross-Modal Graph Alignment for Referring Segmentation in 3D Gaussian Splatting

365. Guardians of the Hair: Rescuing Soft Boundaries in Depth, Stereo, and Novel Views

366. SceMoS: Scene-Aware 3D Human Motion Synthesis by Planning with Geometry-Grounded Tokens

367. Muses: Designing, Composing, Generating Nonexistent Fantasy 3D Creatures without Training

368. SuP: Sub-cloud Driven Point Cloud Registration

369. VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation

370. HAMMER: Harnessing MLLMs via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

371. Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation

372. Masked-Diffusion Autoencoders for 3D Medical Vision Representation Learning

373. Reliev3R: Relieving Feed-forward 3D Reconstruction from Multi-View Geometric Annotations

374. Point Cloud as a Foreign Language for Multi-modal Large Language Model

375. Generative Video Motion Editing with 3D Point Tracks

376. Edges Compete for Trust: Group Relative Edge Optimization for Building Reconstruction from Point Clouds

377. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion

378. ParkGaussian: Surround-view 3D Gaussian Splatting for Autonomous Parking

379. MorphAny3D: Unleashing the Power of Structured Latent in 3D Morphing

380. PackUV: Packed Gaussian UV Maps for 4D Volumetric Video

381. UniDAC: Universal Metric Depth Estimation for Any Camera

382. Haptic Neural Fields: Bringing Tactile Interactions to 3D Rendered Scenes

383. SIMSPINE: A Biomechanics-Aware Simulation Framework for 3D Spine Motion Annotation and Benchmarking

384. Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domain

385. Geometric-Photometric Event-based 3D Gaussian Ray Tracing

386. BA-GS: Bayesian Adaptive Gaussian Splatting for SFM-Free 3D Reconstruction

387. BuildAnyPoint: 3D Building Structured Abstraction from Diverse Point Clouds

388. R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detection

389. When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness

390. Radar-Guided Polynomial Fitting for Metric Depth Estimation

391. 240FPS Stereo Vision from Monocular Mixed Spikes

392. LoST: Level of Semantics Tokenization for 3D Shapes

393. Adaptive Depth Lightweight RGB-T Tracking with Holistic Token Routing

394. HyperGaussians: High-Dimensional Gaussian Splatting for High-Fidelity Animatable Face Avatars

395. ExMesh: EXplicit Mesh Reconstruction with Topology Adaptation

396. Mesh4D: 4D Mesh Reconstruction and Tracking from Monocular Video

397. EchoPOSE: 6D Pose Estimation of Sparse Echocardiograms for Left-Ventricular 3D Shape Reconstruction

398. FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervision

399. S2^2AM3D: Scale-controllable Part Segmentation of 3D Point Clouds

400. SCE-Depth: A Spherical Compound Eye Framework for Wide FOV Depth Estimation

401. Learning Spatial-Temporal Consistency for 3D Semantic Scene Completion

402. Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation

403. Text-Driven 3D Hand Motion Generation from Sign Language Data

404. UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching

405. L2DGSL^{2}DGS: Low-Light Dynamic Gaussian Splatting

406. Native and Compact Structured Latents for 3D Generation

407. Zoo3D: Zero-Shot 3D Object Detection at Scene Level

408. FilterGS: Traversal-Free Parallel Filtering and Adaptive Shrinking for Large-Scale LoD 3D Gaussian Splatting

409. Unsupervised Multi-Scale Segmentation of 3D Subcellular World with Stable Diffusion Foundation Model

410. LiDAR-to-4DRadar Diffusion Bridge via Cross-Modal Alignment and Translation in Latent Space

411. Test-Time Training for LiDAR Semantic Segmentation under Corruption via Geometric Inlier Discrimination

412. Orthogonal Spatial-Aware Multi-View Anchor Graph Clustering for Incomplete Remote Sensing Data

413. Global-Graph Guided and Local-Graph Weighted Contrastive Learning for Unified Clustering on Incomplete and Noise Multi-View Data

414. Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3-D Constrained Terrains

415. Multi-View Hierarchical Alignment Learning for Spatial Transcriptomics

416. Unsupervised Monocular 3D Keypoint Discovery from Multi-View Diffusion Priors

417. 3D-LATTE: Latent Space 3D Editing from Textual Instructions

418. Generative Diffusion Priors for 3D Mapping of the Dark Universe

419. PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure Matching

420. Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

421. BrepGaussian: CAD reconstruction from Multi-View Images with Gaussian Splatting

422. Bringing Your Portrait to 3D Presence

423. Dynamic Visual SLAM using a General 3D Prior

424. Turbo-GS: Accelerating 3D Gaussian Fitting for High-Resolution Radiance Fields

425. Nestwork: Conditional 3D Furnished House Layout Generation through Latent Heterogeneous Graph Diffusion

426. Lafite: A Generative Latent Field for 3D Native Texturing

427. PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion

428. Seeing through Light and Darkness: Sensor-Physics Grounded Deblurring HDR NeRF from Single-Exposure Images and Events

429. Perceptual 3D Simulation With Physical World Modeling

430. Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

431. GEM: Generating LiDAR World Model via Deformable Mamba

432. Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners

433. AMB3R: Accurate Feed-forward Metric-scale 3D Reconstruction with Backend

434. PatchScene: Patch-based Voxel Diffusion Model for Large-Scale Scene Completion

435. SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

436. Lite Any Stereo: Efficient Zero-Shot Stereo Matching

437. GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Views

438. Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images

439. REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusion

440. Scene Reconstruction as Mapping Priors for 3D Detection

441. AlignPose: Generalizable 6D Pose Estimation via Multi-view Feature-metric Alignment

442. InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields

443. ReLaGS: Relational Language Gaussian Splatting

444. EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Head

445. 3D-Object Perception Transformer (3PT)

446. FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoning

447. MuM: Multi-View Masked Image Modeling for 3D Vision

448. LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds

449. Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning

450. EMGauss: Continuous Slice-to-3D Reconstruction via Dynamic Gaussian Modeling in Volume Electron Microscopy

451. Foundry: Distilling 3D Foundation Models for the Edge

452. RelightAnyone: A Generalized Relightable 3D Gaussian Head Model

453. TopoMesh: High-Fidelity Mesh Autoencoding via Topological Unification

454. TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction

455. VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network

456. SGS-Intrinsic: Semantic-Invariant Gaussian Splatting for Sparse-View Indoor Inverse Rendering

457. Sparse-View Localization via Online Neural 3D Regression

458. PhysGen: Physically Grounded 3D Shape Generation for Industrial Design

459. FMPose3D: monocular 3D pose estimation via flow matching

460. Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation

461. Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation

462. Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments

463. TROPHIES: Temporal Reconstruction of Places, Humans, and Cameras from Multi-view Videos

464. SGAD-SLAM: Splatting Gaussians at Adjusted Depth for Better Radiance Fields in RGBD SLAM

465. GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstruction

466. Skullptor: High Fidelity 3D Head Reconstruction in Seconds with Multi-View Normal Prediction

467. ODGS-SLAM: Omnidirectional Gaussian Splatting SLAM

468. GS-ASM: 2DGS-Supervised Active Stereo Matching

469. EV-CGNet: Co-visible Focused 3D-guided 2D Event Keypoint Detection Network

470. Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering

471. Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection

472. Confidence-Guided Multi-Scale Aggregation for Sparse-View High-Resolution 3D Gaussian Splatting

473. EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understanding

474. SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectors

475. SAMosaic3D: Modular Scene Assembly for Real-Time 3D Segment Anything

476. VDFE: Difference-Aware 3D Scene Editing with Non-Intrusive Video Diffusion Priors for Multi-View Consistency and Efficiency

477. Endless World: Real-Time 3D-Aware Long Video Generation

478. Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling

479. MoRE: 3D Visual Geometry Reconstruction Meets Mixture-of-Experts

480. LAMP: Localization Aware Multi-camera People Tracking in Metric 3D World

481. Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors

482. ViLearn: Accelerating Training Convergence of Image-to-3D Generation via Visibility Learning

483. Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors

484. Robust3DGSW: Toward Robust Watermarking for Quantization-Aware 3D Gaussian Splatting

485. PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Models

486. OccAny: Generalized Unconstrained Urban 3D Occupancy

487. Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

488. SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model

489. Block-Sparse Global Attention for Efficient Multi-View Geometry Transformers

490. GHPT: Real-Time Relightable Gaussian Splatting using Hybrid Path Tracing

491. WorldGen: From Text to Traversable and Interactive 3D Worlds

492. HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image

493. ULF-Loc: Unbiased Landmark Feature for Robust Visual Localization with 3D Gaussian Splatting

494. Registration-Free Learnable Multi-View Capture of Faces in Dense Semantic Correspondence

495. MetricHMSR: Metric Human Mesh and Scene Recovery from Monocular Images

496. SpatialDiff: 3D-Aware Object Movement via Implicit Spatial Modeling

497. Voxify3D: Pixel Art Meets Volumetric Rendering

498. Cross-View Distillation and Adaptive Masking for Incomplete Multi-View Multi-Label Classification

499. R2G: A Multi-View Circuit Graph Benchmark Suite from RTL to GDSII

500. JUMP-Hand: Learning Joint-wise Uncertainty to Gate Mixture of View Experts for Multi-View 3D Hand Reconstruction

501. Anatomical Domain Shifts: Test-time Heterogeneous Adaptation for 3D Human Pose Prediction

502. FlashMesh: Faster and Better Autoregressive Mesh Synthesis via Structured Speculation

503. SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation

504. 3D Gaussian Splatting with Self-Constrained Priors for High Fidelity Surface Reconstruction

505. Generalizing Visual Geometry Priors to Sparse Gaussian Occupancy Prediction

506. Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removal

507. Scalable Multi-View Subspace Clustering with Tensorized Anchor Guidance

508. Image-Guided Geometric Stylization of 3D Meshes

509. Zero-Shot Reconstruction of Animatable 3D Avatars with Cloth Dynamics from a Single Image

510. TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens

511. Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation

512. ReGenHOI: Unifying Reconstruction and Generation for 3D Human-Object Interaction Understanding

513. DROID-SLAM in the Wild

514. ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

515. SPAN: Spatial-Projection Alignment for Monocular 3D Object Detection

516. Dark3R: Learning Structure from Motion in the Dark

517. MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts

518. OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data

519. AniMimic: Imitating 3D Animation from Video Priors

520. OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

521. PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving

522. Human Geometry Distribution for 3D Animation Generation

523. Towards Visual Query Localization in the 3D World

524. ArtLLM: Generating Articulated Assets via 3D LLM

525. Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splatting

526. SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

527. Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

528. Learning to Infer Parameterized Representations of Plants from 3D Scans

529. Structure-to-Intensity Diffusion for Adverse-Weather LiDAR Generation

530. VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement

531. IDESplat: Iterative Depth Probability Estimation for Generalizable 3D Gaussian Splatting

532. BEV-SLD: Self-Supervised Scene Landmark Detection for Global Localization with LiDAR Bird's-Eye View Images

533. From None to All: Self-Supervised 3D Reconstruction via Novel View Synthesis

534. Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis

535. CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection

536. Spatial Matters: Position-Guided 3D Referring Expression Segmentation

537. Benchmarking PhD-Level Coding in 3D Geometric Computer Vision

538. SpiderCam: Low-Power Snapshot Depth from Differential Defocus

539. VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation

540. Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation

541. Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification

542. Imbalanced View Contribution Evaluation and Refinement for Deep Incomplete Multi-View Clustering

543. Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models

544. Vista4D: Video Reshooting with 4D Point Clouds

545. NVGS: Neural Visibility for Occlusion Culling in 3D Gaussian Splatting

546. MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation

547. STUR3D: Spatio-Temporal Unified Representation Learning for 3D Object Detection

548. VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents

549. TokenSplat: Token-aligned 3D Gaussian Splatting for Feed-forward Pose-free Reconstruction

550. Cross-Domain Few-Shot Segmentation via Multi-view Progressive Adaptation

551. Think-Then-Generate: Structural Chain-of-Thought Reasoning for Consistent 3D Generation

552. AERGS-SLAM: Auto-Exposure-Robust Stereo 3D Gaussian Splatting SLAM

553. Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement

554. LiREC-Net: A Target-Free and Learning-Based Network for LiDAR, RGB, and Event Calibration

555. Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing

556. Efficient Unrolled Networks for Large-Scale 3D Inverse Problems

557. Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

558. Urban-GS: A Unified 3D Gaussian Splatting Framework for Compact and High-Fidelity Aerial-to-Street Reconstruction

559. Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding

560. A Semantically Disentangled Unified Model for Multi-category 3D Anomaly Detection

561. What Makes Good Synthetic Training Data for Zero-Shot Stereo Matching?

562. GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

563. Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillation

564. Mark4D: Temporally-Consistent Watermarking for 4D Gaussian Splatting

565. 3D Gaussian Splatting from Unposed Spike Stream

566. EXOTIC: External Vision-driven Incomplete Multi-view Classification

567. CompetitorFormer: Mitigating Query Conflicts for 3D Instance Segmentation via Competitive Strategy

568. HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

569. 4D Local Modeling Toward Dynamic Global Perception for Ambiguity-free Rotation-Invariant Point Cloud Analysis

570. Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining

571. Revisiting 3D Reconstruction Kernels as Low-Pass Filters

572. 3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds

573. Rascene: High-Fidelity 3D Scene Imaging with mmWave Communication Signals

574. Depth Hypothesis Guided Iterative Refinement for Event-Image Monocular Depth Estimation

575. M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation

576. Depth Any Endoscopy: Towards Self-Supervised Generalizable Depth Estimation in Monocular Endoscopy

577. VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

578. TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Dual-Level Scale-Oriented Contrast

579. ReManNet: A Riemannian Manifold Network for Monocular 3D Lane Detection

580. Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression

581. FILTR: Extracting Topological Features from Pretrained 3D Models

582. MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

583. 3D Space as a Scratchpad for Editable Text-to-Image Generation

584. Learning 3D Reconstruction with Priors in Test Time

585. Hyper-PCN: Hypergraph-Based Point Cloud Completion via High-Order Correlation Modeling

586. FISHuman: Fine-grained Single-image 3D Human Reconstruction via Multi-view 4D Remeshing

587. StreamVLO: Streaming Visual-LiDAR Odometry with Cumulative Drift Compensation

588. Multi-Hierarchical Contrastive Spectral Fusion for Multi-View Clustering

589. MoRGS: Efficient Per-Gaussian Motion Reasoning for Streamable Dynamic 3D Scenes

590. GS-CLIP: Zero-shot 3D Anomaly Detection by Geometry-Aware Prompt and Synergistic View Representation Learning

591. VGG-T3^3: Offline Feed-Forward 3D Reconstruction at Scale

592. Emergent Extreme-View Geometry in 3D Foundation Models

593. InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization

594. Decoding 3D Perception via BrainSSD: Synergistic Fusion of EEG Representations from Static and Dynamic Visual Streams

595. Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos

596. Image-to-Point Cloud Feature Back-Projection for Multimodal Training of 3D Semantic Segmentation

597. 2D-LFM: Lifting Foundation Model without 3D Supervision

598. DualPrim: Compact 3D Reconstruction with Positive and Negative Primitives

599. TagSplat: Topology-Aware Gaussian Splatting for Dynamic Mesh Modeling and Tracking

600. LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight

601. ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body

602. Unlocking the Power of Critical Factors for 3D Visual Geometry Estimation

603. LangRef3DGS: Natural Language-Guided 3D Referential Segmentation from Partial Observations via 3D Gaussian Splatting

604. Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding

605. RAM: Recover Any 3D Human Motion in-the-Wild

606. Photo-Guided Tooth Segmentation on 3D Oral Scan Model

607. HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction

608. Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

609. M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction

610. ELiC: Efficient LiDAR Geometry Compression via Cross-Bit-depth Feature Propagation and Bag-of-Encoders

611. PV-Ground: Text-Guided Point-Voxel Interaction for 3D Visual Grounding

612. Learning Differentiable Hierarchies in 3D Gaussian Splatting

613. Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images

614. Circular-DPO: Aligning Multi-Stage 3D Generative Models via Preference Feedback Loop

615. ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation

616. EventHub: Data Factory for Generalizable Event-Based Stereo Networks without Active Sensors

617. GS^2: Graph-based Spatial Distribution Optimization for Compact 3D Gaussian Splatting

618. PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation

619. Deformation-based In-Context Learning for Point Cloud Understanding

620. WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

621. SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

622. Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

623. MonoVLM: Monocular 3D Visual Grounding with Vision Language Models

624. FG-Portrait: 3D Flow Guided Editable Portrait Animation

625. ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation

626. GaussianMatch: Semi-Supervised Regression with Pseudo-Label Filtering via Multi-View Gaussian Consistency

627. Curvature-Aware Captioning: Leveraging Geodesic Attention for 3D Scene Understanding

628. MER-Tracker: Towards High-Speed 3D Point Tracking via Multi-View Event-RGB Hybrid Cameras

629. SonoWorld: From One Image to a 3D Audio-Visual Scene

630. AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

631. MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks

632. GOR-IS: 3D Gaussian Object Removal In the Intrinsic Space

633. Mamba Learns in Context: Structure-Aware Domain Generalization for Multi-Task Point Cloud Understanding

634. Color-Encoded Illumination for High-Speed Volumetric Scene Reconstruction

635. SAG-GNN: Semantic-Aware Guided GNN for Descriptor-Free 2D-3D Matching

636. MV-Fashion: Towards Enabling Virtual Try-On and Size Estimation with Multi-View Paired Data

637. Generalizable Sparse-View 3D Reconstruction from Unconstrained Images

638. Topology-aware Feature Propagation for Unsupervised Non-rigid Point Cloud Correspondence

639. FastEventDGS: Deformable Gaussian Splatting for Fast Dynamic Scenes from a Single Event Camera

640. iLRM: An Iterative Large 3D Reconstruction Model

641. Test-Time 3D Occupancy Prediction

642. Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

643. ESAM++: Efficient Online 3D Perception on the Edge

644. StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation

645. Low-Rank Test-Time Training for Pre-Trained Point Cloud Models

646. SR3R: Rethinking Super-Resolution 3D Reconstruction With Feed-Forward Gaussian Splatting

647. SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

648. Forecasting 3D Scanpaths in Egocentric Video

649. MU-GeNeRF: Multi-view Uncertainty-guided Generalizable Neural Radiance Fields for Distractor-aware Scene

650. H^2A^2: Homogeneity-Aware and Heterogeneity-Aware Feature Perception for Unified Indoor 3D Object Detection

651. tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction

652. MVInverse: Feed-forward Multiview Inverse Rendering in Seconds

653. D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation

654. GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processes

655. Noise-Aware Few-Shot Learning through Bi-directional Multi-View Prompt Alignment

656. ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion

657. Towards Intrinsic-Aware Monocular 3D Object Detection

658. Plug-and-Play PDE Optimization for 3D Gaussian Splatting: Toward High-Quality Rendering and Reconstruction

659. AeroGS: Scale-Aware Gaussian Splatting for Pose-Free Dynamic UAV Scene Reconstruction

660. Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motions

661. WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

662. Minimal Constraint Relaxation for Multiview Autocalibration

663. PhysHO: Physics-Based Dynamic 3D Gaussian Human and Object from Monocular Video

664. EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision

665. Evidential Neural Radiance Fields

666. Coupled Diffusion Sampling for Training-Free Multi-View Image Editing

667. From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstruction

668. Order Matters: 3D Shape Generation from Sequential VR Sketches

669. DF^2-VB: Dual-level Fuzzy Fusion with View-specific Boosting for Multi-view Multi-label Classification

670. Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation

671. Revisiting Monocular SLAM with Spatio-Temporal Scene Modeling

672. MORE-STEM: Long-Short MemOry REcall and Spatio-TEmporal Consistency Model for Query-Driven 3D/4D Point Cloud Segmentation

673. Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation

674. SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection

675. RoSAMDepth: Robust Self-supervised Depth Estimation Leveraging Segment Anything Model

676. MLLMSplat: A 2D MLLM-Powered Framework for 3D Gaussian Splatting Understanding, Generation, and Editing

677. Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM

678. NeuroSeg Meets DINOv3: Transferring 2D Self-Supervised Visual Priors to 3D Neuron Segmentation via DINOv3 Initialization

679. Rethinking 2D-3D Registration: A Novel Network for High-Value Zone Selection and Representation Consistency Alignment

680. DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval

681. mmWaveFlow: Unified Enhancement and Generation of mmWave Human Point Clouds

682. Learning Surgical Robotic Manipulation with 3D Spatial Priors

683. DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR

684. ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction

685. Multi-view Pyramid Transformer: Look Coarser to See Broader

686. PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting

687. Iris: Integrating Language into Diffusion-based Monocular Depth Estimation

688. Merge3D: Efficient 3D Multimodal LLMs via Joint 2D-3D Token Merging

689. Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representations

690. SketchFaceGS: Real-Time Sketch-Driven Face Editing and Generation with Gaussian Splatting

691. SHands: A Multi-View Dataset and Benchmark for Surgical Hand-Gesture and Error Recognition Toward Medical Training

692. Changes in Real Time: Online Scene Change Detection with Multi-View Fusion

693. Reliable Clustering Number Estimation for Contrastive Multi-View Clustering

694. NG-GS: NeRF-guided 3D Gaussian Splatting Segmentation

695. VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

696. PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes

697. Wavelet-Driven 3D Anomaly Detection under Pose-Agnostic and Sparse-View

698. 3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

699. ORD: Object-Relation Decoupling for Generalized 3D Visual Grounding

700. Structural Action Transformer for 3D Dexterous Manipulation

701. PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction

702. ProgressiveAvatars: Progressive Animatable 3D Gaussian Avatars

703. SunFaded: Illumination-Aware Gaussian Splatting for Dark Scenes with Camera-Mounted Active Lighting

704. SAQN: Semantic-based Adaptive Query Network for 3D Referring Expression Segmentation

705. PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery

706. RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing

707. Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation

708. Adaptive 3D Perception for Small Aerial Targets Under Sparse Sampling via Reinforcement Learning

709. Hierarchical Visual Relocalization with Nearest View Synthesis from Feature Gaussian Splatting

710. RemedyGS: Defend 3D Gaussian Splatting Against Computation Cost Attacks

711. ArchSym: Detecting 3D-Grounded Architectural Symmetries in the Wild

712. Teaching DINOv3 About Partial 3D Geometry: A Self-Supervised Geometry-Aware Approach

713. UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents

714. Routing on Demand: DSNet for Efficient Progressive Point Cloud Denoising

715. Dropping Anchor and Spherical Harmonics for Sparse-view Gaussian Splatting

716. Good Can Sometimes be Bad: A Unified Attack against 3D Point Cloud Classifier by a Flexible Isotropic Resampling

717. ARES: Unifying Asymmetric RGB-Event Stereo for Probabilistic Scene Flow Estimation

718. Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videos

719. PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding