R
Published on

CVPR 2026 — Video & Motion

Video & Motion

861 papers

1. Spk2VidNet: A Hierarchical Recurrent Architecture for High-Fidelity Video Reconstruction from Long Spike-Camera Streams

2. GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling

3. REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting

4. Ultra Diffusion Poser: Diffusion-Based Human Motion Tracking from Sparse Inertial Sensors and Ranging-based Between-sensor Distances

5. APPO: Attention-guided Perception Policy Optimization for Video Reasoning

6. An Efficient Token Compression Framework for Visual Object Tracking

7. MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark

8. Physical Simulator In-the-Loop Video Generation

9. Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

10. MAMMA: Markerless Accurate Multi-person Motion Acquisition

11. First Frame Is the Place to Go for Video Content Customization

12. OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancement

13. MultiAnimate: Pose-Guided Image Animation Made Extensible

14. AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion

15. Are Image-to-Video Models Good Zero-Shot Image Editors?

16. One-Shot Flow, Any-Time Frame: A Bidirectional Warping Framework for Event-Based Video Frame Interpolation

17. SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

18. GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compression

19. Rethinking Occlusion Modeling for UAV Tracking

20. InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding

21. Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment

22. ForeHOI: Feed-forward 3D Object Reconstruction from Daily Hand-Object Interaction Videos

23. TRM-VLA: Temporal-Aware Chain-of-Thought Reasoning and Memorization for Vision-Language-Action Models

24. BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation

25. Synergistic Bleeding Region and Point Detection in Laparoscopic Surgical Videos

26. EVA: Efficient Reinforcement Learning for End-to-End Video Agent

27. Unstitching the Chimera: Frame-Level Risk and Train-Free Mitigation for Video Hallucination

28. FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching

29. RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos

30. Geometric Neural Distance Fields for Learning Human Motion Priors

31. The Devil Is in Gradient Entanglement: Energy-Aware Gradient Coordinator for Robust Generalized Category Discovery

32. Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments

33. Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video

34. OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery

35. I'm a Map! Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers

36. HamiPose: Hamiltonian Optimization for Unsupervised Domain Adaptive Pose Estimation

37. MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting

38. Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs

39. COG: Confidence-aware Optimal Geometric Correspondence for Unsupervised Single-reference Novel Object Pose Estimation

40. Breaking Smooth-Motion Assumptions: A UAV Benchmark for Multi-Object Tracking in Complex and Adverse Conditions

41. MotionEdit: Benchmarking and Learning Motion-Centric Image Editing

42. MeToM: Metadata-Guided Token Merging for Efficient Video LLMs

43. AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video

44. MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos

45. UAST: Unified Active Search and Tracking for Arbitrary Targets with UAVs

46. META: Meta Evolution of Tool Trajectory Adaptation for Long-Video Understanding

47. Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction

48. OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness

49. Exploring Spatiotemporal Feature Propagation for Video-Level Compressive Spectral Reconstruction: Dataset, Model and Benchmark

50. InterRVOS: Interaction-Aware Referring Video Object Segmentation

51. Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation

52. STAvatar: Soft Binding and Temporal Density Control for Monocular 3D Head Avatars Reconstruction

53. PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization

54. MGDHand: Multi-Granularity Prior-to-Inertial Distillation Framework for Sequential 3D Hand Pose Estimation from Sparse IMUs

55. Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis

56. Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers

57. Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video

58. T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding

59. MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

60. Open the Motion Door: Atomic Motion Decomposition and Recomposition for Open-Vocabulary Motion Generation

61. Pantheon360: Taming Digital Twin Generation via 3D-Aware 360deg Video Diffusion

62. Geometry-Guided 3D Visual Token Pruning for Video-Language Models

63. ReScene4D: Temporally Consistent Semantic Instance Segmentation of Evolving Indoor 3D Scenes

64. Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model

65. DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces

66. Reinforcing Video Object Segmentation to Think before it Segments

67. Scene-Centric Unsupervised Video Panoptic Segmentation

68. MotionHiFlow: Text-to-Motion via Hierarchical Flow Matching

69. What Are You Doing? A Closer Look at Controllable Human Video Generation

70. Semantic-Adaptive Diffusion for Dynamic Spatiotemporal Fusion

71. TVHighlights: LLM-Guided Human-Free Collaborative Training for Video Highlight Detection in Movies and TV Dramas

72. Perceptual Neural Video Compression with Color Separation and Rank Chain

73. SyncMos: Scalable Motion Synchronisation for Multi-Agent Scene Interaction

74. α\alphaMatte4K & μ\muMatting: Dataset and Model for Ultra-Micro Precision Alpha Video Matting

75. Your One-Stop Solution for AI-Generated Video Detection

76. Breaking Multimodal LLM Safety via Video-Driven Prompting

77. FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacement

78. OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text

79. MaskAdapt: Learning Flexible Motion Adaptation via Mask-Invariant Prior for Physics-Based Characters

80. REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding

81. Video2Robo: 3DGS-based Synthetic Data from One Video Enables Scalable Robot Learning

82. SURF: Signature-Retained Fast Video Generation

83. SPDMark: Selective Parameter Displacement for Robust Video Watermarking

84. Transition Matching Distillation for Fast Video Generation

85. MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videos

86. TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models

87. FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation

88. ORBIT: Benchmarking SfM in the Wild with 360deg Video

89. VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition

90. SMV-EAR: Bring Spatiotemporal Multi-View Representation Learning into Efficient Event-Based Action Recognition

91. Benchmarking Single-Factor Physical Video-to-Audio Generation

92. FVBench: Benchmarking Deepfake Video Detection Capability of Large Multimodal Models

93. Time Without Time: Pseudo-Temporal Representation for Space-Time Super-Resolution

94. Exploring Adaptive Masked Reconstruction for Self-Supervised Skeleton-Based Action Recognition

95. One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer

96. Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State Manipulation

97. SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations

98. Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes

99. UST-Hand: An Uncertainty-aware Spatiotemporal Point Cloud Interaction Network for 3D Self-supervised Hand Pose Estimation

100. CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection

101. Memory Matters: Boosting Training-Free Zero-Shot Temporal Action Localization with a Learnable Lookup Table

102. TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition

103. FAVE: A Structured Benchmark for Fine-Grained Audio-Visual Temporal Evaluation in Multimodal LLMs

104. Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

105. TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

106. Adaptive Spatial-Temporal Window: Unlocking the Potential of Event Cameras in Heterogeneous Velocity Scenarios

107. RS-SSM: Refining Forgotten Specifics in State Space Model for Video Semantic Segmentation

108. TV2TV: A Unified Framework for Interleaved Language and Video Generation

109. Pose-Free Omnidirectional Gaussian Splatting for 360-Degree Videos with Consistent Depth Priors

110. FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control

111. Enhancing Accuracy of Uncertainty Estimation in Appearance-based Gaze Tracking with Probabilistic Evaluation and Calibration

112. FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips

113. UDAPose: Unsupervised Domain Adaptation for Low-Light Human Pose Estimation

114. rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training

115. No Labels, No Look-Ahead: Unsupervised Online Video Stabilization with Classical Priors

116. LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens

117. TrackMAE: Video Representation Learning via Track Mask and Predict

118. Translating Signals to Languages for sEMG-Based Activity Recognition

119. Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner

120. HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics

121. SpikeTrack: High-performance and Energy-efficient Event-Based Object Tracking with Spiking Neural Network

122. Stabilizing Streaming Video Geometry via Dynamic Feature Normalization

123. PoseGaussian: 6D Pose Estimation for Unseen Objects via Sparse-View Object-Level 3D Gaussian Splatting

124. Assignment-Driven Hash Learning in a Hyper-Semantic Space for On-the-Fly Category Discovery

125. EmoThinker: Advancing Visual-Acoustic Emotion Analysis via Structural Token Selection and Chain-of-Thought Reasoning

126. VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

127. TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

128. DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching

129. EfficientMonoHair: Fast Strand-Level Reconstruction from Monocular Video via Multi-View Direction Fusion

130. OSMO: Open-vocabulary Self-eMOtion Tracking

131. SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

132. SemVideo: Reconstructs What You Watch from Brain Activity via Hierarchical Semantic Guidance

133. Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning

134. HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

135. SpikeTrack: A Spike-driven Framework for Efficient Visual Tracking

136. Reinforcing Structured Chain-of-Thought for Video Understanding

137. Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Grounding

138. Asynchronous Temporal Modeling with Two-Agent Framework for Streaming Dense Video Captioning

139. SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation

140. Lynx: Towards High-Fidelity Personalized Video Generation

141. Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer

142. E-3DPSM: A State Machine for Event-based Egocentric 3D Human Pose Estimation

143. Semi-supervised Echocardiography Video Segmentation via Anchor Semantic Awareness and Continuous Pseudo-label Reforging

144. ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

145. Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization

146. UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

147. Drift-Resilient Temporal Priors for Visual Tracking

148. MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering

149. Spatia: Video Generation with Updatable Spatial Memory

150. ORV: 4D Occupancy-centric Robot Video Generation

151. UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos

152. LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

153. Recovering Physically Plausible Human-Object Interactions from Monocular Videos

154. Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videos

155. Omni2Sound: Towards Unified Video-Text-to-Audio Generation

156. Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

157. Back to the Feature: Explaining Video Classifiers with Video Counterfactual Explanations

158. NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection

159. SAM2Text: Towards Prompt-Free and Multi-Resolution Video Scene Text Segmentation

160. UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

161. Egocentric Visibility-Aware Human Pose Estimation

162. D2FANet: Enhancing Video Object Detection with Dual-Domain Feature Aggregation Network

163. NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

164. MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding

165. Modeling Spatiotemporal Neural Frames for High Resolution Brain Dynamic

166. Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring

167. NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity

168. ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation

169. MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis

170. CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction

171. Real-World Point Tracking with Verifier-Guided Pseudo-Labeling

172. ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions

173. AXG-Reasoner: Error Detection and Explanation in Long Task Videos with Vision-Language Models

174. MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction

175. Breaking the 3D Dataset Bottleneck: Fast Scalable Generation of Aligned 3D Assets from Scratch for Category 6D Pose Estimation and Robotic Grasping

176. The Road Less Seen: Segment Exploration for Weakly Supervised Video Anomaly Detection

177. PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistency

178. Watch and Learn: Learning to Use Computers from Online Videos

179. Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

180. Protego: User-Centric Pose-Invariant Privacy Protection Against Face Recognition-Induced Digital Footprint Exposure

181. ReMoT: Reinforcement Learning with Motion Contrast Triplets

182. TextOVSR: Text-Guided Real-World Opera Video Super-Resolution

183. Adaptive Capacity Autoregressive Visual Tracking

184. EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing

185. ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding

186. Learning a Unified Latent Action Space from Videos with Action-centric Cycle Consistency

187. EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization

188. Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

189. Enhancing Hands in 3D Whole-Body Pose Estimation with Conditional Hands Modulator

190. SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead

191. Unsupervised 3d Motion Estimation Using Event Camera

192. Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

193. WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling

194. Diff4Splat: Repurposing Video Diffusion Models for Dynamic Scene Generation

195. MAPo: Motion-Aware Partitioning of Deformable 3D Gaussian Splatting for High-Fidelity Dynamic Scene Reconstruction

196. EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

197. Act2See: Emergent Active Visual Perception for Video Reasoning

198. Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling

199. Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance

200. MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Second

201. Gaussian-Mixture Latent Flow for Stochastic 3D Human Motion Prediction

202. MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splatting

203. Real-Time Multimodal Fingertip Contact Detection via Depth and Motion Fusion for Vision-Based Human-Computer Interaction

204. Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devices

205. Building a Precise Video Language with Human-AI Oversight

206. Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprints

207. GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

208. Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision

209. Image Guides Images: Consistent Video Amodal Completion with Rectified In-Context Exemplar Guidance

210. ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-free Physical Motion Extrapolation

211. Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation

212. Gyro-based Deep Video Deblurring

213. 3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation

214. EgoX: Egocentric Video Generation from a Single Exocentric Video

215. The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection

216. Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

217. PromptStereo: Zero-Shot Stereo Matching via Structure and Motion Prompts

218. Bezier Degradation Modeling for LiDAR-based Human Motion Capture

219. Incentivizing Versatile Video Reasoning in MLLMs via Data-Efficient Reinforcement Learning

220. Efficient All-Pairs Correlation Volume Sampling for Optical Flow Estimation

221. AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References

222. ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

223. EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

224. Illumination-Consistent Human-Scene Reconstruction from Monocular Video

225. EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing

226. FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance

227. HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering

228. LAMP: Language-Assisted Motion Planning for Controllable Video Generation

229. DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning

230. HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives

231. SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

232. Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing

233. Scaling4D: Pushing the Frontier of Video Novel View Synthesis through Large-Scale Monocular Videos

234. Chain of World: World Model Thinking in Latent Motion

235. MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer

236. OneThinker: All-in-one Reasoning Model for Image and Video

237. Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

238. Scaling Zero-Shot Reference-to-Video Generation

239. VDOT: Efficient Unified Video Creation via Optimal Transport Distillation

240. Perception Characteristics Distance: Measuring Stability and Robustness of Perception System in Dynamic Conditions under a Certain Decision Rule

241. Active Inference for Micro-Gesture Recognition: EFE-Guided Temporal Sampling and Adaptive Learning

242. FlashCap: Millisecond-Accurate Human Motion Capture via Flashing LEDs and Event-Based Vision

243. RunawayEvil: Jailbreaking the Image-to-Video Generative Models

244. When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse

245. ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation

246. VMonarch: Efficient Video Diffusion Transformers with Structured Attention

247. SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning

248. TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation

249. Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking

250. EchoVDiff: Cardiac-Cycle Echocardiography Video Generation from Arbitrary Single Frame

251. Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

252. InfinityHuman: Towards Long-Term Audio-Driven Human Animation

253. Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs

254. Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking

255. FlexiVideo: Variation-Aware Temporal Dynamics Modeling for Efficient Video Understanding

256. VideoMaMa: Mask-Guided Video Matting via Generative Prior

257. Ref4D-VideoBench: Four-Dimensional Reference-Based Evaluation of Text-to-Video Generative Models

258. PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View Reasoning

259. Event-based Motion Deblurring with Unpaired Data

260. Affordance-First Decomposition for Continual Learning in Video-Language Understanding

261. How Much 3D Do Video Foundation Models Encode?

262. Towards Sparse Video Understanding and Reasoning

263. TIM: Temporal Decoupling with Iterative Mutual-Refinement Model for Longitudinal Radiology Report Generation

264. Fast Spatial Tracking with Visual Geometry Transformer

265. Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

266. VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking

267. EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

268. Thermal Diffusion Matters: Infrared Spatial-Temporal Video Super-Resolution through Heat Conduction Priors

269. S2C2Seg: Semantic-Spatial Consistency and Category Optimization for Open-Vocabulary Segmentation

270. Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control

271. OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning

272. TF-CADE: Foreground-Concentrated Text-Video Alignment for Zero-Shot Temporal Action Detection

273. TiViBench: Benchmarking Think-in-Video Reasoning for Video Generation

274. From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking

275. LangField4D: Learning Identity-Adaptive and Spatio-Temporal Continuous 4D Language Fields for Dynamic Scenes

276. TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion

277. VISTA: A Test-Time Self-Improving Video Generation Agent

278. Dual Band Thermal Videography: Separating Time-Varying Reflection and Emission Near Ambient Conditions

279. FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters

280. Gamba: Mamba-based graph convolutional network with dynamic graph topology learning for action recognition

281. HandX: Scaling Bimanual Motion and Interaction Generation

282. Time-Specialized Event-Image Alignment for Blur-to-Video Decomposition

283. Reasoning Diffusion for Unpaired Test Time Out-of-distribution Text-Image to Video Generation

284. DynamicTree: Interactive Real Tree Animation via Sparse Voxel Spectrum

285. PHANTOM: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics

286. EmoStyle: Emotion-Driven Image Stylization

287. Prospective Dynamic 3D MRI Reconstruction via Latent-Space Motion Tracking from Single Measurement

288. STARFlow-V: End-to-End Video Generative Modeling with Autoregressive Normalizing Flows

289. Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videos

290. Ego: Embedding-Guided Personalization of Vision-Language Models

291. STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction

292. Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning

293. FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing

294. SCAPO: Self-Supervised Category-Level Articulated Pose Estimation from a Single 3D Observation

295. E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving

296. Generalizable Structure-Aware Keypoint Correspondence for Category-Unified 3D Single Object Tracking

297. Unique Lives, Shared World: Learning from Single-Life Videos

298. UniComp: Rethinking Video Compression Through Informational Uniqueness

299. TALON: Test-time Adaptive Learning for On-the-Fly Category Discovery

300. Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generation

301. ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors

302. EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

303. RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space

304. Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

305. On the Role of Temporal Granularity in the Robustness of Spiking Neural Networks

306. MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation

307. RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation

308. Streaming Diffusion Model for Fast Infrared and Visible Video Fusion

309. PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

310. Condensed Test-Time Adaptation of VLMs for Action Recognition

311. Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation

312. TGTrack: Temporal Generative Learning for Unified Single Object Tracking

313. OrienPose: Orientation-Guided Novel View Synthesis for Single-Image Unseen Object Pose Estimation

314. Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots

315. HTTM: Head-wise Temporal Token Merging for Faster VGGT

316. MV-TAP: Tracking Any Point in Multi-View Videos

317. EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation

318. EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

319. ST4R-Splat: Spatio-Temporal Referring Segmentation in 4D Gaussian Splatting

320. LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving

321. CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation

322. Humanoid Generative Pre-Training for Zero-Shot Motion Tracking

323. PersonaLive! Expressive Portrait Image Animation for Live Streaming

324. FUN REC * Reconstructing Functional 3D Scenes from Egocentric Interaction Videos

325. LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map

326. LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

327. When Transformers Meet Mamba: A Hybrid Transformer-Mamba Network for Video Object Detection

328. FisherPoser: Human Motion Estimation from Sparse Observations with Hierarchical Region-Wise Fisher-Matrix Uncertainty Modeling

329. DarkAct: A RGB-Thermal Dataset and Fusion Framework for Multimodal Low-Light Action Recognition

330. Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation

331. AE2VID: Event-based Video Reconstruction via Aperture Modulation

332. Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

333. MoCha: End-to-End Video Character Replacement without Structural Guidance

334. UniVBench: Towards Unified Evaluation for Video Foundation Models

335. CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving

336. TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos

337. CVA: Context-aware Video-text Alignment for Video Temporal Grounding

338. PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs

339. Generalizable Video Quality Assessment via Weak-to-Strong Learning

340. Test-time Ego-Exo-centric Adaptation for Action Anticipation via Multi-Label Prototype Growing and Dual-Clue Consistency

341. DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos

342. Recurrent Video Masked Autoencoders

343. Beyond Caption-Based Queries in Video Moment Retrieval

344. A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

345. MDS-VQA: Model-Informed Data Selection for Video Quality Assessment

346. Streaming Video Crime Anticipation with Spatio-Temporal Causal Reasoning

347. OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

348. Efficient Video Object Segmentation and Tracking with Recurrent Dynamic Submodel

349. SAVA-X: Ego-to-Exo Imitation Error Detection via Scene-Adaptive View Alignment and Bidirectional Cross View Fusion

350. Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation

351. EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval

352. Stereo World Model: Camera-Guided Stereo Video Generation

353. Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

354. MS^2Gait: A Multi-Scale Spatio-Temporal Fusion Network for LiDAR-based Gait Recognition

355. Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding

356. Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

357. An Empirical Study on How Video-LLMs Answer Video Questions

358. Robust Spiking Neural Networks by Temporal Mutual Information

359. GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator

360. SpeeDe3DGS: Speedy Deformable 3D Gaussian Splatting with Temporal Pruning and Motion Grouping

361. SRA-Det: Learning Omni-Grained Open-Vocabulary Detection Beyond Category Names

362. DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution

363. Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy

364. Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

365. Ground Reaction Inertial Poser: Physics-based Human Motion Capture from Sparse IMUs and Insole Pressure Sensors

366. Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning

367. MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

368. Learning from Noisy Supervision: A Denoising-Debiasing Framework for Weakly Supervised Video Anomaly Detection

369. RecEdit-Drive: 3D Reconstruction-Guided Spatiotemporal Video Editing for Autonomous Driving Scenes

370. Ego-1K - A Large-Scale Multiview Video Dataset for Egocentric Vision

371. LensWalk: Agentic Video Understanding by Planning How You See in Videos

372. LAOF: Robust Latent Action Learning with Optical Flow Constraints

373. Seeing Depth Through Frequency and Motion: A Progressive Training Paradigm for Monocular Depth Estimation

374. Stitch-a-Demo: Creating Video Demonstrations from Multistep Descriptions

375. Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention

376. MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

377. When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

378. BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

379. WeaveTime: Streaming from Earlier Frames into Emergent Memory in VideoLLMs

380. FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing

381. OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environments

382. PAVAS: Physics-Aware Video-to-Audio Synthesis

383. VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion

384. EgoAVU: Egocentric Audio-Visual Understanding

385. Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization

386. TimeRipples: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space

387. Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding

388. InternVideo-Next: Towards World-Understanding Video Models

389. VMD-FACT: A New Video Dataset and MLLM-based method for Detecting Realistic AI-Generated Video Misinformation

390. Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos

391. SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation

392. Expanding mmWave Datasets for Human Pose Estimation with Unlabeled Data and LiDAR Datasets

393. Next-Scale Autoregressive Models for Text-to-Motion Generation

394. Focus-to-Perceive Representation Learning: A Cognition-Inspired Hierarchical Framework for Endoscopic Video Analysis

395. HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

396. Bridging Facial Understanding and Animation via Language Models

397. VideoRealBench: A Chain-of-Thought Realism Evaluation Benchmark for Generated Human-Centric Videos

398. Gravitation-Driven Semantic Alignment for Text Video Retrieval

399. OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios

400. UETrack: A Unified and Efficient Framework for Single Object Tracking

401. HSI-GPT2: A Dual-Granularity Large Motion Reasoning Model with Diffusion Refinement for Human-Scene Interaction

402. InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior

403. Hypergraph-State Collaborative Reasoning for Multi-Object Tracking

404. CI-VID: A Coherent Interleaved Text-Video Dataset

405. HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling

406. Content-Adaptive Hierarchical Hyperprior for Neural Video Coding

407. EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing

408. SceMoS: Scene-Aware 3D Human Motion Synthesis by Planning with Geometry-Grounded Tokens

409. PoseAnything: General Pose-guided Video Generation with Part-aware Temporal Coherence

410. Temporal Equilibrium MeanFlow: Bridging the Scale Gap for One-Step Generation

411. PoseD-Flow: Versatile and Guided Flow Matching Model of Human Pose

412. MoBind: Motion Binding for Fine-Grained IMU-Video Pose Alignment

413. Beyond the Static World: Continual Category Discovery under Visual Drift

414. TGT: Text-Grounded Trajectories for Locally Controlled Video Generation

415. Training-free Motion Factorization for Compositional Video Generation

416. Decouple Your Discovery and Memory in Continual Generalized Category Discovery

417. AdapTok: Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space

418. Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing

419. Generative Video Motion Editing with 3D Point Tracks

420. Event6D: Event-based Novel Object 6D Pose Tracking

421. ELVIS: Enhance Low-Light for Video Instance Segmentation in the Dark

422. HFR and HDR Video from Multi-Attenuated Spikes Using a Rapidly Rotating SpokeND Filter

423. Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation

424. PackUV: Packed Gaussian UV Maps for 4D Volumetric Video

425. Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

426. StreamingTOM: Streaming Token Compression for Efficient Video Understanding

427. Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

428. Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization

429. SIMSPINE: A Biomechanics-Aware Simulation Framework for 3D Spine Motion Annotation and Benchmarking

430. Composing Concepts from Images and Videos via Concept-prompt Binding

431. AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

432. TSTM: Temporal Segmentation for Task-relevant Mask in Visual Reinforcement Learning Generalization

433. GMT: Effective Global Framework for Multi-Camera Multi-Target Tracking

434. PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation

435. VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

436. Adaptive Depth Lightweight RGB-T Tracking with Holistic Token Routing

437. Learning to Generate Highly Dynamic Videos using Synthetic Motion Data

438. ProgTrack: A Multi-Object Tracking Algorithm with Progressive Matching Strategy

439. Mesh4D: 4D Mesh Reconstruction and Tracking from Monocular Video

440. EchoPOSE: 6D Pose Estimation of Sparse Echocardiograms for Left-Ventricular 3D Shape Reconstruction

441. SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

442. Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

443. Learning Spatial-Temporal Consistency for 3D Semantic Scene Completion

444. Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation

445. Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

446. Flowception: Temporally Expansive Flow Matching for Video Generation

447. DeRVOS: Decoupling Consistent Trajectory Generation and Multimodal Understanding for Referring Video Object Segmentation

448. Text-Driven 3D Hand Motion Generation from Sign Language Data

449. Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods

450. PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion

451. Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction

452. Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3-D Constrained Terrains

453. PAD-Hand: Physics-Aware Diffusion for Hand Motion Recovery

454. EgoSound: Benchmarking Sound Understanding in Egocentric Videos

455. WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving

456. VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

457. Unified Number-Free Text-to-Motion Generation Via Flow Matching

458. From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimation

459. RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

460. Active Intelligence in Video Avatars via Closed-loop World Modeling

461. Efficient Frame Selection for Long Video Understanding via Reinforcement Learning

462. Weakly Supervised Video Anomaly Detection with Anomaly-Connected Components and Intention Reasoning

463. HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

464. Global Structure-from-Motion Meets Feedforward Reconstruction

465. Compositional Transformation Reasoning for Composed Video Retrieval

466. Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning

467. VAST: Video Ability-Stratified Taxonomy for Data-Efficient Video Reasoning

468. From Pairs to Sequences: Track-Aware Policy Gradients for Keypoint Detection

469. PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference

470. Plenoptic Video Generation

471. DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution

472. Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

473. Relightful Video Portrait Harmonization

474. CIGPose: Causal Intervention Graph Neural Network for Whole-Body Pose Estimation

475. Lighting in Motion: Spatiotemporal HDR Lighting Estimation

476. V-DPM: 4D Video Reconstruction with Dynamic Point Maps

477. AlignPose: Generalizable 6D Pose Estimation via Multi-view Feature-metric Alignment

478. Towards Streaming Referring Video Segmentation via Large Language Model

479. Lighting-grounded Video Generation with Renderer-based Agent Reasoning

480. ParTY: Part-Guidance for Expressive Text-to-Motion Synthesis

481. DynamicsBoost: Dynamic Plausible Video Generation via Annotation-Free Continuation Preference Optimization

482. M4-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection

483. Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos

484. EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Head

485. A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation

486. MAD: Motion Appearance Decoupling for efficient Driving World Models

487. HUMAPS-4D: A Multimodal Dataset for HUman Motion Analysis with Physiological and Semantic informations

488. NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darkness

489. VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale

490. SVAgent: Storyline-guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

491. GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

492. VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network

494. AR2-4FV: Anchored Referring and Re-identification for Long-Term Grounding in Fixed-View Videos

495. FMPose3D: monocular 3D pose estimation via flow matching

496. VABench: A Comprehensive Benchmark for Audio-Video Generation

497. VSRELL: A Simple Baseline for Video Super-Resolution and Enhancement in Low-Light Environment

498. RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation

499. Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation

500. Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs

501. TROPHIES: Temporal Reconstruction of Places, Humans, and Cameras from Multi-view Videos

502. FrankenMotion: Part-level Human Motion Generation and Composition

503. SARL-STG: A Spatially Aware Reinforcement Learning Framework for Refining MLLMs in Spatio-Temporal Video Grounding

504. Cross-Subject EEG-to-Video Reconstruction and Beyond

505. WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

506. EgoPoseFormer v2: Accurate Egocentric Human Motion Estimation for AR/VR

507. Lumosaic: Hyperspectral Video via Active Illumination and Coded-Exposure Pixels

508. Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

509. VDFE: Difference-Aware 3D Scene Editing with Non-Intrusive Video Diffusion Priors for Multi-View Consistency and Efficiency

510. RigMo: Unifying Rig and Motion Learning for Generative Animation

511. HandWorld: Hand-Centric Unified Video Action Generation

512. Endless World: Real-Time 3D-Aware Long Video Generation

513. Pixel Motion Diffusion is What We Need for Robot Control

514. DarkShake-DVS: Event-based Human Action Recognition under Low-light and Shaking Camera Conditions

515. Self-Consistency for LLM-Based Motion Trajectory Generation and Verification

516. UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking

517. GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometry

518. Generative Point Tracking and Forecasting

519. LAMP: Localization Aware Multi-camera People Tracking in Metric 3D World

520. FPS-Bench: A Benchmark for High Frame-Rate Video Understanding

521. V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties

522. Seeing Through the Shift: Causality-Inspired Robust Generalized Category Discovery

523. Inference-time Physics Alignment of Video Generative Models with Latent World Models

524. Unlocking Motion from Large Vision Models with a Semantic and Kinematic Duality for Gait Recognition

525. Dual-level Adaptation for Multi-Object Tracking: Building Test-Time Calibration from Experience and Intuition

526. FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction

527. SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition

528. GenHOI: Towards Object-Consistent Hand-Object Interaction with Temporally Balanced and Spatially Selective Object Injection

529. Learning to Track Instance from Single Nature Language Description

530. ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation

531. LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models

532. Progressive Guessing to Fixed Point: Rethinking Human Motion Prediction with Deep Equilibrium Models

533. FlowPalm: Optical Flow Driven Non-Rigid Deformation for Geometrically Diverse Palmprint Generation

534. When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance

535. Pressure2Motion: Hierarchical Human Motion Reconstruction from Ground Pressure with Text Guidance

536. AdaDexTrack: Dynamic Modulation for Adaptive and Generalizable Dexterous Manipulation Tracking

537. SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model

538. SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System

539. Protect to Adapt: Orthogonal Subspace Control with Ranked Negative-Prompt Curriculum for Few-Shot Action Recognition

540. Differentially Private 2D Human Pose Estimation

541. OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

542. OMoBlur: An Object Motion Blur Dataset and Benchmark for Real-World Local Motion Deblurring

543. Beyond Missing Modalities: Hypergraph Conditioned Diffusion for Uncertainty-Aware Multimodal Emotion Recognition

544. Anatomical Domain Shifts: Test-time Heterogeneous Adaptation for 3D Human Pose Prediction

545. Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

546. VideoSSR: Video Self-Supervised Reinforcement Learning

547. SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

548. Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control

549. Neural-Centric Video Processing Pipeline for Unified Multi-Task Inference

550. PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing

551. ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Senisng

552. SAGA: Source Attribution of Generative AI Videos

553. Temporal Inversion for Learning Interval Change in Chest X-Rays

554. MoVie: Broaden Your Views with Human Motion for Action Detection

555. Prototypical Action Reasoning Facilitated by Vision-Language Alignment for Egocentric Action Anticipation

556. Fine-VAD: Towards Fine-Grained Video Anomaly Detection via Progressive Cross-Granularity Learning

557. FlowMotion: Training-Free Flow Guidance for Video Motion Transfer

558. SHARP: Short-Window Streaming for Accurate and Robust Prediction in Motion Forecasting

559. Dark3R: Learning Structure from Motion in the Dark

560. AniMimic: Imitating 3D Animation from Video Priors

561. DetAny4D: Detect Anything 4D Temporally in a Streaming RGB Video

563. CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects

564. PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation

565. Accelerating Autoregressive Video Diffusion via History-Guided Cache and Residual Correction

566. Human Geometry Distribution for 3D Animation Generation

567. Moving Border Ownership for Event-based Motion Segmentation

568. PhysVid: Physics Aware Local Conditioning for Generative Video Models

569. Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

570. LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding

571. HDR-VLM: HDR-Domain Adaptation of VLMs and Preference-Aligned Quality Assessment for HDR Video Color Grading

572. ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding

573. Unified Camera Positional Encoding for Controlled Video Generation

574. Toward Low-Cost yet Effective Temporal Learning for UAV Tracking

575. DeltaQuant: 4-bit Video Diffusion Models with Spatiotemporal Delta Smoothing

576. Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance

577. PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories

578. Temporal Interaction in Spiking Transformers with Multi-Delay Mixer

579. Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation

580. Temporal Representation Enhancement (TRE): Learning to Forget Dominant Patterns for Enhanced Temporal Spiking Features

581. YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

582. MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator

583. VideoCoF: Unified Video Editing with Temporal Reasoner

584. Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis

585. StreamRAG: Enhancing Real-Time Video Understanding with Retrieval Augmentation

586. ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers

587. CamDirector: Towards Long-Term Coherent Video Trajectory Editing

588. ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos

589. Generative Video Compression with One-Dimensional Latent Representation

590. ExPose: Reinforcing Video Generation Models for Extreme Pose Estimation

591. Gloria: Consistent Character Video Generation via Content Anchors

592. Progressive Multi-cue Alignment for Unaligned RGBT Tracking

593. MPL: Match-guided Prototype Learning for Few-shot Action Recognition

594. VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

595. PhysSkin: Real-Time and Generalizable Physics-Based Animation via Self-Supervised Neural Skinning

596. LRHDR: Learning Representation-enhanced HDR Video Reconstruction

597. Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training

598. Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation

599. Streaming Video Instruction Tuning

600. Vista4D: Video Reshooting with 4D Point Clouds

601. Tracking through Severe Occlusion via Event-Derived Transient Cues

602. FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts

603. Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation

604. Aligning Multi-Character Narrative Image Generation with Multi-Aspect Human Preferences

605. STUR3D: Spatio-Temporal Unified Representation Learning for 3D Object Detection

606. VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents

607. Tracking by Predicting 3-D Gaussians Over Time

608. PAMotion: Physics-Aware Motion Generation for Full-Body Interaction with Multiple Objects

609. OpenT2M: No-frill Motion Generation with Open-source, Large-scale, High-quality Data

610. Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding

611. R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

612. Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing

613. VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation

614. TimeBridge: Self-Supervised Video Representation Learning via Start-End Joint Embedding and In-Between Frame Prediction

615. Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning

616. Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again

617. StreamDiT: Real-Time Streaming Text-to-Video Generation

618. Causality in Video Diffusers is Separable from Denoising

619. PriVi: Towards a General-Purpose Video Model for Primate Behavior in the Wild

620. LumiMotion: Improving Gaussian Relighting with Scene Dynamics

621. SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

622. Temporal Imbalance of Positive and Negative Supervision in Class-Incremental Learning

623. A Semantically Disentangled Unified Model for Multi-category 3D Anomaly Detection

624. AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

625. Towards Uncertainty-aware Unsupervised Domain Adaptation for Videos and Time-Series with Causal Optimal Transport

626. GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

627. Mark4D: Temporally-Consistent Watermarking for 4D Gaussian Splatting

628. WaTeRFlow: Watermark Temporal Robustness via Flow Consistency

629. LoL: Longer than Longer, Scaling Video Generation to Hour

630. VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation

631. Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos

632. Progressive Mask Distillation for Self-supervised Video Representation

633. Progressive Cross-Modal Causal Intervention for Long-Term Action Recognition

634. STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

635. TLMA: Mitigating the Impact of Weakly Labeled Information for Video Anomaly Detection

636. MoRel: Long-Range Flicker-Free 4D Motion Modeling via Anchor Relay-based Bidirectioanl Blending with Hierarchical Densification

637. Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding

638. Ego-Grounding for Personalized Question-Answering in Egocentric Videos

639. FeatureFool: Zero-Query Fooling of Video Models via Feature Map

640. A Temporal and Content Co-Awareness Latent Diffusion for Controllable Hand Image Generation

641. Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining

642. SpatialVID: A Large-Scale Video Dataset with Spatial Annotations

643. 3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds

644. Hierarchical Codec Diffusion for Video-to-Speech Generation

645. Real-Time Neural Video Compression with Unified Intra and Inter Coding

646. Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

647. U^2Flow: Uncertainty-Aware Unsupervised Optical Flow Estimation

648. CoWTracker: Tracking by Warping instead of Correlation

649. Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability

650. From Static to Dynamic: Exploring Self-supervised Image-to-Video Representation Transfer Learning

651. GEM-TFL: Bridging Weak and Full Supervision for Forgery Localization through EM-Guided Decomposition and Temporal Refinement

652. CubeComposer: Spatio-Temporal Autoregressive 4K 360deg Video Generation from Perspective Video

653. VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

654. VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer

655. GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics

656. StreamReady: Learning What to Answer and When in Long Streaming Videos

657. EgoXtreme: A Dataset for Robust Object Pose Estimation in Egocentric Views under Extreme Conditions

658. DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations

659. Causal Motion Diffusion Models for Autoregressive Motion Generation

660. Dynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos

661. Fast Reasoning Segmentation for Images and Videos

662. MoRGS: Efficient Per-Gaussian Motion Reasoning for Streamable Dynamic 3D Scenes

663. TAR: Token-Aware Refinement for Fine-grained Generalized Category Discovery

664. SE(3)-Equivariance with Geometric and Topological Guidance for Category-Level Object Pose Estimation

665. AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding

666. DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models

667. ELITE: Efficient Gaussian Head Avatar from a Monocular Video via Learned Initialization and Test-time Generative Adaptation

668. Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos

669. MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAE

670. 4DEquine: Disentangling Motion and Appearance for 4D Equine Reconstruction from Monocular Video

671. SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval

672. Time Blindness: Why Video-Language Models Can't See What Humans Can?

673. BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

674. StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation

675. TagSplat: Topology-Aware Gaussian Splatting for Dynamic Mesh Modeling and Tracking

676. CURVE: A Benchmark for Cultural and Multilingual Long Video Reasoning

677. PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models

678. Dual-Granularity Memory for Efficient Video Generation

679. A Bit is All You Need! Efficient Video Capture via Single Bit Imaging

680. No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection

681. LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

682. Matching Every Pair to Track Every Point: PairFormer for All-Pairs Tracking and Video Trajectory Fields

683. Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding

684. MVLM: Template-Free Tracking via Vision-Language Margin Confidence and Memory-Gated Tracking

685. RAPID: Reusing Attention Sparsity with Inter-step Adaptation for Efficient Video Diffusion

686. RAM: Recover Any 3D Human Motion in-the-Wild

687. Anti-I2V: Safeguarding your Photos from Malicious Image-to-video Generation

688. Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

689. AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation

690. Cov2Pose: Leveraging Spatial Covariance for Direct Manifold-aware 6-DoF Object Pose Estimation

691. DriveLaW: Unifying Planning and Video Generation in a Latent Driving World

692. Generative Neural Video Compression via Video Diffusion Prior

693. Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

694. ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Video Understanding

695. Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning

696. Spatio-Temporal Difference Guided Motion Deblurring with the Complementary Vision Sensor

697. Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning

698. CineBrain: A Large-Scale Multi-Modal Audiovisual Brain Dataset for Brain-Conditioned Video Generation

699. ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting

700. D2Cache: Second-Order Delta Caching for Higher Video Diffusion Acceleration

701. Content-Aware Dynamic Patchification for Efficient Video Diffusion

702. Object-WIPER: Training-Free Object and Associated Effect Removal in Videos

703. EarlyTom: Early Token Compression Completes Fast Video Understanding

704. High Resolution Neural Video Coding with Bi-directional Confidence-Guided Reference Information Modeling

705. WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

706. MusicInfuser: Making Video Diffusion Listen and Dance

707. MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer

708. Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features

709. EgoRoC: Towards Egocentric Robotic Control via Task-Agnostic Visual Alignment

710. Omni-Supervised Motion Editing: Balancing Change and Invariance through Positive-Negative Learning

711. SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker

712. SkillSight: Efficient First-Person Skill Assessment with Gaze

713. Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

714. Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset

715. Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

716. FG-Portrait: 3D Flow Guided Editable Portrait Animation

717. Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning

718. Seeing Conversations: Communication Context Identification in Egocentric Video

719. SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras

720. FUSAR-GPT: A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery

721. Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation

722. MER-Tracker: Towards High-Speed 3D Point Tracking via Multi-View Event-RGB Hybrid Cameras

723. See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

724. VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

725. IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusion

726. Robust Promptable Video Object Segmentation

727. Towards Storytelling Animations: Joint Synthesis of Human and Camera Motions

728. Space-Time Forecasting of Dynamic Scenes with Motion-aware Gaussian Grouping

729. LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

730. LA-Pose: Latent Action Pretraining Meets Pose Estimation

731. Motion-Aware Animatable Gaussian Avatars Deblurring

732. TTAPFormer: Robust Arbitrary Point Tracking via Transient Asynchronous Fusion of Frames and Events

733. Adapting Lightweight Image-based Counting Models for Video Crowd Counting

734. Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

735. ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos

736. VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues

737. Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization

738. StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation

739. UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models

740. Forecasting 3D Scanpaths in Egocentric Video

741. FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning

742. TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding

743. EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories

744. Spatiotemporal Pyramid Flow Matching for Climate Emulation

745. Relightable Holoported Characters: Capturing and Relighting Dynamic Human Performance from Sparse Views

746. ReFlow: Self-correction Motion Learning for Dynamic Scene Reconstruction

747. SimRecon: SimReady Compositional Scene Reconstruction from Real Videos

748. DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior

749. Compressed-Domain-Aware Online Video Super-Resolution

750. SVBench: Evaluation of Video Generation Models on Social Reasoning

751. TESO: Online Tracking of Essential Matrix by Stochastic Optimization

752. GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processes

753. Hear What Matters! Text-conditioned Selective Video-to-Audio Generation

754. Exploring 6D Object Pose Estimation with Deformation

755. ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion

756. Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

757. Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motions

758. DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction

759. Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models

760. Inter-Photon-Limited Videography

761. LaDy: Lagrangian-Dynamic Informed Network for Skeleton-based Action Segmentation via Spatial-Temporal Modulation

762. PhysHO: Physics-Based Dynamic 3D Gaussian Human and Object from Monocular Video

763. CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

764. SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation

765. Joint Learning of General and Diverse Patterns with Mixture of Memory Experts for Weakly-Supervised Video Anomaly Detection

766. Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models

767. DreamStyle: A Unified Framework for Video Stylization

768. Video Panels for Long Video Understanding

769. Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

770. STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation

771. Video-CoE: Reinforcing Video Event Prediction via Chain of Events

772. PhyCo: Learning Controllable Physical Priors for Generative Motion

773. Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

774. ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation

775. Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation

776. Revisiting Monocular SLAM with Spatio-Temporal Scene Modeling

777. SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution

778. MotionMaster: Generalizable Text-Driven Motion Generation and Editing

779. MORE-STEM: Long-Short MemOry REcall and Spatio-TEmporal Consistency Model for Query-Driven 3D/4D Point Cloud Segmentation

780. Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptation

781. VidEoMT: Your ViT is Secretly Also a Video Segmentation Model

782. DetectSCI: Toward Object-Guided ROI Reconstruction for High-Resolution Video Snapshot Compressive Imaging

783. SPOT: Spatiotemporal Prompt Optimization for Motion-Stabilized MLLM-Guided Video Segmentation

784. Live Interactive Training for Video Segmentation

785. Learning Long-term Motion Embeddings for Efficient Kinematics Generation

786. PFGNet: A Fully Convolutional Frequency-Guided Peripheral Gating Network for Efficient Spatiotemporal Predictive Learning

787. NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos

788. SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning

789. Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamics

790. TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction

791. EvoID: Reinforced Evolution for Identity-Preserving Video Generation

792. Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM

793. TESSERA: Temporal Embeddings of Surface Spectra for Earth Representation and Analysis

794. Bi-directional Autoregressive Diffusion for Large Complex Motion Interpolation

795. RoboTAG: End-to-end Robot Pose Estimation via Topological Alignment Graph

796. F^2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modeling

797. VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

798. MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation

799. Statistical Characteristic-Guided Denoising for Rapid High-Resolution Transmission Electron Microscopy Imaging

800. Occlusion-Aware SORT: Observing Occlusion for Robust Multi-Object Tracking

801. AnthroTAP: Learning Point Tracking with Real-World Motion

802. Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

803. Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning

804. WildPose: A Unified Framework for Robust Pose Estimation in the Wild

805. CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning

806. Seeing Motion Through Polarity for Event-based Action Recognition

807. Ultra-Fast Neural Video Compression

808. EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decompositio

809. ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction

810. EasyV2V: A High-quality Instruction-based Video Editing Framework

811. Personalized Longitudinal Medical Report Generation via Temporally-Aware Federated Adaptation

812. KV-Tracker: Real-Time Pose Tracking with Transformers

813. M4V: Multimodal Mamba for Efficient Text-to-Video Generation

814. Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos

815. SEA-Flow3D: Simplified, Efficient, and Accurate Scene Flow via Spatial Vector Sampling and Multi-scale Refinement

816. Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer

817. Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representations

818. Learning Like Humans: Analogical Concept Learning for Generalized Category Discovery

819. Agentic Video Summarization via Self-Reflecting Multimodal Understanding

820. InterPhys: Physics-aware Human Motion Synthesis in a Dynamic Scene

821. ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars

822. Enhancing Video Vision Language Model with Hippocampal Sensing

823. EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs

824. Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

825. HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos

826. Interactive Tracking: A Human-in-the-Loop Paradigm with Memory-Augmented Adaptation

827. Sparsely Timing the Change: A Spiking Temporal Framework for Remote Sensing Interpretation

828. EthoCLIP: Ontology-Enhanced Video-Language Pretraining for Animal Behavior Understanding

829. OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens

830. TrajTok: Learning Trajectory Tokens Enhances Video Understanding

831. FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolution

832. Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimization

833. SDTrack: A Baseline for Event-based Tracking via Spiking Neural Networks

834. LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

835. Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation

836. Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO

837. Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation

838. Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

839. Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

840. Thermal is Always Wild: Characterizing and Addressing Challenges in Thermal-Only Novel View Synthesis

841. Self-Critical Distillation Network for Video-based Commonsense Captioning

842. AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

843. TempoControl: Temporal Attention Guidance for Text-to-Video Models

844. Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding

845. VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization

846. FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding

847. Unleashing Vision-Language Semantics for Deepfake Video Detection

848. Beyond Explicit Language: Plug-and-Play Visual-to-Linguistic Modeling Toward General Object Tracking

849. VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

850. Instance-level Visual Active Tracking with Occlusion-Aware Planning

851. NS-Diff: Fluid Navier-Stokes Guided Video Diffusion via Reinforcement Learning

852. Alert-CLIP: Abnormality-aware Latent-Enhanced Representation Tuning of CLIP for Video Anomaly Detection

853. Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality

854. PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusion

855. ARES: Unifying Asymmetric RGB-Event Stereo for Probabilistic Scene Flow Estimation

856. SelfHVD: Self-Supervised Handheld Video Deblurring

857. RFDM: Residual Flow Diffusion Models for Video Editing

858. Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

859. Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videos

860. MotionV2V: Editing Motion in a Video

861. CoT-Edit: Let CoT Guide Instruction Video Editing