R
Published on

CVPR 2026 — Reinforcement Learning & Robotics

Reinforcement Learning & Robotics

437 papers

1. PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning

2. RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward

3. APPO: Attention-guided Perception Policy Optimization for Video Reasoning

4. JoPPO: Hierarchical Photography Assessment via Contrastive Joint Conditional Probabilistic Reinforcement Learning

5. Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning

6. AeroAgent: A Vision-Physics-Decision Framework for Aerodynamic Vehicle Design

7. PPISP: Physically-Plausible Compensation and Control of Photometric Variations in Radiance Field Reconstruction

8. Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation

9. EVA: Efficient Reinforcement Learning for End-to-End Video Agent

10. Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning

11. HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation

12. Write Where It Matters: Policy-Guided Watermarks for 3D Gaussian Splatting

13. AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video

14. Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI

15. Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling

16. STAvatar: Soft Binding and Temporal Density Control for Monocular 3D Head Avatars Reconstruction

17. Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment

18. The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation

19. Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers

20. GeoDexGrasp: Geometry-aware Generation for Data-efficient and Physics-plausible Dexterous Grasping

21. What Are You Doing? A Closer Look at Controllable Human Video Generation

22. Neuro-Cognitive Reward Modeling for Human-Centered Autonomous Vehicle Control

23. EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

24. Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time Intervention

25. Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Concepts

26. SyncMos: Scalable Motion Synchronisation for Multi-Agent Scene Interaction

27. ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

28. ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation

29. Video2Robo: 3DGS-based Synthetic Data from One Video Enables Scalable Robot Learning

30. Attack for Defense: Adversarial Agents for Point Prompt Optimization Empowering Segment Anything Model

31. COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

32. CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation

33. CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning

34. SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models

35. Unsafe2Safe: Controllable Image Anonymization for Downstream Utility

36. Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State Manipulation

37. HiconAgent: History Context-aware Policy Optimization for GUI Agents

38. Yume1.5: A Text-Controlled Interactive World Generation Model

39. MangoBench: A Benchmark for Multi-Agent Goal-Conditioned Offline Reinforcement Learning

40. ViLoMem: Agentic Learner with Grow-and-Refine Multimodal Semantic Memory

41. Bootstrap Dynamic-Aware 3D Visual Representation for Scalable Robot Learning

42. AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation

43. FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control

44. Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

45. Simple Agents Outperform Experts in Biomedical Imaging Workflow Optimization

46. RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

47. Real-Time Dynamic Scene Rendering with Controlled Compressibility and Contact Awareness

48. TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

49. SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

50. GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditions

51. Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Grounding

52. Asynchronous Temporal Modeling with Two-Agent Framework for Streaming Dense Video Captioning

53. Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

54. ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

55. Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization

56. InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy

57. ORV: 4D Occupancy-centric Robot Video Generation

58. UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos

59. LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

60. AGiLe: Learning Robust Long-Horizon Manipulation via Affordance-Grounded Bidirectional Latent Planning

61. Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videos

62. Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning

63. OneOcc: Semantic Occupancy Prediction for Legged Robots with a Single Panoramic Camera

64. ModularAgent: A Task-Aware Modular Framework for Joint Optimization of Multimodal Large Language Models and World Models

65. CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

66. Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection

67. NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

68. CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

69. MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding

70. ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation

71. MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis

72. ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions

73. AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization

74. Breaking the 3D Dataset Bottleneck: Fast Scalable Generation of Aligned 3D Assets from Scratch for Category 6D Pose Estimation and Robotic Grasping

75. Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation

76. R3-PCQA: Ray-Reprojection-Reinforcement for No-Reference 3D Point Cloud Quality Assessment

77. ReMoT: Reinforcement Learning with Motion Contrast Triplets

78. Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues

79. Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

80. GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matching

81. Improving Controllable Generation: Faster Training and Better Performance via x0-Supervision

82. EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

83. Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning

84. ActivePolicy: Active Gaussian Reconstruction and Optimization Strategy Based on Global-Local Information Gain

85. Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models

86. Language-Grounded Decoupled Action Representation for Robotic Manipulation

87. Physical Object Understanding with a Physically Controllable World Model

88. Unpaired Image Deraining Using Reward-Guided Self-Reinforcement Strategy

89. ConsistCompose: Unified Multimodal Layout Control for Image Composition

90. 3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation

91. Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

92. Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation

93. CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion

94. Incentivizing Versatile Video Reasoning in MLLMs via Data-Efficient Reinforcement Learning

95. EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

96. EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing

97. DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning

98. FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance

99. LAMP: Language-Assisted Motion Planning for Controllable Video Generation

100. MMBench-GUI: A Unified Hierarchical Evaluation Framework for Multi-Platform GUI Agents

101. Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning

102. Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

103. PaNDaS: Learnable Shape Interpolation Modeling with Localized Control

104. iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception

105. BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections

106. A Unified Perspective on Adversarial Membership Manipulation in Vision Models

107. DemoFunGrasp: Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning

108. VIRAL: Visual Sim-to-Real at Scale for Humanoid Loco-Manipulation

109. SO(3)-Equivariant ViT-Adapter for Data-Efficient Zero-Shot Sim-to-Real Indoor Panoramic Depth Estimation

110. SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization

111. LightMover: Generative Light Movement with Color and Intensity Controls

112. VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation

113. Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation

114. Real-Time Long Horizon Air Quality Forecasting via Group-Relative Policy Optimization

115. Scalable Trajectory Generation for Whole-Body Mobile Manipulation

116. UniDef: Universal Defense Against Unauthorized Image Manipulation

117. WebGym: Scaling Training Environments for Long-Horizon Visual Web Agents with Realistic Tasks

118. Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

119. Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation

120. Vinedresser3D: Towards Agentic Text-guided 3D Editing

121. GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation

122. DualMirage: Hunting Stealthy Multimodal LLM Agents via CAPTCHAs with Contour and Adversarial Illusions

123. Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer

124. Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation

125. VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking

126. VA-p: Variational Policy Alignment for Pixel-Aware Autoregressive Generation

127. Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control

128. DepthFocus: Controllable Depth Estimation for See-Through Scenes

129. ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation

130. TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion

131. VISTA: A Test-Time Self-Improving Video Generation Agent

132. MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation

133. DRAMA: Next-Gen Dynamic Orchestration for Resilient Multi-Agent Ecosystems in Flux

134. Beyond Rule-Based Agents: Active Markov Games for Realistic Multi-Agent Interaction in Autonomous Driving

135. Spectral Conformal Risk Control: Distribution-Free Tail Guarantees via Bayesian Quadrature

136. SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More

137. One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination

138. From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation

139. Disentangling to Re-couple: Resolving the Similarity-Controllability Paradox in Subject-Driven Text-to-Image Generation

140. PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and VLM-Guided Optimization

141. Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation

142. Frequency-domain Manipulation for Face Obfuscation

143. EcoSplat: Efficiency-controllable Feed-forward 3D Gaussian Splatting from Multi-view Images

144. SenseSearch: Empowering Vision-Language Models with High-Resolution Agentic Search-Reasoning via Reinforcement Learning

145. FloVerse: Floor Plan-Guided Multi-Modal Navigation

146. EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

147. AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

148. MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation

149. PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

150. Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation

151. Semantic Audio-Visual Navigation in Continuous Environments

152. Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation

153. Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots

154. VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement

155. NIL: No-data Imitation Learning

156. SAMIX: Reinforcing SAM2 with Semantic Adapter and Reference Selecting Policy for Mix-Supervised Segmentation

157. MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

158. IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation

159. CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning

160. Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation

161. VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation

162. Seeing What Matters: Visual Preference Policy Optimization for Visual Generation

163. Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation

164. ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering

165. Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

166. Anatomica: Localized Control over Geometric and Topological Properties for Anatomical Diffusion Models

167. AURA: Multi-modal Shared Autonomy for Urban Navigation

168. APEX: A Decoupled Memory-based Explorer for Asynchronous Aerial Object Goal Navigation

169. Resolving the Stability-Plasticity Dilemma in Reinforcement Learning via Complementary Continual Critics

170. GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agents

171. A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

172. SEBA: Sample-Efficient Black-Box Attacks on Visual Reinforcement Learning

173. TopoMA: Topology-Guided Multi-Agent Dense RGB 3D Reconstruction via Distributed Inference

174. Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning

175. Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation

176. Socratic-Geo: Synthetic Data Generation and Cross-Modal Geometric Reasoning via Multi-Agent Interaction

177. REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

178. CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization

179. Semantic Derivative Flow: Graph-Guided Diffusion for Controllable Instance Interactions

180. SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control

181. Reinforcement-Guided Synthetic Data Generation for Privacy-Sensitive Identity Recognition

182. CUBic: Coordinated Unified Bimanual Perception and Control Framework

183. Unifying Precise Keyframes and Semantic Control via Multi-level Diffusion

184. Energy Waveify and Redistribution for Test-Time Adaptation: A Control System Perspective

185. AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence

186. MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

187. NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code

188. Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

189. DiffuView: Multi-View Diffusion Pretraining for 3D Aware Robotic Manipulation

190. Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface

191. PromptDepth: Efficient and Promptable Geometric 3D Vision Model for Embodied Intelligence

192. LensWalk: Agentic Video Understanding by Planning How You See in Videos

193. See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles

194. DynBridge: Bridging Imagination and Control through Interaction Dynamics for Robot Manipulation

195. BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

196. FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation

197. ReFAct: Empowering Multimodal Web Agents with Visual and Context Focusing

198. CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning

199. Towards Open Environments and Instructions: General Vision-Language Navigation via Fast-Slow Interactive Reasoning

200. AdapAction: Adaptive Target Action Backdoor Attack against GUI Agents

201. GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

202. PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

203. VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments

204. Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

205. Exploring Conditions for Diffusion Models in Robotic Control

206. Learning to Focus and Precise Cropping:A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

207. ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

208. MorphSeek: Fine-grained Latent Representation-Level Policy Optimization for Deformable Image Registration

209. 3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience

210. Real2Sim2Real: RetinalDepth-64K for Depth Estimation in Posterior Segment Ophthalmic Surgery

211. SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

212. One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control

213. All-in-One Slider for Attribute Manipulation in Diffusion Models

214. PrivSynth: Alternating and Control-Based Optimization for Privacy and Utility in Synthetic Data

215. GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusion

216. MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

217. Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

218. Towards Policy-Adaptive Image Guardrail: Benchmark and Method

219. Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory

220. Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation

221. DriveVLN: Towards Mapless Vision-and-Language Navigation in Autonomous Driving

222. TGT: Text-Grounded Trajectories for Locally Controlled Video Generation

223. Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

224. Memory-Augmented Scene Understanding and Exploration for Open-World Aerial Object-Goal Navigation

225. GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

226. PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation

227. Unsupervised Multi-agent and Single-agent Perception from Cooperative Views

228. CycleManip: Enabling Cycle-based Manipulation via Effective History Perception and Understanding

229. InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs

230. Tackling Model Bias via Game-theoretic Multi-agent Collaboration Framework for Hateful Meme Classification

231. ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation

232. Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

233. AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

234. Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

235. TSTM: Temporal Segmentation for Task-relevant Mask in Visual Reinforcement Learning Generalization

236. PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation

237. VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

238. S2^2AM3D: Scale-controllable Part Segmentation of 3D Point Clouds

239. History to Future: Evolving Agent with Experience and Thought for Zero-shot Vision-and-Language Navigation

240. AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots

241. JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization

242. SyncDreamer: Controllable and Expressive Avatar Generation Beyond the Talking Head

243. AMusE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

244. TrajRAG: Retrieving Geometric-Semantic Experience for Zero-Shot Object Navigation

245. Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3-D Constrained Terrains

246. Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

247. Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

248. Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

249. Action-Sketcher: From Reasoning to Action via Visual Sketches for Robotic Manipulation

250. RoboAgent: Chaining Basic Capabilities for Embodied Task Planning

251. MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement

252. RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

253. Efficient Frame Selection for Long Video Understanding via Reinforcement Learning

254. IGen: Scalable Data Generation for Robot Learning from Open-World Images

255. W2W: Language-Model-Based Trajectory Prediction with Reinforcement Learning

256. Hybrid Agents for Image Restoration

257. EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents

258. From Pairs to Sequences: Track-Aware Policy Gradients for Keypoint Detection

259. Obstruction Reasoning for Robotic Grasping

260. Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation

261. MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

262. HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

263. Lighting-grounded Video Generation with Renderer-based Agent Reasoning

264. General Process Reward Modeling for Robotic Reinforcement Learning

265. WPT: World-to-Policy Transfer via Online World Model Distillation

266. InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions

267. A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation

268. SVAgent: Storyline-guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

269. OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation

270. When Robots Should Say ''I Don't Know'': Benchmarking Abstention in Embodied Question Answering

271. Semantic Scale Space: A Framework for Controllable Image Abstraction

272. Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation

273. Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual-Inertial Odometry

274. Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs

275. One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution

276. SARL-STG: A Spatially Aware Reinforcement Learning Framework for Refining MLLMs in Spatio-Temporal Video Grounding

277. SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design

278. WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

279. EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understanding

280. TokenLight: Precise Lighting Control in Images using Attribute Tokens

281. Pixel Motion Diffusion is What We Need for Robot Control

282. Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding

283. Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling

284. V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties

285. AdaDexTrack: Dynamic Modulation for Adaptive and Generalizable Dexterous Manipulation Tracking

286. SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System

287. NitroGen: An Open Foundation Model for Generalist Gaming Agents

288. Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs

289. Protect to Adapt: Orthogonal Subspace Control with Ranked Negative-Prompt Curriculum for Few-Shot Action Recognition

290. GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping

291. SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation

292. VideoSSR: Video Self-Supervised Reinforcement Learning

293. Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control

294. Learning Latent Proxies for Controllable Single-Image Relighting

295. ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Senisng

296. When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models

297. CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation

298. Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing

299. Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration

300. Beyond Sequential Tools: A Unified VLM Agent System for Photographic Post-Processing via Dynamic Multi-Expert Fusion

301. MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts

302. OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data

304. End-to-End Language-Action Model for Humanoid Whole Body Control

305. Reliable Policy Transfer for Safety-Aware End-to-End Driving with Deep Reinforcement Learning

306. Dejavu: Towards Experience Feedback Learning for Embodied Intelligence

307. LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding

308. Unified Camera Positional Encoding for Controlled Video Generation

309. Rethinking Intermediate Representation for VLM-based Robot Manipulation

310. HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning

311. Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation

312. Efficient Equivariant Transformer for Self-Driving Agent Modeling

313. Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paper

314. OctoT2I: A Self-Evolving Agentic Text-to-Image Router

315. SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

316. MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

317. Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens

318. Towards Human-Like Robot Handwriting via Contour-Aware Generation

319. Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation

320. Leveraging Verifier-Based Reinforcement Learning in Image Editing

321. VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

322. OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection

323. EE-RL: Vision Language Guided Reinforcement Learning with Explorer and Expert model for End-to-End Autonomous Driving

324. LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

325. Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation

326. ProSoftArena: Benchmarking Hierarchical Capabilities of Multi-modal Agents in Professional Software Environments

327. VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents

328. Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols

329. Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning

330. Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation

331. Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

332. SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

333. RAAS: LLM Agentic System Architecture Search with GRPO

334. RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning

335. A Temporal and Content Co-Awareness Latent Diffusion for Controllable Hand Image Generation

336. IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-Resolution

337. MaskDexGrasp: Generative Masked Modeling for Part-Aware Dexterous Grasp Synthesis

338. Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

339. PvP: Data-Efficient Humanoid Robot Learning with Proprioceptive-Privileged Contrastive Representations

340. SDUIE: Semi-Supervised Diffusion for Underwater Image Enhancement with Quant-Text Dual Control

341. GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics

342. MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

343. V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs

344. Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation

345. GeCo-SRT: Geometry-aware Continual Adaptation for Cross-Task Sim-to-Real Transfer

346. Specificity-aware reinforcement learning for fine-grained open-world classification

347. Forensic-Friendly Image Manipulation via Controllable Latent Diffusion

348. Geometrically-Constrained Agent for Spatial Reasoning

349. ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

350. StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation

351. ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body

352. BuildingGPT: Auto-Regressive Building Wireframe Reconstruction Model with Reinforcement Learning

353. Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding

354. Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

355. GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

356. Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning

357. Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning

358. Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents

359. Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

360. FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-and-Language Navigation

361. Extending Embodied Question Answering from Perception to Decision

362. SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

363. EgoRoC: Towards Egocentric Robotic Control via Task-Agnostic Visual Alignment

364. Learning to Diversify and Focus: A Reinforcement Framework for Open-Vocabulary HOI Detection

365. TaskForce: Cooperative Multi-agent Reinforcement Learning for Multi-task Optimization

366. Experience Transfer for Multimodal LLM Agents in Minecraft Game

367. AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

368. Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent

369. RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation

370. Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution

371. OLATverse: A Large-scale Real-world Object Dataset with Precise Lighting Control

372. Predict Before You Explore: Predictive Planning with Specialized Memory for Embodied Question Answering

373. AgentDet: A Shared-Blackboard Multi-Agent Framework for Zero-/Few-Shot Object Detection

374. WeatherCity: Urban Scene Reconstruction with Controllable Multi-Weather Transformation

375. FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning

376. DualReg: Dual-Space Filtering and Reinforcement for Rigid Registration

377. D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation

378. See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis

379. AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions

380. Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motions

381. Tutor-Student Reinforcement Learning: A Dynamic Curriculum for Robust Deepfake Detection

382. WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

383. TTRV: Test-Time Reinforcement Learning for Vision Language Models

384. Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation

385. STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation

386. Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR

387. PhyCo: Learning Controllable Physical Priors for Generative Motion

388. DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

389. SIR: Structured Image Representations for Explainable Robot Learning

390. Dynamic Important Example Mining for Reinforcement Finetuning

391. SaPaVe: Towards Active Perception and Manipulation in Vision-Language Action Models for Robotics

392. SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning

393. HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restoration

394. RoboTAG: End-to-end Robot Pose Estimation via Topological Alignment Graph

395. TherA: Thermal-Aware Visual-Language Prompting for Controllable RGB-to-Thermal Infrared Translation

396. Learning Surgical Robotic Manipulation with 3D Spatial Priors

397. CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning

398. Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding

399. FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition

400. RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation

401. OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

402. IntrinsicWeather: Controllable Weather Editing in Intrinsic Space

403. DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation

404. BiPreManip: Learning Affordance-Based Bimanual Preparatory Manipulation through Anticipatory Collaboration

405. ActiveGrasp: Information-Guided Active Grasping with Calibrated Energy-based Model

406. Agentic Video Summarization via Self-Reflecting Multimodal Understanding

407. ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars

408. Controllable Federated Prompt Learning at Test Time

409. PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes

410. Agentic Retoucher for Text-To-Image Generation

411. RL-ScanIQA: Reinforcement-Learned Scanpaths for Blind 360deg Image Quality Assessment

412. 3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

413. Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning

414. PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment

415. R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning

416. ChArtist: Generating Pictorial Charts with Unified Spatial and Subject Control

417. Structural Action Transformer for 3D Dexterous Manipulation

418. Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation

419. PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling

420. INSIGHT Bench: Towards Grounded IN-SItu Guidance for Robotic ManipulaTion

421. MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents

422. Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulation

423. TeamHOI: Learning a Unified Policy for Cooperative Human-Object Interactions with Any Team Size

424. C^2FG: Control Classifier-Free Guidance via Score Discrepancy Analysis

425. AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

426. TempoControl: Temporal Attention Guidance for Text-to-Video Models

427. NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction

428. RealAppiance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manauls

429. OctoNav: Towards Generalist Embodied Navigation

430. Adaptive 3D Perception for Small Aerial Targets Under Sparse Sampling via Reinforcement Learning

431. VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

432. NS-Diff: Fluid Navier-Stokes Guided Video Diffusion via Reinforcement Learning

433. EpiAgent: An Agent-Centric System for Ancient Inscription Restoration

434. Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification

435. Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

436. GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

437. Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning