R
Published on

ICLR 2026 — Robotics & Control

Robotics & Control

229 papers (0 oral)

Improving Diffusion Models for Class-imbalanced Training Data via Capacity Manipulation

Steering the Herd: A Framework for LLM-based Control of Social Learning

Rodrigues Network for Learning Robot Actions

MotionStream: Real-Time Video Generation with Interactive Motion Controls

Differentiable Model Predictive Control on the GPU

PateGAIL++: Utility Optimized Private Trajectory Generation with Imitation Learning

Conformal Robustness Control: A New Strategy for Robust Decision

Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning

Random Controlled Differential Equations

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

Cross-ControlNet: Training-Free Fusion of Multiple Conditions for Text-to-Image Generation

RNE: plug-and-play diffusion inference-time control and energy-based training

SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment

Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding

OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation

Emergent Discrete Controller Modules for Symbolic Planning in Transformers

Seeing Through Words: Controlling Visual Retrieval Quality with Language Models

Unveiling the Potential of Diffusion Large Language Model in Controllable Generation

A New Initialization to Control Gradients in Sinusoidal Neural Networks

A Schrödinger Eigenfunction Method for Long-Horizon Stochastic Optimal Control

Learning Massively Multitask World Models for Continuous Control

Vision-Language-Action Instruction Tuning: From Understanding to Manipulation

GRL-SNAM: Geometric Reinforcement Learning with Differential Hamiltonians for Navigation and Mapping in Unknown Environments

Manipulation as in Simulation: Enabling Accurate Geometry Perception in Robots

Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning

Interleave-VLA: Enhancing Robot Manipulation with Image-Text Interleaved Instructions

Virtual Community: An Open World for Humans, Robots, and Society

Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation

MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control

Differentiable Simulation of Hard Contacts with Soft Gradients for Learning and Control

Learning Koopman Representations with Controllability Guarantees

Beyond Distributions: Geometric Action Control for Continuous Reinforcement Learning

Regret-Guided Search Control for Efficient Learning in AlphaZero

OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling

Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

Operator Theory-Driven Autoformulation of MDPs for Control of Queueing Systems

K²-Agent: Co-Evolving Know-What and Know-How for Hierarchical Mobile Device Control

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

Much Ado About Noising: Dispelling the Myths of Generative Robotic Control

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

WithAnyone: Toward Controllable and ID Consistent Image Generation

Follow-Your-Shape: Shape-Aware Image Editing via Trajectory-Guided Region Control

CTRL&SHIFT: High-quality Geometry-Aware Object Manipulation in Visual Generation

MIMIC: Mask-Injected Manipulation Video Generation with Interaction Control

LightCtrl: Training-free Controllable Video Relighting

CREPE: Controlling diffusion with REPlica Exchange

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

Omni-IML: Towards Unified Interpretable Image Manipulation Localization

DriftLite: Lightweight Drift Control for Inference-Time Scaling of Diffusion Models

Breaking and Fixing Defenses Against Control Flow Hijacking in Multi-Agent Systems

Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols

GenCtrl -- A Formal Controllability Toolkit for Generative Models

A New Approach to Controlling Linear Dynamical Systems

CitySeeker: How Do VLMs Explore Embodied Urban Navigation with Implicit Human Needs?

VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation

SpikePingpong: Spike Vision-based Fast-Slow Pingpong Robot System

Lifelong Embodied Navigation Learning

RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation

OpenFly: A COMPREHENSIVE PLATFORM FOR AERIAL VISION-LANGUAGE NAVIGATION

GoldenStart: Q-Guided Priors and Entropy Control for Distilling Flow Policies

Masked Generative Policy for Robotic Control

DataMIL: Selecting Data for Robot Imitation Learning with Datamodels

From Embedding to Control: Representations for Stochastic Multi-Object Systems

From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

Same Content, Different Representations: A Controlled Study for Table QA

RAVEN: End-to-end Equivariant Robot Learning with RGB Cameras

Ctrl-World: A Controllable Generative World Model for Robot Manipulation

Online Navigation Refinement: Achieving Lane-Level Guidance by Associating Standard-Definition and Online Perception Maps

Hierarchical Value-Decomposed Offline Reinforcement Learning for Whole-Body Control

NewtonGen: Physics-consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics

Light-X: Generative 4D Video Rendering with Camera and Illumination Control

Time-to-Move: Training-Free Motion-Controlled Video Generation via Dual-Clock Denoising

3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation

Following the Navigation: Enhancing Small Language Models Contextual Reasoning with LLM Guidance

Boolean Satisfiability via Imitation Learning

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

From Collapse to Control: Understanding and Extending Context Length in Emerging Hybrid Models via Universal Position Interpolation

Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs

Controllable Logical Hypothesis Generation for Abductive Reasoning in Knowledge Graphs

NDAD: Negative-Direction Aware Decoding for Large Language Models via Controllable Hallucination Signal Injection

Robust Deep Reinforcement Learning against Adversarial Behavior Manipulation

Controllable diffusion-based generation for multi-channel biological data

Controllable Sequence Editing for Biological and Clinical Trajectories

Less Is More: Clustered Cross-Covariance Control for Offline RL

ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation

Causal Imitation Learning under Expert-Observable and Expert-Unobservable Confounding

RoboPARA: Dual-Arm Robot Planning with Parallel Allocation and Recomposition Across Tasks

ArtVIP: Articulated Digital Assets of Visual Realism, Modular Interaction, and Physical Fidelity for Robot Learning

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

RoboCasa365: A Large-Scale Simulation Framework for Training and Benchmarking Generalist Robots

BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised Reinforcement Learning

TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models

Towards Bridging the Gap between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

BOLT: Decision‑Aligned Distillation and Budget-Aware Routing for Constrained Multimodal QA on Robots

Latent Wasserstein Adversarial Imitation Learning

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

RFS: Reinforcement learning with Residual flow steering for dexterous manipulation

Model Predictive Adversarial Imitation Learning for Planning from Observation

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

Scaling up Memory for Robotic Control via Experience Retrieval

Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies

On Entropy Control in LLM-RL Algorithms

Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment

Characterizing Human Semantic Navigation in Concept Production as Trajectories in Embedding Space

PRO-MOF: Policy Optimization with Universal Atomistic Models for Controllable MOF Generation

SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models

From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance

Self-Improving Loops for Visual Robotic Planning

Empowering Multi-Robot Cooperation via Sequential World Models

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control

MoCa: Modeling Object Consistency for 3D Camera Control in Video Generation

CASteer: Cross-Attention Steering for Controllable Concept Erasure

Multilevel Control Functional

Gradient-Direction-Aware Density Control for 3D Gaussian Splatting

Dual Optimistic Ascent (PI Control) is the Augmented Lagrangian Method in Disguise

Anime-Ready: Controllable 3D Anime Character Generation with Body-Aligned Component-Wise Garment Modeling

Inference-Time Personalized Safety Control via Paired Difference-in-Means Intervention

RelayFormer: A Unified Local-Global Attention Framework for Scalable Image and Video Manipulation Localization

Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion

ACE: Attribution-Controlled Knowledge Editing for Multi-hop Factual Recall

SubDyve: Subgraph-Driven Dynamic Propagation for Virtual Screening Enhancement Controlling False Positive

Controlling Repetition in Protein Language Models

ViPRA: Video Prediction for Robot Actions

Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations

Embodied Navigation Foundation Model

EquAct: An SE(3)-Equivariant Multi-Task Transformer for 3D Robotic Manipulation

DexMove: Learning Tactile-Guided Non-Prehensile Manipulation with Dexterous Hands

CoNavBench: Collaborative Long-Horizon Vision-Language Navigation Benchmark

Policy Contrastive Decoding for Robotic Foundation Models

EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

When a Robot is More Capable than a Human: Learning from Constrained Demonstrators

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

Entropy Regularizing Activation: Boosting Continuous Control, Large Language Models, and Image Classification with Activation as Entropy Constraints

When would Vision-Proprioception Policies Fail in Robotic Manipulation?

Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task?

The CoT Encyclopedia: Analyzing, Predicting, and Controlling how a Reasoning Model will Think

Parameters vs. Context: Fine-Grained Control of Knowledge Reliance in Language Models

AttriCtrl: A Generalizable Framework for Controlling Semantic Attribute Intensity in Diffusion Models

Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!

Real-Time Motion-Controllable Autoregressive Video Diffusion

Towards Physically Executable 3D Gaussian for Embodied Navigation

Color3D: Controllable and Consistent 3D Colorization with Personalized Colorizer

Cross-Embodiment Offline Reinforcement Learning for Heterogeneous Robot Datasets

Test-Time Accuracy-Cost Control in Neural Simulators via Recurrent-Depth

Scalable Exploration for High-Dimensional Continuous Control via Value-Guided Flow

Robust Fine-tuning of Vision-Language-Action Robot Policies via Parameter Merging

Real-Time Robot Execution with Masked Action Chunking

RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields

All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation

M3^3E: Continual Vision-and-Language Navigation via Mixture of Macro and Micro Experts

VLMgineer: Vision-Language Models as Robotic Toolsmiths

Imitation Learning as Return Distribution Matching

ManipEvalAgent: Promptable and Efficient Evaluation Framework for Robotic Manipulation Policies

VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing

Abstracting Robot Manipulation Skills via Mixture-of-Experts Diffusion Policies

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

Uncertainty-Aware Gaussian Map for Vision-Language Navigation

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-Language Navigation

Capturing Visual Environment Structure Correlates with Control Performance

ExoPredicator: Learning Abstract Models of Dynamic Worlds for Robot Planning

Test-Time Alignment for Large Language Models via Textual Model Predictive Control

Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization

WIMLE: Uncertainty‑Aware World Models with IMLE for Sample‑Efficient Continuous Control

Confident and Adaptive Generative Speech Recognition via Risk Control

PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra

CE-Nav: Flow-Guided Reinforcement Refinement for Cross-Embodiment Local Navigation

SpatialHand: Generative Object Manipulation from 3D Prespective

Near-Optimal Second-Order Guarantees for Model-Based Adversarial Imitation Learning

WholeBodyVLA: Towards Unified Latent VLA for Whole-body Loco-manipulation Control

Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Control Tax: The Price of Keeping AI in Check

Persona Features Control Emergent Misalignment

Activation Steering with a Feedback Controller

What Matters for Batch Online Reinforcement Learning in Robotics?

LeRobot: An Open-Source Library for End-to-End Robot Learning

Stochastic Optimal Control for Continuous-Time fMRI Representation Learning

Controllable Video Generation with Provable Disentanglement

From Tokens to Nodes: Semantic-Guided Motion Control for Dynamic 3D Gaussian Splatting

UniHand: A Unified Model for Diverse Controlled 4D Hand Motion Modeling

TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions

Robust Multi-Objective Controlled Decoding of Large Language Models

Shortcut Diffusion Training with Cumulative Consistency Loss: An Optimal Control View

Seeing Through the PRISM: Compound & Controllable Restoration of Scientific Images

Training-Free Reward-Guided Image Editing via Trajectory Optimal Control

CardioComposer: Leveraging Differentiable Geometry for Compositional Control of Anatomical Diffusion Models

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

Primary-Fine Decoupling for Action Generation in Robotic Imitation

SafeFlowMatcher: Safe and Fast Planning using Flow Matching with Control Barrier Functions

PA3FF:Learning Part-Aware Dense 3D Feature Field For Generalizable Articulated Object Manipulation

CompassNav: Steering From Path Imitation to Decision Understanding In Navigation

Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation

SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints

Accelerated co-design of robots through morphological pretraining

AutoBio: A Simulation and Benchmark for Robotic Automation in Digital Biology Laboratory

Demystifying Robot Diffusion Policies: Action Memorization and a Simple Lookup Table Alternative

Koopman-Assisted Trajectory Synthesis: A Data Augmentation Framework for Offline Imitation Learning

RobotArena ∞\infty: Scalable Robot Benchmarking via Real-to-Sim Translation

DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning

Difference-Aware Retrieval Policies for Imitation Learning

Remotely Detectable Robot Policy Watermarking

HWC-Loco: A Hierarchical Whole-Body Control Approach to Robust Humanoid Locomotion

Geometry-aware 4D Video Generation for Robot Manipulation

GRACE: A Language Model Framework for Explainable Inverse Reinforcement Learning

Matching Multiple Experts: On the Exploitability of Multi-Agent Imitation Learning

ClarifyVC: Clarifying Ambiguous Commands in Vehicle Control with a Hybrid Data Augmentation Pipeline

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception

Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation

MoMaGen: Generating Demonstrations under Soft and Hard Constraints for Multi-Step Bimanual Mobile Manipulation

Causal-Steer: Disentangled Continuous Style Control without Parallel Corpora

Neologism Learning for Controllability and Self-Verbalization

SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling

Sim2Real VLA: Zero-Shot Generalization of Synthesized Skills to Realistic Manipulation