- Published on
ICLR 2026 — Reinforcement Learning
Reinforcement Learning
657 papers (0 oral)
Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling
- Link: OpenReview
Mastering Sparse CUDA Generation through Pretrained Models and Deep Reinforcement Learning
- Link: OpenReview
Reducing Belief Deviation in Reinforcement Learning for Active Reasoning of LLM Agents
- Link: OpenReview
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
- Link: OpenReview
GLASS Flows: Efficient Inference for Reward Alignment of Flow and Diffusion Models
- Link: OpenReview
Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
- Link: OpenReview
LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning
- Link: OpenReview
EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
- Link: OpenReview
Is it Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort
- Link: OpenReview
P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling
- Link: OpenReview
LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts
- Link: OpenReview
AgentGym-RL: An Open-Source Framework to Train LLM Agents for Long-Horizon Decision Making via Multi-Turn RL
- Link: OpenReview
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
- Link: OpenReview
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
- Link: OpenReview
World-In-World: World Models in a Closed-Loop World
- Link: OpenReview
Latent Particle World Models: Self-supervised Object-centric Stochastic Dynamics Modeling
- Link: OpenReview
EditBench: Evaluating LLM Abilities to Perform Real-World Instructed Code Edits
- Link: OpenReview
Exploratory Diffusion Model for Unsupervised Reinforcement Learning
- Link: OpenReview
Uncover Underlying Correspondence for Robust Multi-view Clustering
- Link: OpenReview
TROLL: Trust Regions Improve Reinforcement Learning for Large Language Models
- Link: OpenReview
FlashWorld: High-quality 3D Scene Generation within Seconds
- Link: OpenReview
The Art of Scaling Reinforcement Learning Compute for LLMs
- Link: OpenReview
From movement to cognitive maps: recurrent neural networks reveal how locomotor development shapes hippocampal spatial coding
- Link: OpenReview
: A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
- Link: OpenReview
RealPDEBench: A Benchmark for Complex Physical Systems with Real-World Data
- Link: OpenReview
TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning
- Link: OpenReview
CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
- Link: OpenReview
Triple-BERT: Do We Really Need MARL for Order Dispatch on Ride-Sharing Platforms?
- Link: OpenReview
Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
- Link: OpenReview
Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning
- Link: OpenReview
6. Enhancing Sparse Event Detection in Healthcare Time-Series via Adaptive Gate of Context–Detail Interaction
- Topics: Medical & Healthcare
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
- Link: OpenReview
ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks
- Link: OpenReview
LearnIR: Learnable Posterior Sampling for Real-World Image Restoration
- Link: OpenReview
ChronoEdit: Towards Temporal Reasoning for In-Context Image Editing and World Simulation
- Link: OpenReview
DAMR: Efficient and Adaptive Context-Aware Knowledge Graph Question Answering with LLM-Guided MCTS
- Link: OpenReview
SysMoBench: Evaluating AI on Formally Specifying Complex Real-World Systems
- Link: OpenReview
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
- Link: OpenReview
GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning
- Link: OpenReview
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
- Link: OpenReview
Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs
- Link: OpenReview
FrontierCO: Real-World and Large-Scale Evaluation of Machine Learning Solvers for Combinatorial Optimization
- Link: OpenReview
Towards Dynamic Interleaving Optimizers
- Link: OpenReview
TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
- Link: OpenReview
Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
- Link: OpenReview
Spotlight on Token Perception for Multimodal Reinforcement Learning
- Link: OpenReview
Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World
- Link: OpenReview
LLM-Guided Evolutionary Program Synthesis for Quasi-Monte Carlo Design
- Link: OpenReview
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
- Link: OpenReview
Revisual-R1: Advancing Multimodal Reasoning From Optimized Cold Start to Staged Reinforcement Learning
- Link: OpenReview
VisualPRM400K: An Effective Dataset for Training Multimodal Process Reward Models
- Link: OpenReview
Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation
- Link: OpenReview
DVLA-RL: Dual-Level Vision–Language Alignment with Reinforcement Learning Gating for Few-Shot Learning
- Link: OpenReview
Doctor-R1: Mastering Clinical Inquiry with Experiential Agentic Reinforcement Learning
- Link: OpenReview
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
- Link: OpenReview
General Exploratory Bonus for Optimistic Exploration in RLHF
- Link: OpenReview
Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding
- Link: OpenReview
PonderLM: Pretraining Language Models to Ponder in Continuous Space
- Link: OpenReview
ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping
- Link: OpenReview
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
- Link: OpenReview
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
- Link: OpenReview
Mapping Overlaps in Benchmarks through Perplexity in the Wild
- Link: OpenReview
Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
- Link: OpenReview
Early Signs of Steganographic Capabilities in Frontier LLMs
- Link: OpenReview
ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models
- Link: OpenReview
Algorithmic Guarantees for Distilling Supervised and Offline RL Datasets
- Link: OpenReview
Automata Learning and Identification of the Support of Language Models
- Link: OpenReview
Neural+Symbolic Approaches for Interpretable Actor-Critic Reinforcement Learning
- Link: OpenReview
Single Index Bandits: Generalized Linear Contextual Bandits with Unknown Reward Functions
- Link: OpenReview
Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs
- Link: OpenReview
Tackling Heavy-Tailed Q-Value Bias in Offline-to-Online Reinforcement Learning with Laplace-Robust Modeling
- Link: OpenReview
Scalable Offline Model-Based RL with Action Chunks
- Link: OpenReview
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
- Link: OpenReview
Reevaluating Policy Gradient Methods for Imperfect-Information Games
- Link: OpenReview
XQC: Well-conditioned Optimization Accelerates Deep Reinforcement Learning
- Link: OpenReview
Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism
- Link: OpenReview
Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
- Link: OpenReview
Spectral Bellman Method: Unifying Representation and Exploration in RL
- Link: OpenReview
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
- Link: OpenReview
NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context
- Link: OpenReview
One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning
- Link: OpenReview
Self-Improving Skill Learning for Robust Skill-based Meta-Reinforcement Learning
- Link: OpenReview
Strict Subgoal Execution: Reliable Long-Horizon Planning in Hierarchical Reinforcement Learning
- Link: OpenReview
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
- Link: OpenReview
Does “Do Differentiable Simulators Give Better Policy Gradients?” Give Better Policy Gradients?
- Link: OpenReview
Unlocking Long-Horizon Agentic Search with Large-Scale End-to-End RL
- Link: OpenReview
Learning Massively Multitask World Models for Continuous Control
- Link: OpenReview
GRL-SNAM: Geometric Reinforcement Learning with Differential Hamiltonians for Navigation and Mapping in Unknown Environments
- Link: OpenReview
Emergent Dexterity Via Diverse Resets and Large-Scale Reinforcement Learning
- Link: OpenReview
Self-Aligned Reward: Towards Effective and Efficient Reasoners
- Link: OpenReview
Understanding and Improving Hyperbolic Deep Reinforcement Learning
- Link: OpenReview
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
- Link: OpenReview
Goal Reaching with Eikonal-Constrained Hierarchical Quasimetric Reinforcement Learning
- Link: OpenReview
RM-R1: Reward Modeling as Reasoning
- Link: OpenReview
Interleave-VLA: Enhancing Robot Manipulation with Image-Text Interleaved Instructions
- Link: OpenReview
Directed Exploration in Reinforcement Learning from Linear Temporal Logic
- Link: OpenReview
616. ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
- Topics: Optimization & Training Methods, Trust & Safety, Efficiency & Compression
Virtual Community: An Open World for Humans, Robots, and Society
- Link: OpenReview
Who Matters Matters: Agent-Specific Conservative Offline MARL
- Link: OpenReview
Learning to summarize user information for personalized reinforcement learning from human feedback
- Link: OpenReview
Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
- Link: OpenReview
From Observations to Events: Event-Aware World Models for Reinforcement Learning
- Link: OpenReview
Efficient Best-of-Both-Worlds Algorithms for Contextual Combinatorial Semi-Bandits
- Link: OpenReview
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
- Link: OpenReview
Beyond Distributions: Geometric Action Control for Continuous Reinforcement Learning
- Link: OpenReview
Solving Parameter-Robust Avoid Problems with Unknown Feasibility using Reinforcement Learning
- Link: OpenReview
WebArbiter: A Generative Reasoning Process Reward Model for Web Agents
- Link: OpenReview
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
- Link: OpenReview
Asynchronous Policy Gradient Aggregation for Efficient Distributed Reinforcement Learning
- Link: OpenReview
ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement Learning
- Link: OpenReview
Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
- Link: OpenReview
On the Computational Limits of AI4S-RL : A Unified - Analysis
- Link: OpenReview
TSM-Bench: Detecting LLM-Generated Text in Real-World Wikipedia Editing Practices
- Link: OpenReview
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
- Link: OpenReview
OPPO: Accelerating PPO-based RLHF via Pipeline Overlap
- Link: OpenReview
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
- Link: OpenReview
Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training
- Link: OpenReview
Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling
- Link: OpenReview
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
- Link: OpenReview
PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation
- Link: OpenReview
Speech World Model: Causal State–Action Planning with Explicit Reasoning for Speech
- Link: OpenReview
Beyond Pass@ 1: Self-Play with Variational Problem Synthesis Sustains RLVR
- Link: OpenReview
SELF-HARMONY: LEARNING TO HARMONIZE SELF-SUPERVISION AND SELF-PLAY IN TEST-TIME REINFORCEMENT LEARNING
- Link: OpenReview
PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning
- Link: OpenReview
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
- Link: OpenReview
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- Link: OpenReview
Leveraging Explanation to Improve Generalization of Meta Reinforcement Learning
- Link: OpenReview
Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
- Link: OpenReview
Emergence of Spatial Representation in an Actor-Critic Agent with Hippocampus-Inspired Sequence Generator
- Link: OpenReview
Hippoformer: Integrating Hippocampus-inspired Spatial Memory with Transformers
- Link: OpenReview
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
- Link: OpenReview
WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning
- Link: OpenReview
Mixture-of-World Models: Scaling Multi-Task Reinforcement Learning with Modular Latent Dynamics
- Link: OpenReview
DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment
- Link: OpenReview
Unraveling the Complexity of Memory in RL Agents: an Approach for Classification and Evaluation
- Link: OpenReview
Joint Selection for Large-Scale Pre-Training Data via Policy Gradient-based Mask Learning
- Link: OpenReview
Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
- Link: OpenReview
World2Minecraft: Occupancy-Driven Simulated Scenes Construction
- Link: OpenReview
Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning
- Link: OpenReview
RD-HRL: Generating Reliable Sub-Goals for Long-Horizon Sparse-Reward Tasks
- Link: OpenReview
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- Link: OpenReview
Overlap-Adaptive Regularization for Conditional Average Treatment Effect Estimation
- Link: OpenReview
Learning Nonlinear Causal Reductions to Explain Reinforcement Learning Policies
- Link: OpenReview
CTRL&SHIFT: High-quality Geometry-Aware Object Manipulation in Visual Generation
- Link: OpenReview
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
- Link: OpenReview
Supporting Multimodal Intermediate Fusion with Informatic Constraint and Distribution Coherence
- Link: OpenReview
MicroVerse: A Preliminary Exploration Toward a Micro-World Simulation
- Link: OpenReview
LightCtrl: Training-free Controllable Video Relighting
- Link: OpenReview
Supporting High-Stakes Decision Making Through Interactive Preference Elicitation in the Latent Space
- Link: OpenReview
RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
- Link: OpenReview
TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
- Link: OpenReview
SpaCE-Eval: A Benchmark for Real-World Multi-Modal Reasoning
- Link: OpenReview
SPIKE-RL: Video-LLMs meet Bayesian Surprise
- Link: OpenReview
Refining Hybrid Genetic Search for CVRP via Reinforcement Learning-Finetuned LLM
- Link: OpenReview
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
- Link: OpenReview
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
- Link: OpenReview
CARL: Camera-Agnostic Representation Learning for Spectral Image Analysis
- Link: OpenReview
Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations
- Link: OpenReview
Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective
- Link: OpenReview
Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
- Link: OpenReview
Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences
- Link: OpenReview
Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
- Link: OpenReview
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
- Link: OpenReview
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
- Link: OpenReview
GenCtrl -- A Formal Controllability Toolkit for Generative Models
- Link: OpenReview
PRISM: Progressive Robust Learning for Open-World Continual Category Discovery
- Link: OpenReview
Nearly-Optimal Bandit Learning in Stackelberg Games with Side Information
- Link: OpenReview
Learning Correlated Reward Models: Statistical Barriers and Opportunities
- Link: OpenReview
A Near-Optimal Best-of-Both-Worlds Algorithm for Federated Bandits
- Link: OpenReview
Iterative Distillation for Reward-Guided Fine-Tuning of Diffusion Models in Biomolecular Design
- Link: OpenReview
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
- Link: OpenReview
The Sample Complexity of Online Reinforcement Learning: A Multi-model Perspective
- Link: OpenReview
Flow Matching Policy Gradients
- Link: OpenReview
CARL: Preserving Causal Structure in Representation Learning
- Link: OpenReview
Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments
- Link: OpenReview
Language Agents for Hypothesis-driven Clinical Decision Making with Reinforcement Learning
- Link: OpenReview
Preference-based Policy Optimization from Sparse-reward Offline Dataset
- Link: OpenReview
Q-Learning with Adjoint Matching
- Link: OpenReview
Robust Reward Modeling via Causal Rubrics
- Link: OpenReview
Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning
- Link: OpenReview
Sample Efficient Offline RL via T-Symmetry Enforced Latent State-Stitching
- Link: OpenReview
Peak-Return Greedy Slicing: Subtrajectory Selection for Transformer-based Offline RL
- Link: OpenReview
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
- Link: OpenReview
ProRe: A Proactive Reward System for GUI Agents via Reasoner–Actor Collaboration
- Link: OpenReview
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
- Link: OpenReview
MARL2Grid-TR: A Multi-Agent RL Benchmark in Power Grid Operations
- Link: OpenReview
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
- Link: OpenReview
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
- Link: OpenReview
Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments
- Link: OpenReview
Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs
- Link: OpenReview
Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion
- Link: OpenReview
: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
- Link: OpenReview
Entropy-preserving reinforcement learning
- Link: OpenReview
Iterated Q-Network: Beyond One-Step Bellman Updates in Deep Reinforcement Learning
- Link: OpenReview
1527. D-REX: Differentiable Real-to-Sim-to-Real Engine for Learning Dexterous Grasping
- Topics: Other / Unclassified
Sample-Efficient Distributionally Robust Multi-Agent Reinforcement Learning via Online Interaction
- Link: OpenReview
Optimas: Optimizing Compound AI Systems with Globally Aligned Local Rewards
- Link: OpenReview
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
- Link: OpenReview
Getting Your LLMs Ready for Reinforcement Learning with Lightweight SFT
- Link: OpenReview
LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
- Link: OpenReview
J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
- Link: OpenReview
PAMDP: Interact to Persona Alignment via a Partially Observable Markov Decision Process
- Link: OpenReview
PEAR: Phase Entropy Aware Reward for Efficient Reasoning
- Link: OpenReview
Helix: Evolutionary Reinforcement Learning for Open-Ended Scientific Problem Solving
- Link: OpenReview
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
- Link: OpenReview
Dual-Robust Cross-Domain Offline Reinforcement Learning Against Dynamics Shifts
- Link: OpenReview
Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback
- Link: OpenReview
Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions
- Link: OpenReview
Process-Verified Reinforcement Learning for Theorem Proving via Lean
- Link: OpenReview
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
- Link: OpenReview
Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
- Link: OpenReview
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
- Link: OpenReview
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
- Link: OpenReview
Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
- Link: OpenReview
CaRe-BN: Precise Moving Statistics for Stabilizing Spiking Neural Networks in Reinforcement Learning
- Link: OpenReview
Agnostics: Learning to Synthesize Code in Any Programming Language with a Universal Reinforcement Learning Environment
- Link: OpenReview
Virne: A Comprehensive Benchmark for RL-based Network Resource Allocation in NFV
- Link: OpenReview
Reasoning in Space via Grounding in the World
- Link: OpenReview
Ctrl-World: A Controllable Generative World Model for Robot Manipulation
- Link: OpenReview
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
- Link: OpenReview
PROS: Towards Compute-Efficient RLVR via Rollout Prefix Reuse
- Link: OpenReview
Learn to Reason Efficiently with Adaptive Length-based Reward Shaping
- Link: OpenReview
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
- Link: OpenReview
Hierarchical Value-Decomposed Offline Reinforcement Learning for Whole-Body Control
- Link: OpenReview
NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation
- Link: OpenReview
HippoTune: A Hippocampal Associative Loop–Inspired Fine-Tuning Method for Continual Learning
- Link: OpenReview
WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
- Link: OpenReview
Unifying Stable Optimization and Reference Regularization in RLHF
- Link: OpenReview
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
- Link: OpenReview
Distributionally Robust Cooperative Multi-agent Reinforcement Learning with Value Factorization
- Link: OpenReview
Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning
- Link: OpenReview
Designing Time Series Experiments in A/B Testing with Transformer Reinforcement Learning
- Link: OpenReview
An Orthogonal Learner for Individualized Outcomes in Markov Decision Processes
- Link: OpenReview
Overlap-weighted orthogonal meta-learner for treatment effect estimation over time
- Link: OpenReview
WorldTree: Towards 4D Dynamic Worlds from Monocular Video using Tree-Chains
- Link: OpenReview
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
- Link: OpenReview
TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning
- Link: OpenReview
VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL
- Link: OpenReview
LLMs as Rules Oracles: Exploring Real-World Multimodal Reasoning in Tabletop Strategy Game Environments
- Link: OpenReview
RLAP-CLIP: Continual Multimodal Learning with Prototype Adaptation and Difficulty-Aware Routing
- Link: OpenReview
MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
- Link: OpenReview
RL makes MLLMs see better than SFT
- Link: OpenReview
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
- Link: OpenReview
WOW-Seg: A Word-free Open World Segmentation Model
- Link: OpenReview
EAST: Early Action Prediction Sampling Strategy with Token Masking
- Link: OpenReview
Learning Heterogeneous Degradation Representation for Real-World Super-Resolution
- Link: OpenReview
Learning to Reason Efficiently with Discounted Reinforcement Learning
- Link: OpenReview
Sample Reward Soups: Query-efficient Multi-Reward Guidance for Text-to-Image Diffusion Models
- Link: OpenReview
Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
- Link: OpenReview
Learning Ordinal Probabilistic Reward from Preferences
- Link: OpenReview
OpenAgentSafety: A Comprehensive Framework For Evaluating Real-World AI Agent Safety
- Link: OpenReview
Robust Deep Reinforcement Learning against Adversarial Behavior Manipulation
- Link: OpenReview
Beyond Spectra: Eigenvector Overlaps in Loss Geometry
- Link: OpenReview
Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining
- Link: OpenReview
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
- Link: OpenReview
VCWorld: A Biological World Model for Virtual Cell Simulation
- Link: OpenReview
DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning
- Link: OpenReview
Less Is More: Clustered Cross-Covariance Control for Offline RL
- Link: OpenReview
DR-SAC: Distributionally Robust Soft Actor-Critic for Reinforcement Learning under Uncertainty
- Link: OpenReview
ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation
- Link: OpenReview
Action-Free Offline-To-Online RL via Discretised State Policies
- Link: OpenReview
Peng's Q() for Conservative Value Estimation in Offline Reinforcement Learning
- Link: OpenReview
QeRL: Beyond Efficiency - Quantization-enhanced Reinforcement Learning for LLMs
- Link: OpenReview
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
- Link: OpenReview
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- Link: OpenReview
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
- Link: OpenReview
Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL
- Link: OpenReview
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
- Link: OpenReview
Reward Model Routing in Alignment
- Link: OpenReview
A Primer on SO(3) Action Representations in Deep Reinforcement Learning
- Link: OpenReview
From Ticks to Flows: Dynamics of Neural Reinforcement Learning in Continuous Environments
- Link: OpenReview
The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning
- Link: OpenReview
Vid2World: Crafting Video Diffusion Models to Interactive World Models
- Link: OpenReview
MIRACLE: Model-free Imitation and Reinforcement Learning for Adaptive Cut-Selection
- Link: OpenReview
CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
- Link: OpenReview
BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised Reinforcement Learning
- Link: OpenReview
Retaining Suboptimal Actions to Follow Shifting Optima in Multi-Agent Reinforcement Learning
- Link: OpenReview
SocialJax: An Evaluation Suite for Multi-agent Reinforcement Learning in Sequential Social Dilemmas
- Link: OpenReview
DEAS: DEtached value learning with Action Sequence for Scalable Offline RL
- Link: OpenReview
Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning
- Link: OpenReview
Bayesian Robust Cooperative Multi-Agent Reinforcement Learning Against Unknown Adversaries
- Link: OpenReview
RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
- Link: OpenReview
AgentPO: Enhancing Multi-Agent Collaboration via Reinforcement Learning
- Link: OpenReview
Sample-efficient and Scalable Exploration in Continuous-Time RL
- Link: OpenReview
RFS: Reinforcement learning with Residual flow steering for dexterous manipulation
- Link: OpenReview
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
- Link: OpenReview
Learning to Be Uncertain: Pre-training World Models with Horizon-Calibrated Uncertainty
- Link: OpenReview
MIRA: Memory-Integrated Reinforcement Learning Agent with Limited LLM Guidance
- Link: OpenReview
Towards Robust Real-World Multivariate Time Series Forecasting: A Unified Framework for Dependency, Asynchrony, and Missingness
- Link: OpenReview
Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions
- Link: OpenReview
Agentic Reinforcement Learning with Implicit Step Rewards
- Link: OpenReview
SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning
- Link: OpenReview
RewardBench 2: Advancing Reward Model Evaluation
- Link: OpenReview
How Far Can Unsupervised RLVR Scale LLM Training?
- Link: OpenReview
AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
- Link: OpenReview
Risk-Sensitive Reinforcement Learning for Alleviating Exploration Dilemmas in Large Language Models
- Link: OpenReview
THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
- Link: OpenReview
Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents
- Link: OpenReview
Causally Robust Reward Learning from Reason-Augmented Preference Feedback
- Link: OpenReview
RL for Reasoning by Adaptively Revealing Rationales
- Link: OpenReview
ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
- Link: OpenReview
Measuring and Mitigating Rapport Bias of Large Language Models under Multi-Agent Social Interactions
- Link: OpenReview
WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
- Link: OpenReview
TIPS: Turn-level Information-Potential Reward Shaping for Search-Augmented LLMs
- Link: OpenReview
Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs
- Link: OpenReview
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
- Link: OpenReview
Knowing When to Quit: Probabilistic Early Exits for Speech Separation Networks
- Link: OpenReview
Dynamic Early Exit in Reasoning Models
- Link: OpenReview
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
- Link: OpenReview
RESTRAIN: From Spurious Votes to Signals — Self-Training RL with Self-Penalization
- Link: OpenReview
Building spatial world models from sparse transitional episodic memories
- Link: OpenReview
On Entropy Control in LLM-RL Algorithms
- Link: OpenReview
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
- Link: OpenReview
CellDuality: Unlocking Biological Reasoning in LLMs with Self-Supervised RLVR
- Link: OpenReview
LLMs Struggle to Balance Reasoning and World Knowledge in Causal Narrative Understanding
- Link: OpenReview
SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models
- Link: OpenReview
Dual-Scale World Memory for LLM Agents towards Hard-Exploration Problems
- Link: OpenReview
Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Link: OpenReview
Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction
- Link: OpenReview
floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL
- Link: OpenReview
Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning
- Link: OpenReview
Sharp asymptotic theory for Q-learning with learning rate and its generalization
- Link: OpenReview
DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains
- Link: OpenReview
Empowering Multi-Robot Cooperation via Sequential World Models
- Link: OpenReview
WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark
- Link: OpenReview
Hybrid Reinforcement: when reward is sparse, better to be dense
- Link: OpenReview
ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask
- Link: OpenReview
Generative Blocks World: Moving Things Around in Pictures
- Link: OpenReview
Multiverse Mechanica: A Testbed for Learning Game Mechanics via Counterfactual Worlds
- Link: OpenReview
Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
- Link: OpenReview
Direct Reward Fine-Tuning on Poses for Single Image to 3D Human in the Wild
- Link: OpenReview
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
- Link: OpenReview
DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
- Link: OpenReview
Expertise Can Be Helpful for Reinforcement Learning-based Macro Placement
- Link: OpenReview
Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
- Link: OpenReview
ViMo: A Generative Visual GUI World Model for App Agents
- Link: OpenReview
HierLoc: Hyperbolic Entity Embeddings for Hierarchical Visual Geolocation
- Link: OpenReview
Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations
- Link: OpenReview
Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization
- Link: OpenReview
GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
- Link: OpenReview
Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems
- Link: OpenReview
ReTrace: Reinforcement Learning-Guided Reconstruction Attacks on Machine Unlearning
- Link: OpenReview
Value Matching: Scalable and Gradient-Free Reward-Guided Flow Adaptation
- Link: OpenReview
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
- Link: OpenReview
Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework
- Link: OpenReview
Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study
- Link: OpenReview
Code World Models for General Game Playing
- Link: OpenReview
Instance-Dependent Fixed-Budget Pure Exploration in Reinforcement Learning
- Link: OpenReview
Frozen Policy Iteration: Computationally Efficient RL under Linear Realizability for Deterministic Dynamics
- Link: OpenReview
Sampling Complexity of TD and PPO in RKHS
- Link: OpenReview
Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection
- Link: OpenReview
Fine-tuning Behavioral Cloning Policies with Preference‑Based Reinforcement Learning
- Link: OpenReview
Q-learning with Posterior Sampling
- Link: OpenReview
MolEditRL: Structure-Preserving Molecular Editing via Discrete Diffusion and Reinforcement Learning
- Link: OpenReview
Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with -SoftArgmax Parameterization Coupled Regularization
- Link: OpenReview
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
- Link: OpenReview
Towards Sustainable Investment Policies Informed by Opponent Shaping
- Link: OpenReview
BoreaRL: A Multi-Objective Reinforcement Learning Environment for Climate-Adaptive Boreal Forest Management
- Link: OpenReview
Offline Reinforcement Learning with Adaptive Feature Fusion
- Link: OpenReview
Improving and Accelerating Offline RL in Large Discrete Action Spaces with Structured Policy Initialization
- Link: OpenReview
Adaptive Scaling of Policy Constraints for Offline Reinforcement Learning
- Link: OpenReview
APC-RL: Exceeding data-driven behavior priors with adaptive policy composition
- Link: OpenReview
Efficient Offline Reinforcement Learning via Peer-Influenced Constraint
- Link: OpenReview
Scalable In-Context Q-Learning
- Link: OpenReview
MAGE: Multi-scale Autoregressive Generation for Offline Reinforcement Learning
- Link: OpenReview
Escaping Policy Contraction: Contraction-Aware PPO (CaPPO) for Stable Language Model Fine-Tuning
- Link: OpenReview
Use the Online Network If You Can: Towards Fast and Stable Reinforcement Learning
- Link: OpenReview
Efficient Reinforcement Learning by Guiding World Models with Non-Curated Data
- Link: OpenReview
Principled Fast and Meta Knowledge Learners for Continual Reinforcement Learning
- Link: OpenReview
FlowRL: Matching Reward Distributions for LLM Reasoning
- Link: OpenReview
BRIDGE: Bi-level Reinforcement Learning for Dynamic Group Structure in Coalition Formation Games
- Link: OpenReview
ResWorld: Temporal Residual World Model for End-to-End Autonomous Driving
- Link: OpenReview
RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
- Link: OpenReview
Stackelberg Coupling of Online Representation Learning and Reinforcement Learning
- Link: OpenReview
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
- Link: OpenReview
Sparse Imagination for Efficient Visual World Model Planning
- Link: OpenReview
Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning
- Link: OpenReview
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
- Link: OpenReview
Graph-Theoretic Intrinsic Reward: Guiding RL with Effective Resistance
- Link: OpenReview
Wavelet Predictive Representations for Non-Stationary Reinforcement Learning
- Link: OpenReview
Parameter-Efficient Reinforcement Learning using Prefix Optimization
- Link: OpenReview
Tricks or Traps? A Deep Dive into RL for LLM Reasoning
- Link: OpenReview
Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models
- Link: OpenReview
On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
- Link: OpenReview
Off-Policy Safe Reinforcement Learning with Cost-Constrained Optimistic Exploration
- Link: OpenReview
DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Tree-based Search
- Link: OpenReview
Policy Likelihood-based Query Sampling and Critic-Exploited Reset for Efficient Preference-based Reinforcement Learning
- Link: OpenReview
3D-aware Disentangled Representation for Compositional Reinforcement Learning
- Link: OpenReview
Flowing Through States: Neural ODE Regularization for Reinforcement Learning
- Link: OpenReview
Master Skill Learning with Policy-Grounded Synergy of LLM-based Reward Shaping and Exploring
- Link: OpenReview
From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning
- Link: OpenReview
MVR: Multi-view Video Reward Shaping for Reinforcement Learning
- Link: OpenReview
Mirage or Method? How Model–Task Alignment Induces Divergent RL Conclusions
- Link: OpenReview
Deep SPI: Safe Policy Improvement via World Models
- Link: OpenReview
SafeMPO: Constrained Reinforcement Learning with Probabilistic Incremental Improvement
- Link: OpenReview
SSVPO: Effective Step-Level Credit Assignment for RL Training of Language Models
- Link: OpenReview
Robustness in the Face of Partial Identifiability in Reward Learning
- Link: OpenReview
When Is Diversity Rewarded in Cooperative Multi-Agent Learning?
- Link: OpenReview
Continuous-Time Value Iteration for Multi-Agent Reinforcement Learning
- Link: OpenReview
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
- Link: OpenReview
Defending Against Unknown Corrupted Agents: Reinforcement Learning of Adversarially Robust Nash Equilibria
- Link: OpenReview
3399. SciTS: Scientific Time Series Understanding and Generation with LLMs
- Topics: LLMs & Foundation Models, Graphs & Structured Data
All Roads Lead to Likelihood: The Value of Reinforcement Learning in Fine-Tuning
- Link: OpenReview
ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents
- Link: OpenReview
EUBRL: Epistemic Uncertainty Directed Bayesian Reinforcement Learning
- Link: OpenReview
FrugalRAG: Less is More in RL Finetuning for Multi-hop Question Answering
- Link: OpenReview
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
- Link: OpenReview
R4: Nested Reasoning-Retrieval for Reward Modeling in Role-Playing Agents
- Link: OpenReview
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
- Link: OpenReview
AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints
- Link: OpenReview
Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
- Link: OpenReview
Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning
- Link: OpenReview
Scaling Goal-conditioned Reinforcement Learning with Multistep Quasimetric Distances
- Link: OpenReview
Robust Optimization for Mitigating Reward Hacking with Correlated Proxies
- Link: OpenReview
Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
- Link: OpenReview
Discrete Compositional Generation via General Soft Operators and Robust Reinforcement Learning
- Link: OpenReview
Predictive CVaR Q-learning
- Link: OpenReview
Meta-RL Induces Exploration in Language Agents
- Link: OpenReview
Kevin: Multi-Turn RL for Generating CUDA Kernels
- Link: OpenReview
mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
- Link: OpenReview
Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
- Link: OpenReview
RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards
- Link: OpenReview
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
- Link: OpenReview
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
- Link: OpenReview
Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs
- Link: OpenReview
UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- Link: OpenReview
EXPO: Stable Reinforcement Learning with Expressive Policies
- Link: OpenReview
GoT-R1: Unleashing Reasoning Capability of Autoregressive Visual Generation with Reinforcement Learning
- Link: OpenReview
MATH-Beyond: A Benchmark for RL to Expand Beyond the Base Model
- Link: OpenReview
ToolTree: Efficient LLM Tool Planning via Dual-Feedback Monte Carlo Tree Search and Bidirectional Pruning
- Link: OpenReview
HackWorld: Evaluating Computer-Use Agents on Exploiting Web Application Vulnerabilities
- Link: OpenReview
Neural Theorem Proving for Verification Conditions: A Real-World Benchmark
- Link: OpenReview
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
- Link: OpenReview
ELMUR: External Layer Memory with Update/Rewrite for Long-Horizon RL Problems
- Link: OpenReview
Potentially Optimal Joint Actions Recognition for Cooperative Multi-Agent Reinforcement Learning
- Link: OpenReview
Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
- Link: OpenReview
Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?
- Link: OpenReview
Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs
- Link: OpenReview
Astra: General Interactive World Model with Autoregressive Denoising
- Link: OpenReview
SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
- Link: OpenReview
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards
- Link: OpenReview
EgoWorld: Translating Exocentric View to Egocentric View using Rich Exocentric Observations
- Link: OpenReview
Composition of Memory Experts for Diffusion World Models
- Link: OpenReview
Consistent Noisy Latent Rewards for Trajectory Preference Optimization in Diffusion Models
- Link: OpenReview
AttriCtrl: A Generalizable Framework for Controlling Semantic Attribute Intensity in Diffusion Models
- Link: OpenReview
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
- Link: OpenReview
Verification of the Implicit World Model in a Generative Model via Adversarial Sequences
- Link: OpenReview
UniFace: A fied ine-grained Understanding and Generation Model
- Link: OpenReview
RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning
- Link: OpenReview
EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling
- Link: OpenReview
Forget Forgetting: Continual Learning in a World of Abundant Memory
- Link: OpenReview
Beyond Text-Only: Towards Multimodal Table Retrieval in Open-World
- Link: OpenReview
FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction
- Link: OpenReview
DreamCS: Geometry-Aware Text-to-3D Generation with Unpaired 3D Reward Supervision
- Link: OpenReview
Neural Predictor-Corrector: Solving Homotopy Problems with Reinforcement Learning
- Link: OpenReview
RRNCO: Towards Real-World Routing with Neural Combinatorial Optimization
- Link: OpenReview
ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
- Link: OpenReview
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
- Link: OpenReview
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
- Link: OpenReview
M-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
- Link: OpenReview
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
- Link: OpenReview
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
- Link: OpenReview
VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- Link: OpenReview
Language-guided Open-world Video Anomaly Detection under Weak Supervision
- Link: OpenReview
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
- Link: OpenReview
Reward Models Inherit Value Biases from Pretraining
- Link: OpenReview
Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR
- Link: OpenReview
Near-Optimal Sample Complexity Bounds for Constrained Average-Reward MDPs
- Link: OpenReview
Sparling: End-to-End Spatial Concept Learning via Extremely Sparse Activations
- Link: OpenReview
RIDER: 3D RNA Inverse Design with Reinforcement Learning-Guided Diffusion
- Link: OpenReview
Skill Learning via Policy Diversity Yields Identifiable Representations for Reinforcement Learning
- Link: OpenReview
Moving Beyond Medical Exams: A Clinician-Annotated Fairness Dataset of Real-World Tasks and Ambiguity in Mental Healthcare
- Link: OpenReview
Q-Learning with Fine-Grained Gap-Dependent Regret
- Link: OpenReview
Minimax Optimal Adversarial Reinforcement Learning
- Link: OpenReview
Solving General-Utility Markov Decision Processes in the Single-Trial Regime with Online Planning
- Link: OpenReview
From Curiosity to Caution: Mitigating Reward Hacking for Best-of- with Pessimism
- Link: OpenReview
Toward Conservative Planning from Human-AI Preferences in Reinforcement Learning
- Link: OpenReview
MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- Link: OpenReview
Flow Actor-Critic for Offline Reinforcement Learning
- Link: OpenReview
GAS: Enhancing Reward-Cost Balance of Generative Model-assisted Offline Safe RL
- Link: OpenReview
Cross-Embodiment Offline Reinforcement Learning for Heterogeneous Robot Datasets
- Link: OpenReview
Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning
- Link: OpenReview
Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
- Link: OpenReview
One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning
- Link: OpenReview
Polychromic Objectives for Reinforcement Learning
- Link: OpenReview
Learning to Reason as Action Abstractions with Scalable Mid-Training RL
- Link: OpenReview
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
- Link: OpenReview
Transitive RL: Value Learning via Divide and Conquer
- Link: OpenReview
Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks
- Link: OpenReview
Temporal Representations for Exploration: Learning Complex Exploratory Behavior without Extrinsic Rewards
- Link: OpenReview
RiskPO: Risk-based Policy Optimization with Verifiable Reward for LLM Post-Training
- Link: OpenReview
QuRL: Rubrics As Judge For Open-Ended Question Answering
- Link: OpenReview
Ego-Foresight: Self-supervised Learning of Agent-Aware Representations for Improved RL
- Link: OpenReview
DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
- Link: OpenReview
Multi-Bellman operator for convergence of Q-learning with linear function approximation
- Link: OpenReview
4280. On Discovering Algorithms for Adversarial Imitation Learning
- Topics: Trust & Safety, Robotics & Control
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
- Link: OpenReview
Opponent Shaping in LLM Agents
- Link: OpenReview
Safe Continuous-time Multi-Agent Reinforcement Learning via Epigraph Form
- Link: OpenReview
STAIRS-Former: Spatio-Temporal Attention with Interleaved Recursive Structure TransFormer for Offline Mulit-task Multi-agent Reinforcement Learning
- Link: OpenReview
HiPO: Self-Hint Policy Optimization for RLVR
- Link: OpenReview
Text2Grad: Reinforcement Learning from Natural Language Feedback
- Link: OpenReview
R2-Dreamer: Redundancy-Reduced World Models without Decoders or Augmentation
- Link: OpenReview
Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning
- Link: OpenReview
Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning
- Link: OpenReview
Automating the Refinement of Reinforcement Learning Specifications
- Link: OpenReview
ExoPredicator: Learning Abstract Models of Dynamic Worlds for Robot Planning
- Link: OpenReview
Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models
- Link: OpenReview
HARDTESTGEN: A High-Quality RL Verifier Generation Pipeline for LLM Algorithimic Coding
- Link: OpenReview
Learnable Fractional Superlets with a Spectro-Temporal Emotion Encoder for Speech Emotion Recognition
- Link: OpenReview
Balancing the Experts: Unlocking LoRA-MoE for GRPO via Mechanism-Aware Rewards
- Link: OpenReview
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
- Link: OpenReview
WIMLE: Uncertainty‑Aware World Models with IMLE for Sample‑Efficient Continuous Control
- Link: OpenReview
VeriRole: Verifiable Role-Awareness through Hint-Guided Reinforcement Learning
- Link: OpenReview
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
- Link: OpenReview
ASearch: Ambiguity-Aware Question Answering with Reinforcement Learning
- Link: OpenReview
WorldGym: World Model as An Environment for Policy Evaluation
- Link: OpenReview
Scaling Large Vision-Language Model RL Training via Efficient Load Balancing
- Link: OpenReview
StoryAlign: Evaluating and Training Reward Models for Story Generation
- Link: OpenReview
One Life to Learn: Inferring Symbolic World Models for Stochastic Environments from Unguided Exploration
- Link: OpenReview
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
- Link: OpenReview
Beyond Magnitude: Leveraging Direction of RLVR Updates for LLM Reasoning
- Link: OpenReview
Smarter Not Harder: Generative Process Evaluation with Intrinsic-Signal Driving and Ability‑Adaptive Reward Shaping
- Link: OpenReview
Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models
- Link: OpenReview
Learning to Reason over Continuous Tokens with Reinforcement Learning
- Link: OpenReview
Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning
- Link: OpenReview
RLP: Reinforcement as a Pretraining Objective
- Link: OpenReview
MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
- Link: OpenReview
Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution
- Link: OpenReview
Empowering LLM Tool Invocation with Tool-call Reward Model
- Link: OpenReview
R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning
- Link: OpenReview
Late-to-Early Training: LET LLMs Learn Earlier, So Faster and Better
- Link: OpenReview
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
- Link: OpenReview
Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning
- Link: OpenReview
Disco: Densely-overlapping Cell Instance Segmentation via Adjacency-aware Collaborative Coloring
- Link: OpenReview
Weak Correlations as the Underlying Principle for Linearization of Gradient-Based Learning Systems
- Link: OpenReview
What Matters for Batch Online Reinforcement Learning in Robotics?
- Link: OpenReview
OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data
- Link: OpenReview
Reinforcement Learning for Machine Learning Engineering Agents
- Link: OpenReview
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
- Link: OpenReview
Natural Language PDDL (NL-PDDL) for Open-world Goal-oriented Commonsense Regression Planning in Embodied AI
- Link: OpenReview
Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions
- Link: OpenReview
On Predictability of Reinforcement Learning Dynamics for Large Language Models
- Link: OpenReview
OPRIDE: Efficient Offline Preference-based Reinforcement Learning via In-Dataset Exploration
- Link: OpenReview
BaseReward: A Strong Baseline for Multimodal Reward Model
- Link: OpenReview
SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning
- Link: OpenReview
R-WoM: Retrieval-augmented World Model For Computer-use Agents
- Link: OpenReview
How to Lose Inherent Counterfactuality in Reinforcement Learning
- Link: OpenReview
Generalization of RLVR Using Causal Reasoning as a Testbed
- Link: OpenReview
Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling
- Link: OpenReview
RAEE: A Robust Retrieval-Augmented Early Exit Framework for Efficient Inference
- Link: OpenReview
Unified 3D Scene Understanding Through Physical World Modeling
- Link: OpenReview
TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
- Link: OpenReview
Context and Diversity Matter: The Emergence of In-Context Learning in World Models
- Link: OpenReview
Beyond the Heatmap: A Rigorous Evaluation of Component Impact in MCTS-Based TSP Solvers
- Link: OpenReview
Efficient Approximate Posterior Sampling with Annealed Langevin Monte Carlo
- Link: OpenReview
OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds
- Link: OpenReview
Incentivizing LLM Reasoning via Reinforcement Learning with Functional Monte Carlo Tree Search
- Link: OpenReview
ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction
- Link: OpenReview
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
- Link: OpenReview
Can Vision-Language Models Answer Face to Face Questions in the Real-World?
- Link: OpenReview
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
- Link: OpenReview
Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models
- Link: OpenReview
Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs
- Link: OpenReview
One step further with Monte-Carlo sampler to guide diffusion better
- Link: OpenReview
Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- Link: OpenReview
ReLaSH: Reconstructing Joint Latent Spaces for Efficient Generation of Synthetic Hypergraphs with Hyperlink Attributes
- Link: OpenReview
Learning To Draft: Adaptive Speculative Decoding with Reinforcement Learning
- Link: OpenReview
Learning to Reason in Structured In-context Environments with Reinforcement Learning
- Link: OpenReview
Why is Your Language Model a Poor Implicit Reward Model?
- Link: OpenReview
How reinforcement learning after next-token prediction facilitates learning
- Link: OpenReview
CodeSense: a Real-World Benchmark and Dataset for Code Semantic Reasoning
- Link: OpenReview
Barriers for Learning in an Evolving World: Mathematical Understanding of Loss of Plasticity
- Link: OpenReview
PETRI: Learning Unified Cell Embeddings from Unpaired Modalities via Early-Fusion Joint Reconstruction
- Link: OpenReview
SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Modeling
- Link: OpenReview
Analysis of approximate linear programming solution to Markov decision problem with log barrier function
- Link: OpenReview
Replicable Reinforcement Learning with Linear Function Approximation
- Link: OpenReview
SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation
- Link: OpenReview
Trajectory Generation with Conservative Value Guidance for Offline Reinforcement Learning
- Link: OpenReview
In-Context Compositional Q-Learning for Offline Reinforcement Learning
- Link: OpenReview
Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement Learning
- Link: OpenReview
DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving
- Link: OpenReview
MOBODY: Model-Based Off-Dynamics Offline Reinforcement Learning
- Link: OpenReview
ROSETTA: Constructing Code-Based Reward from Unconstrained Language Preference
- Link: OpenReview
On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning
- Link: OpenReview
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
- Link: OpenReview
APPLE: Toward General Active Perception via Reinforcement Learning
- Link: OpenReview
QuRL: Low-Precision Reinforcement Learning for Efficient Reasoning
- Link: OpenReview
Reinforcement Learning via Value Gradient Flow
- Link: OpenReview
A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning
- Link: OpenReview
ContextIF: Enhancing Instruction-Following through Context Reward
- Link: OpenReview
Demystifying The Mechanisms Behind Emergent Exploration in Goal-Conditioned RL
- Link: OpenReview
RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?
- Link: OpenReview
Octax: Accelerated CHIP-8 Arcade Environments for Reinforcement Learning in JAX
- Link: OpenReview
Jackpot: Align Actor-Policy Distribution for scalable and stable RL for LLM
- Link: OpenReview
Bridging the performance-gap between target-free and target-based reinforcement learning
- Link: OpenReview
GRACE: A Language Model Framework for Explainable Inverse Reinforcement Learning
- Link: OpenReview
GARLIC: Graph Attention-based Relational Learning of Multivariate Time Series in Intensive Care
- Link: OpenReview
Rethinking Policy Diversity in Ensemble Policy Gradient in Large-Scale Reinforcement Learning
- Link: OpenReview
PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity
- Link: OpenReview
ATGen: Adversarial Reinforcement Learning for Test Case Generation
- Link: OpenReview
LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision
- Link: OpenReview
KL-Regularized Reinforcement Learning for Generative Modelling is Designed to Mode Collapse
- Link: OpenReview
Count Counts: Motivating Exploration in LLM Reasoning with Count-based Intrinsic Rewards
- Link: OpenReview
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
- Link: OpenReview
Learning to Generate Unit Test via Adversarial Reinforcement Learning
- Link: OpenReview
OR-PRM: A Process Reward Model for Algorithmic Problem in Operations Research
- Link: OpenReview
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
- Link: OpenReview
Critique-RL: Training Language Models For Critiquing Through Two-Stage Reinforcement Learning
- Link: OpenReview
Code Aesthetics with Agentic Reward Feedback
- Link: OpenReview
Object-Centric World Models from Few-Shot Annotations for Sample-Efficient Reinforcement Learning
- Link: OpenReview
Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling
- Link: OpenReview
RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
- Link: OpenReview
AlphaAgentEvo: Evolution-Oriented Alpha Mining via Self-Evolving Agentic Reinforcement Learning
- Link: OpenReview
TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning
- Link: OpenReview
StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models
- Link: OpenReview
SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
- Link: OpenReview
Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment
- Link: OpenReview
WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning
- Link: OpenReview
LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection
- Link: OpenReview
Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models
- Link: OpenReview
Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
- Link: OpenReview
AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
- Link: OpenReview
Model-based Offline RL via Robust Value-Aware Model Learning with Implicitly Differentiable Adaptive Weighting
- Link: OpenReview
A High Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation
- Link: OpenReview
Interleaving Reasoning for Better Text-to-Image Generation
- Link: OpenReview
From f(x) and g(x) to f(g(x)): LLMs Learn New Skills in RL by Composing Old Ones
- Link: OpenReview
Tree Search for LLM Agent Reinforcement Learning
- Link: OpenReview
Fresh in memory: Training-order recency is linearly encoded in language model activations
- Link: OpenReview
VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution
- Link: OpenReview
Learning to Reason without External Rewards
- Link: OpenReview
Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning
- Link: OpenReview
RL's Razor: Why Online Reinforcement Learning Forgets Less
- Link: OpenReview
Dual-Objective Reinforcement Learning with Novel Hamilton-Jacobi-Bellman Formulations
- Link: OpenReview