R
Published on

ICLR 2026 — Reinforcement Learning

Reinforcement Learning

657 papers (0 oral)

Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling

Mastering Sparse CUDA Generation through Pretrained Models and Deep Reinforcement Learning

Reducing Belief Deviation in Reinforcement Learning for Active Reasoning of LLM Agents

MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent

GLASS Flows: Efficient Inference for Reward Alignment of Flow and Diffusion Models

Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment

LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

Is it Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort

P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling

LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts

AgentGym-RL: An Open-Source Framework to Train LLM Agents for Long-Horizon Decision Making via Multi-Turn RL

Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences

GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

World-In-World: World Models in a Closed-Loop World

Latent Particle World Models: Self-supervised Object-centric Stochastic Dynamics Modeling

EditBench: Evaluating LLM Abilities to Perform Real-World Instructed Code Edits

Exploratory Diffusion Model for Unsupervised Reinforcement Learning

Uncover Underlying Correspondence for Robust Multi-view Clustering

TROLL: Trust Regions Improve Reinforcement Learning for Large Language Models

FlashWorld: High-quality 3D Scene Generation within Seconds

The Art of Scaling Reinforcement Learning Compute for LLMs

From movement to cognitive maps: recurrent neural networks reveal how locomotor development shapes hippocampal spatial coding

PhyWorldBenchPhyWorldBench: A Comprehensive Evaluation of Physical Realism in Text-to-Video Models

RealPDEBench: A Benchmark for Complex Physical Systems with Real-World Data

TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning

CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale

Triple-BERT: Do We Really Need MARL for Order Dispatch on Ride-Sharing Platforms?

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

6. Enhancing Sparse Event Detection in Healthcare Time-Series via Adaptive Gate of Context–Detail Interaction

  • Topics: Medical & Healthcare

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks

LearnIR: Learnable Posterior Sampling for Real-World Image Restoration

ChronoEdit: Towards Temporal Reasoning for In-Context Image Editing and World Simulation

DAMR: Efficient and Adaptive Context-Aware Knowledge Graph Question Answering with LLM-Guided MCTS

SysMoBench: Evaluating AI on Formally Specifying Complex Real-World Systems

STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning

GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning

MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning

Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs

FrontierCO: Real-World and Large-Scale Evaluation of Machine Learning Solvers for Combinatorial Optimization

Towards Dynamic Interleaving Optimizers

TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning

Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning

Spotlight on Token Perception for Multimodal Reinforcement Learning

Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World

LLM-Guided Evolutionary Program Synthesis for Quasi-Monte Carlo Design

VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning

Revisual-R1: Advancing Multimodal Reasoning From Optimized Cold Start to Staged Reinforcement Learning

VisualPRM400K: An Effective Dataset for Training Multimodal Process Reward Models

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

DVLA-RL: Dual-Level Vision–Language Alignment with Reinforcement Learning Gating for Few-Shot Learning

Doctor-R1: Mastering Clinical Inquiry with Experiential Agentic Reinforcement Learning

Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead

General Exploratory Bonus for Optimistic Exploration in RLHF

Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding

PonderLM: Pretraining Language Models to Ponder in Continuous Space

ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping

VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models

DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization

Mapping Overlaps in Benchmarks through Perplexity in the Wild

Parallel-R1: Towards Parallel Thinking via Reinforcement Learning

Early Signs of Steganographic Capabilities in Frontier LLMs

ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models

Algorithmic Guarantees for Distilling Supervised and Offline RL Datasets

Automata Learning and Identification of the Support of Language Models

Neural+Symbolic Approaches for Interpretable Actor-Critic Reinforcement Learning

Single Index Bandits: Generalized Linear Contextual Bandits with Unknown Reward Functions

Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

Tackling Heavy-Tailed Q-Value Bias in Offline-to-Online Reinforcement Learning with Laplace-Robust Modeling

Scalable Offline Model-Based RL with Action Chunks

Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models

Reevaluating Policy Gradient Methods for Imperfect-Information Games

XQC: Well-conditioned Optimization Accelerates Deep Reinforcement Learning

Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism

Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning

Spectral Bellman Method: Unifying Representation and Exploration in RL

No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping

NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context

One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning

Self-Improving Skill Learning for Robust Skill-based Meta-Reinforcement Learning

Strict Subgoal Execution: Reliable Long-Horizon Planning in Hierarchical Reinforcement Learning

Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains

Does “Do Differentiable Simulators Give Better Policy Gradients?” Give Better Policy Gradients?

Unlocking Long-Horizon Agentic Search with Large-Scale End-to-End RL

Learning Massively Multitask World Models for Continuous Control

GRL-SNAM: Geometric Reinforcement Learning with Differential Hamiltonians for Navigation and Mapping in Unknown Environments

Emergent Dexterity Via Diverse Resets and Large-Scale Reinforcement Learning

Self-Aligned Reward: Towards Effective and Efficient Reasoners

Understanding and Improving Hyperbolic Deep Reinforcement Learning

Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning

Goal Reaching with Eikonal-Constrained Hierarchical Quasimetric Reinforcement Learning

RM-R1: Reward Modeling as Reasoning

Interleave-VLA: Enhancing Robot Manipulation with Image-Text Interleaved Instructions

Directed Exploration in Reinforcement Learning from Linear Temporal Logic

616. ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

  • Topics: Optimization & Training Methods, Trust & Safety, Efficiency & Compression

Virtual Community: An Open World for Humans, Robots, and Society

Who Matters Matters: Agent-Specific Conservative Offline MARL

Learning to summarize user information for personalized reinforcement learning from human feedback

Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models

From Observations to Events: Event-Aware World Models for Reinforcement Learning

Efficient Best-of-Both-Worlds Algorithms for Contextual Combinatorial Semi-Bandits

REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning

Beyond Distributions: Geometric Action Control for Continuous Reinforcement Learning

Solving Parameter-Robust Avoid Problems with Unknown Feasibility using Reinforcement Learning

WebArbiter: A Generative Reasoning Process Reward Model for Web Agents

On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting

Asynchronous Policy Gradient Aggregation for Efficient Distributed Reinforcement Learning

ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement Learning

Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards

On the Computational Limits of AI4S-RL : A Unified ε\varepsilon-NN Analysis

TSM-Bench: Detecting LLM-Generated Text in Real-World Wikipedia Editing Practices

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

OPPO: Accelerating PPO-based RLHF via Pipeline Overlap

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training

Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling

NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning

PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation

Speech World Model: Causal State–Action Planning with Explicit Reasoning for Speech

Beyond Pass@ 1: Self-Play with Variational Problem Synthesis Sustains RLVR

SELF-HARMONY: LEARNING TO HARMONIZE SELF-SUPERVISION AND SELF-PLAY IN TEST-TIME REINFORCEMENT LEARNING

PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning

HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation

SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning

Leveraging Explanation to Improve Generalization of Meta Reinforcement Learning

Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models

Emergence of Spatial Representation in an Actor-Critic Agent with Hippocampus-Inspired Sequence Generator

Hippoformer: Integrating Hippocampus-inspired Spatial Memory with Transformers

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary

WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning

Mixture-of-World Models: Scaling Multi-Task Reinforcement Learning with Modular Latent Dynamics

DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment

Unraveling the Complexity of Memory in RL Agents: an Approach for Classification and Evaluation

Joint Selection for Large-Scale Pre-Training Data via Policy Gradient-based Mask Learning

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

World2Minecraft: Occupancy-Driven Simulated Scenes Construction

Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning

RD-HRL: Generating Reliable Sub-Goals for Long-Horizon Sparse-Reward Tasks

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

Overlap-Adaptive Regularization for Conditional Average Treatment Effect Estimation

Learning Nonlinear Causal Reductions to Explain Reinforcement Learning Policies

CTRL&SHIFT: High-quality Geometry-Aware Object Manipulation in Visual Generation

RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents

Supporting Multimodal Intermediate Fusion with Informatic Constraint and Distribution Coherence

MicroVerse: A Preliminary Exploration Toward a Micro-World Simulation

LightCtrl: Training-free Controllable Video Relighting

Supporting High-Stakes Decision Making Through Interactive Preference Elicitation in the Latent Space

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis

SpaCE-Eval: A Benchmark for Real-World Multi-Modal Reasoning

SPIKE-RL: Video-LLMs meet Bayesian Surprise

Refining Hybrid Genetic Search for CVRP via Reinforcement Learning-Finetuned LLM

CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

CARL: Camera-Agnostic Representation Learning for Spectral Image Analysis

Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations

Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective

Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning

Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences

Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty

Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

GenCtrl -- A Formal Controllability Toolkit for Generative Models

PRISM: Progressive Robust Learning for Open-World Continual Category Discovery

Nearly-Optimal Bandit Learning in Stackelberg Games with Side Information

Learning Correlated Reward Models: Statistical Barriers and Opportunities

A Near-Optimal Best-of-Both-Worlds Algorithm for Federated Bandits

Iterative Distillation for Reward-Guided Fine-Tuning of Diffusion Models in Biomolecular Design

Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective

The Sample Complexity of Online Reinforcement Learning: A Multi-model Perspective

Flow Matching Policy Gradients

CARL: Preserving Causal Structure in Representation Learning

Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments

Language Agents for Hypothesis-driven Clinical Decision Making with Reinforcement Learning

Preference-based Policy Optimization from Sparse-reward Offline Dataset

Q-Learning with Adjoint Matching

Robust Reward Modeling via Causal Rubrics

Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning

Sample Efficient Offline RL via T-Symmetry Enforced Latent State-Stitching

Peak-Return Greedy Slicing: Subtrajectory Selection for Transformer-based Offline RL

Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization

ProRe: A Proactive Reward System for GUI Agents via Reasoner–Actor Collaboration

Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning

MARL2Grid-TR: A Multi-Agent RL Benchmark in Power Grid Operations

GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning

Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation

Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs

Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion

Re2\textbf{Re}^{2}: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving

Entropy-preserving reinforcement learning

Iterated Q-Network: Beyond One-Step Bellman Updates in Deep Reinforcement Learning

1527. D-REX: Differentiable Real-to-Sim-to-Real Engine for Learning Dexterous Grasping

  • Topics: Other / Unclassified

Sample-Efficient Distributionally Robust Multi-Agent Reinforcement Learning via Online Interaction

Optimas: Optimizing Compound AI Systems with Globally Aligned Local Rewards

Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward

Getting Your LLMs Ready for Reinforcement Learning with Lightweight SFT

LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities

J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning

PAMDP: Interact to Persona Alignment via a Partially Observable Markov Decision Process

PEAR: Phase Entropy Aware Reward for Efficient Reasoning

Helix: Evolutionary Reinforcement Learning for Open-Ended Scientific Problem Solving

RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems

Dual-Robust Cross-Domain Offline Reinforcement Learning Against Dynamics Shifts

Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback

Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions

Process-Verified Reinforcement Learning for Theorem Proving via Lean

Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs

Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels

Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning

PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts

Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions

CaRe-BN: Precise Moving Statistics for Stabilizing Spiking Neural Networks in Reinforcement Learning

Agnostics: Learning to Synthesize Code in Any Programming Language with a Universal Reinforcement Learning Environment

Virne: A Comprehensive Benchmark for RL-based Network Resource Allocation in NFV

Reasoning in Space via Grounding in the World

Ctrl-World: A Controllable Generative World Model for Robot Manipulation

Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards

PROS: Towards Compute-Efficient RLVR via Rollout Prefix Reuse

Learn to Reason Efficiently with Adaptive Length-based Reward Shaping

GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks

Hierarchical Value-Decomposed Offline Reinforcement Learning for Whole-Body Control

NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation

HippoTune: A Hippocampal Associative Loop–Inspired Fine-Tuning Method for Continual Learning

WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving

Unifying Stable Optimization and Reference Regularization in RLHF

R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning

Distributionally Robust Cooperative Multi-agent Reinforcement Learning with Value Factorization

Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning

Designing Time Series Experiments in A/B Testing with Transformer Reinforcement Learning

An Orthogonal Learner for Individualized Outcomes in Markov Decision Processes

Overlap-weighted orthogonal meta-learner for treatment effect estimation over time

WorldTree: Towards 4D Dynamic Worlds from Monocular Video using Tree-Chains

OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents

TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

LLMs as Rules Oracles: Exploring Real-World Multimodal Reasoning in Tabletop Strategy Game Environments

RLAP-CLIP: Continual Multimodal Learning with Prototype Adaptation and Difficulty-Aware Routing

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

RL makes MLLMs see better than SFT

SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward

WOW-Seg: A Word-free Open World Segmentation Model

EAST: Early Action Prediction Sampling Strategy with Token Masking

Learning Heterogeneous Degradation Representation for Real-World Super-Resolution

Learning to Reason Efficiently with Discounted Reinforcement Learning

Sample Reward Soups: Query-efficient Multi-Reward Guidance for Text-to-Image Diffusion Models

Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function

Learning Ordinal Probabilistic Reward from Preferences

OpenAgentSafety: A Comprehensive Framework For Evaluating Real-World AI Agent Safety

Robust Deep Reinforcement Learning against Adversarial Behavior Manipulation

Beyond Spectra: Eigenvector Overlaps in Loss Geometry

Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining

LaSeR: Reinforcement Learning with Last-Token Self-Rewarding

VCWorld: A Biological World Model for Virtual Cell Simulation

DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning

Less Is More: Clustered Cross-Covariance Control for Offline RL

DR-SAC: Distributionally Robust Soft Actor-Critic for Reinforcement Learning under Uncertainty

ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation

Action-Free Offline-To-Online RL via Discretised State Policies

Peng's Q(λ\lambda) for Conservative Value Estimation in Offline Reinforcement Learning

QeRL: Beyond Efficiency - Quantization-enhanced Reinforcement Learning for LLMs

Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach

ReTool: Reinforcement Learning for Strategic Tool Use in LLMs

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL

Pretrain Value, Not Reward: Decoupled Value Policy Optimization

Reward Model Routing in Alignment

A Primer on SO(3) Action Representations in Deep Reinforcement Learning

From Ticks to Flows: Dynamics of Neural Reinforcement Learning in Continuous Environments

The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning

Vid2World: Crafting Video Diffusion Models to Interactive World Models

MIRACLE: Model-free Imitation and Reinforcement Learning for Adaptive Cut-Selection

CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards

BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised Reinforcement Learning

Retaining Suboptimal Actions to Follow Shifting Optima in Multi-Agent Reinforcement Learning

SocialJax: An Evaluation Suite for Multi-agent Reinforcement Learning in Sequential Social Dilemmas

DEAS: DEtached value learning with Action Sequence for Scalable Offline RL

Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning

Bayesian Robust Cooperative Multi-Agent Reinforcement Learning Against Unknown Adversaries

RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning

AgentPO: Enhancing Multi-Agent Collaboration via Reinforcement Learning

Sample-efficient and Scalable Exploration in Continuous-Time RL

RFS: Reinforcement learning with Residual flow steering for dexterous manipulation

VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications

Learning to Be Uncertain: Pre-training World Models with Horizon-Calibrated Uncertainty

MIRA: Memory-Integrated Reinforcement Learning Agent with Limited LLM Guidance

Towards Robust Real-World Multivariate Time Series Forecasting: A Unified Framework for Dependency, Asynchrony, and Missingness

Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions

Agentic Reinforcement Learning with Implicit Step Rewards

SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning

RewardBench 2: Advancing Reward Model Evaluation

How Far Can Unsupervised RLVR Scale LLM Training?

AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy

Risk-Sensitive Reinforcement Learning for Alleviating Exploration Dilemmas in Large Language Models

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents

Causally Robust Reward Learning from Reason-Augmented Preference Feedback

RL for Reasoning by Adaptively Revealing Rationales

ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning

Measuring and Mitigating Rapport Bias of Large Language Models under Multi-Agent Social Interactions

WMPO: World Model-based Policy Optimization for Vision-Language-Action Models

TIPS: Turn-level Information-Potential Reward Shaping for Search-Augmented LLMs

Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs

SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models

Knowing When to Quit: Probabilistic Early Exits for Speech Separation Networks

Dynamic Early Exit in Reasoning Models

GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning

RESTRAIN: From Spurious Votes to Signals — Self-Training RL with Self-Penalization

Building spatial world models from sparse transitional episodic memories

On Entropy Control in LLM-RL Algorithms

Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment

CellDuality: Unlocking Biological Reasoning in LLMs with Self-Supervised RLVR

LLMs Struggle to Balance Reasoning and World Knowledge in Causal Narrative Understanding

SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models

Dual-Scale World Memory for LLM Agents towards Hard-Exploration Problems

Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing

Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction

floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL

Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning

Sharp asymptotic theory for Q-learning with LD2Z\texttt{LD2Z} learning rate and its generalization

DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains

Empowering Multi-Robot Cooperation via Sequential World Models

WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark

Hybrid Reinforcement: when reward is sparse, better to be dense

ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask

Generative Blocks World: Moving Things Around in Pictures

Multiverse Mechanica: A Testbed for Learning Game Mechanics via Counterfactual Worlds

Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts

Direct Reward Fine-Tuning on Poses for Single Image to 3D Human in the Wild

OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling

DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

Expertise Can Be Helpful for Reinforcement Learning-based Macro Placement

Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning

ViMo: A Generative Visual GUI World Model for App Agents

HierLoc: Hyperbolic Entity Embeddings for Hierarchical Visual Geolocation

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization

GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning

Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems

ReTrace: Reinforcement Learning-Guided Reconstruction Attacks on Machine Unlearning

Value Matching: Scalable and Gradient-Free Reward-Guided Flow Adaptation

Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models

Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework

Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study

Code World Models for General Game Playing

Instance-Dependent Fixed-Budget Pure Exploration in Reinforcement Learning

Frozen Policy Iteration: Computationally Efficient RL under Linear QπQ^{\pi} Realizability for Deterministic Dynamics

Sampling Complexity of TD and PPO in RKHS

Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection

Fine-tuning Behavioral Cloning Policies with Preference‑Based Reinforcement Learning

Q-learning with Posterior Sampling

MolEditRL: Structure-Preserving Molecular Editing via Discrete Diffusion and Reinforcement Learning

Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with f\boldsymbol{f}-SoftArgmax Parameterization &\& Coupled Regularization

Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs

Towards Sustainable Investment Policies Informed by Opponent Shaping

BoreaRL: A Multi-Objective Reinforcement Learning Environment for Climate-Adaptive Boreal Forest Management

Offline Reinforcement Learning with Adaptive Feature Fusion

Improving and Accelerating Offline RL in Large Discrete Action Spaces with Structured Policy Initialization

Adaptive Scaling of Policy Constraints for Offline Reinforcement Learning

APC-RL: Exceeding data-driven behavior priors with adaptive policy composition

Efficient Offline Reinforcement Learning via Peer-Influenced Constraint

Scalable In-Context Q-Learning

MAGE: Multi-scale Autoregressive Generation for Offline Reinforcement Learning

Escaping Policy Contraction: Contraction-Aware PPO (CaPPO) for Stable Language Model Fine-Tuning

Use the Online Network If You Can: Towards Fast and Stable Reinforcement Learning

Efficient Reinforcement Learning by Guiding World Models with Non-Curated Data

Principled Fast and Meta Knowledge Learners for Continual Reinforcement Learning

FlowRL: Matching Reward Distributions for LLM Reasoning

BRIDGE: Bi-level Reinforcement Learning for Dynamic Group Structure in Coalition Formation Games

ResWorld: Temporal Residual World Model for End-to-End Autonomous Driving

RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks

Stackelberg Coupling of Online Representation Learning and Reinforcement Learning

Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards

Sparse Imagination for Efficient Visual World Model Planning

Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning

Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning

Graph-Theoretic Intrinsic Reward: Guiding RL with Effective Resistance

Wavelet Predictive Representations for Non-Stationary Reinforcement Learning

Parameter-Efficient Reinforcement Learning using Prefix Optimization

Tricks or Traps? A Deep Dive into RL for LLM Reasoning

Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models

On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

Off-Policy Safe Reinforcement Learning with Cost-Constrained Optimistic Exploration

Policy Likelihood-based Query Sampling and Critic-Exploited Reset for Efficient Preference-based Reinforcement Learning

3D-aware Disentangled Representation for Compositional Reinforcement Learning

Flowing Through States: Neural ODE Regularization for Reinforcement Learning

Master Skill Learning with Policy-Grounded Synergy of LLM-based Reward Shaping and Exploring

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

MVR: Multi-view Video Reward Shaping for Reinforcement Learning

Mirage or Method? How Model–Task Alignment Induces Divergent RL Conclusions

Deep SPI: Safe Policy Improvement via World Models

SafeMPO: Constrained Reinforcement Learning with Probabilistic Incremental Improvement

SSVPO: Effective Step-Level Credit Assignment for RL Training of Language Models

Robustness in the Face of Partial Identifiability in Reward Learning

When Is Diversity Rewarded in Cooperative Multi-Agent Learning?

Continuous-Time Value Iteration for Multi-Agent Reinforcement Learning

GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving

Defending Against Unknown Corrupted Agents: Reinforcement Learning of Adversarially Robust Nash Equilibria

3399. SciTS: Scientific Time Series Understanding and Generation with LLMs

  • Topics: LLMs & Foundation Models, Graphs & Structured Data

All Roads Lead to Likelihood: The Value of Reinforcement Learning in Fine-Tuning

ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents

EUBRL: Epistemic Uncertainty Directed Bayesian Reinforcement Learning

FrugalRAG: Less is More in RL Finetuning for Multi-hop Question Answering

MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents

R4: Nested Reasoning-Retrieval for Reward Modeling in Role-Playing Agents

WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection

AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints

Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs

Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning

Scaling Goal-conditioned Reinforcement Learning with Multistep Quasimetric Distances

Robust Optimization for Mitigating Reward Hacking with Correlated Proxies

Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning

Discrete Compositional Generation via General Soft Operators and Robust Reinforcement Learning

Predictive CVaR Q-learning

Meta-RL Induces Exploration in Language Agents

Kevin: Multi-Turn RL for Generating CUDA Kernels

mR3: Multilingual Rubric-Agnostic Reward Reasoning Models

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards

Reward Is Enough: LLMs Are In-Context Reinforcement Learners

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning

Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs

UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking

EXPO: Stable Reinforcement Learning with Expressive Policies

GoT-R1: Unleashing Reasoning Capability of Autoregressive Visual Generation with Reinforcement Learning

MATH-Beyond: A Benchmark for RL to Expand Beyond the Base Model

ToolTree: Efficient LLM Tool Planning via Dual-Feedback Monte Carlo Tree Search and Bidirectional Pruning

HackWorld: Evaluating Computer-Use Agents on Exploiting Web Application Vulnerabilities

Neural Theorem Proving for Verification Conditions: A Real-World Benchmark

Scheduling Your LLM Reinforcement Learning with Reasoning Trees

ELMUR: External Layer Memory with Update/Rewrite for Long-Horizon RL Problems

Potentially Optimal Joint Actions Recognition for Cooperative Multi-Agent Reinforcement Learning

Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning

Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?

Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs

Astra: General Interactive World Model with Autoregressive Denoising

SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning

Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards

EgoWorld: Translating Exocentric View to Egocentric View using Rich Exocentric Observations

Composition of Memory Experts for Diffusion World Models

Consistent Noisy Latent Rewards for Trajectory Preference Optimization in Diffusion Models

AttriCtrl: A Generalizable Framework for Controlling Semantic Attribute Intensity in Diffusion Models

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

Verification of the Implicit World Model in a Generative Model via Adversarial Sequences

UniF2^2ace: A Uni‾\underline{Uni}fied F‾\underline{F}ine-grained Face‾\underline{Face} Understanding and Generation Model

RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning

EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling

Forget Forgetting: Continual Learning in a World of Abundant Memory

Beyond Text-Only: Towards Multimodal Table Retrieval in Open-World

FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction

DreamCS: Geometry-Aware Text-to-3D Generation with Unpaired 3D Reward Supervision

Neural Predictor-Corrector: Solving Homotopy Problems with Reinforcement Learning

RRNCO: Towards Real-World Routing with Neural Combinatorial Optimization

ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

M2^2-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining

LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

Language-guided Open-world Video Anomaly Detection under Weak Supervision

Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark

Reward Models Inherit Value Biases from Pretraining

Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR

Near-Optimal Sample Complexity Bounds for Constrained Average-Reward MDPs

Sparling: End-to-End Spatial Concept Learning via Extremely Sparse Activations

RIDER: 3D RNA Inverse Design with Reinforcement Learning-Guided Diffusion

Skill Learning via Policy Diversity Yields Identifiable Representations for Reinforcement Learning

Moving Beyond Medical Exams: A Clinician-Annotated Fairness Dataset of Real-World Tasks and Ambiguity in Mental Healthcare

Q-Learning with Fine-Grained Gap-Dependent Regret

Minimax Optimal Adversarial Reinforcement Learning

Solving General-Utility Markov Decision Processes in the Single-Trial Regime with Online Planning

From Curiosity to Caution: Mitigating Reward Hacking for Best-of-NN with Pessimism

Toward Conservative Planning from Human-AI Preferences in Reinforcement Learning

MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning

Flow Actor-Critic for Offline Reinforcement Learning

GAS: Enhancing Reward-Cost Balance of Generative Model-assisted Offline Safe RL

Cross-Embodiment Offline Reinforcement Learning for Heterogeneous Robot Datasets

Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning

One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning

Polychromic Objectives for Reinforcement Learning

Learning to Reason as Action Abstractions with Scalable Mid-Training RL

From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation

Transitive RL: Value Learning via Divide and Conquer

Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks

Temporal Representations for Exploration: Learning Complex Exploratory Behavior without Extrinsic Rewards

RiskPO: Risk-based Policy Optimization with Verifiable Reward for LLM Post-Training

QuRL: Rubrics As Judge For Open-Ended Question Answering

Ego-Foresight: Self-supervised Learning of Agent-Aware Representations for Improved RL

DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving

Multi-Bellman operator for convergence of Q-learning with linear function approximation

4280. On Discovering Algorithms for Adversarial Imitation Learning

  • Topics: Trust & Safety, Robotics & Control

Self-Improving Vision-Language-Action Models with Data Generation via Residual RL

Opponent Shaping in LLM Agents

Safe Continuous-time Multi-Agent Reinforcement Learning via Epigraph Form

STAIRS-Former: Spatio-Temporal Attention with Interleaved Recursive Structure TransFormer for Offline Mulit-task Multi-agent Reinforcement Learning

HiPO: Self-Hint Policy Optimization for RLVR

Text2Grad: Reinforcement Learning from Natural Language Feedback

R2-Dreamer: Redundancy-Reduced World Models without Decoders or Augmentation

Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning

Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning

Automating the Refinement of Reinforcement Learning Specifications

ExoPredicator: Learning Abstract Models of Dynamic Worlds for Robot Planning

Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models

HARDTESTGEN: A High-Quality RL Verifier Generation Pipeline for LLM Algorithimic Coding

Learnable Fractional Superlets with a Spectro-Temporal Emotion Encoder for Speech Emotion Recognition

Balancing the Experts: Unlocking LoRA-MoE for GRPO via Mechanism-Aware Rewards

Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

WIMLE: Uncertainty‑Aware World Models with IMLE for Sample‑Efficient Continuous Control

VeriRole: Verifiable Role-Awareness through Hint-Guided Reinforcement Learning

BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping

A2^2Search: Ambiguity-Aware Question Answering with Reinforcement Learning

WorldGym: World Model as An Environment for Policy Evaluation

Scaling Large Vision-Language Model RL Training via Efficient Load Balancing

StoryAlign: Evaluating and Training Reward Models for Story Generation

One Life to Learn: Inferring Symbolic World Models for Stochastic Environments from Unguided Exploration

RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents

Beyond Magnitude: Leveraging Direction of RLVR Updates for LLM Reasoning

Smarter Not Harder: Generative Process Evaluation with Intrinsic-Signal Driving and Ability‑Adaptive Reward Shaping

Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models

Learning to Reason over Continuous Tokens with Reinforcement Learning

Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning

RLP: Reinforcement as a Pretraining Objective

MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers

Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution

Empowering LLM Tool Invocation with Tool-call Reward Model

R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning

Late-to-Early Training: LET LLMs Learn Earlier, So Faster and Better

Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models

Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning

Disco: Densely-overlapping Cell Instance Segmentation via Adjacency-aware Collaborative Coloring

Weak Correlations as the Underlying Principle for Linearization of Gradient-Based Learning Systems

What Matters for Batch Online Reinforcement Learning in Robotics?

OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data

Reinforcement Learning for Machine Learning Engineering Agents

ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning

Natural Language PDDL (NL-PDDL) for Open-world Goal-oriented Commonsense Regression Planning in Embodied AI

Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions

On Predictability of Reinforcement Learning Dynamics for Large Language Models

OPRIDE: Efficient Offline Preference-based Reinforcement Learning via In-Dataset Exploration

BaseReward: A Strong Baseline for Multimodal Reward Model

SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning

R-WoM: Retrieval-augmented World Model For Computer-use Agents

How to Lose Inherent Counterfactuality in Reinforcement Learning

Generalization of RLVR Using Causal Reasoning as a Testbed

Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling

RAEE: A Robust Retrieval-Augmented Early Exit Framework for Efficient Inference

Unified 3D Scene Understanding Through Physical World Modeling

TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models

Context and Diversity Matter: The Emergence of In-Context Learning in World Models

Beyond the Heatmap: A Rigorous Evaluation of Component Impact in MCTS-Based TSP Solvers

Efficient Approximate Posterior Sampling with Annealed Langevin Monte Carlo

OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds

ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction

VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models

Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs

One step further with Monte-Carlo sampler to guide diffusion better

Training-Free Reward-Guided Image Editing via Trajectory Optimal Control

Learning To Draft: Adaptive Speculative Decoding with Reinforcement Learning

Learning to Reason in Structured In-context Environments with Reinforcement Learning

Why is Your Language Model a Poor Implicit Reward Model?

How reinforcement learning after next-token prediction facilitates learning

CodeSense: a Real-World Benchmark and Dataset for Code Semantic Reasoning

Barriers for Learning in an Evolving World: Mathematical Understanding of Loss of Plasticity

PETRI: Learning Unified Cell Embeddings from Unpaired Modalities via Early-Fusion Joint Reconstruction

SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Modeling

Analysis of approximate linear programming solution to Markov decision problem with log barrier function

Replicable Reinforcement Learning with Linear Function Approximation

SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

Trajectory Generation with Conservative Value Guidance for Offline Reinforcement Learning

In-Context Compositional Q-Learning for Offline Reinforcement Learning

Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement Learning

DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving

MOBODY: Model-Based Off-Dynamics Offline Reinforcement Learning

ROSETTA: Constructing Code-Based Reward from Unconstrained Language Preference

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning

APPLE: Toward General Active Perception via Reinforcement Learning

QuRL: Low-Precision Reinforcement Learning for Efficient Reasoning

Reinforcement Learning via Value Gradient Flow

A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning

ContextIF: Enhancing Instruction-Following through Context Reward

Demystifying The Mechanisms Behind Emergent Exploration in Goal-Conditioned RL

RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?

Octax: Accelerated CHIP-8 Arcade Environments for Reinforcement Learning in JAX

Jackpot: Align Actor-Policy Distribution for scalable and stable RL for LLM

Bridging the performance-gap between target-free and target-based reinforcement learning

GRACE: A Language Model Framework for Explainable Inverse Reinforcement Learning

GARLIC: Graph Attention-based Relational Learning of Multivariate Time Series in Intensive Care

Rethinking Policy Diversity in Ensemble Policy Gradient in Large-Scale Reinforcement Learning

PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity

ATGen: Adversarial Reinforcement Learning for Test Case Generation

LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision

KL-Regularized Reinforcement Learning for Generative Modelling is Designed to Mode Collapse

Count Counts: Motivating Exploration in LLM Reasoning with Count-based Intrinsic Rewards

Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs

Learning to Generate Unit Test via Adversarial Reinforcement Learning

OR-PRM: A Process Reward Model for Algorithmic Problem in Operations Research

Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning

Critique-RL: Training Language Models For Critiquing Through Two-Stage Reinforcement Learning

Code Aesthetics with Agentic Reward Feedback

Object-Centric World Models from Few-Shot Annotations for Sample-Efficient Reinforcement Learning

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

AlphaAgentEvo: Evolution-Oriented Alpha Mining via Self-Evolving Agentic Reinforcement Learning

TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning

StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models

SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models

Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment

WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models

Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance

AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning

Model-based Offline RL via Robust Value-Aware Model Learning with Implicitly Differentiable Adaptive Weighting

A High Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation

Interleaving Reasoning for Better Text-to-Image Generation

From f(x) and g(x) to f(g(x)): LLMs Learn New Skills in RL by Composing Old Ones

Tree Search for LLM Agent Reinforcement Learning

Fresh in memory: Training-order recency is linearly encoded in language model activations

VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution

Learning to Reason without External Rewards

Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning

RL's Razor: Why Online Reinforcement Learning Forgets Less

Dual-Objective Reinforcement Learning with Novel Hamilton-Jacobi-Bellman Formulations