R
Published on

ICLR 2026 — Optimization & Training Methods

Optimization & Training Methods

406 papers (0 oral)

Non-Convex Federated Optimization under Cost-Aware Client Selection

Fast Escape, Slow Convergence: Learning Dynamics of Phase Retrieval under Power-Law Data

Token-Importance Guided Direct Preference Optimization

On the Generalization Capacities of MLLMs for Spatial Intelligence

Quantitative Bounds for Length Generalization in Transformers

In-the-Flow Agentic System Optimization for Effective Planning and Tool Use

Efficient Resource-Constrained Training of Transformers via Subspace Optimization

FRABench and UFEval: Unified Fine-grained Evaluation with Task and Aspect Generalization

Pareto-Conditioned Diffusion Models for Offline Multi-Objective Optimization

Semi-Supervised Preference Optimization with Limited Feedback

Multiplayer Nash Preference Optimization

Global Resolution: Optimal Multi-Draft Speculative Sampling via Convex Optimization

DTO-KD: Dynamic Trade-off Optimization for Effective Knowledge Distillation

To Infinity and Beyond: Tool-Use Unlocks Length Generalization in State Space Models

SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety

Task-free Adaptive Meta Black-box Optimization

Discount Model Search for Quality Diversity Optimization in High-Dimensional Measure Spaces

Fast training of accurate physics-informed neural networks without gradient descent

Block-Sample MAC-Bayes Generalization Bounds

2. Enhancing Communication Compression via Discrepancy-aware Calibration for Federated Learning

  • Topics: Efficiency & Compression

Ads that Stick: Near-Optimal Ad Optimization through Psychological Behavior Models

18. Multimodal Aligned Semantic Knowledge for Unpaired Image-text Matching

  • Topics: Computer Vision, Multi-modal & Vision-Language

GRACE: Generative Representation Learning via Contrastive Policy Optimization

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

Analyzing the Training Dynamics of Image Restoration Transformers: A Revisit to Layer Normalization

Scalable Random Wavelet Features: Efficient Non-Stationary Kernel Approximation with Convergence Guarantees

Soft Quality-Diversity Optimization

Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization

SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback

Large Language Model Compression with Global Rank and Sparsity Optimization

Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs

FrontierCO: Real-World and Large-Scale Evaluation of Machine Learning Solvers for Combinatorial Optimization

Native Adaptive Solution Expansion for Diffusion-based Combinatorial Optimization

A Convergence Analysis of Adaptive Optimizers under Floating-point Quantization

Derandomized Online-to-Non-convex Conversion for Stochastic Weakly Convex Optimization

A Block Coordinate Descent Method for Nonsmooth Composite Optimization under Orthogonality Constraints

Riemannian Optimization on Relaxed Indicator Matrix Manifold

Online Inventory Optimization in Non-Stationary Environment

Local Entropy Search over Descent Sequences for Bayesian Optimization

Composite Optimization with Error Feedback: the Dual Averaging Approach

The Potential of Second-Order Optimization for LLMs: A Study with Full Gauss-Newton

Unveiling the Basin-Like Loss Landscape in Large Language Models

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding

Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods

Efficient Quantization of Mixture-of-Experts with Theoretical Generalization Guarantees

TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models

Continual Unlearning for Text-to-Image Diffusion Models: A Regularization Perspective

Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization

DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization

Generalization of Diffusion Models Arises with a Balanced Representation Space

Provable Separations between Memorization and Generalization in Diffusion Models

Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization

Finite-Time Convergence Analysis of ODE-based Generative Models for Stochastic Interpolants

Implicit Regularization of SGD Reduces Shortcut Learning

Does Weak-to-strong Generalization Happen under Spurious Correlations?

An Information-Theoretic Lower Bound on the Generalization Error of Autoencoders

470. Modal Aphasia: Can Unified Multimodal Models Describe Images From Memory?

  • Topics: Computer Vision, Multi-modal & Vision-Language

Test-time Domain Generalization for Image Super-resolution

DuPO: Enabling Reliable Self-Verification via Dual Preference Optimization

Discounted Online Convex Optimization: Uniform Regret Across a Continuous Interval

In-Context Multi-Objective Optimization

XQC: Well-conditioned Optimization Accelerates Deep Reinforcement Learning

Operator Learning with Domain Decomposition for Geometry Generalization in PDE Solving

EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget

Single-stream Policy Optimization

Multi-Agent Guided Policy Optimization

Negotiated Reasoning: On Provably Addressing Relative Over-Generalization

SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration

Lost in the Non-convex Loss Landscape: How to Fine-tune the Large Time Series Model?

MaskCO: Masked Generation Drives Effective Representation Learning and Exploiting for Combinatorial Optimization

From Utterance to Vividity: Training Expressive Subtitle Translation LLM via Adaptive Local Preference Optimization

Taming Hierarchical Image Coding Optimization: A Spectral Regularization Perspective

Group-Normalized Implicit Value Optimization for Language Models

FSPO: Few-Shot Optimization of Synthetic Preferences Effectively Personalizes to Real Users

PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning

Leveraging Explanation to Improve Generalization of Meta Reinforcement Learning

SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations

A Problem-Oriented Perspective and Anchor Verification for Code Optimization

Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization

Li2\mathbf{Li_2}: A Framework on Dynamics of Feature Emergence and Delayed Generalization

How does the optimizer implicitly bias the model merging loss landscape?

Frequency-Balanced Retinal Representation Learning with Mutual Information Regularization

Graph Representational Learning: When Does More Expressivity Hurt Generalization?

Fast Data Mixture Optimization via Gradient Descent

DrugTrail: Interpretable Drug Discovery via Structured Reasoning and Druggability‑Tailored Preference Optimization

Overlap-Adaptive Regularization for Conditional Average Treatment Effect Estimation

Revisiting Weight Regularization for Low-Rank Continual Learning

Separable Neural Networks: Approximation Theory, NTK Regime, and Preconditioned Gradient Descent

Diffusion Negative Preference Optimization Made Simple

Temporal Generalization: A Reality Check

ConRep4CO: Contrastive Representation Learning of Combinatorial Optimization Instances across Types

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

Distributionally Robust Optimization via Generative Ambiguity Modeling

Symmetry-Aware Bayesian Optimization via Max Kernels

Improving LLM-based Global Optimization with Search Space Partitioning

DeMo: Decoupled Momentum Optimization

Fine-tuning Quantized Neural Networks with Zeroth-order Optimization

GoalRank: Group-Relative Optimization for a Large Ranking Model

MaskInversion: Localized Embeddings via Optimization of Explainability Maps

Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models

Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models

Continuum Transformers Perform In-Context Learning by Operator Gradient Descent

Fairness via Independence: A General Regularization Framework for Machine Learning

Mitigating Mismatch within Reference-based Preference Optimization

Pretrain–Test Task Alignment Governs Generalization in In-Context Learning

Study of Training Dynamics for Memory-Constrained Fine-Tuning

On the O(1/T)O(1/T) Convergence of Alternating Gradient Descent–Ascent in Bilinear Games

Convergence of Regret Matching in Potential Games and Constrained Optimization

Memory-Statistics Tradeoff in Continual Learning with Structural Regularization

Interactive Learning of Single-Index Models via Stochastic Gradient Descent

Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling

Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning

On the stability of gradient descent with second order dynamics for time-varying cost functions

1440. GeoFAR: Geography-Informed Frequency-Aware Super-Resolution for Climate Data

  • Topics: Graph Neural Networks, Graphs & Combinatorial

Preference-based Policy Optimization from Sparse-reward Offline Dataset

Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning

Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization

Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents

Trust-Region Adaptive Policy Optimization

GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning

Chart Deep Research in LVLMs via Parallel Relative Policy Optimization

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

Guided Policy Optimization under Partial Observability

Multi-Action Self-Improvement For Neural Combinatorial Optimization

CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition

Provable and Practical In-Context Policy Optimization for Self-Improvement

Generalization Below the Edge of Stability: The Role of Data Geometry

Group Verification-based Policy Optimization for Interactive Coding Agents

Reinforcing Diffusion Models by Direct Group Preference Optimization

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

μ\muLO: Compute-Efficient Meta-Generalization of Learned Optimizers

Boosting Multi-Domain Reasoning of LLMs via Curvature-Guided Policy Optimization

A Hierarchical Circuit Symbolic Discovery Framework for Efficient Logic Optimization

ReForm: Reflective Autoformalization with Prospective Bounded Sequence Optimization

Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization

Incorporating Expert Priors into Bayesian Optimization via Dynamic Mean Decay

MAGO: Beyond Fixed Hyperparameters with Multi-Objective Pareto Optimization for Hybrid LLM Reasoning

Long-Context Generalization with Sparse Attention

Unifying Stable Optimization and Reference Regularization in RLHF

Intrinsic training dynamics of deep neural networks

Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning

ToProVAR: Efficient Visual Autoregressive Modeling via Tri-Dimensional Entropy-Aware Semantic Analysis and Sparsity Optimization

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

TINKER: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization

Towards Better Optimization For Listwise Preference in Diffusion Models

Compositional-ARC: Assessing Systematic Generalization in Abstract Spatial Reasoning

NEO — No-Optimization Test-Time Adaptation through Latent Re-Centering

Minimax-Optimal Aggregation for Density Ratio Estimation

A Step to Decouple Optimization in 3DGS

Path Matters: Unveiling Geometric Implicit Bias via Curvature-Aware Sparse View Optimization

SCas4D: Structural Cascaded Optimization for Boosting Persistent 4D Novel View Synthesis

1945. From Sorting Algorithms to Scalable Kernels: Bayesian Optimization in High-Dimensional Permutation Spaces

  • Topics: Optimization & Training Methods, Theory & Deep Learning Theory

Bilevel Optimization with Lower-Level Uniform Convexity: Theory and Algorithm

Generative Bayesian Optimization: Generative Models as Acquisition Functions

Proving the Limited Scalability of Centralized Distributed Optimization via a New Lower Bound Construction

Sobolev Gradient Ascent for Optimal Transport: Barycenter Optimization and Convergence Analysis

Sign-SGD via Parameter-Free Optimization

Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning

VisionLaw: Inferring Interpretable Intrinsic Dynamics from Visual Observations via Bilevel Optimization

OD3^3: Optimization-free Dataset Distillation for Object Detection

Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

Reinforcement Unlearning via Group Relative Policy Optimization

Diverse Text-to-Image Generation via Contrastive Noise Optimization

Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models

Adaptive Mixture of Disentangled Experts for Dynamic Graph Out-of-Distribution Generalization

Spurious Correlation-Aware Embedding Regularization for Worst-Group Robustness

Convergence Dynamics of Over-Parameterized Score Matching for a Single Gaussian

Memorizing Long-tail Data Can Help Generalization Through Composition

ZeroSiam: An Efficient Asymmetry for Test-Time Entropy Optimization without Collapse

Exploring Mode Connectivity in Krylov Subspace for Domain Generalization

Theoretical Modeling of Large Language Model Self-Improvement Training Dynamics Through Solver-Verifier Gap

Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought

Differentially Private Two-Stage Gradient Descent for Instrumental Variable Regression

Theoretical Analysis of Contrastive Learning under Imbalanced Data: From Training Dynamics to a Pruning Solution

Diagnosing Generalization Failures from Representational Geometry Markers

Adaptive gradient descent on Riemannian manifolds and its applications to Gaussian variational inference

Stop Guessing: Choosing the Optimization-Consistent Uncertainty Measurement for Evidential Deep Learning

Combinatorial Bandit Bayesian Optimization for Tensor Outputs

Primal-Dual Policy Optimization for Linear CMDPs with Adversarial Losses

Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach

Pretrain Value, Not Reward: Decoupled Value Policy Optimization

Fast Convergence of Natural Gradient Descent for Over-parameterized Physics-Informed Neural Networks

Enhancing Stability of Physics-Informed Neural Network Training Through Saddle-Point Reformulation

Agentic Reinforced Policy Optimization

ATPO: ADAPTIVE TREE POLICY OPTIMIZATION FOR MULTI-TURN MEDICAL DIALOGUE

FastGRPO: Accelerating Policy Optimization via Concurrency-aware Speculative Decoding and Online Draft Learning

When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets

BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization

AutoQD: Automatic Discovery of Diverse Behaviors with Quality-Diversity Optimization

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

ViPO: Visual Preference Optimization at Scale

NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization

WMPO: World Model-based Policy Optimization for Vision-Language-Action Models

∇\nabla-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space

P2^2-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

Prompt and Parameter Co-Optimization for Large Language Models

Inpainting-Guided Policy Optimization for Diffusion Large Language Models

PCPO: Proportionate Credit Policy Optimization for Preference Alignment of Image Generation Models

Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training

Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks

OmniPortrait: Fine-Grained Personalized Portrait Synthesis via Pivotal Optimization

PRO-MOF: Policy Optimization with Universal Atomistic Models for Controllable MOF Generation

Joint Optimization for 4D Human-Scene Reconstruction in the Wild

Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs

Globally aware optimization with resurgence

Sharp asymptotic theory for Q-learning with LD2Z\texttt{LD2Z} learning rate and its generalization

Trion: FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of LLMs

Reducing Class-Wise Performance Disparity via Margin Regularization

GIT-BO: High-Dimensional Bayesian Optimization with Tabular Foundation Models

TTOM: Test-Time Optimization and Memorization for Compositional Video Generation

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

Symmetric Space Learning for Combinatorial Generalization

Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts

DiffVax: Optimization-Free Image Immunization Against Diffusion-Based Editing

ACCORD: Alleviating Concept Coupling through Dependence Regularization for Text-to-Image Diffusion Personalization

reAR: Rethinking Visual Autoregressive Models via Token-wise Consistency Regularization

Convergence Analysis of Tsetlin Machines under Noise-Free and Noisy Training Conditions: From 22 Bits to kk Bits

Gradient-Based Diversity Optimization with Differentiable Top-kk Objective

Generalization in LLM Problem Solving: The Case of the Shortest Path

Predictive Differential Training Guided by Training Dynamics

Scalable Second-order Riemannian Optimization for KK-means Clustering

Demystifying Supervision Data Generalization in Multimodal LMs

Bridging Generalization Gap of Heterogeneous Federated Clients Using Generative Models

Corner Gradient Descent

Training Dynamics Impact Post-Training Quantization Robustness

Adaptive Regularization for Large-Scale Sparse Feature Embedding Models

Clipped Gradient Methods for Nonsmooth Convex Optimization under Heavy-Tailed Noise: A Refined Analysis

Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization

Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization

Reasoning-Driven Multimodal LLM for Domain Generalization

Training Dynamics of the Cooldown Stage in Warmup-Stable-Decay Learning Rate Scheduler

3000. Learned Meta-Tokens for Language Modeling

  • Topics: LLMs & Foundation Models

Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment

wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models

Adversarial Déjà Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks

Minimax Sample Complexity of Graph Neural Networks: Lower Bounds and Structural Effects

Gelato: Graph Edit Distance via Autoregressive Neural Combinatorial Optimization

Unlearning during Training: Domain-Specific Gradient Ascent for Domain Generalization

VUDG: A Dataset for Video Understanding Domain Generalization

Saddle-To-Saddle Dynamics in Deep ReLU Networks: Low-Rank Bias in the First Saddle Escape

Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models

Rényi Sharpness: A Novel Sharpness that Strongly Correlates with Generalization

Saddle-to-Saddle Dynamics Explains A Simplicity Bias Across Neural Network Architectures

Directional Convergence, Benign Overfitting of Gradient Descent in leaky ReLU two-layer Neural Networks

Gradient Descent Dynamics of Rank-One Matrix Denoising

On the Convergence Behavior of Preconditioned Gradient Descent Toward the Rich Learning Regime

Minimax Rates for Learning Pairwise Interactions in Attention-Style Models

SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization

Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection

Generalizable Heuristic Generation Through LLMs with Meta-Optimization

BioBO: Biology-informed Bayesian Optimization for Perturbation Design

Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with f\boldsymbol{f}-SoftArgmax Parameterization &\& Coupled Regularization

Convergence of an actor-critic gradient flow for entropy regularised MDPs in general spaces

Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models

Offline Preference-Based Value Optimization

Parameter-Efficient Reinforcement Learning using Prefix Optimization

On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

Flowing Through States: Neural ODE Regularization for Reinforcement Learning

EMBridge: Enhancing Gesture Generalization from EMG Signals Through Cross-modal Representation Learning

Correlated Policy Optimization in Multi-Agent Subteams

Characteristic Root Analysis and Regularization for Linear Time Series Forecasting

RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment

Robust Optimization for Mitigating Reward Hacking with Correlated Proxies

On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization

FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning

On the Convergence of Two-Layer Kolmogorov-Arnold Networks with First-Layer Training

Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization

Disentangling the Factors of Convergence between Brains and DINOv3

Pretraining with Re-parametrized Self-Attention: Unlocking Generalizationin SNN-Based Neural Decoding Across Time, Brains, and Tasks

Bound by semanticity: universal laws governing the generalization-identification tradeoff

Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization

Simplex Constrained Sparse Optimization via Tail Screening

3594. Aurelius: Relation Aware Text-to-Audio Generation At Scale

  • Topics: Audio & Speech

AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization

Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization

OFMU: OPTIMIZATION-DRIVEN FRAMEWORK FOR MACHINE UNLEARNING

Adaptive Social Learning via Mode Policy Optimization for Language Agents

ALM-MTA: Front-Door Causal Multi-Touch Attribution Method for Creator-Ecosystem Optimization

Consistent Noisy Latent Rewards for Trajectory Preference Optimization in Diffusion Models

VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis

Soft Equivariance Regularization for Invariant Self-Supervised Learning

Behavioral Embeddings of Programs: A Quasi-Dynamic Approach for Optimization Prediction

Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization

Covariate-Guided Clusterwise Linear Regression for Generalization to Unseen Data

New Hybrid Fine-Tuning Paradigm for LLMs: Algorithm Design and Convergence Analysis Framework

BoGrape: Bayesian optimization over graphs with shortest-path encoded

RRNCO: Towards Real-World Routing with Neural Combinatorial Optimization

Celo2: Towards Learned Optimization Free Lunch

HBO: Hierarchical Balancing Optimization for Fine-Tuning Large Language Models

Convergence of Muon with Newton-Schulz

Faster Gradient Methods for Highly-smooth Stochastic Bilevel Optimization

Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization

Diffusion-DFL: Decision-focused Diffusion Models for Stochastic Optimization

Reducing Contextual Stochastic Bilevel Optimization via Structured Function Approximation

A Sharp KL Convergence Analysis for Diffusion Models under Minimal Assumptions

Converge Faster, Talk Less: Hessian-Informed Federated Zeroth-Order Optimization

Scaling Multi-Task Bayesian Optimization with Large Language Models

Decentralized Nonconvex Optimization under Heavy-Tailed Noise: Normalization and Optimal Convergence

Egalitarian Gradient Descent: A Simple Approach to Accelerated Grokking

Neural Multi-Objective Combinatorial Optimization for Flexible Job Shop Scheduling Problems

Breaking the Correlation Plateau: On the Optimization and Capacity Limits of Attention-Based Regressors

Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs

Not All Bits Are Equal: Scale-Dependent Memory Optimization Strategies for Reasoning Models

Rethinking Model Calibration through Spectral Entropy Regularization in Medical Image Segmentation

Learning of Population Dynamics: Inverse Optimization Meets JKO Scheme

Is the Reversal Curse a Binding Problem? Uncovering Limitations of Transformers from a Basic Generalization Failure

Designing Affine-Invariant Neural Networks for Photometric Corruption Robustness and Generalization

EAMET: ROBUST MASSIVE MODEL EDITING VIA EMBEDDING ALIGNMENT OPTIMIZATION

LiteGuard: Efficient Task-Agnostic Model Fingerprinting with Enhanced Generalization

Variational Deep Learning via Implicit Regularization

Never Saddle for Reparameterized Steepest Descent as Mirror Flow

Compositional Generalization from Learned Skills via CoT Training: A Theoretical and Structural Analysis for Reasoning

Gradient Descent with Large Step Sizes: Chaos and Fractal Convergence Region

Training Dynamics of Learning 3D-Rotational Equivariance

4171. Explaining Grokking and Information Bottleneck through Neural Collapse Emergence

  • Topics: Interpretability & Mechanistic Interpretability, Theory & Deep Learning Theory

High Probability Bounds for Non-Convex Stochastic Optimization with Momentum

Communication-Efficient Decentralized Optimization via Double-Communication Symmetric ADMM

Online Black-Box Prompt Optimization with Regret Guarantees under Noisy Feedback

Smooth Calibration Error: Uniform Convergence and Functional Gradient Analysis

TusoAI: Agentic Optimization for Scientific Methods

Minimax Optimal Adversarial Reinforcement Learning

Keep the Best, Forget the Rest: Reliable Alignment with Order-Aware Preference Optimization

Self-Predictive Representations for Combinatorial Generalization in Behavioral Cloning

Cross-Domain Policy Optimization via Bellman Consistency and Hybrid Critics

RiskPO: Risk-based Policy Optimization with Verifiable Reward for LLM Post-Training

Relative Entropy Pathwise Policy Optimization

Multi-Bellman operator for convergence of Q-learning with linear function approximation

4280. On Discovering Algorithms for Adversarial Imitation Learning

  • Topics: Trust & Safety, Robotics & Control

Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning

Adapt Data to Model: Adaptive Transformation Optimization for Domain-shared Time Series Foundation Models

HiPO: Self-Hint Policy Optimization for RLVR

Tackling Time-Series Forecasting Generalization via Mitigating Concept Drift

Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game

Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization

On the Tension Between Optimality and Adversarial Robustness in Policy Optimization

BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping

Efficient Degradation-agnostic Image Restoration via Channel-Wise Functional Decomposition and Manifold Regularization

GRO-RAG: Gradient-aware Re-rank Optimization for Multi-source Retrieval-Augmented Generation

Gradient-Normalized Smoothness for Optimization with Approximate Hessians

Nesterov Finds GRAAL: Optimal and Adaptive Gradient Method for Convex Optimization

Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning

Dichotomous Diffusion Policy Optimization

Consis-GCPO: Consistency-Preserving Group Causal Preference Optimization for Vision Customization

Transformers as Measure-Theoretic Associative Memory: A Statistical Perspective and Minimax Optimality

Newton Method Revisited: Global Convergence Rates up to O(1/k3)O(1/k^3) for Stepsize Schedules and Linesearch Procedures

Generalization of RLVR Using Causal Reasoning as a Testbed

Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization

Group Critical-token Policy Optimization for Autoregressive Image Generation

NeuCLIP: Efficient Large-Scale CLIP Training with Neural Normalizer Optimization

Compositional Generalization through Gradient Search in Nonparametric Latent Space

From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation

Noise-Aware Generalization: Robustness to In-Domain Noise and Out-of-Domain Generalization

Function Induction and Task Generalization: An Interpretability Study with Off-by-One Addition

Improving Online-to-Nonconvex Conversion for Smooth Optimization via Double Optimism

Efficient Sliced Wasserstein Distance Computation via Adaptive Bayesian Optimization

Adaptive Acquisition Selection for Bayesian Optimization with Large Language Models

Perception-Aware Policy Optimization for Multimodal Reasoning

From Sequential to Parallel: Reformulating Dynamic Programming as GPU Kernels for Large-Scale Stochastic Combinatorial Optimization

FedMuon: Federated Learning with Bias-corrected LMO-based Optimization

On the Convergence Direction of Gradient Descent

Rethinking Unsupervised Cross-modal Flow Estimation: Learning from Decoupled Optimization and Consistency Constraint

Private Rate-Constrained Optimization with Applications to Fair Learning

Weak-to-Strong Generalization with Failure Trajectories

GraphUniverse: Synthetic Graph Generation for Evaluating Inductive Generalization

Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks

How Muon’s Spectral Design Benefits Generalization: A Study on Imbalanced Data

RankFlow: Property-aware Transport for Protein Optimization

Escaping Model Collapse via Synthetic Data Verification: Near-term Improvements and Long-term Convergence

Polynomial Convergence of Riemannian Diffusion Models

A Theoretical Analysis of Mamba’s Training Dynamics: Filtering Relevant Features for Generalization in State Space Models

Understanding the Dynamics of Forgetting and Generalization in Continual Learning via the Neural Tangent Kernel

Single-Loop Byzantine-Resilient Federated Bilevel Optimization

Heterogeneous Agent Q-weighted Policy Optimization

Geometric-Mean Policy Optimization

SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization

Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits

Rectifying LLM Thought from Lens of Optimization

OptimSyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation

Is On-Policy Data always the Best Choice for Direct Preference Optimization-Based LM Alignment?

SPRIG: Improving Large Language Model Performance by System Prompt Optimization

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

MindPilot: Closed-loop Visual Stimulation Optimization for Brain Modulation with EEG-guided Diffusion

MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization

From Large to Small: Transferring CUDA Optimization Expertise via Reasoning Graph

Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

Optimizing Canaries for Privacy Auditing with Metagradient Descent

Landing with the Score: Riemannian Optimization through Denoising

Are Domain Generalization Benchmarks with Accuracy on the Line Misspecified?

5334. The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward

  • Topics: Reinforcement Learning

Test-Time Optimization of 3D Point Cloud LLM via Manifold-Aware In-Context Guidance and Refinement

It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization

Temporal Geometry of Deep Networks: Hyperbolic Representations of Training Dynamics for Intrinsic Explainability

Sim2Real VLA: Zero-Shot Generalization of Synthesized Skills to Realistic Manipulation