- Published on
ICLR 2026 — Optimization & Training Methods
Optimization & Training Methods
406 papers (0 oral)
Non-Convex Federated Optimization under Cost-Aware Client Selection
- Link: OpenReview
Fast Escape, Slow Convergence: Learning Dynamics of Phase Retrieval under Power-Law Data
- Link: OpenReview
Token-Importance Guided Direct Preference Optimization
- Link: OpenReview
On the Generalization Capacities of MLLMs for Spatial Intelligence
- Link: OpenReview
Quantitative Bounds for Length Generalization in Transformers
- Link: OpenReview
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
- Link: OpenReview
Efficient Resource-Constrained Training of Transformers via Subspace Optimization
- Link: OpenReview
FRABench and UFEval: Unified Fine-grained Evaluation with Task and Aspect Generalization
- Link: OpenReview
Pareto-Conditioned Diffusion Models for Offline Multi-Objective Optimization
- Link: OpenReview
Semi-Supervised Preference Optimization with Limited Feedback
- Link: OpenReview
Multiplayer Nash Preference Optimization
- Link: OpenReview
Global Resolution: Optimal Multi-Draft Speculative Sampling via Convex Optimization
- Link: OpenReview
DTO-KD: Dynamic Trade-off Optimization for Effective Knowledge Distillation
- Link: OpenReview
To Infinity and Beyond: Tool-Use Unlocks Length Generalization in State Space Models
- Link: OpenReview
SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
- Link: OpenReview
Task-free Adaptive Meta Black-box Optimization
- Link: OpenReview
Discount Model Search for Quality Diversity Optimization in High-Dimensional Measure Spaces
- Link: OpenReview
Fast training of accurate physics-informed neural networks without gradient descent
- Link: OpenReview
Block-Sample MAC-Bayes Generalization Bounds
- Link: OpenReview
2. Enhancing Communication Compression via Discrepancy-aware Calibration for Federated Learning
- Topics: Efficiency & Compression
Ads that Stick: Near-Optimal Ad Optimization through Psychological Behavior Models
- Link: OpenReview
18. Multimodal Aligned Semantic Knowledge for Unpaired Image-text Matching
- Topics: Computer Vision, Multi-modal & Vision-Language
GRACE: Generative Representation Learning via Contrastive Policy Optimization
- Link: OpenReview
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
- Link: OpenReview
Analyzing the Training Dynamics of Image Restoration Transformers: A Revisit to Layer Normalization
- Link: OpenReview
Scalable Random Wavelet Features: Efficient Non-Stationary Kernel Approximation with Convergence Guarantees
- Link: OpenReview
Soft Quality-Diversity Optimization
- Link: OpenReview
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
- Link: OpenReview
SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback
- Link: OpenReview
Large Language Model Compression with Global Rank and Sparsity Optimization
- Link: OpenReview
Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs
- Link: OpenReview
FrontierCO: Real-World and Large-Scale Evaluation of Machine Learning Solvers for Combinatorial Optimization
- Link: OpenReview
Native Adaptive Solution Expansion for Diffusion-based Combinatorial Optimization
- Link: OpenReview
A Convergence Analysis of Adaptive Optimizers under Floating-point Quantization
- Link: OpenReview
Derandomized Online-to-Non-convex Conversion for Stochastic Weakly Convex Optimization
- Link: OpenReview
A Block Coordinate Descent Method for Nonsmooth Composite Optimization under Orthogonality Constraints
- Link: OpenReview
Riemannian Optimization on Relaxed Indicator Matrix Manifold
- Link: OpenReview
Online Inventory Optimization in Non-Stationary Environment
- Link: OpenReview
Local Entropy Search over Descent Sequences for Bayesian Optimization
- Link: OpenReview
Composite Optimization with Error Feedback: the Dual Averaging Approach
- Link: OpenReview
The Potential of Second-Order Optimization for LLMs: A Study with Full Gauss-Newton
- Link: OpenReview
Unveiling the Basin-Like Loss Landscape in Large Language Models
- Link: OpenReview
HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- Link: OpenReview
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
- Link: OpenReview
Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods
- Link: OpenReview
Efficient Quantization of Mixture-of-Experts with Theoretical Generalization Guarantees
- Link: OpenReview
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
- Link: OpenReview
Continual Unlearning for Text-to-Image Diffusion Models: A Regularization Perspective
- Link: OpenReview
Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
- Link: OpenReview
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
- Link: OpenReview
Generalization of Diffusion Models Arises with a Balanced Representation Space
- Link: OpenReview
Provable Separations between Memorization and Generalization in Diffusion Models
- Link: OpenReview
Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization
- Link: OpenReview
Finite-Time Convergence Analysis of ODE-based Generative Models for Stochastic Interpolants
- Link: OpenReview
Implicit Regularization of SGD Reduces Shortcut Learning
- Link: OpenReview
Does Weak-to-strong Generalization Happen under Spurious Correlations?
- Link: OpenReview
An Information-Theoretic Lower Bound on the Generalization Error of Autoencoders
- Link: OpenReview
470. Modal Aphasia: Can Unified Multimodal Models Describe Images From Memory?
- Topics: Computer Vision, Multi-modal & Vision-Language
Test-time Domain Generalization for Image Super-resolution
- Link: OpenReview
DuPO: Enabling Reliable Self-Verification via Dual Preference Optimization
- Link: OpenReview
Discounted Online Convex Optimization: Uniform Regret Across a Continuous Interval
- Link: OpenReview
In-Context Multi-Objective Optimization
- Link: OpenReview
XQC: Well-conditioned Optimization Accelerates Deep Reinforcement Learning
- Link: OpenReview
Operator Learning with Domain Decomposition for Geometry Generalization in PDE Solving
- Link: OpenReview
EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget
- Link: OpenReview
Single-stream Policy Optimization
- Link: OpenReview
Multi-Agent Guided Policy Optimization
- Link: OpenReview
Negotiated Reasoning: On Provably Addressing Relative Over-Generalization
- Link: OpenReview
SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration
- Link: OpenReview
Lost in the Non-convex Loss Landscape: How to Fine-tune the Large Time Series Model?
- Link: OpenReview
MaskCO: Masked Generation Drives Effective Representation Learning and Exploiting for Combinatorial Optimization
- Link: OpenReview
From Utterance to Vividity: Training Expressive Subtitle Translation LLM via Adaptive Local Preference Optimization
- Link: OpenReview
Taming Hierarchical Image Coding Optimization: A Spectral Regularization Perspective
- Link: OpenReview
Group-Normalized Implicit Value Optimization for Language Models
- Link: OpenReview
FSPO: Few-Shot Optimization of Synthetic Preferences Effectively Personalizes to Real Users
- Link: OpenReview
PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning
- Link: OpenReview
Leveraging Explanation to Improve Generalization of Meta Reinforcement Learning
- Link: OpenReview
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
- Link: OpenReview
A Problem-Oriented Perspective and Anchor Verification for Code Optimization
- Link: OpenReview
Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization
- Link: OpenReview
: A Framework on Dynamics of Feature Emergence and Delayed Generalization
- Link: OpenReview
How does the optimizer implicitly bias the model merging loss landscape?
- Link: OpenReview
Frequency-Balanced Retinal Representation Learning with Mutual Information Regularization
- Link: OpenReview
Graph Representational Learning: When Does More Expressivity Hurt Generalization?
- Link: OpenReview
Fast Data Mixture Optimization via Gradient Descent
- Link: OpenReview
DrugTrail: Interpretable Drug Discovery via Structured Reasoning and Druggability‑Tailored Preference Optimization
- Link: OpenReview
Overlap-Adaptive Regularization for Conditional Average Treatment Effect Estimation
- Link: OpenReview
Revisiting Weight Regularization for Low-Rank Continual Learning
- Link: OpenReview
Separable Neural Networks: Approximation Theory, NTK Regime, and Preconditioned Gradient Descent
- Link: OpenReview
Diffusion Negative Preference Optimization Made Simple
- Link: OpenReview
Temporal Generalization: A Reality Check
- Link: OpenReview
ConRep4CO: Contrastive Representation Learning of Combinatorial Optimization Instances across Types
- Link: OpenReview
AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization
- Link: OpenReview
Distributionally Robust Optimization via Generative Ambiguity Modeling
- Link: OpenReview
Symmetry-Aware Bayesian Optimization via Max Kernels
- Link: OpenReview
Improving LLM-based Global Optimization with Search Space Partitioning
- Link: OpenReview
DeMo: Decoupled Momentum Optimization
- Link: OpenReview
Fine-tuning Quantized Neural Networks with Zeroth-order Optimization
- Link: OpenReview
GoalRank: Group-Relative Optimization for a Large Ranking Model
- Link: OpenReview
MaskInversion: Localized Embeddings via Optimization of Explainability Maps
- Link: OpenReview
Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
- Link: OpenReview
Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models
- Link: OpenReview
Continuum Transformers Perform In-Context Learning by Operator Gradient Descent
- Link: OpenReview
Fairness via Independence: A General Regularization Framework for Machine Learning
- Link: OpenReview
Mitigating Mismatch within Reference-based Preference Optimization
- Link: OpenReview
Pretrain–Test Task Alignment Governs Generalization in In-Context Learning
- Link: OpenReview
Study of Training Dynamics for Memory-Constrained Fine-Tuning
- Link: OpenReview
On the Convergence of Alternating Gradient Descent–Ascent in Bilinear Games
- Link: OpenReview
Convergence of Regret Matching in Potential Games and Constrained Optimization
- Link: OpenReview
Memory-Statistics Tradeoff in Continual Learning with Structural Regularization
- Link: OpenReview
Interactive Learning of Single-Index Models via Stochastic Gradient Descent
- Link: OpenReview
Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling
- Link: OpenReview
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
- Link: OpenReview
On the stability of gradient descent with second order dynamics for time-varying cost functions
- Link: OpenReview
1440. GeoFAR: Geography-Informed Frequency-Aware Super-Resolution for Climate Data
- Topics: Graph Neural Networks, Graphs & Combinatorial
Preference-based Policy Optimization from Sparse-reward Offline Dataset
- Link: OpenReview
Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning
- Link: OpenReview
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
- Link: OpenReview
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
- Link: OpenReview
Trust-Region Adaptive Policy Optimization
- Link: OpenReview
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
- Link: OpenReview
Chart Deep Research in LVLMs via Parallel Relative Policy Optimization
- Link: OpenReview
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
- Link: OpenReview
Guided Policy Optimization under Partial Observability
- Link: OpenReview
Multi-Action Self-Improvement For Neural Combinatorial Optimization
- Link: OpenReview
CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition
- Link: OpenReview
Provable and Practical In-Context Policy Optimization for Self-Improvement
- Link: OpenReview
Generalization Below the Edge of Stability: The Role of Data Geometry
- Link: OpenReview
Group Verification-based Policy Optimization for Interactive Coding Agents
- Link: OpenReview
Reinforcing Diffusion Models by Direct Group Preference Optimization
- Link: OpenReview
Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs
- Link: OpenReview
LO: Compute-Efficient Meta-Generalization of Learned Optimizers
- Link: OpenReview
Boosting Multi-Domain Reasoning of LLMs via Curvature-Guided Policy Optimization
- Link: OpenReview
A Hierarchical Circuit Symbolic Discovery Framework for Efficient Logic Optimization
- Link: OpenReview
ReForm: Reflective Autoformalization with Prospective Bounded Sequence Optimization
- Link: OpenReview
Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization
- Link: OpenReview
Incorporating Expert Priors into Bayesian Optimization via Dynamic Mean Decay
- Link: OpenReview
MAGO: Beyond Fixed Hyperparameters with Multi-Objective Pareto Optimization for Hybrid LLM Reasoning
- Link: OpenReview
Long-Context Generalization with Sparse Attention
- Link: OpenReview
Unifying Stable Optimization and Reference Regularization in RLHF
- Link: OpenReview
Intrinsic training dynamics of deep neural networks
- Link: OpenReview
Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
- Link: OpenReview
ToProVAR: Efficient Visual Autoregressive Modeling via Tri-Dimensional Entropy-Aware Semantic Analysis and Sparsity Optimization
- Link: OpenReview
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
- Link: OpenReview
TINKER: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
- Link: OpenReview
Towards Better Optimization For Listwise Preference in Diffusion Models
- Link: OpenReview
Compositional-ARC: Assessing Systematic Generalization in Abstract Spatial Reasoning
- Link: OpenReview
NEO — No-Optimization Test-Time Adaptation through Latent Re-Centering
- Link: OpenReview
Minimax-Optimal Aggregation for Density Ratio Estimation
- Link: OpenReview
A Step to Decouple Optimization in 3DGS
- Link: OpenReview
Path Matters: Unveiling Geometric Implicit Bias via Curvature-Aware Sparse View Optimization
- Link: OpenReview
SCas4D: Structural Cascaded Optimization for Boosting Persistent 4D Novel View Synthesis
- Link: OpenReview
1945. From Sorting Algorithms to Scalable Kernels: Bayesian Optimization in High-Dimensional Permutation Spaces
- Topics: Optimization & Training Methods, Theory & Deep Learning Theory
Bilevel Optimization with Lower-Level Uniform Convexity: Theory and Algorithm
- Link: OpenReview
Generative Bayesian Optimization: Generative Models as Acquisition Functions
- Link: OpenReview
Proving the Limited Scalability of Centralized Distributed Optimization via a New Lower Bound Construction
- Link: OpenReview
Sobolev Gradient Ascent for Optimal Transport: Barycenter Optimization and Convergence Analysis
- Link: OpenReview
Sign-SGD via Parameter-Free Optimization
- Link: OpenReview
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
- Link: OpenReview
VisionLaw: Inferring Interpretable Intrinsic Dynamics from Visual Observations via Bilevel Optimization
- Link: OpenReview
OD: Optimization-free Dataset Distillation for Object Detection
- Link: OpenReview
Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization
- Link: OpenReview
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization
- Link: OpenReview
Reinforcement Unlearning via Group Relative Policy Optimization
- Link: OpenReview
Diverse Text-to-Image Generation via Contrastive Noise Optimization
- Link: OpenReview
Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models
- Link: OpenReview
Adaptive Mixture of Disentangled Experts for Dynamic Graph Out-of-Distribution Generalization
- Link: OpenReview
Spurious Correlation-Aware Embedding Regularization for Worst-Group Robustness
- Link: OpenReview
Convergence Dynamics of Over-Parameterized Score Matching for a Single Gaussian
- Link: OpenReview
Memorizing Long-tail Data Can Help Generalization Through Composition
- Link: OpenReview
ZeroSiam: An Efficient Asymmetry for Test-Time Entropy Optimization without Collapse
- Link: OpenReview
Exploring Mode Connectivity in Krylov Subspace for Domain Generalization
- Link: OpenReview
Theoretical Modeling of Large Language Model Self-Improvement Training Dynamics Through Solver-Verifier Gap
- Link: OpenReview
Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought
- Link: OpenReview
Differentially Private Two-Stage Gradient Descent for Instrumental Variable Regression
- Link: OpenReview
Theoretical Analysis of Contrastive Learning under Imbalanced Data: From Training Dynamics to a Pruning Solution
- Link: OpenReview
Diagnosing Generalization Failures from Representational Geometry Markers
- Link: OpenReview
Adaptive gradient descent on Riemannian manifolds and its applications to Gaussian variational inference
- Link: OpenReview
Stop Guessing: Choosing the Optimization-Consistent Uncertainty Measurement for Evidential Deep Learning
- Link: OpenReview
Combinatorial Bandit Bayesian Optimization for Tensor Outputs
- Link: OpenReview
Primal-Dual Policy Optimization for Linear CMDPs with Adversarial Losses
- Link: OpenReview
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
- Link: OpenReview
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
- Link: OpenReview
Fast Convergence of Natural Gradient Descent for Over-parameterized Physics-Informed Neural Networks
- Link: OpenReview
Enhancing Stability of Physics-Informed Neural Network Training Through Saddle-Point Reformulation
- Link: OpenReview
Agentic Reinforced Policy Optimization
- Link: OpenReview
ATPO: ADAPTIVE TREE POLICY OPTIMIZATION FOR MULTI-TURN MEDICAL DIALOGUE
- Link: OpenReview
FastGRPO: Accelerating Policy Optimization via Concurrency-aware Speculative Decoding and Online Draft Learning
- Link: OpenReview
When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets
- Link: OpenReview
BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization
- Link: OpenReview
AutoQD: Automatic Discovery of Diverse Behaviors with Quality-Diversity Optimization
- Link: OpenReview
THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
- Link: OpenReview
ViPO: Visual Preference Optimization at Scale
- Link: OpenReview
NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization
- Link: OpenReview
WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
- Link: OpenReview
-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space
- Link: OpenReview
P-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization
- Link: OpenReview
Prompt and Parameter Co-Optimization for Large Language Models
- Link: OpenReview
Inpainting-Guided Policy Optimization for Diffusion Large Language Models
- Link: OpenReview
PCPO: Proportionate Credit Policy Optimization for Preference Alignment of Image Generation Models
- Link: OpenReview
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
- Link: OpenReview
Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
- Link: OpenReview
OmniPortrait: Fine-Grained Personalized Portrait Synthesis via Pivotal Optimization
- Link: OpenReview
PRO-MOF: Policy Optimization with Universal Atomistic Models for Controllable MOF Generation
- Link: OpenReview
Joint Optimization for 4D Human-Scene Reconstruction in the Wild
- Link: OpenReview
Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
- Link: OpenReview
Globally aware optimization with resurgence
- Link: OpenReview
Sharp asymptotic theory for Q-learning with learning rate and its generalization
- Link: OpenReview
Trion: FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of LLMs
- Link: OpenReview
Reducing Class-Wise Performance Disparity via Margin Regularization
- Link: OpenReview
GIT-BO: High-Dimensional Bayesian Optimization with Tabular Foundation Models
- Link: OpenReview
TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
- Link: OpenReview
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
- Link: OpenReview
Symmetric Space Learning for Combinatorial Generalization
- Link: OpenReview
Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
- Link: OpenReview
DiffVax: Optimization-Free Image Immunization Against Diffusion-Based Editing
- Link: OpenReview
ACCORD: Alleviating Concept Coupling through Dependence Regularization for Text-to-Image Diffusion Personalization
- Link: OpenReview
reAR: Rethinking Visual Autoregressive Models via Token-wise Consistency Regularization
- Link: OpenReview
Convergence Analysis of Tsetlin Machines under Noise-Free and Noisy Training Conditions: From Bits to Bits
- Link: OpenReview
Gradient-Based Diversity Optimization with Differentiable Top- Objective
- Link: OpenReview
Generalization in LLM Problem Solving: The Case of the Shortest Path
- Link: OpenReview
Predictive Differential Training Guided by Training Dynamics
- Link: OpenReview
Scalable Second-order Riemannian Optimization for -means Clustering
- Link: OpenReview
Demystifying Supervision Data Generalization in Multimodal LMs
- Link: OpenReview
Bridging Generalization Gap of Heterogeneous Federated Clients Using Generative Models
- Link: OpenReview
Corner Gradient Descent
- Link: OpenReview
Training Dynamics Impact Post-Training Quantization Robustness
- Link: OpenReview
Adaptive Regularization for Large-Scale Sparse Feature Embedding Models
- Link: OpenReview
Clipped Gradient Methods for Nonsmooth Convex Optimization under Heavy-Tailed Noise: A Refined Analysis
- Link: OpenReview
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
- Link: OpenReview
Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization
- Link: OpenReview
Reasoning-Driven Multimodal LLM for Domain Generalization
- Link: OpenReview
Training Dynamics of the Cooldown Stage in Warmup-Stable-Decay Learning Rate Scheduler
- Link: OpenReview
3000. Learned Meta-Tokens for Language Modeling
- Topics: LLMs & Foundation Models
Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment
- Link: OpenReview
wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
- Link: OpenReview
Adversarial Déjà Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks
- Link: OpenReview
Minimax Sample Complexity of Graph Neural Networks: Lower Bounds and Structural Effects
- Link: OpenReview
Gelato: Graph Edit Distance via Autoregressive Neural Combinatorial Optimization
- Link: OpenReview
Unlearning during Training: Domain-Specific Gradient Ascent for Domain Generalization
- Link: OpenReview
VUDG: A Dataset for Video Understanding Domain Generalization
- Link: OpenReview
Saddle-To-Saddle Dynamics in Deep ReLU Networks: Low-Rank Bias in the First Saddle Escape
- Link: OpenReview
Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models
- Link: OpenReview
Rényi Sharpness: A Novel Sharpness that Strongly Correlates with Generalization
- Link: OpenReview
Saddle-to-Saddle Dynamics Explains A Simplicity Bias Across Neural Network Architectures
- Link: OpenReview
Directional Convergence, Benign Overfitting of Gradient Descent in leaky ReLU two-layer Neural Networks
- Link: OpenReview
Gradient Descent Dynamics of Rank-One Matrix Denoising
- Link: OpenReview
On the Convergence Behavior of Preconditioned Gradient Descent Toward the Rich Learning Regime
- Link: OpenReview
Minimax Rates for Learning Pairwise Interactions in Attention-Style Models
- Link: OpenReview
SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization
- Link: OpenReview
Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection
- Link: OpenReview
Generalizable Heuristic Generation Through LLMs with Meta-Optimization
- Link: OpenReview
BioBO: Biology-informed Bayesian Optimization for Perturbation Design
- Link: OpenReview
Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with -SoftArgmax Parameterization Coupled Regularization
- Link: OpenReview
Convergence of an actor-critic gradient flow for entropy regularised MDPs in general spaces
- Link: OpenReview
Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models
- Link: OpenReview
Offline Preference-Based Value Optimization
- Link: OpenReview
Parameter-Efficient Reinforcement Learning using Prefix Optimization
- Link: OpenReview
On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
- Link: OpenReview
Flowing Through States: Neural ODE Regularization for Reinforcement Learning
- Link: OpenReview
EMBridge: Enhancing Gesture Generalization from EMG Signals Through Cross-modal Representation Learning
- Link: OpenReview
Correlated Policy Optimization in Multi-Agent Subteams
- Link: OpenReview
Characteristic Root Analysis and Regularization for Linear Time Series Forecasting
- Link: OpenReview
RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment
- Link: OpenReview
Robust Optimization for Mitigating Reward Hacking with Correlated Proxies
- Link: OpenReview
On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization
- Link: OpenReview
FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
- Link: OpenReview
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
- Link: OpenReview
On the Convergence of Two-Layer Kolmogorov-Arnold Networks with First-Layer Training
- Link: OpenReview
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
- Link: OpenReview
Disentangling the Factors of Convergence between Brains and DINOv3
- Link: OpenReview
Pretraining with Re-parametrized Self-Attention: Unlocking Generalizationin SNN-Based Neural Decoding Across Time, Brains, and Tasks
- Link: OpenReview
Bound by semanticity: universal laws governing the generalization-identification tradeoff
- Link: OpenReview
Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization
- Link: OpenReview
Simplex Constrained Sparse Optimization via Tail Screening
- Link: OpenReview
3594. Aurelius: Relation Aware Text-to-Audio Generation At Scale
- Topics: Audio & Speech
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
- Link: OpenReview
Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization
- Link: OpenReview
OFMU: OPTIMIZATION-DRIVEN FRAMEWORK FOR MACHINE UNLEARNING
- Link: OpenReview
Adaptive Social Learning via Mode Policy Optimization for Language Agents
- Link: OpenReview
ALM-MTA: Front-Door Causal Multi-Touch Attribution Method for Creator-Ecosystem Optimization
- Link: OpenReview
Consistent Noisy Latent Rewards for Trajectory Preference Optimization in Diffusion Models
- Link: OpenReview
VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis
- Link: OpenReview
Soft Equivariance Regularization for Invariant Self-Supervised Learning
- Link: OpenReview
Behavioral Embeddings of Programs: A Quasi-Dynamic Approach for Optimization Prediction
- Link: OpenReview
Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization
- Link: OpenReview
Covariate-Guided Clusterwise Linear Regression for Generalization to Unseen Data
- Link: OpenReview
New Hybrid Fine-Tuning Paradigm for LLMs: Algorithm Design and Convergence Analysis Framework
- Link: OpenReview
BoGrape: Bayesian optimization over graphs with shortest-path encoded
- Link: OpenReview
RRNCO: Towards Real-World Routing with Neural Combinatorial Optimization
- Link: OpenReview
Celo2: Towards Learned Optimization Free Lunch
- Link: OpenReview
HBO: Hierarchical Balancing Optimization for Fine-Tuning Large Language Models
- Link: OpenReview
Convergence of Muon with Newton-Schulz
- Link: OpenReview
Faster Gradient Methods for Highly-smooth Stochastic Bilevel Optimization
- Link: OpenReview
Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization
- Link: OpenReview
Diffusion-DFL: Decision-focused Diffusion Models for Stochastic Optimization
- Link: OpenReview
Reducing Contextual Stochastic Bilevel Optimization via Structured Function Approximation
- Link: OpenReview
A Sharp KL Convergence Analysis for Diffusion Models under Minimal Assumptions
- Link: OpenReview
Converge Faster, Talk Less: Hessian-Informed Federated Zeroth-Order Optimization
- Link: OpenReview
Scaling Multi-Task Bayesian Optimization with Large Language Models
- Link: OpenReview
Decentralized Nonconvex Optimization under Heavy-Tailed Noise: Normalization and Optimal Convergence
- Link: OpenReview
Egalitarian Gradient Descent: A Simple Approach to Accelerated Grokking
- Link: OpenReview
Neural Multi-Objective Combinatorial Optimization for Flexible Job Shop Scheduling Problems
- Link: OpenReview
Breaking the Correlation Plateau: On the Optimization and Capacity Limits of Attention-Based Regressors
- Link: OpenReview
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
- Link: OpenReview
Not All Bits Are Equal: Scale-Dependent Memory Optimization Strategies for Reasoning Models
- Link: OpenReview
Rethinking Model Calibration through Spectral Entropy Regularization in Medical Image Segmentation
- Link: OpenReview
Learning of Population Dynamics: Inverse Optimization Meets JKO Scheme
- Link: OpenReview
Is the Reversal Curse a Binding Problem? Uncovering Limitations of Transformers from a Basic Generalization Failure
- Link: OpenReview
Designing Affine-Invariant Neural Networks for Photometric Corruption Robustness and Generalization
- Link: OpenReview
EAMET: ROBUST MASSIVE MODEL EDITING VIA EMBEDDING ALIGNMENT OPTIMIZATION
- Link: OpenReview
LiteGuard: Efficient Task-Agnostic Model Fingerprinting with Enhanced Generalization
- Link: OpenReview
Variational Deep Learning via Implicit Regularization
- Link: OpenReview
Never Saddle for Reparameterized Steepest Descent as Mirror Flow
- Link: OpenReview
Compositional Generalization from Learned Skills via CoT Training: A Theoretical and Structural Analysis for Reasoning
- Link: OpenReview
Gradient Descent with Large Step Sizes: Chaos and Fractal Convergence Region
- Link: OpenReview
Training Dynamics of Learning 3D-Rotational Equivariance
- Link: OpenReview
4171. Explaining Grokking and Information Bottleneck through Neural Collapse Emergence
- Topics: Interpretability & Mechanistic Interpretability, Theory & Deep Learning Theory
High Probability Bounds for Non-Convex Stochastic Optimization with Momentum
- Link: OpenReview
Communication-Efficient Decentralized Optimization via Double-Communication Symmetric ADMM
- Link: OpenReview
Online Black-Box Prompt Optimization with Regret Guarantees under Noisy Feedback
- Link: OpenReview
Smooth Calibration Error: Uniform Convergence and Functional Gradient Analysis
- Link: OpenReview
TusoAI: Agentic Optimization for Scientific Methods
- Link: OpenReview
Minimax Optimal Adversarial Reinforcement Learning
- Link: OpenReview
Keep the Best, Forget the Rest: Reliable Alignment with Order-Aware Preference Optimization
- Link: OpenReview
Self-Predictive Representations for Combinatorial Generalization in Behavioral Cloning
- Link: OpenReview
Cross-Domain Policy Optimization via Bellman Consistency and Hybrid Critics
- Link: OpenReview
RiskPO: Risk-based Policy Optimization with Verifiable Reward for LLM Post-Training
- Link: OpenReview
Relative Entropy Pathwise Policy Optimization
- Link: OpenReview
Multi-Bellman operator for convergence of Q-learning with linear function approximation
- Link: OpenReview
4280. On Discovering Algorithms for Adversarial Imitation Learning
- Topics: Trust & Safety, Robotics & Control
Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
- Link: OpenReview
Adapt Data to Model: Adaptive Transformation Optimization for Domain-shared Time Series Foundation Models
- Link: OpenReview
HiPO: Self-Hint Policy Optimization for RLVR
- Link: OpenReview
Tackling Time-Series Forecasting Generalization via Mitigating Concept Drift
- Link: OpenReview
Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game
- Link: OpenReview
Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization
- Link: OpenReview
On the Tension Between Optimality and Adversarial Robustness in Policy Optimization
- Link: OpenReview
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
- Link: OpenReview
Efficient Degradation-agnostic Image Restoration via Channel-Wise Functional Decomposition and Manifold Regularization
- Link: OpenReview
GRO-RAG: Gradient-aware Re-rank Optimization for Multi-source Retrieval-Augmented Generation
- Link: OpenReview
Gradient-Normalized Smoothness for Optimization with Approximate Hessians
- Link: OpenReview
Nesterov Finds GRAAL: Optimal and Adaptive Gradient Method for Convex Optimization
- Link: OpenReview
Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
- Link: OpenReview
Dichotomous Diffusion Policy Optimization
- Link: OpenReview
Consis-GCPO: Consistency-Preserving Group Causal Preference Optimization for Vision Customization
- Link: OpenReview
Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search
- Link: OpenReview
Transformers as Measure-Theoretic Associative Memory: A Statistical Perspective and Minimax Optimality
- Link: OpenReview
Newton Method Revisited: Global Convergence Rates up to for Stepsize Schedules and Linesearch Procedures
- Link: OpenReview
Generalization of RLVR Using Causal Reasoning as a Testbed
- Link: OpenReview
Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization
- Link: OpenReview
Group Critical-token Policy Optimization for Autoregressive Image Generation
- Link: OpenReview
NeuCLIP: Efficient Large-Scale CLIP Training with Neural Normalizer Optimization
- Link: OpenReview
Compositional Generalization through Gradient Search in Nonparametric Latent Space
- Link: OpenReview
From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation
- Link: OpenReview
Noise-Aware Generalization: Robustness to In-Domain Noise and Out-of-Domain Generalization
- Link: OpenReview
Function Induction and Task Generalization: An Interpretability Study with Off-by-One Addition
- Link: OpenReview
Improving Online-to-Nonconvex Conversion for Smooth Optimization via Double Optimism
- Link: OpenReview
Efficient Sliced Wasserstein Distance Computation via Adaptive Bayesian Optimization
- Link: OpenReview
Adaptive Acquisition Selection for Bayesian Optimization with Large Language Models
- Link: OpenReview
Perception-Aware Policy Optimization for Multimodal Reasoning
- Link: OpenReview
From Sequential to Parallel: Reformulating Dynamic Programming as GPU Kernels for Large-Scale Stochastic Combinatorial Optimization
- Link: OpenReview
FedMuon: Federated Learning with Bias-corrected LMO-based Optimization
- Link: OpenReview
On the Convergence Direction of Gradient Descent
- Link: OpenReview
Rethinking Unsupervised Cross-modal Flow Estimation: Learning from Decoupled Optimization and Consistency Constraint
- Link: OpenReview
Private Rate-Constrained Optimization with Applications to Fair Learning
- Link: OpenReview
Weak-to-Strong Generalization with Failure Trajectories
- Link: OpenReview
GraphUniverse: Synthetic Graph Generation for Evaluating Inductive Generalization
- Link: OpenReview
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
- Link: OpenReview
How Muon’s Spectral Design Benefits Generalization: A Study on Imbalanced Data
- Link: OpenReview
RankFlow: Property-aware Transport for Protein Optimization
- Link: OpenReview
Escaping Model Collapse via Synthetic Data Verification: Near-term Improvements and Long-term Convergence
- Link: OpenReview
Polynomial Convergence of Riemannian Diffusion Models
- Link: OpenReview
A Theoretical Analysis of Mamba’s Training Dynamics: Filtering Relevant Features for Generalization in State Space Models
- Link: OpenReview
Understanding the Dynamics of Forgetting and Generalization in Continual Learning via the Neural Tangent Kernel
- Link: OpenReview
Single-Loop Byzantine-Resilient Federated Bilevel Optimization
- Link: OpenReview
Heterogeneous Agent Q-weighted Policy Optimization
- Link: OpenReview
Geometric-Mean Policy Optimization
- Link: OpenReview
SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization
- Link: OpenReview
Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits
- Link: OpenReview
Rectifying LLM Thought from Lens of Optimization
- Link: OpenReview
OptimSyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation
- Link: OpenReview
Is On-Policy Data always the Best Choice for Direct Preference Optimization-Based LM Alignment?
- Link: OpenReview
SPRIG: Improving Large Language Model Performance by System Prompt Optimization
- Link: OpenReview
Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test
- Link: OpenReview
MindPilot: Closed-loop Visual Stimulation Optimization for Brain Modulation with EEG-guided Diffusion
- Link: OpenReview
MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization
- Link: OpenReview
From Large to Small: Transferring CUDA Optimization Expertise via Reasoning Graph
- Link: OpenReview
Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts
- Link: OpenReview
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
- Link: OpenReview
Optimizing Canaries for Privacy Auditing with Metagradient Descent
- Link: OpenReview
Landing with the Score: Riemannian Optimization through Denoising
- Link: OpenReview
Are Domain Generalization Benchmarks with Accuracy on the Line Misspecified?
- Link: OpenReview
5334. The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward
- Topics: Reinforcement Learning
Test-Time Optimization of 3D Point Cloud LLM via Manifold-Aware In-Context Guidance and Refinement
- Link: OpenReview
It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization
- Link: OpenReview
Temporal Geometry of Deep Networks: Hyperbolic Representations of Training Dynamics for Intrinsic Explainability
- Link: OpenReview
Sim2Real VLA: Zero-Shot Generalization of Synthesized Skills to Realistic Manipulation
- Link: OpenReview