R
Published on

ICLR 2026 — LLMs & Foundation Models

LLMs & Foundation Models

1515 papers (0 oral)

Mastering Sparse CUDA Generation through Pretrained Models and Deep Reinforcement Learning

Benchmarking Empirical Privacy Protection for Adaptations of Large Language Models

Invisible Safety Threat: Malicious Finetuning for LLM via Steganography

Reducing Belief Deviation in Reinforcement Learning for Active Reasoning of LLM Agents

Actions Speak Louder than Prompts: A Large-Scale Study of LLMs for Graph Inference

The Shape of Adversarial Influence: Characterizing LLM Latent Spaces with Persistent Homology

Let Features Decide Their Own Solvers: Hybrid Feature Caching for Diffusion Transformers

MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent

Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning

Multi-Domain Riemannian Graph Gluing for Building Graph Foundation Models

LLM Fingerprinting via Semantically Conditioned Watermarks

Revela: Dense Retriever Learning via Language Modeling

Steering the Herd: A Framework for LLM-based Control of Social Learning

Every Language Model Has a Forgery-Resistant Signature

Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts

How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability

Sequences of Logits Reveal the Low Rank Structure of Language Models

On the Generalization Capacities of MLLMs for Spatial Intelligence

LLMs Get Lost In Multi-Turn Conversation

Intrinsic Entropy of Context Length Scaling in LLMs

How Reliable is Language Model Micro-Benchmarking?

DepthLM: Metric Depth from Vision Language Models

FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging

AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference

The Coverage Principle: How Pre-Training Enables Post-Training

Quantitative Bounds for Length Generalization in Transformers

Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction–Reasoning Synergy

MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Models for Embodied Task Planning

Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation

SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer

WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training

Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks

mCLM: A Modular Chemical Language Model that Generates Functional and Makeable Molecules

How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining

NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale

Efficient Resource-Constrained Training of Transformers via Subspace Optimization

Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments

AgentGym-RL: An Open-Source Framework to Train LLM Agents for Long-Horizon Decision Making via Multi-Turn RL

Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention

Softmax Transformers are Turing-Complete

HATSolver: Learning Gröbner Bases with Hierarchical Attention Transformers

Pre-training under infinite compute

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training

EditBench: Evaluating LLM Abilities to Perform Real-World Instructed Code Edits

SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents

Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training

Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents

ParaRNN: Unlocking Parallel Training of Nonlinear RNNs for Large Language Models

Energy-Based Transformers are Scalable Learners and Thinkers

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

Visual symbolic mechanisms: Emergent symbol processing in Vision Language Models

Transformers are Inherently Succinct

Diffusion Language Model Knows the Answer Before It Decodes

TROLL: Trust Regions Improve Reinforcement Learning for Large Language Models

On the Reasoning Abilities of Masked Diffusion Language Models

CauKer: Classification Time Series Foundation Models Can Be Pretrained on Synthetic Data

Planner Aware Path Learning in Diffusion Language Models Training

The Art of Scaling Reinforcement Learning Compute for LLMs

Decentralized Attention Fails Centralized Signals: Rethinking Transformers for Medical Time Series

p-lessp\textrm{-less} Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding

Latent Speech-Text Transformer

Plug-and-Play Compositionality for Boosting Continual Learning with Foundation Models

Train-before-Test Harmonizes Language Model Rankings

Reliable Weak-to-Strong Monitoring of LLM Agents

LLM DNA: Tracing Model Evolution via Functional Representations

Hubble: a Model Suite to Advance the Study of LLM Memorization

Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource

Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute

CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering

Optimistic Task Inference for Behavior Foundation Models

WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality

AutoEP: LLMs-Driven Automation of Hyperparameter Evolution for Metaheuristic Algorithms

RMAAT: Astrocyte-Inspired Memory Compression and Replay for Efficient Long-Context Transformers

4. SpectraLLM: Uncovering the Ability of LLMs for Molecule Structure Elucidation from Multi-Spectra

  • Topics: LLMs & Foundation Models, Graph Neural Networks

MADFormer\textit{MADFormer}: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation

10. ARINBEV: Bird's-Eye View Layout Estimation with Conditional Autoregressive Model

  • Topics: LLMs & Foundation Models

SafeMoE: Safe Fine-Tuning for MoE LLMs by Aligning Harmful Input Routing

12. FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents

  • Topics: LLMs & Foundation Models, Agents & Tool Use, Data-centric & Curation

BA-LoRA: Bias-Alleviating Low-Rank Adaptation to Mitigate Catastrophic Inheritance in Large Language Models

16. GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation

  • Topics: Multi-modal & Vision-Language

A Unified Federated Framework for Trajectory Data Preparation via LLMs

22. MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models

  • Topics: LLMs & Foundation Models, Efficiency & Compression

ssToken: Self-modulated and Semantic-aware Token Selection for LLM Fine-tuning

28. Optimizing ID Consistency in Multimodal Large Models: Facial Restoration via Alignment, Entanglement, and Disentanglement

  • Topics: Trust & Safety, Multi-modal & Vision-Language

From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics

30. Quasi-Monte Carlo Methods Enable Extremely Low-Dimensional Deep Generative Models

  • Topics: Reinforcement Learning, Diffusion Models & Generative AI

Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

38. COSMO-INR: Complex Sinusoidal Modulation for Implicit Neural Representations

  • Topics: Other / Unclassified

FlowGen: Synthesizing Diverse Flowcharts to Enhance and Benchmark MLLM Reasoning

UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers

Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis

Analyzing the Training Dynamics of Image Restoration Transformers: A Revisit to Layer Normalization

D-AR: Diffusion via Autoregressive Models

Hyperspherical Latents Improve Continuous-Token Autoregressive Generation

TokMem: One-Token Procedural Memory for Large Language Models

ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models

Bridging the Distribution Gap to Harness Pretrained Diffusion Priors for Super-Resolution

Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs

Dens3R: A Foundation Model for 3D Geometry Prediction

DAMR: Efficient and Adaptive Context-Aware Knowledge Graph Question Answering with LLM-Guided MCTS

EIP: Weighted Ranking of LLMs by Quantifying Question Difficulty

Noisy but Valid: Robust Statistical Evaluation of LLMs with Imperfect Judges

AssetFormer: Modular 3D Assets Generation with Autoregressive Transformer

Pretraining with hierarchical memories: separating long-tail and common knowledge

VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding

THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics

MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning

CALM: Co-evolution of Algorithms and Language Model for Automatic Heuristic Design

Large Language Model Compression with Global Rank and Sparsity Optimization

Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders

Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs

Task-Aware Data Selection via Proxy-Label Enhanced Distribution Matching for LLM Finetuning

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World

LLM-Guided Evolutionary Program Synthesis for Quasi-Monte Carlo Design

The Potential of Second-Order Optimization for LLMs: A Study with Full Gauss-Newton

MergeTune: Continued Fine-Tuning of Vision-Language Models

Unveiling the Basin-Like Loss Landscape in Large Language Models

Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking

Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models

Sculpting Subspaces: Constrained Full Fine-Tuning in LLMs for Continual Learning

QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining

U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs

Adaptive Nonlinear Compression for Large Foundation Models

Alignment-Enhanced Integration of Connectivity and Spectral Sparsity in Dynamic Sparse Training of LLM

Inference-Cost-Aware Dynamic Tree Construction for Efficient Inference in Large Language Models

UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs

Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?

SliderQuant: Accurate Post-Training Quantization for LLMs

Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods

Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking

Rethinking Residual Errors in Compensation-based LLM Quantization

Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models

Video-LevelGauge: Investigating Contextual Positional Bias in Video Language Models.

Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data

MoDr: Mixture-of-Depth-Recurrent Transformers for Test-Time Reasoning

Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection

Attend to the Active: Structure-Aware Dynamic Attention in LLMs for Compositional Instruction Following

FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference

Token Alignment Heads: Unveiling Attention's Role in LLM Multilingual Translation

InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation

Vulcan: Crafting Compact Class-Specific Vision Transformers For Edge Intelligence

QuoKA: Query-Oriented KV Selection for Efficient LLM Prefill

The Counting Power of Transformers

Critical attention scaling in long-context transformers

Emergent Discrete Controller Modules for Symbolic Planning in Transformers

Seeing Through Words: Controlling Visual Retrieval Quality with Language Models

Unveiling the Potential of Diffusion Large Language Model in Controllable Generation

CIMemories: A Compositional Benchmark For Contextual Integrity In LLMs

Flow of Spans: Generalizing Language Models to Dynamic Span-Vocabulary via GFlowNets

Tab-MIA: A Benchmark Dataset for Membership Inference Attacks on Tabular Data in LLMs

Precise and Interpretable Editing of Code Knowledge in Large Language Models

Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation

CoFact: Conformal Factuality Guarantees for Language Models under Covariate Shift

Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding

Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models

Fewer Weights, More Problems: A Practical Attack on LLM Pruning

Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models

TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models

Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test

PonderLM: Pretraining Language Models to Ponder in Continuous Space

Next-ToBE: Probabilistic Next Token-Bag Exploitation for Activating Anticipatory Capacity in LLMs

REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence

Robust LLM Unlearning via Post Judgment and Multi-round Thinking

Spilled Energy in Large Language Models

ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping

Learning to Lie: Adversarial Attacks on Human-AI Teams and LLMs

ASIDE: Architectural Separation of Instructions and Data in Language Models

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

Rote Learning Considered Useful: Generalizing over Memorized Data in LLMs

Model Collapse Is Not a Bug but a Feature in Machine Unlearning for LLMs

VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models

Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization

LLMs Process Lists With General Filter Heads

Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks

From Concepts to Components: Concept-Agnostic Attention Module Discovery in Transformers

UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models

Vision Language Models are Biased

Watermarking Diffusion Language Models

How Catastrophic is Your LLM? Certifying Risks in Conversation

SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests

Predicting LLM Output Length via Entropy-Guided Representations

Unveiling Downstream Performance Scaling of LLMs: A Clustering-Based Perspective

MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs

Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance

Truthfulness Despite Weak Supervision: Evaluating and Training LLMs Using Peer Prediction

MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents

MSCR: Exploring the Vulnerability of LLMs’ Mathematical Reasoning Abilities Using Multi-Source Candidate Replacement

GraphOmni: A Comprehensive and Extensible Benchmark Framework for Large Language Models on Graph-theoretic Tasks

Multi-Scale Hypergraph Meets LLMs: Aligning Large Language Models for Time Series Analysis

From Evaluation to Defense: Advancing Safety in Video Large Language Models

Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing

Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense

Robust Fine-Tuning from Non-Robust Pretrained Models: Mitigating Suboptimal Transfer With Epsilon-Scheduling

VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models

Semantic Uncertainty Quantification of Hallucinations in LLMs: A Quantum Tensor Network Based Method

Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!

Predicting Training Re-evaluation Curves Enables Effective Data Curriculums for LLMs

SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks

How Transformers Learn Causal Structures In-Context: Explainable Mechanism Meets Theoretical Guarantee

Reconstructing KV Caches with Cross-Layer Fusion for Enhanced Transformers

BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models

Learn-to-Distance: Distance Learning for Detecting LLM-Generated Text

Highly Efficient and Effective LLMs with Multi-Boolean Architectures

Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?

Early Signs of Steganographic Capabilities in Frontier LLMs

DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems

Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity

Latent-Guided Reasoning: Empowering Small LLMs with Large-Model Thinking

ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models

FutureMind: Equipping Small Language Models with Strategic Thinking-Pattern Priors via Adaptive Knowledge Distillation

NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents

SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs

Automata Learning and Identification of the Support of Language Models

Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models

Towards All-Atom Foundation Models for Biomolecular Binding Affinity Prediction

Characterizing and Mitigating Reasoning Drift in Large Language Models

Towards Knowledge‑and‑Data‑Driven Organic Reaction Prediction: RAG‑Enhanced and Reasoning‑Powered Hybrid System with LLMs

RCPU: Rotation-Constrained Error Compensation for Structured Pruning of Large Language Models

Multi-LLM Adaptive Conformal Inference for Reliable LLM Response

FlexRibbon: Joint Sequence and Structure Pretraining for Protein Modeling

Unified Biomolecular Trajectory Generation via Pretrained Variational Bridge

EarthSE: A Benchmark Evaluating Earth Scientific Exploration Capability for Large Language Models

Task-Adaptive Parameter-Efficient Fine-Tuning for Weather Foundation Models

Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

A Joint Diffusion Model with Pre-Trained Priors for RNA Sequence-Structure Co-Design

AntigenLM: Structure-Aware DNA Language Modeling for Influenza

Lost in Tokenization: Context as the Key to Unlocking Biomolecular Understanding in Scientific LLMs

CellAgent: LLM-Driven Multi-Agent Framework for Natural Language-Based Single-Cell Analysis

Spectral Bellman Method: Unifying Representation and Exploration in RL

Knowledgeable Language Models as Black-Box Optimizers for Personalized Medicine

Can we generate portable representations for clinical time series data using LLMs?

Joint Adaptation of Uni-modal Foundation Models for Multi-modal Alzheimer's Disease Diagnosis

No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping

NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context

FETAL-GAUGE: A BENCHMARK FOR ASSESSING VISION-LANGUAGE MODELS IN FETAL ULTRASOUND

Zero-Shot Adaptation of Behavioral Foundation Models to Unseen Dynamics

RECAST: Expanding the Boundaries of LLMs' Complex Instruction Following with Multi-Constraint Data

Sample Lottery: Unsupervised Discovery of Critical Instances for LLM Reasoning

One Demo Is All It Takes: Planning Domain Derivation with LLMs from A Single Demonstration

Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation

CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control

Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models

PMDformer: Patch-Mean Decoupling Information Transformer for Long-term Forecasting

Test-Time Efficient Pretrained Model Portfolios for Time Series Forecasting

TS-DDAE: A Novel Temporal-Spectral Denoising Diffusion AutoEncoder for Wireless Signal Recognition Model Pre-training

SFT Doesn’t Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs

CoRA: Boosting Time Series Foundation Models for Multivariate Forecasting through Correlation-aware Adapter

When Foundation Models are One-Liners: Limitations and Future Directions for Time Series Anomaly Detection

ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement Learning

Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards

TSM-Bench: Detecting LLM-Generated Text in Real-World Wikipedia Editing Practices

SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Parallel Token Prediction for Language Models

NextQuill: Causal Preference Modeling for Enhancing LLM Personalization

Flow Caching for Autoregressive Video Generation

LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models

Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training

Hedonic Neurons: A Mechanistic Mapping of Latent Coalitions in Transformer MLPs

Do LLMs Forget What They Should? Evaluating In-Context Forgetting in Large Language Models

Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?

Plan-Answer-Refine-on-Graph: Structured Planning and Self-Refinement for Large Language Model Reasoning on Knowledge Graphs

LatentQA: Teaching LLMs to Decode Activations Into Natural Language

From Utterance to Vividity: Training Expressive Subtitle Translation LLM via Adaptive Local Preference Optimization

Rethinking LLM Evaluation: Can We Evaluate LLMs with 200× Less Data?

The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs

PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models

SpatiaLab: Can Vision–Language Models Perform Spatial Reasoning in the Wild?

Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles

Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling

Group-Normalized Implicit Value Optimization for Language Models

Out of the Memory Barrier: A Highly Memory-Efficient Training System for LLMs with Million-Token Contexts

LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation

Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training

AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs

Towards Understanding Valuable Preference Data for Large Language Model Alignment

Rethinking LLM Reasoning: From Explicit Trajectories to Latent Representations

PT2^2-LLM: Post-Training Ternarization for Large Language Models

ChemEval: A Multi-level and Fine-grained Chemical Capability Evaluation for Large Language Models

Hippoformer: Integrating Hippocampus-inspired Spatial Memory with Transformers

Autoregressive Visual Decoding from EEG Signals

AutoCode: LLMs as Problem Setters for Competitive Programming

AudioTrust: Benchmarking The Multifaceted Trustworthiness of Audio Large Language Models

Inducing Dyslexia in Vision Language Models

Riemannian High-Order Pooling for Brain Foundation Models

Autoencoding-Free Context Compression for LLMs via Contextual Semantic Anchors

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

Synthetic Bootstrapped Pretraining

Mitigating Non-IID Drift in Zeroth-Order Federated LLM Fine-Tuning with Transferable Sparsity

AetherCode: Evaluating LLMs’ Ability to Win In Premier Programming Competitions

Enhancing Vision-Language Model with Unmasked Token Alignment

821. AB-UPT: Scaling Neural CFD Surrogates for High- Fidelity Automotive Aerodynamics Simulations via Anchored- Branched Universal Physics Transformers

  • Topics: LLMs & Foundation Models

822. Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

  • Topics: Diffusion Models & Generative AI, Computer Vision, Efficiency & Compression

Steering Autoregressive Music Generation with Recursive Feature Machines

Token-Efficient Long-Term Interest Sketching and Internalized Reasoning for LLM-based Recommendation

Evolving Graph Structured Programs for Circuit Generation with Large Language Models

T1: Tool-integrated Verification for Test-time Compute Scaling in Small Language Models

NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

Progressive Gaussian Transformer with Anisotropy-aware Sampling for Open Vocabulary Occupancy Prediction

Joint Selection for Large-Scale Pre-Training Data via Policy Gradient-based Mask Learning

Reinforced Latent Reasoning for LLM-based Recommendation

FastVGGT: Fast Visual Geometry Transformer

Pretraining Scaling Laws for Generative Evaluations of Language Models

Fewer Battles, More Gain: An Information-Efficient Framework for Arena-based LLM Evaluation

TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning

Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning

OptimalThinkingBench: Evaluating Over and Underthinking in LLMs

Understanding and Relaxing the Limitations of Transformers for Linear Algebra

The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas

ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction

Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models

Analyzing and Evaluating Unbiased Language Model Watermark

CAR-LoRA: Training Compression-Aware and Robust LoRA Adapters for Evolving LLMs

On the Eligibility of LLMs for Counterfactual Reasoning: A Decompositional Study

LLM Pretraining with Continuous Concepts

Autoregressive Image Generation with Randomized Parallel Decoding

Let LLMs Speak Embedding Languages: Generative Text Embeddings via Iterative Contrastive Refinement

VQ-Transplant: Efficient VQ-Module Integration for Pre-trained Visual Tokenizers

Fly-CL: A Fly-Inspired Framework for Enhancing Efficient Decorrelation and Reduced Training Time in Pre-trained Model-based Continual Representation Learning

SSG: Scaled Spatial Guidance for Multi-Scale Visual Autoregressive Generation

Tracing and Reversing Edits in LLMs

Meta-Router: Bridging Gold-standard and Preference-based Evaluations in LLM Routing

Mapping Post-Training Forgetting in Language Models at Scale

Knowledge Distillation for Large Language Models through Residual Learning

SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?

Textual Bayes: Quantifying Prompt Uncertainty in LLM-Based Systems

PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters

Hallucination-aware Intermediate Representation Edit in Large Vision-Language Models

ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Models

MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs

Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models

Divide, Harmonize, Then Conquer It: Shooting Multi-Commodity Flow Problems with Multimodal Language Models

LLaVAction: evaluating and training multi-modal large language models for action understanding

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

Improving the Trade-off Between Watermark Strength and Speculative Sampling Efficiency for Language Models

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning

Improving LLM-based Global Optimization with Search Space Partitioning

GranViT: A Fine-Grained Vision Model For Autoregressive Multimodal Large Language Models

Thompson Sampling via Fine-Tuning of LLMs

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

SPIKE-RL: Video-LLMs meet Bayesian Surprise

Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs

Refining Hybrid Genetic Search for CVRP via Reinforcement Learning-Finetuned LLM

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

An Agentic Framework with LLMs for Solving Complex Vehicle Routing Problems

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

Whatever Remains Must Be True: Filtering Drives Reasoning in LLMs, Shaping Diversity

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

Guided Speculative Inference for Efficient Test-Time Alignment of LLMs

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs

TEST-TIME SCALING IN DIFFUSION LLMS VIA HIDDEN SEMI-AUTOREGRESSIVE EXPERTS

Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models

Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

RF-DETR: Neural Architecture Search for Real-Time Detection Transformers

Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition

Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs

Efficient Message-Passing Transformer for Error Correcting Codes

Continuum Transformers Perform In-Context Learning by Operator Gradient Descent

Transformers Learn Latent Mixture Models In-Context via Mirror Descent

Pose-RFT: Aligning MLLMs for 3D Pose Generation via Hybrid Action Reinforcement Fine-Tuning

SinkTrack: Attention Sink based Context Anchoring for Large Language Models

ZeroTuning: Unlocking the Initial Token's Power to Enhance Large Language Models Without Training

Setting the Record Straight on Transformer Oversmoothing

1173. Human-Object Interaction via Automatically Designed VLM-Guided Motion Policy

  • Topics: Multi-modal & Vision-Language

Steering MoE LLMs via Expert (De)Activation

SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs

MOAI: Module-Optimizing Architecture for Non-Interactive Secure Transformer Inference

Membership Inference Attacks Against Fine-tuned Diffusion Language Models

Searching for Privacy Risks in LLM Agents via Simulation

Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning

When LLMs get significantly worse: A statistical approach to detect model degradations

In Agents We Trust, but Who Do Agents Trust? Latent Source Preferences Steer LLM Generations

Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets

LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena

ExpGuard: LLM Content Moderation in Specialized Domains

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

LS-Merge: Merging Language Models in Latent Space

LLM Unlearning with LLM Beliefs

Scaling Laws for Diffusion Transformers

Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective

PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach

DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher

GneissWeb: Preparing High Quality Data for LLMs at Scale

ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding

Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning

Towards Sequence Modeling Alignment between Tokenizer and Autoregressive Model

Reforming the Mechanism: Editing Reasoning Patterns in LLMs with Circuit Reshaping

Obfuscated Activations Bypass LLM Latent-Space Defenses

Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework

Counterfactual LLM-based Framework for Measuring Rhetorical Style

Hidden Breakthroughs in Language Model Training

AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size

Thought Branches: Interpreting LLM Reasoning Requires Resampling

Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training

Knowledge Externalization: Reversible Unlearning and Modular Retrieval in Multimodal Large Language Models

SAE as a Crystal Ball: Interpretable Features Predict Cross-domain Transferability of LLMs without Training

The Achilles’ Heel of LLMs: How Altering a Handful of Neurons Can Cripple Language Abilities

From Sure" to Sorry": Detecting Jailbreak in Large Vision Language Model via JailNeurons

HLD: Approximate Hierarchical Linguistic Distribution Modeling for LLM-Generated Text Detection

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

STAR: Strategy-driven Automatic Jailbreak Red-teaming For Large Language Model

DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs

Dual-Space Smoothness for Robust and Balanced LLM Unlearning

Probability Distributions Computed by Autoregressive Transformers

Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning

MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes

BiasScope: Towards Automated Detection of Bias in LLM-as-a-Judge Evaluation

Pretrain–Test Task Alignment Governs Generalization in In-Context Learning

BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses

PRISON: Unmasking the Criminal Potential of Large Language Models

Is Your Paper Being Reviewed by an LLM? Benchmarking AI Text Detection in Peer Review

Self-Destructive Language Models

LLMS ON TRIAL: Evaluating Judicial Fairness For Large Language Models

DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD

LSA: Layer-wise Sparsity Allocation for Large Language Model Pruning Based on Minimal Linear Reconstruction Error

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

Preserve and Sculpt: Manifold-Aligned Fine-tuning of Vision-Language Models for Few-Shot Learning

The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs

COMAL: A Convergent Meta-Algorithm for Aligning LLMs with General Preferences

Randomized Antipodal Search Done Right for Data Pareto Improvement of LLM Unlearning

Pruning as a Cooperative Game: Surrogate-Assisted Layer Contribution Estimation for Large Language Models

Predicting LLM Reasoning Performance with Small Proxy Model

MLP Memory: A Retriever-Pretrained Memory for Large Language Models

Efficient Turing Machine Simulation with Transformers

Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs

ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models

Transformers as Unsupervised Learning Algorithms: A study on Gaussian Mixtures

Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning

ATOM: A Pretrained Neural Operator for Multitask Molecular Dynamics

Rigidity-Aware Geometric Pretraining for Protein Design and Conformational Ensembles

Small Transformers Don’t Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and Implications for Mechanistic Interpretability

Decoupling Positional and Symbolic Attention in Transformers

Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective

Orbital Transformers for Predicting Wavefunctions in Time-Dependent Density Functional Theory

LC-PLM: Long-context Protein Language Modeling Using Bidirectional Mamba with Shared Projection Layers

1437. High-Probability Bounds for the Last Iterate of Clipped SGD

  • Topics: Other / Unclassified

Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling

A Resolution-Agnostic Geometric Transformer for Chromosome Modeling Using Inertial Frame

AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs

Can SAEs reveal and mitigate racial biases of LLMs in healthcare?

From Cheap Geometry to Expensive Physics: A Physics-agnostic Pretraining Framework for Neural Operators

Nudging the Boundaries of LLM Reasoning

The State of Reinforcement Finetuning for Transformer-based Agents

Peak-Return Greedy Slicing: Subtrajectory Selection for Transformer-based Offline RL

CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics

Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning

Squeeze the Soaked Sponge: Efficient Off-policy RFT for Large Language Model

Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs

Re2\textbf{Re}^{2}: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving

Iterated Q-Network: Beyond One-Step Bellman Updates in Deep Reinforcement Learning

1527. D-REX: Differentiable Real-to-Sim-to-Real Engine for Learning Dexterous Grasping

  • Topics: Other / Unclassified

Low Rank Transformer for Multivariate Time Series Anomaly Detection and Localization

Multi-objective Large Language Model Alignment with Hierarchical Experts

Enhancing Language Model Reasoning with Structured Multi-Level Modeling

Semantic-Enhanced Time-Series Forecasting via Large Language Models

Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents

Context parroting: A simple but tough-to-beat baseline for foundation models in scientific machine learning

Getting Your LLMs Ready for Reinforcement Learning with Lightweight SFT

LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities

J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning

RPM: Reasoning-Level Personalization for Black-Box Large Language Models

RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems

FlowNIB: An Information Bottleneck Analysis of Bidirectional vs. Unidirectional Language Models

Lossless Vocabulary Reduction for Auto-Regressive Language Models

When Does Divide and Conquer Work for Long Context LLM? A Noise Decomposition Framework

Can Speech LLMs Think while Listening?

DeepRAG: Thinking to Retrieve Step by Step for Large Language Models

X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model

When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs

ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

UNDERSTANDING TRANSFORMERS FOR TIME SERIES FORECASTING: A CASE STUDY ON MOIRAI

Strategic Planning and Rationalizing on Trees Make LLMs Better Debaters

ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs

Beyond the Known: An Unknown-Aware Large Language Model for Open-Set Text Classification

Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels

Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning

R-Zero: Self-Evolving Reasoning LLM from Zero Data

DND: Boosting Large Language Models with Dynamic Nested Depth

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

How Text Quality Interventions Reshape Neural Scaling Laws for LLMs: Empirical Study

Decoding Dynamic Visual Experience from Calcium Imaging via Cell-Pattern-Aware Pretraining

From Assistant to Independent Developer — Are GPTs Ready for Software Development?

Otters: An Energy-Efficient Spiking Transformer via Optical Time-to-First-Spike Encoding

Neural Dynamics Self-Attention for Spiking Transformers

LogiConBench: Benchmarking Logical Consistencies of LLMs

Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions

Boosting Multi-Domain Reasoning of LLMs via Curvature-Guided Policy Optimization

ProSafePrune: Projected Safety Pruning for Mitigating Over-Refusal in LLMs

Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models

LaVCa: LLM-assisted Visual Cortex Captioning

Align Your Structures: Generating Trajectories with Structure Pretraining for Molecular Dynamics

MindMix: A Multimodal Foundation Model for Auditory Perception Decoding via Deep Neural-Acoustic Alignment

AlphaBench: Benchmarking Large Language Models in Formulaic Alpha Factor Mining

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

RefineBench: Evaluating Refinement Capability of Language Models via Checklists

Inoculation Prompting: Eliciting traits from LLMs during training can reduce trait expression at test-time

ELLMob: Event-Driven Human Mobility Generation with Self-Aligned LLM Framework

Geometric Constraints for Small Language Models to Understand and Expand Scientific Taxonomies

Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance

Where Did This Sentence Come From? Tracing Provenance in LLM Reasoning Distillation

Towards a Foundation Model for Crowdsourced Label Aggregation

In-Context Algorithm Emulation in Fixed-Weight Transformers

Reasoning Language Model Inference Serving Unveiled: An Empirical Study

Unified Vision–Language Modeling via Concept Space Alignment

Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards

Closing the Safety Gap: Surgical Concept Erasure in Visual Autoregressive Models

Flock: A Knowledge Graph Foundation Model via Learning on Random Walks

Ensembling Pruned Attention Heads For Uncertainty-Aware Efficient Transformers

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

PACE: Pretrained Audio Continual Learning

MAGO: Beyond Fixed Hyperparameters with Multi-Objective Pareto Optimization for Hybrid LLM Reasoning

Transformers with Endogenous In-Context Learning: Bias Characterization and Mitigation

DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science

PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement

GarmentGPT: Compositional Garment Pattern Generation via Discrete Latent Tokenization

Optimal Brain Restoration for Joint Quantization and Sparsification of LLMs

TP-Spikformer: Token Pruned Spiking Transformer

Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning

ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer

LLM-JEPA: Large Language Models Meet Joint Embedding Predictive Architectures

KVComm: Enabling Efficient LLM Communication through Selective KV Sharing

Learning to Recall with Transformers Beyond Orthogonal Embeddings

Learning-Time Encoding Shapes Unlearning in LLMs

CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Vision-Language Model

SPICE: Submodular Penalized Information–Conflict Selection for Efficient Large Language Model Training

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning

Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning

Information Theoretic Guarantees For Policy Alignment In Large Language Models

1814. Adjusting Prediction Model Through Wasserstein Geodesic for Causal Inference

  • Topics: Efficiency & Compression

Relational Feature Caching for Accelerating Diffusion Transformers

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

ToProVAR: Efficient Visual Autoregressive Modeling via Tri-Dimensional Entropy-Aware Semantic Analysis and Sparsity Optimization

Designing Time Series Experiments in A/B Testing with Transformer Reinforcement Learning

Token-Efficient Item Representation via Images for LLM Recommender Systems

Learning is Forgetting; LLM Training As Lossy Compression

Building Massively Multimodal Foundation Models with Interaction-aware Mixture-of-Experts

CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design

SiNGER: A Clearer Voice Distills Vision Transformers Further

Entropy-Based Block Pruning for Efficient Large Language Models

ORION: Decoupling and Alignment for Unified Autoregressive Understanding and Generation

Locality-Attending Vision Transformer

StyliTruth : Unlocking Stylized yet Truthful LLM Generation via Disentangled Steering

Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows

BAR: Refactor the Basis of Autoregressive Visual Generation

Knowledge Fusion of Large Language Models via Modular SkillPacks

VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision–Language Models

Following the Navigation: Enhancing Small Language Models Contextual Reasoning with LLM Guidance

NOVA3R: Non-pixel-aligned Visual Transformer for Amodal 3D Reconstruction

DUET: Optimizing LLM Training Data Mixtures via Noisy Feedback from Unseen, Downstream Evaluation Tasks

Prompt-Robust Vision-Language Models via Meta-Finetuning

Post-hoc Probabilistic Vision-Language Models

Efficient Autoregressive Inference for Transformer Probabilistic Models

RIVER: A Real-Time Interaction Benchmark for Video LLMs

Do LLM Agents Know How to Ground, Recover, and Assess? Evaluating Epistemic Competence in Information-Seeking Agents

Efficient Test-Time Scaling for Small Vision-Language Models

On Discriminative vs. Generative classifiers: Rethinking MLLMs for Action Understanding

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

Long-tailed Test-Time Adaptation for Vision-Language Models

LLM as an Algorithmist: Enhancing Anomaly Detectors via Programmatic Synthesis

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

Imitating the Truth: Attention-aware Truth-Guided Enhancement for Hallucination Mitigation in Large Vision-Language Models

ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?

TerraFM: A Scalable Foundation Model for Unified Multisensor Earth Observation

pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models

Mordal: Automated Pretrained Model Selection for Vision Language Models

InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models

Constrained Decoding of Diffusion LLMs with Context-Free Grammars

Beyond Magic Words: Sharpness-Aware Prompt Evolving for Robust Large Language Models with TARE

DASH: Deterministic Attention Scheduling for High-throughput Reproducible LLM Training

LLMs as Rules Oracles: Exploring Real-World Multimodal Reasoning in Tabletop Strategy Game Environments

HiFo-Prompt: Prompting with Hindsight and Foresight for LLM-based Automatic Heuristic Design

The Unseen Frontier: Pushing the Limits of LLM Sparsity with Surrogate-Free ADMM

DaVinci: Reinforcing Visual-Structural Syntax in MLLMs for Generalized Scientific Diagram Parsing

MIMIC-Bench: Exploring the User-Like Thinking and Mimicking Capabilities of Multimodal Large Language Models

AdaCache: Adaptive Caching and Context Augmentation for Efficient LLM Serving

The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss

To View Transform or Not to View Transform: NeRF-based Pre-training Perspective

Mitigating Hallucination in Vision-Language Model with Depth and Spatial-aware Key-Value Refinement

Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning

Meta-UCF: Unified Task-Conditioned LoRA Generation for Continual Learning in Large Language Models

RL makes MLLMs see better than SFT

Equilibrium Language Models

AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward

Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries

SAES-SVD: Self-Adaptive Suppression of Accumulated and Local Errors for SVD-based LLM Compression

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models

FSOD-VFM: Few-Shot Object Detection with Vision Foundation Models and Graph Diffusion

IceCache: Memory-Efficient KV-cache Management for Long-Sequence LLMs

MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs

3DSMT: A Hybrid Spiking Mamba-Transformer for Point Cloud Analysis

Identifying and Evaluating Inactive Heads in Pretrained LLMs

Understanding Transformers for Time Series: Rank Structure, Flow-of-ranks, and Compressibility

A State-Transition Framework for Efficient LLM Reasoning

Smooth Reading: Bridging the Gap of Recurrent LLM to Self-Attention LLM on Long-Context Understanding

NRGPT: An Energy-based Alternative for GPT

Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification

String Seed of Thought: Prompting LLMs for Distribution-Faithful and Diverse Generation

Dynamic Weight Grafting: Localizing Finetuned Factual Knowledge in Transformers

THE PATH OF LEAST RESISTANCE: GUIDING LLM REASONING TRAJECTORIES WITH PREFIX CONSENSUS

SparseD: Sparse Attention for Diffusion Language Models

Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings

Reformulation for Pretraining Data Augmentation

SecP-Tuning: Efficient Privacy-Preserving Prompt Tuning for Large Language Models via MPC

Structurally Human, Semantically Biased: Detecting LLM-Generated References with Embeddings and GNNs

e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs

DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation

ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents

FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion

SeedPrints: Fingerprints Can Even Tell Which Seed Your Large Language Model Was Trained From

Soft-Masked Diffusion Language Models

RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs

Evolution of Concepts in Language Model Pre-Training

Pedagogically-Inspired Data Synthesis for Language Model Knowledge Distillation

Composition of Pretrained Diffusion Models: A Logic-Based Calculus

Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models

Log Probability Tracking of LLM APIs

DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation

Copy-Paste to Mitigate Large Language Model Hallucinations

Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs

Routing, Cascades, and User Choice for LLMs

Hey, That's My Model! Introducing Chain & Hash, An LLM Fingerprinting Technique

Doubly-Robust LLM-as-a-Judge: Externally Valid Estimation with Imperfect Personas

Understanding Cross-layer Contributions to Mixture-of-Experts Routing in LLMs

Global-Recent Semantic Reasoning on Dynamic Text-Attributed Graphs with Large Language Models

MoEEdit: Efficient and Routing-Stable Knowledge Editing for Mixture-of-Experts LLMs

Semantic Regexes: Auto-Interpreting LLM Features with a Structured Language

Priors in time: Missing inductive biases for language model interpretability

Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs

: One LLM Token for Explicit Graph Structural Understanding

Spilling the Beans: Teaching LLMs to Self-Report Their Hidden Objectives

Breaking Agent Backbones: Evaluating the Security of Backbone LLMs in AI Agents

AWM: Accurate Weight-Matrix Fingerprint for Large Language Models

NDAD: Negative-Direction Aware Decoding for Large Language Models via Controllable Hallucination Signal Injection

When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment

Generative Value Conflicts Reveal LLM Priorities

Relational Graph Transformer

Bilateral Information-aware Test-time Adaptation for Vision-Language Models

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Are Reasoning LLMs Robust to Interventions on their Chain-of-Thought?

ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

Two failure modes of deep transformers and how to avoid them: a unified theory of signal propagation at initialisation

Cost-of-Pass: An Economic Framework for Evaluating Language Models

The Effect of Attention Head Count on Transformer Approximation

Theoretical Modeling of Large Language Model Self-Improvement Training Dynamics Through Solver-Verifier Gap

Language Models are Injective and Hence Invertible

Deep Hierarchical Learning with Nested Subspace Networks for Large Language Models

Towards Strategic Persuasion with Language Models

MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling

From Tokens to Thoughts: How LLMs and Humans Trade Compression for Meaning

Cutting the Skip: Training Residual-Free Transformers

Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Spinning Straw into Gold: Relabeling LLM Agent Trajectories in Hindsight for Successful Demonstrations

DynamicInfer: Runtime-Aware Sparse Offloading for LLMs Inference on a Consumer-Grade GPU

On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs

Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners

First is Not Really Better Than Last: Evaluating Layer Choice and Aggregation Strategies in Language Model Data Influence Estimation

Quantifying Cross-Attention Interaction in Transformers for Interpreting TCR-pMHC Binding

GALAX: Graph-Augmented Language Model for Explainable Reinforcement-Guided Subgraph Reasoning in Precision Medicine

When More is Less: Understanding Chain-of-Thought Length in LLMs

Tokenization to Transfer: Do Genomic Foundation Models Learn Good Representations?

Bridging Radiology and Pathology Foundation Models via Concept-Based Multimodal Co-Adaptation

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

QeRL: Beyond Efficiency - Quantization-enhanced Reinforcement Learning for LLMs

ReTool: Reinforcement Learning for Strategic Tool Use in LLMs

Si-GT: Fast Interconnect Signal Integrity Analysis for Integrated Circuit Design via Graph Transformers

Robust and Interpretable Adaptation of Equivariant Materials Foundation Models via Sparsity-promoting Fine-tuning

Panda: A pretrained forecast model for chaotic dynamics

Pretrain Value, Not Reward: Decoupled Value Policy Optimization

Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models

AbstRaL: Augmenting LLMs' Reasoning by Reinforcing Abstract Thinking

BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised Reinforcement Learning

Towards Bridging the Gap between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning

D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI

VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications

Learning to Be Uncertain: Pre-training World Models with Horizon-Calibrated Uncertainty

MIRA: Memory-Integrated Reinforcement Learning Agent with Limited LLM Guidance

OrchestrationBench: LLM-Driven Agentic Planning and Tool Use in Multi-Domain Scenarios

Test-Time Adaptation for LLM Agents via Environment Interaction

Beyond Accuracy: Are Time Series Foundation Models Well-Calibrated?

TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models

How Far Can Unsupervised RLVR Scale LLM Training?

Unsupervised Learning of Efficient Exploration: Pre-training Adaptive Policies via Self-Imposed Goals

EVEREST: A Transformer for Probabilistic Rare-Event Anomaly Detection with Evidential and Tail-Aware Uncertainty

Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies

Adaptive Conformal Anomaly Detection with Time Series Foundation Models for Signal Monitoring.

Risk-Sensitive Reinforcement Learning for Alleviating Exploration Dilemmas in Large Language Models

How to train data-efficient LLMs

Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs

LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning

Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents

ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

Turning Internal Gap into Self-Improvement: Promoting the Generation-Understanding Unification in MLLMs

Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers

CaTS: Calibrated Test-Time Scaling for Efficient LLM Reasoning

Are LLMs Really Not Knowledgeable? Mining the Submerged Knowledge in LLMs' Memory

Measuring and Mitigating Rapport Bias of Large Language Models under Multi-Agent Social Interactions

TIPS: Turn-level Information-Potential Reward Shaping for Search-Augmented LLMs

∇\nabla-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

Plan and Budget: Effective and Efficient Test-Time Scaling on Reasoning Large Language Models

Cognitive models can reveal interpretable value trade-offs in language models

Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs

Prompt and Parameter Co-Optimization for Large Language Models

Revisiting Parameter Server in LLM Post-Training

SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models

Inpainting-Guided Policy Optimization for Diffusion Large Language Models

Representation Alignment for Diffusion Transformers without External Components

Influence-Preserving Proxies for Gradient-Based Data Selection in LLM FineTuning

Incentive-Aligned Multi-Source LLM Summaries

DispViT: Direct Stereo Disparity Regression with a Single-Stream Vision Transformer

Search Arena: Analyzing Search-Augmented LLMs

Continuous Audio Language Models

How Stable is the Next Token? A Geometric View of LLM Prediction Stability

Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents

LLMs Can Hide Text in Other Text of the Same Length

LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns

On Entropy Control in LLM-RL Algorithms

Tug-of-War No More: Harmonizing Accuracy and Robustness in Vision-Language Models via Stability-Aware Task Vector Merging

Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment

Strategic Obfuscation of Deceptive Reasoning in Language Models

MeSH: Memory-as-State-Highways for Recursive Transformers

CellDuality: Unlocking Biological Reasoning in LLMs with Self-Supervised RLVR

FeDaL: Federated Dataset Learning for General Time Series Foundation Models

LLMs Struggle to Balance Reasoning and World Knowledge in Causal Narrative Understanding

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

Scaling Behavior of Discrete Diffusion Language Models

A cross-species neural foundation model for end-to-end speech decoding

Brain-Semantoks: Learning Semantic Tokens of Brain Dynamics with a Self-Distilled Foundation Model

SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs

ProofOptimizer: Training Language Models to Simplify Proofs without Human Demonstrations

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

Dual-Scale World Memory for LLM Agents towards Hard-Exploration Problems

When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs

More Than What Was Chosen: LLM-based Explainable Recommendation Beyond Noisy User Preferences

Evaluating Text Creativity across Diverse Domains: a Dataset and Large Language Model Evaluator

Diffusion Transformers with Representation Autoencoders

Sci2Pol: Evaluating and Fine-tuning LLMs on Scientific-to-Policy Brief Generation

Music Flamingo: Scaling Music Understanding in Audio Language Models

USTBench: Benchmarking and Dissecting Spatiotemporal Reasoning Capabilities of LLMs as Urban Agents

Knowledge Reasoning Language Model: Unifying Knowledge and Language for Inductive Knowledge Graph Reasoning

AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?

An Ensemble Framework for Unbiased Language Model Watermarking

YuE: Scaling Open Foundation Models for Long-Form Music Generation

Variational Reasoning for Language Models

Astraea: A Token-wise Acceleration Framework for Video Diffusion Transformers

Distillation of Large Language Models via Concrete Score Matching

OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning

GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs

PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs

Trion: FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of LLMs

Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Reasoning Large Language Models

Uncertainty as Feature Gaps: Epistemic Uncertainty Quantification of LLMs in Contextual Question-Answering

Enhancing Visual Token Representations for Video Large Language Models via Training-free Spatial-Temporal Pooling and Gridding

Teach2Eval: An Interaction-Driven LLMs Evaluation Method via Teaching Effectiveness

GIT-BO: High-Dimensional Bayesian Optimization with Tabular Foundation Models

Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation

Do 3D Large Language Models Really Understand 3D Spatial Relationships?

The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs

Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration

LH-DECEPTION: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

LightRetriever: A LLM-based Text Retrieval Architecture with Extremely Faster Query Inference

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts

Streaming Autoregressive Video Generation via Diagonal Distillation

Prompt-MII: Meta-Learning Instruction Induction for LLMs

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

Condition Errors Refinement in Autoregressive Image Generation with Diffusion Loss

Exploring Knowledge Purification in Multi-Teacher Knowledge Distillation for LLMs

From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation

reAR: Rethinking Visual Autoregressive Models via Token-wise Consistency Regularization

Rethinking Global Text Conditioning in Diffusion Transformers

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

Evaluating Language Models' Evaluations of Games

Pre-training Limited Memory Language Models with Internal and External Knowledge

HalluGuard: Demystifying Data-Driven and Reasoning-Driven Hallucinations in LLMs

Generalization in LLM Problem Solving: The Case of the Shortest Path

On Code-Induced Reasoning in LLMs

Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs

Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation

Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning

SAM-Veteran: An MLLM-Based Human-like SAM Agent for Reasoning Segmentation

Thicker and Quicker: The Jumbo Token for Fast Plain Vision Transformers

Antislop: A Comprehensive Framework for Identifying and Eliminating Repetitive Patterns in Language Models

DualMap: Enabling Both Cache Affinity and Load Balancing for Distributed LLM Serving

ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models

Measure Twice, Cut Once: A Semantic-Oriented Approach to Video Temporal Localization with Video LLMs

Teaching Metric Distance to Discrete Autoregressive Language Models

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models

GlowQ: Group-Shared LOw-Rank Approximation for Quantized LLMs

Part-X-MLLM: Part-aware 3D Multimodal Large Language Model

SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs

WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models

SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs

Programming by Backprop: An Instruction is Worth 100 Examples When Finetuning LLMs

MotionSight: Boosting Fine-Grained Motion Understanding in Multimodal LLMs

HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes

Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization

Universal Model Routing for Efficient LLM Inference

Decomposed Attention Fusion in MLLMs for Training-free Video Reasoning Segmentation

Hierarchy Decoding: A Training-free Parallel Decoding Strategy for Diffusion Large Language Models

SCoT: Teaching 3D-LLMs to Think Spatially with Million-scale CoT Annotations

VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration

Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations

TS2^2: Training with Sparsemax+, Testing with Softmax for Accurate and Diverse LLM Fine-Tuning

Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models

Reasoning-Driven Multimodal LLM for Domain Generalization

Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment

DiffuDETR: Rethinking Detection Transformers with Denoising Diffusion Process

EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models

Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs

DPad: Efficient Diffusion Language Models with Suffix Dropout

Bootstrapping MLLM for Weakly‑Supervised Class‑Agnostic Object Counting

Expert Divergence Learning for MoE-based Language Models

MotionGPT3: Human Motion as a Second Modality

DETR-ViP: Detection Transformer with Robust Discriminative Visual Prompts

Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment

Operationalizing Data Minimization for Privacy-Preserving LLM Prompting

Natural Identifiers for Privacy and Data Audits in Large Language Models

PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery

Secure Outlier-Aware Large Language Model Inference

Winter Soldier: Backdooring Language Models at Pre-Training with Indirect Data Poisoning

InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models

When Priors Backfire: On the Vulnerability of Unlearnable Examples to Pretraining

wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models

Unlearning Isn't Invisible: Detecting Unlearning Traces in LLMs from Model Outputs

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

RedSage: A Cybersecurity Generalist LLM

Video-GPT via Next Clip Diffusion

Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference

JULI: Jailbreak Large Language Models by Self-Introspection

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

Once-More: Continuous Self-Correction for Large Language Models via Perplexity-Guided Intervention

All Code, No Thought: Language Models Struggle to Reason in Ciphered Language

ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference

GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback

When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models

LingoLoop Attack: Trapping MLLMs via Linguistic Context and State Entrapment into Endless Loops

RepIt: Steering Language Models with Concept-Specific Refusal Vectors

Bridging Input Feature Spaces Towards Graph Foundation Models

GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods

Gelato: Graph Edit Distance via Autoregressive Neural Combinatorial Optimization

Ghost in the Cloud: Your Geo-Distributed Large Language Models Training is Easily Manipulated

D&R: Recovery-based AI-Generated Text Detection via a Single Black-box LLM Call

Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents

Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models

Towards Self-Robust LLMs: Intrinsic Prompt Noise Resistance via CoIPO

Zero-Sacrifice Persistent-Robustness Adversarial Defense for Pre-Trained Encoders

Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth

Multi-Feature Quantized Self-Attention for Fair Large Language Models

TRACEDET: HALLUCINATION DETECTION FROM THE DECODING TRACE OF DIFFUSION LARGE LANGUAGE MODELS

Scaling with Collapse: Efficient and Predictable Training of LLM Families

Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models

SERQ: Saliency-Aware Low-Rank Error Reconstruction for LLM Quantization

Detecting Data Contamination in LLMs via In-Context Learning

Enhancing Instruction Following of LLMs via Activation Steering with Dynamic Rejection

QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models

The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context

CLUE: Conflict-guided Localization for LLM Unlearning Framework

Block Recurrent Dynamics in Vision Transformers

Continual Low-Rank Adapters for LLM-based Generative Recommender Systems

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization

Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs

Mixing Mechanisms: How Language Models Retrieve Bound Entities In-Context

Eliciting Numerical Predictive Distributions of LLMs Without Auto-Regression

Markovian Transformers for Informative Language Modeling

AMiD: Knowledge Distillation for LLMs with α\alpha-mixture Assistant Distribution

Causality ≠ Invariance: Function and Concept Vectors in LLMs

VoG: Enhancing LLM Reasoning through Stepwise Verification on Knowledge Graphs

Medical Interpretability and Knowledge Maps of Large Language Models

Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models

CatalystBench: A Comprehensive Multi-Task Benchmark for Advancing Language Models in Catalysis Science

The Lattice Representation Hypothesis of Large Language Models

Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection

Generalizable Heuristic Generation Through LLMs with Meta-Optimization

Rethinking Uncertainty Estimation in LLMs: A Principled Single-Sequence Measure

BED-LLM: Intelligent Information Gathering with LLMs and Bayesian Experimental Design

Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation

MatRIS: Toward Reliable and Efficient Pretrained Machine Learning Interatomic Potentials

Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs

TetraGT: Tetrahedral Geometry-Driven Explicit Token Interactions with Graph Transformer for Molecular Representation Learning

The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm

Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models

Controlling Repetition in Protein Language Models

MAGE: Multi-scale Autoregressive Generation for Offline Reinforcement Learning

Escaping Policy Contraction: Contraction-Aware PPO (CaPPO) for Stable Language Model Fine-Tuning

Plan-R1: Safe and Feasible Trajectory Planning as Language Modeling

FlowRL: Matching Reward Distributions for LLM Reasoning

Embodied Navigation Foundation Model

FASTer: Toward Powerful and Efficient Autoregressive Vision–Language–Action Models with Learnable Action Tokenizer and Block-wise Decoding

Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning

EquAct: An SE(3)-Equivariant Multi-Task Transformer for 3D Robotic Manipulation

Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning

Policy Contrastive Decoding for Robotic Foundation Models

Tricks or Traps? A Deep Dive into RL for LLM Reasoning

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

Master Skill Learning with Policy-Grounded Synergy of LLM-based Reward Shaping and Exploring

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

Entropy Regularizing Activation: Boosting Continuous Control, Large Language Models, and Image Classification with Activation as Entropy Constraints

SSVPO: Effective Step-Level Credit Assignment for RL Training of Language Models

Rating Quality of Diverse Time Series Data by Meta-learning from LLM Judgment

TSPulse: Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis

PINFDiT: Energy-Based Physics-Informed Diffusion Transformers for General-purpose Time Series Tasks

Understanding the Implicit Biases of Design Choices for Time Series Foundation Models

Estimating Semantic Alphabet Size for LLM Uncertainty Quantification

Near-Optimal Online Deployment and Routing for Streaming LLMs

Diagnosing and Remedying Knowledge Deficiencies in LLMs via Label-free Curricular Meaningful Learning

Transducing Language Models

Prompt Curriculum Learning for Efficient LLM Post-Training

When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling

Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs

Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning

Verification and Co-Alignment via Heterogeneous Consistency for Preference-Aligned LLM Annotations

RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment

Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning

SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs

Measuring LLM Novelty As The Frontier Of Original And High-Quality Output

Toward Efficient Exploration by Large Language Model Agents

MobiEdit: Resource-efficient Knowledge Editing for Personalized On-device LLMs

On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization

Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval

Closing the Gap Between Text and Speech Understanding in LLMs

GradPruner: Gradient-guided Layer Pruning Enabling Efficient Fine-Tuning and Inference for LLMs

PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits

Probing to Refine: Reinforcement Distillation of LLM Reasoners via Explanatory Inversion

LLM2Fx-Tools: Tool Calling for Music Post-Production

Reward Is Enough: LLMs Are In-Context Reinforcement Learners

PerFit: Exploring Personalization Shifts in Representation Space of LLMs

RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM Generation

Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs

EmoPrefer: Can Large Language Models Understand Human Emotion Preferences?

Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling

Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models

Dual-objective Language Models: Training Efficiency Without Overfitting

Analytica: Soft Propositional Reasoning for Robust and Scalable LLM-Driven Analysis

From Static Benchmarks to Dynamic Protocol: Agent-Centric Text Anomaly Detection for Evaluating LLM Reasoning

Enhancing LLMs for Knowledge Base Question Answering by Chain-of-Decomposition

GoT-R1: Unleashing Reasoning Capability of Autoregressive Visual Generation with Reinforcement Learning

FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs

Coupled Transformer Autoencoder for Disentangling Multi-Region Neural Latent Dynamics

Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization

CodeBrain: Bridging Decoupled Tokenizer and Multi-Scale Architecture for EEG Foundation Model

Neural Synchrony Between Socially Interacting Language Models

Pretraining with Re-parametrized Self-Attention: Unlocking Generalizationin SNN-Based Neural Decoding Across Time, Brains, and Tasks

SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors

High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning

When Language Models Lose Their Mind: The Consequences of Brain Misalignment

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers

Spiking Discrepancy Transformer for Point Cloud Analysis

Local Success Does Not Compose: Benchmarking Large Language Models for Compositional Formal Verification

ToolTree: Efficient LLM Tool Planning via Dual-Feedback Monte Carlo Tree Search and Bidirectional Pruning

CrossPL: Systematic Evaluation of Large Language Models for Cross Programming Language Interoperating Code Generation

Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models

SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports

HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming

Fantastic Pretraining Optimizers and Where to Find Them

LLEMA: Evolutionary Search with LLMs for Multi-Objective Materials Discovery

Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models

AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization

Automated Formalization via Conceptual Retrieval-Augmented LLMs

Critical Confabulation: Can LLMs Hallucinate for Social Good?

How Far Are LLMs from Professional Poker Players? Revisiting Game-Theoretic Reasoning with Agentic Tool Use

Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset

On the Thinking-Language Modeling Gap in Large Language Models

SAFER: Risk-Constrained Sample-then-Filter in Large Language Models

dParallel: Learnable Parallel Decoding for dLLMs

Scheduling Your LLM Reinforcement Learning with Reasoning Trees

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Parameters vs. Context: Fine-Grained Control of Knowledge Reliance in Language Models

Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs

Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning

TSLM: Tree-Structured Language Modeling for Divergent Thinking

Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?

Rethinking Code Similarity for Automated Algorithm Design with LLMs

Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs

SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence

Astra: General Interactive World Model with Autoregressive Denoising

Understanding and Improving Continuous LLM Adversarial Training via In-context Learning Theory

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

Adaptive Thinking: Large Language Models Know When to Think in Latent Space

GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models

GenCompositor: Generative Video Compositing with Diffusion Transformer

CaTs and DAGs: Integrating Directed Acyclic Graphs with Transformers for Causally Constrained Predictions

Generation then Reconstruction: Accelerating Masked Autoregressive Models via Two-Stage Sampling

MVAR: Visual Autoregressive Modeling with Scale and Spatial Markovian Conditioning

Difficulty–Diversity Collaborative Filtering for Data-Efficient LLM Fine-Tuning

Reverse Distillation: Consistently Scaling Protein Language Model Representations

Visual Autoregressive Modeling for Instruction-Guided Image Editing

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Towards Understanding the Shape of Representations in Protein Language Models

Enhanced Continual Learning of Vision-Language Models with Model Fusion

BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching

New Hybrid Fine-Tuning Paradigm for LLMs: Algorithm Design and Convergence Analysis Framework

Gradient-Sign Masking for Task Vector Transport Across Pre-Trained Models

Real-Time Motion-Controllable Autoregressive Video Diffusion

FastAvatar: Towards Unified and Fast 3D Avatar Reconstruction with Large Gaussian Reconstruction Transformers

Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs

Revisiting [CLS] and Patch Token Interaction in Vision Transformers

Human-LLM Collaborative Feature Engineering for Tabular Data

RAR: Reversing Visual Attention Re-Sinking for Unlocking Potential in Multimodal Large Language Models

Revisiting Multimodal Positional Encoding in Vision–Language Models

HBO: Hierarchical Balancing Optimization for Fine-Tuning Large Language Models

Divid: Disentangled Spatial-Temporal Modeling within LLMs for Temporally Grounded Video Understanding

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning

Scaling Multi-Task Bayesian Optimization with Large Language Models

SpareTrain: Fault-Tolerant LLM Training via Low-Cost Dual Modular Redundancy

FZOO: Fast Zeroth-Order Optimizer for Fine‑Tuning Large Language Models towards Adam‑Scale Speed

Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes

Developmental Federated Tuning: A Cognitive-Inspired Paradigm for Efficient LLM Adaptation

PTNET: A PROPOSAL-CENTRIC TRANSFORMER NET- WORK FOR 3D OBJECT DETECTION

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

COSMOS: A Hybrid Adaptive Optimizer for Efficient Training of Large Language Models

CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs

CircuitSense: A Hierarchical MLLM Benchmark Bridging Visual Comprehension and Symbolic Reasoning in Engineering Design Process

BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models

EventFlash: Towards Efficient MLLMs for Event-Based Vision

Training Large Language Models To Reason In Parallel With Global Forking Tokens

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

3D Aware Region Prompted Vision Language Model

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

What Layers When: Learning to Skip Compute in LLMs with Residual Gates

Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception

The Lattice Geometry of Neural Network Quantization: A Short Equivalence Proof of GPTQ and Babai's Algorithm

Let's (not) just put things in Context: Test-time Training for Long-context LLMs

Scaling Knowledge Editing in LLMs to 100,000 Facts with Neural KV Database

Massive Editing for Large Language Models Based on Dynamic Weight Generation

Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs

Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models

Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models

Dr.LLM: Dynamic Layer Routing in LLMs

Attention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin

Hyper-SET: Designing Transformers via Hyperspherical Energy Minimization

Draft-based Approximate Inference for LLMs

Logit‑KL Flow Matching: Non‑Autoregressive Text Generation via Sampling‑Hybrid Inference

Is the Reversal Curse a Binding Problem? Uncovering Limitations of Transformers from a Basic Generalization Failure

Evidence for Limited Metacognition in LLMs

Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy

COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics

KV Cache Transform Coding for Compact Storage in LLM Inference

InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning

There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-Training

Autoregressive-based Progressive Coding for Ultra-Low Bitrate Image Compression

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

HiddenEcho: Mitigating Noise Amplification in Differentially Private LLMs with Hidden-State Correction

DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning

Dual-Path Condition Alignment for Diffusion Transformers

Transferable and Stealthy Adversarial Attacks on Large Vision-Language Models

Identifying Robust Neural Pathways: Few-Shot Adversarial Mask Tuning for Vision-Language Models

Enhancing Trustworthiness of Fine-Tuned LLMs via Regularized Subset Selection

Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks

Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark

Ice Cream Doesn’t Cause Drowning: Benchmarking LLMs Against Statistical Pitfalls in Causal Inference

Relational Transformer: Toward Zero-Shot Foundation Models for Relational Data

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

Glance for Context: Learning When to Leverage LLMs for Node-Aware GNN-LLM Fusion

Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts

Your Language Model Secretly Contains Personality Subnetworks

HGNet: Scalable Foundation Model for Automated Knowledge Graph Generation from Scientific Literature

Adversarial Robustness of Graph Transformers

4040. Explainable Mixture Models through Differentiable Rule Learning

  • Topics: Interpretability & Mechanistic Interpretability

KnowledgeSmith: Uncovering Knowledge Updating in LLMs with Model Editing and Unlearning

Sampling-aware Adversarial Attacks Against Large Language Models

Latent Concept Disentanglement in Transformer-based Language Models

Reward Models Inherit Value Biases from Pretraining

Trapped by simplicity: When Transformers fail to learn from noisy features

Neuron-Level Analysis of Cultural Understanding in Large Language Models

Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability

Steering Evaluation-Aware Language Models To Act Like They Are Deployed

When Agents “Misremember” Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

Explainable LLM Unlearning through Reasoning

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

Token-level Data Selection for Safe LLM Fine-tuning

Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges

Benchmarking Overton Pluralism in LLMs

Reasoning Boosts Opinion Alignment in LLMs

Benchmarking LLM Tool-Use in the Wild

Learning Semi-Structured Sparsity for LLMs via Shared and Context-Aware Hypernetwork

Naming to Learn: Class Incremental Learning for Vision-Language Model with Unlabeled Data

Can Language Models Discover Scaling Laws?

Social Agents: Collective Intelligence Improves LLM Predictions

LinguaMap: Which Layers of LLMs Speak Your Language and How to Tune Them?

FACET: A Fragment-Aware Conformer Ensemble Transformer

Internal Planning in Language Models: Characterizing Horizon and Branch Awareness

Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers

Unveiling Super Experts in Mixture-of-Experts Large Language Models

Structural Inference: Interpreting Small Language Models with Susceptibilities

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

HEIST: A Graph Foundation Model for Spatial Transcriptomics and Proteomics Data

GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance

Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models

Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs

Can Large Language Models Match the Conclusions of Systematic Reviews?

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner

Critic–Adviser–Reviser Cyclic Refinement: Towards High-Quality EMR Corpus Generation with LLMs

Cross-Domain Policy Optimization via Bellman Consistency and Hybrid Critics

Structured Reasoning for LLMs: A Unified Framework for Efficiency and Explainability

Map as a Prompt: Learning Multi-Modal Spatial-Signal Foundation Models for Cross-scenario Wireless Localization

RiskPO: Risk-based Policy Optimization with Verifiable Reward for LLM Post-Training

Chunking the Critic: A Transformer-based Soft Actor-Critic with N-Step Returns

VLMgineer: Vision-Language Models as Robotic Toolsmiths

Multi-Bellman operator for convergence of Q-learning with linear function approximation

4280. On Discovering Algorithms for Adversarial Imitation Learning

  • Topics: Trust & Safety, Robotics & Control

Opponent Shaping in LLM Agents

VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing

Off-Trajectory Reasoning: Can LLMs Collaborate on Reasoning Trajectories?

GuidedSampling: Steering LLMs Towards Diverse Candidate Solutions at Inference-Time

Emergent Coordination in Multi-Agent Language Models

Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning

Adapt Data to Model: Adaptive Transformation Optimization for Domain-shared Time Series Foundation Models

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-Language Navigation

From Assumptions to Actions: Turning LLM Reasoning into Uncertainty-Aware Planning for Embodied Agents

STAIRS-Former: Spatio-Temporal Attention with Interleaved Recursive Structure TransFormer for Offline Mulit-task Multi-agent Reinforcement Learning

Best-of-Infinity: Asymptotic Performance of Test-Time LLM Ensembling

DAK-UCB: Diversity-Aware Prompt Routing for LLMs and Generative Models

Repurposing Foundation Model for Generalizable Medical Time Series Classification

Complexity- and Statistics-Guided Anomaly Detection in Time Series Foundation Models

SwiftTS: A Swift Selection Framework for Time Series Pre-trained Models via Multi-task Meta-Learning

Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning

GTool: Graph Enhanced Tool Planning with Large Language Model

OWL : Geometry-Aware Spatial Reasoning for Audio Large Language Models

Test-Time Alignment for Large Language Models via Textual Model Predictive Control

Flipping the Dialogue: Training and Evaluating User Language Models

Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models

HARDTESTGEN: A High-Quality RL Verifier Generation Pipeline for LLM Algorithimic Coding

GPS: Graph-guided Proactive Information Seeking in Large Language Models

Data Selection for LLM Alignment Using Fine-Grained Preferences

BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping

Scaling Large Vision-Language Model RL Training via Efficient Load Balancing

A Fano-Style Accuracy Upper Bound for LLM Single-Pass Reasoning in Multi-Hop QA

Differential Fine-Tuning Large Language Models Towards Better Diverse Reasoning Abilities

Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment

Beyond Magnitude: Leveraging Direction of RLVR Updates for LLM Reasoning

Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models

On the Predictive Power of Representation Dispersion in Language Models

CoT Vectors: Transferring and Probing the Reasoning Mechanisms of LLMs

Distribution-Aware Multi-Granularity Phase Coding: Towards Lower Conversion Error for Spike-Driven Large Language Models

Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models

STEM: SCALING TRANSFORMERS WITH EMBEDDING MODULES

RLP: Reinforcement as a Pretraining Objective

Rewriting Pre-Training Data Boosts LLM Performance in Math and Code

MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers

In-Context Watermarks for Large Language Models

SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse–Linear Attention

A2^2FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning

How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

KnowProxy: Adapting Large Language Models by Knowledge-guided Proxy

Comparing the learning dynamics of in-context learning and fine-tuning in language models

StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs

4428. Fair Reinforcement Learning for Just AI

  • Topics: Reinforcement Learning

Evolution and compression in LLMs: on the emergence of human-aligned categorization

CerebraGloss: Instruction-Tuning a Large Vision-Language Model for Fine-Grained Clinical EEG Interpretation

Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM

Extending the Context of Pretrained LLMs by Dropping Their Positional Embedding

A Brain Graph Foundation Model: Pre-Training and Prompt-Tuning across Broad Atlases and Disorders

Is This Just Fantasy? Language Model Representations Reflect Human Judgments of Event Plausibility

References Improve LLM Alignment in Non-Verifiable Domains

Empowering LLM Tool Invocation with Tool-call Reward Model

Are EEG Foundation Models Worth It? Comparative Evaluation with Traditional Decoders in Diverse BCI Tasks

A foundation model with multi-variate parallel attention to generate neuronal activity

Pitfalls in Evaluating Language Model Forecasters

Entropy-Guided Dynamic Tokens for Graph-LLM Alignment in Molecular Understanding

Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes

SK2Decompile: LLM-based Two-Phase Binary Decompilation from Skeleton to Skin

R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning

Late-to-Early Training: LET LLMs Learn Earlier, So Faster and Better

Diffusion Language Models are Provably Optimal Parallel Samplers

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding

Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval

LoC-Decomp: LLM Autoformalization via Logical Concept Decomposition and Iterative Feedback Correction

Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning

AutoSP: Unlocking Long-Context LLM Training Via Compiler-Based Sequence Parallelism

RAPID3^3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer

Visual Jigsaw Post-Training Improves MLLMs

OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data

Uni-NTFM: A Unified Foundation Model for EEG Signal Representation Learning

MoSA: Mosaic Shared Adaptation of Large Language Models

Sparsity Forcing: Reinforcing Token Sparsity of MLLMs

StochasTok: Improving Fine-Grained Subword Understanding in LLMs

Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions

AttTok: Marrying Attribute Tokens with Generative Pre-trained Vision-Language Models towards Medical Image Understanding

NLI : Non-uniform Linear Interpolation Approximation of Nonlinear Operations for Efficient LLMs Inference

On Predictability of Reinforcement Learning Dynamics for Large Language Models

Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling

Rolling Forcing: Autoregressive Long Video Diffusion in Real Time

Taming Curvature: Architecture Warm-up for Stable Transformer Training

Scaling Agents via Continual Pre-training

DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference

TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them

Frozen Priors, Fluid Forecasts: Prequential Uncertainty for Low-Data Deployment with Pretrained Generative Models

Transformers as Measure-Theoretic Associative Memory: A Statistical Perspective and Minimax Optimality

Query-Level Uncertainty in Large Language Models

Foundation Models for Causal Inference via Prior-Data Fitted Networks

Executable Counterfactuals: Improving LLMs' Causal Reasoning Through Code

Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective

Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization

Group Critical-token Policy Optimization for Autoregressive Image Generation

SPRINT: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers

NerVE: Nonlinear Eigenspectrum Dynamics in LLM Feed-Forward Networks

LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation

Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

SoftCFG: Uncertainty-guided Stable Guidance for Visual Autoregressive Model

Learning Pseudorandom Numbers with Transformers: Permuted Congruential Generators, Curricula, and Interpretability

An evolutionary perspective on modes of learning in Transformers

Geometric Image Editing via Effects-Sensitive In-Context Inpainting with Diffusion Transformers

STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer

QuadGPT: Native Quadrilateral Mesh Generation with Autoregressive Models

Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in LLMs

Don’t Pass@k: A Bayesian Framework for Large Language Model Evaluation

Quantized Visual Geometry Grounded Transformer

BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models

Streaming Visual Geometry Transformer

Lightweight Transformer for EEG Classification via Balanced Signed Graph Algorithm Unrolling

ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis

RESCHED: Rethinking Flexible Job Shop Scheduling from a Transformer-based Architecture with Simplified States

DTP: Delta-Guided Two Stage Pruning for Mamba-based Multimodal Large Language Models

ViTSP: A Vision Language Models Guided Framework for Solving Large-Scale Traveling Salesman Problems

lmgame-Bench: How Good are LLMs at Playing Games?

Adaptive Acquisition Selection for Bayesian Optimization with Large Language Models

Trinity: An Evolved LLM Coordinator

Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks

Unlocking Full Efficiency of Token Filtering in Large Language Model Training

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

DES-LOC: Desynced Low Communication Adaptive Optimizers for Foundation Models

Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models

More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models

CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild

ADEPT: Continual Pretraining via Adaptive Expansion and Dynamic Decoupled Tuning

PoSh: Using Scene Graphs to Guide LLMs-as-a-Judge for Detailed Image Descriptions

Faster Vision Transformers with Adaptive Patches

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

Flatness Guided Test-Time Adaptation for Vision-Language Models

WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference

ChainGPT: Dual-Reasoning Model with Recurrent Depth and Multi-Rank State Updates

FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models

InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models

d2^2Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive Caching

Knowledge Exchange with Confidence: Cost-Effective LLM Integration for Reliable and Efficient Visual Question Answering

Metis: Training LLMs with FP4 Quantization

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

Holdout-Loss-Based Data Selection for LLM Finetuning via In-Context Learning

Towards Quantization-Aware Training for Ultra-Low-Bit Reasoning LLMs

RouterArena: An Open Platform for Comprehensive Comparison of LLM Routers

LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models

AtlasKV: Augmenting LLMs with Billion-Scale Knowledge Graphs in 20GB VRAM

SLM-MUX: Orchestrating Small Language Models for Reasoning

LeSTD: LLM Compression via Learning-based Sparse Tensor Decomposition

Expert Heads: Robust Evidence Identification for Large Language Models

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding

Attention Is All You Need for KV Cache in Diffusion LLMs

FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models

RestoreVAR: Visual Autoregressive Generation for All-in-One Image Restoration

LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale Diffusion Transformer

Improving Autoregressive Video Modeling with History Understanding

FARTrack: Fast Autoregressive Visual Tracking with High Performance

Catalog-Native LLM: Speaking Item-ID dialect with Less Entanglement for Recommendation

Robust Multi-Objective Controlled Decoding of Large Language Models

Self-Speculative Decoding Accelerates Lossless Inference in Any-Order and Any-Subset Autoregressive Models

Discovering Novel LLM Experts via Task-Capability Coevolution

Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs

Stop Tracking Me! Proactive Defense Against Attribute Inference Attack in LLMs

Neodragon: Mobile Video Generation Using Diffusion Transformer

PARD: Accelerating LLM Inference with Low‑Cost PARallel Draft Model Adaptation

Front-Loading Reasoning: The Synergy between Pretraining and Post-Training Data

Using maximal information auxiliary variables to improve synthetic data generation based on TabPFN foundation models

Steering Language Models with Weight Arithmetic

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?

Tabby: A Language Model Architecture for Tabular and Structured Data Synthesis

4923. What happens when generative AI models train recursively on each others' outputs?

  • Topics: Diffusion Models & Generative AI

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

Do Large Language Models Know What They Are Capable Of?

Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks

Decomposing LLM Computation with Jets

ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases

Scaling Laws Revisited: Modeling the Role of Data Quality in Language Model Pretraining

Why is Your Language Model a Poor Implicit Reward Model?

Language Models Use Lookbacks to Track Beliefs

Noise Stability of Transformer Models

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

Adaptive Logit Adjustment for Debiasing Multimodal Language Models

Preference Leakage: A Contamination Problem in LLM-as-a-judge

When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms

CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives

VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models

Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models

Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs

Bias Similarity Measurement: A Black-Box Audit of Fairness Across LLMs

ELEPHANT: Measuring and understanding social sycophancy in LLMs

Beyond Linear Probes: Dynamic Safety Monitoring for Language Models

Universal Properties of Activation Sparsity in Modern Large Language Models

A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models

PoliCon: Evaluating LLMs on Achieving Diverse Political Consensus Objectives

What Do Large Language Models Know About Opinions?

Graph Diffusion Transformers are In-Context Molecular Designers

ProTDyn: A Foundation Protein Language Model for Thermodynamics and Dynamics Generation

IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra

Bridging Kolmogorov Complexity and Deep Learning: Asymptotically Optimal Description Length Objectives for Transformers

CHAMMI-75: Pre-training multi-channel models with heterogeneous microscopy images

Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective

Strong Correlations Induce Cause Only Predictions in Transformer Training

FM4NPP: A Scaling Foundation Model for Nuclear and Particle Physics

Tequila: Trapping-free Ternary Quantization for Large Language Models

Accelerated co-design of robots through morphological pretraining

Beyond Pairwise: Empowering LLM Alignment With (Ranked) Choice Modeling

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning

Native Reasoning Models: Training Language Models to Reason on Unverifiable Data

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?

Jackpot: Align Actor-Policy Distribution for scalable and stable RL for LLM

GRACE: A Language Model Framework for Explainable Inverse Reinforcement Learning

UniCA: Unified Covariate Adaptation for Time Series Foundation Model

MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs

G-reasoner: Foundation Models for Unified Reasoning over Graph-structured Knowledge

Leveraging Pretrained Knowledge at Inference Time: LoRA-Gated Contrastive Decoding for Multilingual Factual Language Generation in Adapted LLMs

Neuron-Aware Data Selection in Instruction Tuning for Large Language Models

IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment

LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision

Inheriting Generalizable Knowledge from LLMs to Diverse Vertical Tasks

GEM: A Gym for Generalist LLMs

BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning

Should We Still Pretrain Encoders with Masked Language Modeling?

SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization

CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs

Count Counts: Motivating Exploration in LLM Reasoning with Count-based Intrinsic Rewards

Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs

AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent

Rectifying LLM Thought from Lens of Optimization

TableMaster: A Recipe to Advance Table Understanding with Language Models

SPRIG: Improving Large Language Model Performance by System Prompt Optimization

IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction

Critique-RL: Training Language Models For Critiquing Through Two-Stage Reinforcement Learning

DESIGNER: Design-Logic-Guided Multidisciplinary Data Synthesis for LLM Reasoning

Disentangling Knowledge Representations for Large Language Model Editing

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

Context Tokens are Anchors: Understanding the Repeat Curse in dMLLMs from an Information Flow Perspective

Sculptor: Empowering LLMs with Cognitive Agency via Active Context Management

DreamOn: Diffusion Language Models For Code Infilling Beyond Fixed-size Canvas

Variation in Verification: Understanding Verification Dynamics in Large Language Models

Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents

ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment

Graph Tokenization for Bridging Graphs and Transformers

Post-training Large Language Models for Diverse High-Quality Responses

Data-Centric Lessons To Improve Speech-Language Pretraining

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning

StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models

Don't Throw Away Your Pretrained Model

SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

Wide-In, Narrow-Out: Revokable Decoding for Efficient and Effective DLLMs

ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality

Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

The Mind's Transformer: Computational Neuroanatomy of LLM-Brain Alignment

Low rank adaptation of chemical foundation models generate effective odorant representations

Animal behavioral analysis and neural encoding with transformer-based self-supervised pretraining

Brain-IT: Image Reconstruction from fMRI via Brain-Interaction Transformer

Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning

Arbitrary-Order Block SignSGD for Memory-Efficient LLM Fine-Tuning

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

SmartDJ: Declarative Audio Editing with Audio Language Model

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

MARTI: A Framework for Multi-Agent LLM Systems Reinforced Training and Inference

Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

PCB-Bench: Benchmarking LLMs for Printed Circuit Board Placement and Routing

DiSRouter: Distributed Self-Routing for LLM Selections

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties among Vision-Language Models

FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction

Fast-dLLM v2: Efficient Block-Diffusion LLM

GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching

Reassessing Layer Pruning in LLMs: New Insights and Methods

VideoAgentTrek: Computer-Use Pretraining from Unlabeled Videos

Cascadia: An Efficient Cascade Serving System for Large Language Models

Echoes as Anchors: Probabilistic Costs and Attention Refocusing in LLM Reasoning

Tactic: Adaptive Sparse Attention with Clustering and Distribution Fitting for Long-Context LLMs

One Patch Doesn’t Fit All: Adaptive Patching for Native-Resolution Multimodal Large Language Models

To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models

Estimating Worst-Case Frontier Risks of Open-Weight LLMs

Test-Time Optimization of 3D Point Cloud LLM via Manifold-Aware In-Context Guidance and Refinement

DefensiveKV: Taming the Fragility of KV Cache Eviction in LLM Inference

Recurrent Action Transformer with Memory

From f(x) and g(x) to f(g(x)): LLMs Learn New Skills in RL by Composing Old Ones

THE END OF MANUAL DECODING: TOWARDS TRULY END-TO-END LANGUAGE MODELS

Tree Search for LLM Agent Reinforcement Learning

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

Fresh in memory: Training-order recency is linearly encoded in language model activations

Can Vision–Language Models Assess Graphic Design Aesthetics? A Benchmark, Evaluation, and Dataset Perspective.

Neural Sum-of-Squares: Certifying the Nonnegativity of Polynomials with Transformers

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

TrustGen: A Platform of Dynamic Benchmarking on the Trustworthiness of Generative Foundation Models

Micro-Macro Retrieval: Reducing Long-Form Hallucination in Large Language Models

Dual-Objective Reinforcement Learning with Novel Hamilton-Jacobi-Bellman Formulations

StreamingThinker: Large Language Models Can Think While Reading

A Stitch in Time Saves Nine: Proactive Self-Refinement for Language Models