- Published on
ACL 2026 — Efficiency & Inference
Efficiency & Inference
268 papers Links not yet available — ACL proceedings pending on ACL Anthology.
- Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models
- CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models
- Your Reasoning Model Knows What Counts: Self-Guided Chain-of-Thought Pruning for Efficient Reasoning
- Efficient Provably Secure Linguistic Steganography via Range Coding
- RoBSA: RoPE-based Blockwise Sparse Multi-head Latent Attention
- Focusing Condition: Inference-Time Self-Contrastive Steering Elicits Better Conditional Text Embeddings in LLMs
- CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
- Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning
- ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
- Explicit Trait Inference for Multi-Agent Coordination
- CRISP: Persistent Concept Unlearning via Sparse Autoencoders
- LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
- Mechanistic Interpretability Should Prioritize Feature Consistency in Sparse Autoencoders
- EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning
- LEASH: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model
- Two-Stage Regularization-Based Structured Pruning for LLMs
- SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
- Optimizing Length Compression in Large Reasoning Models
- Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
- Mitigating Context Interference for Reliable and Efficient Search Agents
- Saber: Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model in Code Generation
- Debiased Orthogonal Boundary-Driven Efficient Noise Mitigation
- Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding
- SAGE: Sparse Adaptive Guidance for Dependency-Aware Tabular Data Generation
- Native Hybrid Attention for Efficient Sequence Modeling
- Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
- Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion
- Multi-Granularity Semantic Revision for Large Language Model Distillation
- AgentOCR: Reimagining Agent History via Optical Self-Compression
- Miner: Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
- TiKMiX: Efficient Semi-Dynamic Data Mixture via Data Influence for LLM Pre-training
- OCP: Outlier-Centric Probing for Dynamic Structured Pruning of LLMs
- UniSpec: Training-Free Speculative Decoding for Robust LLM Acceleration Across Languages and Hardware
- Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search
- Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration
- Calibrating Inference Time Alignment with Sequence-level Risk Accumulation
- SharedRequest: Privacy-Preserving Model‑Agnostic Inference for Large Language Models
- Efficient Learned Data Compression via Dual-Stream Feature Decoupling
- MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
- When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges
- Reducing Token Redundancy in LVLMs: A Systematic Review of Token Pruning Methods
- Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
- S2O: Early Stopping for Sparse Attention via Online Permutation
- HCSpec: Two-Tier Horizontal Cascade Speculative Decoding for High-Efficiency Large Language Model Inference
- EfficientLLM: Unified Pruning-Aware Pretraining for Auto-Designed Compact Language Models
- Dual Activation-Weight Sparsity: A Training-Free Framework for Efficient Large Language Model Compression
- HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
- InferenceDynamics: Adaptive LLM Routing through Structured Capability and Knowledge Profiling
- ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs
- Revisiting Model Interpolation for Efficient Reasoning
- SCVQ: Sparse-Compensated Vector Quantization for Large Language Models
- Efficient KL Divergence Estimation via Truncated Top-K Integration for Large Language Models
- ContrastKV: Robust KV Cache Eviction via Contrastive Signal Fusion for Multi-Query Generalization
- VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
- Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
- Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs
- When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
- Distilling Large Embeddings via Hyperspherical Householder Quantization
- InstructDiff: Domain-Adaptive Data Selection via Contrastive Entropy for Efficient LLM Fine-Tuning
- Jakiro: Boosting Speculative Decoding via Decoupled MoE
- GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models
- Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification
- Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
- Beyond Pedagogical Principles: Multi-Horizon Preference Optimization for Efficient Socratic Tutoring
- Protecting Language Models Against Unauthorized Distillation through Trace Rewriting
- Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER
- Evolving Sparsity: Leveraging Token Importance Dynamics for Efficient LLM Decoding with Sparse Attention
- From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
- Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
- Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
- RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents
- From Form to Logic: Masked Reconstruction and Reasoning Distillation for Short Video Fake News Detection
- Making Large Language Models Efficient Dense Retrievers
- HeteroSpec: Leveraging Contextual Heterogeneity for Efficient Speculative Decoding
- Rethinking Table Pruning in TableQA: From Sequential Revisions to Gold Trajectory-Supervised Parallel Search
- HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
- A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Task
- Vista-LLM: Decoupled Query-Guided Visual Token Pruning for Efficient Long-Video Large Language Models
- DORA: A Dual-Objective Reinforcement Learning Framework for Effective and Efficient Multimodal Agentic Search
- Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models
- SpiderFlow: Efficient Topology-Aware Scheduling for LLM Training Across Decentralized GPU Clusters
- Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR
- Powerful Training-Free Membership Inference Against Fine-Tuned Autoregressive Language Models
- Communication-Efficient Desire Alignment for Proactive Embodied Human–Agent Interaction
- SARA: Selective and Adaptive Retrieval-augmented Generation with Context Compression
- For-Value: Efficient Forward-Only Data Valuation for finetuning LLMs and VLMs
- Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation
- Bridging the Memorization-Utilization Gap: Near-Lossless Context Compression via Reinforcement Learning
- AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs
- MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel Execution
- Adaptive Constraint Propagation: Scaling Structured Inference for Large Language Models via Meta-Reinforcement Learning
- Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
- Query-Efficient Agentic Graph Extraction Attacks on GraphRAG Systems
- Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence
- Label and Explanation Variation in LLM-Based Annotation: a Case Study in Natural Language Inference
- Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration
- GS-Quant: Granular Semantic and Generative Structural Quantization for Knowledge Graph Completion
- Subject-level Inference for Realistic Text Anonymization Evaluation
- SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion
- From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration
- ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
- Immediate Inference: The Missing Foundation in Large Language Model Logical Reasoning
- Efficiently Learning To Reason or Not to Reason: Root-token Policy Optimization for Adaptive Thinking
- Towards Efficient and Effective Diffusion Language Model Inference via Semantic-Aware Adaptive Denoising
- Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
- Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling
- Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action Memory
- FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
- ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
- SpecCache: Speculative KV Cache Reuse for Efficient RAG Serving
- Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
- Double: Breaking the Acceleration Limit via Double Retrieval Speculative Parallelism
- BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
- Causal-ESC: Reliable Policy Learning for Emotional Support Conversation via Causal Inference
- Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
- Distillation Traps and Guards: A Calibration Knob for LLM Distillability
- Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders
- Merlin’s Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
- Mem²Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation
- From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons
- MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
- Beyond the Context Window: Scaling Agentic RL via End-to-end Optimized Context Compression
- Controllable LLM Reasoning via Sparse Autoencoder‑Based Steering
- Profiling-Free Mixed-Precision Quantization for MoE LLMs via Fuzzy Rule Interpolation
- WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning
- Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
- Gold-Medal-Level Olympiad Geometry Solving with Efficient Heuristic Auxiliary Constructions
- SelFusion: Self-distillation for Diffusion Language Models
- CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models
- MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
- Efficient Prior-Guided Reasoning for Robust Retrieval-Augmented Generation under Conflicts
- FLARE: Fine-Grained Length-Aware Routing for Resource-Efficient Heterogeneous LLM Serving
- RST-Guarder: Enhancing Long-Context Robustness for Safeguards via RST Parsing and Probabilistic Inference
- Debiasing Reward Models via Causally Motivated Inference-Time Intervention
- SADA: Bridging In-Context Learning and Fine-Tuning via State-Aligned Distillation Adapters
- Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
- BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
- GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models
- When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning
- See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
- When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language Models
- Adaptive Spatial and Temporal Redundancy Optimization for Efficient Reasoning in Large Language Models
- Agent Newsroom: Efficient Chronological Report Generation via Dynamic Multi-Agent Collaboration
- Collision to Cognition: Hash-Driven Graph Construction for Efficient RAG
- WebSynthesis: World Model-Guided Monte Carlo Tree Search for Efficient WebAgent Trajectory Synthesis
- GMFL: Efficient Global Masking for Federated LLM Fine-tuning
- Latent-Condensed Transformer for Efficient Long Context Modeling
- From Logical to Computational Sparsity: Structure-Aware Block-Sparse Attention for Long-Code Completion
- Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation
- Selective Knowledge Distillation: Fusing LLM Semantic Strengths with DNN Efficiency for Binary Code Similarity Detection
- RRAtention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference
- Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs
- EQUIP: EQUivariant preserving In-Place updates for Efficient Token Pruning
- Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
- ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification
- Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
- Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling
- A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ Integration into Upcycled MoE
- Question Tells You Where the Answer Is: Intention-aware Long-Context KV Cache Compression
- LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
- CuMA: Aligning LLMs with Sparse Cultural Values via Demographic-Aware Mixture of Adapters
- ToMMeR - Efficient Entity Mention Detection from Large Language Models
- Efficient Hyperparameter Optimization for LLM Reinforcement Learning
- Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding
- Semantically Comprehensive Token Pruning in LVLMs via Maximizing Concept Coverage
- Difference in Task Performance on Sparse Speech Representations
- GMSA: Enhancing Context Compression via Group Merging and Layer Semantic Alignment
- Learn Like Humans: Use Meta-cognitive Reflection for Efficient Self-Improvement
- Think Faster Than Words: Efficient LLM Chain-of-Thought Reasoning via Dynamic Shortcut Decoding
- SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
- N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
- Exploring and Distilling Multi-Dimensional Clues for Interpretable Social Bot Detection
- Systematicity between Forms and Meanings across Languages Supports Efficient Communication
- On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
- LaCo: Layer-wise Compensation for Pruned Large Language Models
- GLIER: Generative Legal Inference and Evidence Ranking for Legal Case Retrieval
- Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
- Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework
- Think Better, Not Longer: Token-Level Marginal Utility for Efficient Reasoning in Large Reasoning Models
- AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems
- SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation
- ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
- VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
- MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation
- TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation
- SRA: Span Representation Alignment for Large Language Model Distillation
- LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
- SSSD: Simply-Scalable Speculative Decoding
- IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering
- Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation
- SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
- What Deserves Memory: Adaptive Memory Distillation for LLM Agents
- CaBSALLM: Efficient Context-Aware Batch Annotation of Conversational Streams with Large Language Models
- Lizard: An Efficient Linearization Framework for Large Language Models
- Octopus: Gated Selective Attention for Memory-Bounded Long-Context Inference in Large Language Models
- LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation
- From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
- LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient
- Attn-GS: Attention-Guided Context Compression for Efficient Personalized LLMs
- LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning
- Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation
- SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition Inference
- PaT: Planning-after-Trial for Efficient Test-Time Code Generation
- Glyph: Scaling Context Windows via Visual-Text Compression
- Evolutionary Negative Module Pruning for Better LoRA Merging
- Resonating with RoPE: Spectral Quantization for High-Fidelity Key Cache Compression
- Efficient Process Reward Modeling via Contrastive Mutual Information
- MARD: Module-Aware Reasoning Distillation for Language Models with Adaptive Supervision
- Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities
- Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
- Theory-optimal Quantization Based on Flatness
- PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation
- CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling
- Frame-Semantic Knowledge Injection for Event-Level Inference in LLMs
- BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes
- Fast and Accurate Fisher-Guided Quantization via Efficient Kronecker Factorization
- One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
- Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression
- REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache Compression
- From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution
- Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment
- Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language Models
- Robust Membership Inference for Large Language Models under Adversarial Generative Corruption
- PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
- AttnPO: Attention-Guided Process Supervision for Efficient Reasoning
- Decoding-Unlearning: Fact Forgetting via Entropy-Guided Inference
- Global Adaptive Momentum Meets Local Personalized Perturbation: Efficient Federated LLM Fine-Tuning with Zeroth-Order Gradients
- Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
- Too Long, Do Re-weighting for Efficient LLM Reasoning Compression
- TAIGR: Towards Modeling Influencer Content on Social Media via Structured, Pragmatic Inference
- Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech
- MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
- The Pitfalls of KV Cache Compression
- Success and Cost Elicit Convention Formation for Efficient Communication
- A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass Classification
- ACBQ: Adaptive Cross-Block Quantization of Large Language Models
- JW-SVD: Bridging the Cross-Modal Mismatch in Post-Training MLLM Compression
- Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation
- TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
- AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache Reuse
- HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
- Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
- Simple Agents, Biased Judges: Efficient Multi-Party Dialogue Generation & The Evaluation Gap
- EdgeFormer: Latency-Aware Collaborative Multi-Head Attention of Transformer Inference in Edge Networks
- LEAF: Knowledge Distillation of Text Embedding Models with Teacher-Aligned Representations
- MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation
- MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization
- Programming over Thinking: Efficient and Robust Multi-Constraint Planning
- CLAOCS-TX: Cross-Lingual Triplet Extraction with Aspect-Opinion-Aware Code-Switched Prompting and LLM-Guided Contrastive Distillation
- When Benchmarks Leak: Inference-Time Decontamination for LLMs
- Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization
- Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Language Models
- Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
- Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective
- Data Efficient RLVR via Off-Policy Influence Guidance
- EDSD: Entropy-Driven Design for Faster Speculative Decoding
- GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs
- DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
- ReasMark: A Robust Watermark for Attributing LLM Reasoning Under Knowledge Distillation Attacks
- Solve-Detect-Verify: Inference-Time Scaling with Flexible Generative Verifier
- Look Within or Beyond? A Theoretical Comparison Between Parameter-Efficient and Full Fine-Tuning
- SharVeT: Similarity-aware Parameter Sharing with Vector-based Tuning for Efficient LLM Compression
- Beyond Variance: Knowledge-Aware LLM Compression via Fisher-Aligned Subspace Diagnostics
- Reinforced Efficient Reasoning via Semantically Diverse Exploration
- Accurate and Efficient Statistical Testing for Word Semantic Breadth
- Towards a Mechanistic Understanding of Large Reasoning Models: A Survey of Training, Inference, and Failures