R
Published on

ACL 2026 — Efficiency & Inference

Efficiency & Inference

268 papers Links not yet available — ACL proceedings pending on ACL Anthology.

  • Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models
  • CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models
  • Your Reasoning Model Knows What Counts: Self-Guided Chain-of-Thought Pruning for Efficient Reasoning
  • Efficient Provably Secure Linguistic Steganography via Range Coding
  • RoBSA: RoPE-based Blockwise Sparse Multi-head Latent Attention
  • Focusing Condition: Inference-Time Self-Contrastive Steering Elicits Better Conditional Text Embeddings in LLMs
  • CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
  • Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning
  • ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
  • Explicit Trait Inference for Multi-Agent Coordination
  • CRISP: Persistent Concept Unlearning via Sparse Autoencoders
  • LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
  • Mechanistic Interpretability Should Prioritize Feature Consistency in Sparse Autoencoders
  • EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning
  • LEASH: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model
  • Two-Stage Regularization-Based Structured Pruning for LLMs
  • SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
  • Optimizing Length Compression in Large Reasoning Models
  • Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
  • Mitigating Context Interference for Reliable and Efficient Search Agents
  • Saber: Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model in Code Generation
  • Debiased Orthogonal Boundary-Driven Efficient Noise Mitigation
  • Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding
  • SAGE: Sparse Adaptive Guidance for Dependency-Aware Tabular Data Generation
  • Native Hybrid Attention for Efficient Sequence Modeling
  • Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
  • Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion
  • Multi-Granularity Semantic Revision for Large Language Model Distillation
  • AgentOCR: Reimagining Agent History via Optical Self-Compression
  • Miner: Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
  • TiKMiX: Efficient Semi-Dynamic Data Mixture via Data Influence for LLM Pre-training
  • OCP: Outlier-Centric Probing for Dynamic Structured Pruning of LLMs
  • UniSpec: Training-Free Speculative Decoding for Robust LLM Acceleration Across Languages and Hardware
  • Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search
  • Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration
  • Calibrating Inference Time Alignment with Sequence-level Risk Accumulation
  • SharedRequest: Privacy-Preserving Model‑Agnostic Inference for Large Language Models
  • Efficient Learned Data Compression via Dual-Stream Feature Decoupling
  • MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
  • When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges
  • Reducing Token Redundancy in LVLMs: A Systematic Review of Token Pruning Methods
  • Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
  • S2O: Early Stopping for Sparse Attention via Online Permutation
  • HCSpec: Two-Tier Horizontal Cascade Speculative Decoding for High-Efficiency Large Language Model Inference
  • EfficientLLM: Unified Pruning-Aware Pretraining for Auto-Designed Compact Language Models
  • Dual Activation-Weight Sparsity: A Training-Free Framework for Efficient Large Language Model Compression
  • HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
  • InferenceDynamics: Adaptive LLM Routing through Structured Capability and Knowledge Profiling
  • ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs
  • Revisiting Model Interpolation for Efficient Reasoning
  • SCVQ: Sparse-Compensated Vector Quantization for Large Language Models
  • Efficient KL Divergence Estimation via Truncated Top-K Integration for Large Language Models
  • ContrastKV: Robust KV Cache Eviction via Contrastive Signal Fusion for Multi-Query Generalization
  • VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
  • Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
  • Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs
  • When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
  • Distilling Large Embeddings via Hyperspherical Householder Quantization
  • InstructDiff: Domain-Adaptive Data Selection via Contrastive Entropy for Efficient LLM Fine-Tuning
  • Jakiro: Boosting Speculative Decoding via Decoupled MoE
  • GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models
  • Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification
  • Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
  • Beyond Pedagogical Principles: Multi-Horizon Preference Optimization for Efficient Socratic Tutoring
  • Protecting Language Models Against Unauthorized Distillation through Trace Rewriting
  • Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER
  • Evolving Sparsity: Leveraging Token Importance Dynamics for Efficient LLM Decoding with Sparse Attention
  • From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
  • Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
  • Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
  • RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents
  • From Form to Logic: Masked Reconstruction and Reasoning Distillation for Short Video Fake News Detection
  • Making Large Language Models Efficient Dense Retrievers
  • HeteroSpec: Leveraging Contextual Heterogeneity for Efficient Speculative Decoding
  • Rethinking Table Pruning in TableQA: From Sequential Revisions to Gold Trajectory-Supervised Parallel Search
  • HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
  • A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Task
  • Vista-LLM: Decoupled Query-Guided Visual Token Pruning for Efficient Long-Video Large Language Models
  • DORA: A Dual-Objective Reinforcement Learning Framework for Effective and Efficient Multimodal Agentic Search
  • Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models
  • SpiderFlow: Efficient Topology-Aware Scheduling for LLM Training Across Decentralized GPU Clusters
  • Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR
  • Powerful Training-Free Membership Inference Against Fine-Tuned Autoregressive Language Models
  • Communication-Efficient Desire Alignment for Proactive Embodied Human–Agent Interaction
  • SARA: Selective and Adaptive Retrieval-augmented Generation with Context Compression
  • For-Value: Efficient Forward-Only Data Valuation for finetuning LLMs and VLMs
  • Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation
  • Bridging the Memorization-Utilization Gap: Near-Lossless Context Compression via Reinforcement Learning
  • AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs
  • MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel Execution
  • Adaptive Constraint Propagation: Scaling Structured Inference for Large Language Models via Meta-Reinforcement Learning
  • Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
  • Query-Efficient Agentic Graph Extraction Attacks on GraphRAG Systems
  • Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence
  • Label and Explanation Variation in LLM-Based Annotation: a Case Study in Natural Language Inference
  • Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration
  • GS-Quant: Granular Semantic and Generative Structural Quantization for Knowledge Graph Completion
  • Subject-level Inference for Realistic Text Anonymization Evaluation
  • SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion
  • From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration
  • ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
  • Immediate Inference: The Missing Foundation in Large Language Model Logical Reasoning
  • Efficiently Learning To Reason or Not to Reason: Root-token Policy Optimization for Adaptive Thinking
  • Towards Efficient and Effective Diffusion Language Model Inference via Semantic-Aware Adaptive Denoising
  • Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
  • Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling
  • Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action Memory
  • FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
  • ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
  • SpecCache: Speculative KV Cache Reuse for Efficient RAG Serving
  • Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
  • Double: Breaking the Acceleration Limit via Double Retrieval Speculative Parallelism
  • BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
  • Causal-ESC: Reliable Policy Learning for Emotional Support Conversation via Causal Inference
  • Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
  • Distillation Traps and Guards: A Calibration Knob for LLM Distillability
  • Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders
  • Merlin’s Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
  • Mem²Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation
  • From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons
  • MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
  • Beyond the Context Window: Scaling Agentic RL via End-to-end Optimized Context Compression
  • Controllable LLM Reasoning via Sparse Autoencoder‑Based Steering
  • Profiling-Free Mixed-Precision Quantization for MoE LLMs via Fuzzy Rule Interpolation
  • WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning
  • Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
  • Gold-Medal-Level Olympiad Geometry Solving with Efficient Heuristic Auxiliary Constructions
  • SelFusion: Self-distillation for Diffusion Language Models
  • CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models
  • MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
  • Efficient Prior-Guided Reasoning for Robust Retrieval-Augmented Generation under Conflicts
  • FLARE: Fine-Grained Length-Aware Routing for Resource-Efficient Heterogeneous LLM Serving
  • RST-Guarder: Enhancing Long-Context Robustness for Safeguards via RST Parsing and Probabilistic Inference
  • Debiasing Reward Models via Causally Motivated Inference-Time Intervention
  • SADA: Bridging In-Context Learning and Fine-Tuning via State-Aligned Distillation Adapters
  • Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
  • BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
  • GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models
  • When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning
  • See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
  • When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language Models
  • Adaptive Spatial and Temporal Redundancy Optimization for Efficient Reasoning in Large Language Models
  • Agent Newsroom: Efficient Chronological Report Generation via Dynamic Multi-Agent Collaboration
  • Collision to Cognition: Hash-Driven Graph Construction for Efficient RAG
  • WebSynthesis: World Model-Guided Monte Carlo Tree Search for Efficient WebAgent Trajectory Synthesis
  • GMFL: Efficient Global Masking for Federated LLM Fine-tuning
  • Latent-Condensed Transformer for Efficient Long Context Modeling
  • From Logical to Computational Sparsity: Structure-Aware Block-Sparse Attention for Long-Code Completion
  • Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation
  • Selective Knowledge Distillation: Fusing LLM Semantic Strengths with DNN Efficiency for Binary Code Similarity Detection
  • RRAtention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference
  • Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs
  • EQUIP: EQUivariant preserving In-Place updates for Efficient Token Pruning
  • Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
  • ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification
  • Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
  • Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling
  • A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ Integration into Upcycled MoE
  • Question Tells You Where the Answer Is: Intention-aware Long-Context KV Cache Compression
  • LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
  • CuMA: Aligning LLMs with Sparse Cultural Values via Demographic-Aware Mixture of Adapters
  • ToMMeR - Efficient Entity Mention Detection from Large Language Models
  • Efficient Hyperparameter Optimization for LLM Reinforcement Learning
  • Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding
  • Semantically Comprehensive Token Pruning in LVLMs via Maximizing Concept Coverage
  • Difference in Task Performance on Sparse Speech Representations
  • GMSA: Enhancing Context Compression via Group Merging and Layer Semantic Alignment
  • Learn Like Humans: Use Meta-cognitive Reflection for Efficient Self-Improvement
  • Think Faster Than Words: Efficient LLM Chain-of-Thought Reasoning via Dynamic Shortcut Decoding
  • SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
  • N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
  • Exploring and Distilling Multi-Dimensional Clues for Interpretable Social Bot Detection
  • Systematicity between Forms and Meanings across Languages Supports Efficient Communication
  • On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
  • LaCo: Layer-wise Compensation for Pruned Large Language Models
  • GLIER: Generative Legal Inference and Evidence Ranking for Legal Case Retrieval
  • Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
  • Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework
  • Think Better, Not Longer: Token-Level Marginal Utility for Efficient Reasoning in Large Reasoning Models
  • AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems
  • SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation
  • ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
  • VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
  • MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation
  • TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation
  • SRA: Span Representation Alignment for Large Language Model Distillation
  • LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
  • SSSD: Simply-Scalable Speculative Decoding
  • IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering
  • Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation
  • SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
  • What Deserves Memory: Adaptive Memory Distillation for LLM Agents
  • CaBSALLM: Efficient Context-Aware Batch Annotation of Conversational Streams with Large Language Models
  • Lizard: An Efficient Linearization Framework for Large Language Models
  • Octopus: Gated Selective Attention for Memory-Bounded Long-Context Inference in Large Language Models
  • LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation
  • From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
  • LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient
  • Attn-GS: Attention-Guided Context Compression for Efficient Personalized LLMs
  • LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning
  • Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation
  • SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition Inference
  • PaT: Planning-after-Trial for Efficient Test-Time Code Generation
  • Glyph: Scaling Context Windows via Visual-Text Compression
  • Evolutionary Negative Module Pruning for Better LoRA Merging
  • Resonating with RoPE: Spectral Quantization for High-Fidelity Key Cache Compression
  • Efficient Process Reward Modeling via Contrastive Mutual Information
  • MARD: Module-Aware Reasoning Distillation for Language Models with Adaptive Supervision
  • Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities
  • Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
  • Theory-optimal Quantization Based on Flatness
  • PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation
  • CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling
  • Frame-Semantic Knowledge Injection for Event-Level Inference in LLMs
  • BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes
  • Fast and Accurate Fisher-Guided Quantization via Efficient Kronecker Factorization
  • One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
  • Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression
  • REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache Compression
  • From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution
  • Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment
  • Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language Models
  • Robust Membership Inference for Large Language Models under Adversarial Generative Corruption
  • PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
  • AttnPO: Attention-Guided Process Supervision for Efficient Reasoning
  • Decoding-Unlearning: Fact Forgetting via Entropy-Guided Inference
  • Global Adaptive Momentum Meets Local Personalized Perturbation: Efficient Federated LLM Fine-Tuning with Zeroth-Order Gradients
  • Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
  • Too Long, Do Re-weighting for Efficient LLM Reasoning Compression
  • TAIGR: Towards Modeling Influencer Content on Social Media via Structured, Pragmatic Inference
  • Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech
  • MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
  • The Pitfalls of KV Cache Compression
  • Success and Cost Elicit Convention Formation for Efficient Communication
  • A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass Classification
  • ACBQ: Adaptive Cross-Block Quantization of Large Language Models
  • JW-SVD: Bridging the Cross-Modal Mismatch in Post-Training MLLM Compression
  • Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation
  • TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
  • AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache Reuse
  • HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
  • Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
  • Simple Agents, Biased Judges: Efficient Multi-Party Dialogue Generation & The Evaluation Gap
  • EdgeFormer: Latency-Aware Collaborative Multi-Head Attention of Transformer Inference in Edge Networks
  • LEAF: Knowledge Distillation of Text Embedding Models with Teacher-Aligned Representations
  • MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation
  • MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization
  • Programming over Thinking: Efficient and Robust Multi-Constraint Planning
  • CLAOCS-TX: Cross-Lingual Triplet Extraction with Aspect-Opinion-Aware Code-Switched Prompting and LLM-Guided Contrastive Distillation
  • When Benchmarks Leak: Inference-Time Decontamination for LLMs
  • Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization
  • Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Language Models
  • Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
  • Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective
  • Data Efficient RLVR via Off-Policy Influence Guidance
  • EDSD: Entropy-Driven Design for Faster Speculative Decoding
  • GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs
  • DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
  • ReasMark: A Robust Watermark for Attributing LLM Reasoning Under Knowledge Distillation Attacks
  • Solve-Detect-Verify: Inference-Time Scaling with Flexible Generative Verifier
  • Look Within or Beyond? A Theoretical Comparison Between Parameter-Efficient and Full Fine-Tuning
  • SharVeT: Similarity-aware Parameter Sharing with Vector-based Tuning for Efficient LLM Compression
  • Beyond Variance: Knowledge-Aware LLM Compression via Fisher-Aligned Subspace Diagnostics
  • Reinforced Efficient Reasoning via Semantically Diverse Exploration
  • Accurate and Efficient Statistical Testing for Word Semantic Breadth
  • Towards a Mechanistic Understanding of Large Reasoning Models: A Survey of Training, Inference, and Failures