R
Published on

ACL 2026 — LLMs & Foundation Models

LLMs & Foundation Models

985 papers Links not yet available — ACL proceedings pending on ACL Anthology.

  • Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models
  • Rhetorical Questions in LLM Representations: A Linear Probing Study
  • Different types of syntactic agreement recruit the same units within large language models
  • Benchmarking LLM’s Capability in Reasoning over Conflicting Web References
  • Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation
  • Can Continual Pretraining Bridge the Performance Gap between General-purpose and Specialized Language Models in the Medical Domain?
  • MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Long-tail Knowledge
  • PR-XAI: PageRank-Based Feature Attribution for Transformers
  • CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models
  • Your Reasoning Model Knows What Counts: Self-Guided Chain-of-Thought Pruning for Efficient Reasoning
  • How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior
  • SACTOR: LLM-Driven Correct and Idiomatic C to Rust Translation with Static Analysis and FFI-Based Verification
  • IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review
  • Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
  • Augur: Modeling Covariate Causal Associations in Time Series via Large Language Models
  • AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering
  • MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
  • DecIF: Improving Instruction-Following through Decomposition
  • NavA³: Understanding Any Instruction, Navigating Anywhere, Finding Anything
  • MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
  • CAPC-CG: A Large-Scale, Expert-Directed LLM-Annotated Corpus of Adaptive Policy Communication in China
  • MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
  • What Makes Good Instruction-Tuning Data? An In-Context Learning Perspective
  • XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI Collaboration
  • Learn to Relax with Large Language Models: Solving Constraint Optimization Problems via Bidirectional Coevolution
  • Focusing Condition: Inference-Time Self-Contrastive Steering Elicits Better Conditional Text Embeddings in LLMs
  • Exploring Attention Attractors in Large Language Models
  • SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models
  • CoreGaze: Core Subgraph-Driven Visual Gaze Diffusion for Training-Free Referring Multimodal Large Language Models
  • RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification
  • Beyond Detection: Evaluating Fallacy Awareness of LLMs in Interactive Scenarios
  • Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining
  • On the Emergence and Test-Time Use of Structural Information in Large Language Models
  • SAGE: A Search-AuGmented Evaluation of Large Language Models on Free‑Form QA
  • CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
  • Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs
  • Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
  • Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning
  • SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe
  • Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness
  • Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models
  • What is a protest anyway? Codebook conceptualization is still a first-order concern in LLM-era classification
  • Contextual Relevance and Adaptive Sampling for LLM-Based Document Reranking
  • Quantifying Aleatoric Uncertainty of In-Context Learning for Robust Measure of LLM Prediction Confidence
  • SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
  • EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning
  • From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization
  • TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language Models
  • MMCLIP: Cross-Modal Attention Masked Modelling for Medical Language-Image Pre-Training
  • LaMI: Augmenting Large Language Models via Late Multi-Image Fusion
  • Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning
  • SDE-SQL: Enhancing Text-to-SQL Generation in Large Language Models via Self-Driven Exploration with SQL Probes
  • Thinking beyond the anthropomorphic paradigm benefits LLM research
  • LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
  • SCAN: Structured Capability Assessment and Navigation for LLMs
  • EMCEE: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context
  • Can LLMs Learn to Map the World from Local Descriptions?
  • ALIGN: Word Association Learning for Cultural Alignment in Large Language Models
  • Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
  • Beyond Examples: Towards Automated Thought-level In-Context Reasoning for Large Language Models
  • Two-Stage Regularization-Based Structured Pruning for LLMs
  • K-Merge: Online Continual Merging of Adapters for On-device Large Language Models
  • TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation
  • It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief
  • Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders
  • Evolutionary Guided Decoding: Iterative Value Refinement for LLMs
  • KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM Evaluation
  • BracketRank: Large Language Model Document Ranking via Reasoning-based Competitive Elimination
  • Multi-component Causal Tracing in Large Language Models
  • Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
  • TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors
  • OASIS: Online Sample Selection for Continual Instruction Tuning
  • Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization
  • CODERL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
  • Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding
  • LLM-XTM: Enhancing Cross-Lingual Topic Models with Large Language Models
  • From Factuality to Meta-Factivity: A Cognitive Blueprint for Trustworthy LLMs
  • From ID to LLM: Rethinking Representation Learning for Recommendation
  • DMHM: Density-aware Manifold Learning and Hybrid Mahalanobis Energy for LLMs-generated Text Detection
  • SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling
  • Adam’s Law: Textual Frequency Law on Large Language Models
  • Are Emotion and Rhetoric Neurons in LLM? Neuron Recognition and Adaptive Masking for Emotion-Rhetoric Prediction Steering
  • Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training
  • Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs
  • Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with Constraints
  • Thermometer of Thoughts: Enhancing LLM’s Exploration via Attention Temperature Modulation
  • Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency
  • Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
  • Open Schrödinger’s Closed Box: Identifying Retrieval Augmented Generation in API-Accessible Large Language Model Services
  • Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
  • Multi-Granularity Semantic Revision for Large Language Model Distillation
  • Instruction Data Selection via Answer Divergence
  • Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation
  • Instructions are all you need: Self-supervised Reinforcement Learning for Instruction Following
  • Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization
  • Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy Models
  • MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
  • Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
  • MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
  • Beyond the Crowd: LLM-Augmented Community Notes for Governing Health Misinformation
  • Beyond the Final Actor: Modeling the Dual Roles of Creator and Editor for Fine-Grained LLM-Generated Text Detection
  • PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models
  • MSEarth: A Multimodal Benchmark for Earth Science Phenomenon Discovery with MLLMs
  • Reasoning Structure Matters for Safety Alignment of Reasoning Models
  • Who Wrote This Line? Evaluating the Detection of LLM-Generated Classical Chinese Poetry
  • Representation Interventions Enable Lifelong Knowledge Memory Control in LLMs
  • SLoRA: Balancing Plasticity and Forgetting in Large Language Models for Continual Learning
  • Common to Whom? Regional Cultural Commonsense and LLM Bias in India
  • Par-ITA: Benchmarking Seq2Seq and LLMs on a Human-Supervised Parallel Corpus for Italian Hyperpartisan Neutralization
  • Demystifying Uncertainty in LLMs: Active Calibration between Concepts and Human Evaluations
  • LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
  • TiKMiX: Efficient Semi-Dynamic Data Mixture via Data Influence for LLM Pre-training
  • FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation
  • AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages
  • What Does LLM Refinement Actually Improve? A Systematic Study on Document-Level Literary Translation
  • OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
  • Editing the Moving World: Model Editing for Video LLMs
  • OCP: Outlier-Centric Probing for Dynamic Structured Pruning of LLMs
  • Attention Sinks Are Provably Necessary in Softmax Transformers: Evidence from Trigger-Conditional Tasks
  • AutoTaskEval: Towards Domain-Specific and Fine-Grained Evaluation for LLMs
  • CiteGuard: Faithful Citation Attribution for LLMs via Retrieval-Augmented Validation
  • From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models
  • UniSpec: Training-Free Speculative Decoding for Robust LLM Acceleration Across Languages and Hardware
  • Logical Consistency as a Bridge: Improving LLM Hallucination Detection via Label Constraint Modeling between Responses and Self-Judgments
  • FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
  • A Mechanistic Account of Attention Sinks in GPT-2: One Circuit, Broader Implications for Mitigation
  • LLMs Enable Bag-of-Texts Representations for Short-Text Clustering
  • TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs
  • StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation
  • Integrating Data Validation with Large Language Models for Regulation-Guided Tabular Anomaly Detection
  • Faithful Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance
  • Calibrating Inference Time Alignment with Sequence-level Risk Accumulation
  • QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs
  • HoWToBench: Holistic Evaluation for LLM’s Capability in Human-level Writing using Tree of Writing
  • Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
  • SeLaR: Selective Latent Reasoning in Large Language Models
  • GRAPHIA: Harnessing Social Graph Data to Enhance LLM-Based Social Simulation
  • SharedRequest: Privacy-Preserving Model‑Agnostic Inference for Large Language Models
  • Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM Tutors
  • When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges
  • Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS
  • Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI Recommendation
  • Spectral Disentanglement: Rank-Aware Task Adaptation for Rehearsal-free Continual Learning in LLMs
  • StructMem: Structured Memory for Long-Horizon Behavior in LLMs
  • Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refinement
  • Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
  • Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
  • ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch
  • arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
  • SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
  • HCSpec: Two-Tier Horizontal Cascade Speculative Decoding for High-Efficiency Large Language Model Inference
  • Revisiting the Reliability of Language Models in Instruction-Following
  • EfficientLLM: Unified Pruning-Aware Pretraining for Auto-Designed Compact Language Models
  • Enhancing the Transferability of Jailbreak Attacks on Large Language Models via Exploiting Reparameterization Invariance
  • GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
  • AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering
  • ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
  • From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning
  • From Word to World: Can Large Language Models be Implicit Text-based World Models?
  • GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
  • Large Language Model-Enhanced Multi-Armed Bandits
  • Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
  • A Survey of Large Language Model-Based Search Agents
  • The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination
  • Protecting multimodal large language models against misleading visualizations
  • Dual Activation-Weight Sparsity: A Training-Free Framework for Efficient Large Language Model Compression
  • Repeated Sequences Reveal Gaps between Large Language Models and Natural Language
  • Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
  • InferenceDynamics: Adaptive LLM Routing through Structured Capability and Knowledge Profiling
  • Beyond Monolingual Assumptions: A Survey on Code-Switched NLP in the Era of Large Language Models across Modalities
  • Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
  • ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs
  • MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution
  • When Correct Beliefs Collapse: Epistemic Resilience of LLMs under Clinical Pressure
  • Dissecting Failure Dynamics in Large Language Model Reasoning
  • SCVQ: Sparse-Compensated Vector Quantization for Large Language Models
  • Efficient KL Divergence Estimation via Truncated Top-K Integration for Large Language Models
  • VFA: Empoweing Multilingual MLLMs via Vision-Free Adaptation
  • Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective
  • Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization
  • CoSToM: Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models
  • ConlangCrafter: Constructing Languages with a Multi-Hop LLM Pipeline
  • VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
  • Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
  • PAM: Enhancing General Alignment of Large Reasoning Models through Priority-Aware Metacognition
  • One Battle After Another: Probing LLMs’ Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
  • Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
  • SGPVT: Self-Generated Proximal Visual Tokens for Mitigating Proximal Collateral Damage in MLLM Unlearning
  • VIGIL: Defending LLM Agents Against Tool-Stream Injection via Verify-Before-Commit
  • Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs
  • SPEAK: Spiking Neurons as an Entropy-Aware Tokenizer for Large Language Models
  • CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
  • Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs
  • PLAWBENCH: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
  • MT³: A Synergistic Multi-Task RL Framework for Specializing MLLMs in Text Image Machine Translation
  • Do LLMs Capture Embodied Cognition and Cultural Variation? Cross-Linguistic Evidence from Demonstratives
  • SGT: Securing Open-Source LLMs Against Malicious Fine-tuning via Safety Guidance Trigger
  • Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
  • Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
  • FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
  • Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs
  • From Experts to Bases: Orthogonal Subspace Mixture for Continual Multimodal Instruction Tuning
  • Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness
  • InstructDiff: Domain-Adaptive Data Selection via Contrastive Entropy for Efficient LLM Fine-Tuning
  • Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
  • GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models
  • Musical Score Understanding Benchmark: Evaluating Large Language Models’ Comprehension of Complete Musical Scores
  • Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
  • How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study
  • Sycophants in the Courtroom: Are LLMs Fragile to Juridical Authority and Evolving Legal Standards?
  • Valid Survey Simulations with Limited Human Data: The Roles of Prompting, Fine-Tuning, and Rectification
  • CuBridge: An LLM-Based Framework for Understanding and Reconstructing High-Performance Attention Kernels
  • Defenses Against Prompt Attacks Learn Surface Heuristics
  • Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data
  • Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
  • Learning from Evolving Training Dynamics: An Entropy-Maximizing Data Curation Strategy for LLM Supervised Post-Training
  • Reinforcement Learning on Pre-Training Data
  • CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
  • Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring
  • DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
  • PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data
  • SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
  • LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
  • HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
  • Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER
  • SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs
  • Evolving Sparsity: Leveraging Token Importance Dynamics for Efficient LLM Decoding with Sparse Attention
  • MOA: Multi-Objective Alignment for Role-Playing Agents
  • Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs
  • Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents
  • Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
  • Adaptive Prompt Structure Factorization: A Framework for Self-Discovering and Optimizing Compositional Prompt Programs
  • Cognitive Alpha Mining via LLM-Driven Code-Based Evolution
  • KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMs
  • Fingerprinting LLMs via Prompt Injection
  • Exploring Layer Activation Dynamic of CoT via Knowledge Probe
  • From Trust to Compromise: Outcome-Verified LLM Phishing Simulation and Real-Time Defense
  • DecoCal: Decoding with Calibration in Diffusion Large Language Models
  • LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection
  • Beyond “I Don’t Know”: Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty
  • Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
  • Diffusion-CAM: Faithful Visual Explanations for dMLLMs
  • Beyond Noise: Characterizing Creative Potential in Unverifiable LLM Hallucinations
  • LLM-SLM Collaborative Framework of Idiomatic Expression Generation
  • Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
  • Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation
  • Patches of Nonlinearity: Instruction Vectors in Large Language Models
  • Reasoning Gets Harder for LLMs Inside A Dialogue
  • PDR: A Plug-and-Play Positional Decay Framework for LLM Pre-training Data Detection
  • Deep Kernel Fusion for Transformers
  • Generative Gamer: Learning Equilibrium Strategy by LLM-driven Dynamic Deduction
  • A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven Enhancement
  • LLM-as-Scheduler: Agentic Workflow Dynamic Scheduling
  • Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
  • CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
  • Making Large Language Models Efficient Dense Retrievers
  • Lightweight LLM Agent Memory with Small Language Models
  • HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
  • Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility
  • Vista-LLM: Decoupled Query-Guided Visual Token Pruning for Efficient Long-Video Large Language Models
  • Scaling Law for Multimodal Large Language Model Supervised Fine-Tuning
  • IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation
  • Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs
  • SpiderFlow: Efficient Topology-Aware Scheduling for LLM Training Across Decentralized GPU Clusters
  • Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
  • Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks
  • HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents
  • Can Factual Opinions Be Edited (Manipulated) in Large Language Models?
  • Language of Thought Shapes Output Diversity in Large Language Models
  • Aligning Backchannel and Dialogue Context Representations via Contrastive LLM Fine-Tuning
  • Verifiable LLM-Generated Text Detection via Projected Semantic-Structural Distributions
  • Communication-Efficient Desire Alignment for Proactive Embodied Human–Agent Interaction
  • ICDAGENT: Empowering Agentic Large Language Models for Explainable Medical Coding
  • Iterative Dual-Model Alignment for Story Evaluation
  • LLMs Underperform Graph-Based Parsers on Supervised Relation Extraction for Complex Graphs
  • Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals distinct Multi-Turn Behavior in LLMs
  • What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context
  • FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
  • For-Value: Efficient Forward-Only Data Valuation for finetuning LLMs and VLMs
  • PARASITE: Conditional System Prompt Poisoning to Hijack LLMs
  • XMark: Reliable Multi-Bit Watermarking for LLM-Generated Texts
  • CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories
  • Language Models Struggle to Use Representations Learned In-Context
  • Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights
  • PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
  • ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
  • AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs
  • The Imperfective Paradox in Large Language Models
  • Attention Under Attack: Analog Noise Effects and Mechanistic Vulnerabilities in Transformer Models
  • How to Improve LLMs’ Performance on Specific Languages: A Perspective on LLM-Derived Language Similarity
  • MATCH: Modulating Attention via In‑Context Retrieval for Long‑Context Transformers
  • Protecting Bystander Privacy via Selective Hearing in Audio LLMs
  • LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs
  • To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs
  • Adaptive Constraint Propagation: Scaling Structured Inference for Large Language Models via Meta-Reinforcement Learning
  • STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning
  • Hallucination Detection in LLMs with Topological Divergence on Attention Graphs
  • Mediocrity is the key for LLM as a Judge Anchor Selection
  • To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT Examples
  • ReproEvalCard: A Reporting Standard for Reproducible Evaluation of LLM Pipelines
  • LLM Agents in Law: Taxonomy, Applications, and Challenges
  • Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
  • Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors
  • MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs
  • Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful Beliefs
  • Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition
  • Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities
  • Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence
  • Narrative License and Model Sycophancy in LLM Summaries of Scientific Work
  • AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation
  • CoAct: Co-Active LLM Preference Learning with Human-AI Synergy
  • Label and Explanation Variation in LLM-Based Annotation: a Case Study in Natural Language Inference
  • Text-Attributed Knowledge Graph Enrichment with Large Language Models for Medical Concept Representation
  • Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
  • Check Your Work: Structured Checklist Feedback for Improving Large Language Models
  • LOKA: Conflict-Aware LLM Knowledge Update with Adaptive Knowledge Memory
  • When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors
  • Decoupling Task-Solving and Output Formatting in LLM Generation
  • Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language Models
  • Analyzing and Internalizing Complex Policy Documents for LLM Agents
  • In-Context Representation Hijacking
  • Quantifying Metric and Model Agreement in Bias Evaluation of Large Language Models
  • MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
  • Do LLMs Really Need 10+ Thoughts for “Find the Time 1000 Days Later”? Towards Structural Understanding of LLM Overthinking
  • When One LLM Drools, Multi-LLM Collaboration Rules
  • Select Before Use: On the Importance of Reference Model Selection in Preference Alignment
  • VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs
  • From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration
  • What Do LLMs Learn First? Asymmetric Learning Dynamics of Input Complexity and Output Ambiguity in Preference Alignment
  • Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation
  • OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
  • Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
  • LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models
  • FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware Fusion
  • DiZiNER: Disagreement-guided Instruction Refinement via Simulating Pilot Annotation for Zero-shot Named Entity Recognition
  • Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
  • ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
  • Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning
  • On the Continued Value of Universal Dependencies in the Era of Large Language Models
  • Adaptive Text2GQL: Integrating Structural Twig Linking and Evolutionary In-Context Learning
  • XToM: Exploring the Multilingual Theory of Mind for Large Language Models
  • Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support Conversation
  • Immediate Inference: The Missing Foundation in Large Language Model Logical Reasoning
  • Reference Attack: A New Cross-Modal Jailbreaking Attack against Multimodal Large Language Models
  • POWSM: A Phonetic Open Whisper-Style Speech Foundation Model
  • CIA: Inferring the Communication Topology from LLM-based Multi-Agent Systems
  • AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following
  • Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
  • TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only
  • Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts
  • Would LLMs be Good Historical Linguists and Chinese Dialect Learners?
  • Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
  • CADMate: Generating CAD Assembly Plan with Geometric Chain-of-Thought and Spatial Physical Rewards
  • Calibration-Aware Policy Optimization for Reasoning LLMs
  • Beyond End-to-End: Dynamic Chain Optimization for Private LLM Adaptation on the Edge
  • TalkLoRA: Communication-Aware Mixture of Low-Rank Adaptation for Large Language Models
  • TARE: Lightweight Token-Aware Representation Editing for Fine-tuning Transformer-like Models
  • Soft Orthogonal Low-Rank Adaptation for Knowledge Sharing in Large Language Model Continual Learning
  • Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
  • Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
  • Enhancing Linguistic Competence of Language Models through Pre-training with Language Learning Tasks
  • FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
  • ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
  • Closing the Modality Reasoning Gap for Speech Large Language Models
  • Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning
  • Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates
  • TLSA: LLM-Guided Text-Label Space Alignment with Contrastive Learning for Generalized Category Discovery
  • Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings
  • StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation
  • ODL-TempLLM: Ontology-Guided and Description Logic-Reasoned Temporal Reasoning with LLMs
  • Your Students Don’t Use LLMs Like You Wish They Did
  • BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
  • Dynamics of Cognitive Heterogeneity: Investigating Behavioral Biases in Multi-Stage Supply Chains with LLM-Based Simulation
  • Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
  • CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
  • Modeling LLM Unlearning as an Asymmetric Two-Task Learning Problem
  • MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction
  • Maximizing Local Entropy Where It Matters: Prefix-Aware Localized LLM Unlearning
  • Language Acquisition Device in Large Language Models
  • ReFL: Reflective Feedback Learning for Hallucination Detection of Large Language Models
  • Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
  • NaturalSloth: Revisiting Denial-of-Service Attacks on Large Language Models
  • Distillation Traps and Guards: A Calibration Knob for LLM Distillability
  • DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping
  • IS-CoT: Breaking the Long-form Generation Collapse via Interleaved Structural Thinking
  • Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems
  • Why LLMs Hallucinate on Structured Knowledge: A Mechanistic Analysis of Reasoning over Linearized Representations
  • Merlin’s Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
  • CAKE: Causal-Guided Adaptive Knowledge Editing for LLMs
  • Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention
  • League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
  • Rethinking Data Mixing from the Perspective of Large Language Models
  • The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs
  • Uncovering Sentiment Analysis Circuit in Large Language Model
  • ReEfBench: Quantifying the Reasoning Efficiency of LLMs
  • Beyond Ranking: Fine-Grained Diagnostics and Self-Improvement for MLLMs
  • Bridging Internal Consistency and External Alignment: A Causal and Dynamic Interpretability Framework for LLM Generation
  • Toward Robust In-Context Learning: Leveraging Out-of-distribution Proxies for Target Inaccessible Demonstration Retrieval
  • Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models
  • HiSVD: Principled Low-Rank Approximation of LLMs via Hierarchical Modeling of Information Capacity and Spectral Structure
  • Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible Multilinguality
  • Fisher-Driven Adaptive Locating for Knowledge Editing in Large Language Models
  • From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons
  • ExPerT: Personalizing LLM Responses to Users’ Domain Expertise via Query-Wise Semantic and Keystroke Behavioral Cues
  • Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
  • ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning
  • MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
  • Beyond the Context Window: Scaling Agentic RL via End-to-end Optimized Context Compression
  • Probing the Safety Robustness of LLMs in Latent Space
  • LoopTool: Closing the Data–Training Loop for Robust LLM Tool Calls
  • USB: A COMPREHENSIVE AND UNIFIED SAFETY EVALUATION BENCHMARK FOR MULTIMODAL LARGE LANGUAGE MODELS
  • LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
  • Controllable LLM Reasoning via Sparse Autoencoder‑Based Steering
  • The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models
  • Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents
  • Profiling-Free Mixed-Precision Quantization for MoE LLMs via Fuzzy Rule Interpolation
  • EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
  • MMAC: A Multilingual, Multimodal Alignment Framework for Cultural Grounding Evaluation
  • Traffic-R1: Reinforced LLMs Bring Human-Like Reasoning to Traffic Signal Control Systems
  • BoYaEval: Evaluating Multimodal Large Language Models on Understanding Ancient Chinese Musical Scores
  • Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training
  • How Can Synthetic Data Improve Multilingual Language Model Pretraining? A Data Quality Perspective
  • Can Large Language Models Infer Causal Relationships from Real-World Text?
  • Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models
  • Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start Scenarios
  • MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
  • Markovian Linguistic-Temporal Bridge: Unlocking the Potential of LLMs for Time Series Forecasting
  • FLARE: Fine-Grained Length-Aware Routing for Resource-Efficient Heterogeneous LLM Serving
  • Bit-by-Bit: Progressive QAT Strategy with Outlier Channel Splitting for Stable Low-Bit LLMs
  • Learning from Cognition: Enhancing RL Efficiency for LLM Reasoning via Hierarchical Metacognitive Decomposition and Refinement
  • EpiCaR: Knowing What You Don’t Know Matters for Better Reasoning in LLMs
  • Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
  • SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science
  • Causal2Vec: Improving Decoder-only LLMs as Embedding Models through a Contextual Token
  • Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning
  • See2Refine: Vision-Language Feedback Improves LLM-Based eHMI Action Designers
  • A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions
  • SADA: Bridging In-Context Learning and Fine-Tuning via State-Aligned Distillation Adapters
  • Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions
  • PROMPRINT: Prompt Fingerprinting via First-Token Response for LLM App Cloning Detection
  • CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
  • Make LLMs See Like Investigators, Not Just Think More: The Role of Structured Analysis in Investigative Reasoning
  • From Narrow Unlearning to Emergent Misalignment in LLMs
  • MUR: Momentum Uncertainty guided Reasoning for Large Language Models
  • How Training Data Shapes the Use of Parametric and In-Context Knowledge in Language Models
  • BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
  • GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models
  • Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection
  • Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data
  • Are they lovers or friends? Evaluating LLMs’ Social Reasoning in English and Korean Dialogues
  • Detoxification for LLM: From Dataset Itself
  • Instant Personalized Large Language Model Adaptation via Hypernetwork
  • Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment
  • See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
  • LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
  • Gradient-Guided Multi-Judge Prompt Optimization
  • IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
  • Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
  • Mnemis: Dual-Route Retrieval on Hierarchical Graphs for Long-Term LLM Memory
  • Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
  • Scaling Laws for Code: A More Data-Hungry Regime
  • VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training
  • Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
  • KoCo: Conditioning Language Model Pre-training on Knowledge Coordinates
  • Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies
  • Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models
  • SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning
  • Looking Beyond the One: Operationalizing and Eliciting Visual Ambiguity in VLLMs
  • Safe-FedLLM: Delving into the Safety of Federated Large Language Models
  • ImCoref-CeS: An Improved Lightweight Pipeline for Coreference Resolution with LLM-based Checker-Splitter Refinement
  • When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language Models
  • WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
  • Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy
  • Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment
  • Adaptive Spatial and Temporal Redundancy Optimization for Efficient Reasoning in Large Language Models
  • AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin
  • Learning to Edit Knowledge via Instruction-based Chain-of-Thought Prompting
  • BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
  • DFAMS: Dynamic-flow guided Federated Alignment based Multi-prototype Search
  • PARIF: Pushing the Pareto Frontier of Instruction Following and Reasoning with Curriculum Reinforcement Learning
  • GeoLaux: A Benchmark for Evaluating MLLMs’ Geometry Performance on Long-Step Problems Requiring Auxiliary Lines
  • Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering
  • Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries
  • Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning
  • IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
  • Know Your Place: Diagnosing Implicit Social Adaptation Failures in Chinese Large Language Models
  • Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents
  • VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
  • NiuTrans.LMT: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs
  • MERIT Feedback Elicits Better Bargaining in LLM Negotiators
  • GMFL: Efficient Global Masking for Federated LLM Fine-tuning
  • AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement Learning
  • MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
  • ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
  • Learning to Think on Hypergraph: HyperCoT for Structure-Guided N-ary Knowledge Graph Completion
  • Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations
  • LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech
  • Latent-Condensed Transformer for Efficient Long Context Modeling
  • CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
  • ImF: Embedding an Implicit Fingerprint in Your Large Language Models
  • Jailbreaking Multimodal Large Language Models using Multi-Clip Video
  • Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation
  • Selective Knowledge Distillation: Fusing LLM Semantic Strengths with DNN Efficiency for Binary Code Similarity Detection
  • TransLLM: A Unified Multi-Task Large Language Model for Urban Transportation via Learnable Prompting
  • Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
  • Attention Basin: Why Contextual Position Matters in Large Language Models
  • Beyond Surface Features: Advancing Medical Vision-Language Alignment via Dynamic Evidence-Guided Preference Optimization
  • TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles
  • Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models
  • Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
  • TimeSAF: Towards LLM-Guided Semantic Asynchronous Fusion for Time Series Forecasting
  • Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs
  • Cat-MoD: Accelerating Multimodal Alignment via Caption Token Guided Asymmetric Mixture-of-Depths
  • Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
  • Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
  • TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment
  • Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs
  • MPBoCo: Multimodal Prompt-based Boundary-enhanced Continual Framework for Joint Entity and Relation Extraction
  • Personalizing LLMs with Binary Feedback: A Preference-Calibrated Optimization Framework
  • AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
  • Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
  • False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models
  • LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
  • A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ Integration into Upcycled MoE
  • The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis
  • Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?
  • Human or LLM as Standardized Patients? A Comparative Study in Medical Education
  • Harmonizing the Past, Present, and Future: A Null-Space Constrained Region-Specific Method for Continual Learning in LLMs
  • Inertia in Moral and Value Judgments of Large Language Models
  • LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations
  • LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
  • PACE: Predictive Adaptive Context Extraction for Long-Horizon LLM Agents
  • Draft, Verify, Restore: Self-Refining Historical Inscription Restoration with a Unified MLLM
  • SAM3-I: Segment Anything with Instructions
  • Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
  • CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs
  • Demystifying Data Organization for Enhanced LLM Training
  • Beyond Single View: A Comprehensive Benchmark for Medical Multimodal Large Language Models on Multi-Image Understanding
  • When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs
  • CuMA: Aligning LLMs with Sparse Cultural Values via Demographic-Aware Mixture of Adapters
  • Selective Span-Level Unlearning for Large Language Models
  • ToMMeR - Efficient Entity Mention Detection from Large Language Models
  • Shuttle Between Symbolic Instructions and Neural Parameters of Large Language Models
  • Efficient Hyperparameter Optimization for LLM Reinforcement Learning
  • Hetero-Designer: Automated Design of Multi-Agent Systems with Heterogeneous LLMs
  • Achieving Multi-Hop Calculation and Safe Abstention in Financial Numerical Reasoning by Metric Graph Constrained LLMs
  • MemBuilder: Reinforcing LLMs for Long-Term Memory Construction via Attributed Dense Rewards
  • Probing Semantic Alignment, Lexical Invariance, and Syntactic Influence in LLM Metaphor Processing
  • MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
  • Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA
  • Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents
  • LLM-MC-Affect: LLM-Based Monte Carlo Modeling of Affective Trajectories and Latent Ambiguity for Interpersonal Dynamic Insight
  • UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
  • VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision
  • VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation Agents
  • ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models
  • VerilogLAVD: LLM-Aided Pattern Generation for Verilog CWE Detection
  • Temporal Sampling for Forgotten Reasoning in LLMs
  • STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training
  • OASIS: Mitigating Harmful Fine-tuning Attacks on LLMs via Orthogonal and Adaptive Safety Alignment Strategy
  • KoCo-Bench: Can Large Language Models Leverage Domain Knowledge in Software Development?
  • MagicBench: Diagnosing Visual Agency Loss and Semantic Dependency in Multimodal LLMs
  • Fair-CCD: Mitigating Bias in Large Language Models for Tabular Classification Through Context-Contrastive Decoding
  • GMSA: Enhancing Context Compression via Group Merging and Layer Semantic Alignment
  • From Knowing to Teaching: Scaffolding Pedagogical Decisions for LLM Agent
  • Think Faster Than Words: Efficient LLM Chain-of-Thought Reasoning via Dynamic Shortcut Decoding
  • AEA: Adaptive Expert Allocation Improves Sentence Embeddings from Mixture-of-Experts LLM
  • N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
  • Beyond Static Persona Consistency: Dynamic Persona Coherence in LLM Role-Playing
  • Why Are We Moral? An LLM-based Agent Simulation Approach to the Study of Moral Evolution
  • On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
  • LaCo: Layer-wise Compensation for Pruned Large Language Models
  • Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs
  • LLMs in Sarcasm Detection? It’s elementary! (Or is it?)
  • TLoRA: Task-aware Low Rank Adaptation of Large Language Models
  • LLMs as Knowledge Graph Refiners: Mitigating Factual Inconsistencies in Generative Knowledge Extraction
  • SILO-BENCH: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems
  • Mitigating Structural Knowledge Collapse in Domain-Specific LLMs via Morpheme-Aware KV-Aggregation
  • Whose Facts Win? LLM Source Preferences under Knowledge Conflicts
  • EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering
  • Detecting What Queries Seek: Steering LLM Safety with FFN Output Activation Monitoring
  • Temporal Evidence Chain for Temporal Knowledge Graph Question Answering with Large Language Models
  • UERLens: Understanding Event Relations in Large Language Models
  • DEFT: Demystifying VLN Failures via a Unified Dual-View Explainability Framework for LLM-based Agents
  • LLMs (Almost) Never Abstain Under Medical Uncertainty
  • TOWER+: Bridging Generality and Translation Specialization in Multilingual LLMs
  • Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation
  • LongTutor: Benchmarking Large Language Models for Long-term Personalized Tutoring
  • Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language Models
  • Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination
  • Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework
  • Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models
  • One Cognitive Loop Is Enough: SODA unlocks Pure-Text Spatial Reasoning in Large Language Models
  • Compatibility-Aware Dynamic Fine-Tuning for Large Language Models
  • Reusable Experiences: Latent Routing and Modular Composition in LLMs
  • Controllable Contamination Detection for Reliable LLM Evaluation with Statistical Guarantees
  • From 1,000,000 Users to Every User: Scaling Up Personalized Preference for User-level Alignment
  • Beyond Atomic Characters: Glyph-Aware Sub-character Alignment for Low-Resource Multilingual OCR
  • Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
  • Towards Interpretable Tabular Reasoning: Enhancing LLM Reasoning on Tabular Data with Pre-Constructed Logic Graph
  • Compressing LLM Knowledge into Graph Representations for Text-attributed Graphs Learning
  • End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
  • Understanding Emergent Misalignment via Feature Superposition Geometry
  • Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning
  • Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection
  • Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks
  • Beyond the Panorama: Training-Free Hierarchical Perception-Reasoning for Fine-Grained Vision in MLLMs
  • To Judge or Not to Judge: Can Large Language Models Leverage the Dispute Focus in Legal Judgment?
  • Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks
  • ArgGenBench: Benchmarking the Complex Controlled Argument Generation Capability of Large Language Models
  • Language-Aware Token Boosting: LLM Language Confusion Reduction Without Tuning
  • HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment
  • Do LLMs Encode Functional Importance of Reasoning Tokens ?
  • EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment
  • The “Knowledge–Behavior Gap” in Cultural Taboo Safety of Large Language Models
  • UMPIRE: Unveiling LLM-generated Posts via Redundant Expressions
  • Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models
  • MirrorCAPTCHA: Wild CAPTCHA, Wild Distribution, Wild Web-based Platform Meet Multimodal LLM Agents
  • GASE: Graph-Aware Semantic Embedding Learning with Frozen LLMs for Text-Attributed Graphs
  • Compositional Steering of Large Language Models with Steering Tokens
  • Pref-CTRL: Preference Driven LLM Alignment using Representation Editing
  • Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing
  • GiLT: Augmenting Transformer Language Models with Dependency Graphs
  • TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems
  • How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities
  • Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
  • A Survey of Inductive Reasoning for Large Language Models
  • CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models
  • VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
  • SAFO: Stable Adaptive Fairness Optimization for LLM-Based Social Survey Simulation
  • Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
  • Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization
  • Understanding LLM Performance Degradation in Multi-Instance Processing: The Roles of Instance Count and Context Length
  • Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
  • LLM-Generated Text May Harm Your Retrieval! A Robust Detection Strategy for Retrieval-Augmented Generation
  • The Retrieval Bottleneck: Scaling Laws for Reinforcement Learning in RAG
  • Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective
  • Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
  • Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge
  • Self-SoftCoT: A Self-Consistent Framework via Position-Aware Latent Space Reinforcement Learning
  • Routing with Generated Data: Annotation-Free LLM Skill Estimation and Expert Selection
  • Injecting Context via Situation Working Memory for Logical Reasoning with LLMs
  • ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs
  • SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator
  • Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs
  • How Much Would a Clinician Edit This Draft? Evaluating LLM Alignment for Patient Message Response Drafting
  • MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
  • MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation
  • Measuring Distribution Shift in User Prompts and Its Effects on LLM Performance
  • TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation
  • The Personalization Trap: How User Memory Alters Emotional Reasoning in LLMs
  • Multimodal Large Language Models for Multi-Subject In-Context Image Generation
  • Discourse Realization of Generics in Human and LLM-generated Texts
  • SRA: Span Representation Alignment for Large Language Model Distillation
  • Neuron-Aware Active Few-Shot Learning for LLMs
  • Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
  • LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
  • RedCoder: Automated Multi-Turn Red Teaming for Code LLMs
  • Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
  • PIArena: A Platform for Prompt Injection Evaluation
  • ChemReason-Bench: Benchmarking Large Language Models for Procedural Reasoning in Experimental Chemistry
  • How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
  • MARS²: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
  • Ranking Reasoning LLMs under Test-Time Scaling
  • PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations
  • ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
  • On the Rejection Criterion for Proxy-based Test-time Alignment
  • Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
  • IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering
  • Do LLMs Really Memorize Personally Identifiable Information? Revisiting PII Leakage with a Cue-Controlled Memorization Framework
  • Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop
  • LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target
  • CURA: Clinical Uncertainty Risk Alignment for Language Model–Based Risk Prediction
  • EthicMind: A Risk-Aware Framework for Ethical-Emotional Alignment in Multi-Turn Dialogue
  • Resolving the Security-Auditability Dilemma with Auditable Latent Chain-of-Thought Alignment
  • ART: Attention Replacement Technique to Improve Factuality in LLMs
  • More Thinking, Less Talking: Internalizing Deliberative Safety into LLM Parameters
  • ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering
  • Conjunctive Prompt Attacks in Multi-Agent LLM Systems
  • Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation
  • Trajectory Signatures of Deception in Large Language Models
  • Improving the Distributional Alignment of LLMs using Supervision
  • Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models
  • SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
  • Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
  • What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
  • Confident, Calibrated, or Complicit: Safety Alignment and Ideological Bias in LLM Hate Speech Detection
  • Aligning Large Language Models via Fully Self-Synthetic Data
  • GAM: Hierarchical Graph-based Agentic Memory for LLM Agents
  • CypherSmith: Transforming Text-to-Cypher Generation for LLMs with Synthetic Data
  • New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMs
  • L2Dir: Integrating L₂-Norm and Directional Alignment for Unsupervised Contrastive Representation Learning in Multimodal Retrieval
  • Towards Intrinsic Interpretability of Large Language Models: A Survey of Design Principles and Architectures
  • What Deserves Memory: Adaptive Memory Distillation for LLM Agents
  • MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language Models
  • CaBSALLM: Efficient Context-Aware Batch Annotation of Conversational Streams with Large Language Models
  • WSDPO: A Generative Word Sense Disambiguation Framework with Chain-of-Thought and Preference Optimization
  • Lizard: An Efficient Linearization Framework for Large Language Models
  • S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
  • Can LLM Safety Be Ensured by Constraining Parameter Regions?
  • CityVG: Contrastive Fine-Tuning and Reward-Based Chain-of-Thought Reasoning for Zero-Shot City-Scale 3D Visual Grounding
  • E2EDev: Benchmarking Large Language Models in End-to-End Software Development Task
  • Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers
  • Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
  • KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering
  • Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs
  • LeLoRA: Learnable Low-Rank Adaptation of Large Language Models
  • Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs
  • Octopus: Gated Selective Attention for Memory-Bounded Long-Context Inference in Large Language Models
  • Escaping the Echo Trap: On Credit Assignment Failure in Multi-turn LLM Self-Reflection
  • ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization
  • SMART: Evaluating LLMs’ Mathematical Reasoning via a Human Cognitive Process-Inspired Benchmark
  • LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation
  • SeDev: Structured Semantic Exploration for LLM-Driven Code Generation
  • User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios
  • ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants
  • NL → Schedule: Evaluate Multitask Scheduling Capability of Large Language Models
  • SLICEFORMER: Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding
  • SCOPE: Boosting LLM Efficiency with Scoped Position Encoding
  • Debate-of-Thoughts: Resolving Knowledge Conflicts in LLMs Through Internal Deliberation
  • Projecting Out the Malice: A Global Subspace Approach to LLM Detoxification
  • From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
  • GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding
  • If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs
  • Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models
  • LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient
  • Attn-GS: Attention-Guided Context Compression for Efficient Personalized LLMs
  • Structured Semantic Information Helps Retrieve Better Examples for In-Context Learning Applied to Few-Shot Relation Extraction
  • DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models
  • METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
  • PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
  • “Excuse me, may I say something…” CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert Collaborations
  • PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters’ Lack of Knowledge
  • Memorization, Emergence, and Explaining Reversal Failures: A Controlled Study of Relational Semantics in LLMs
  • Framing Political Bias in Multilingual LLMs Across Pakistani Languages
  • InsAT: Instance-aware Semantic Alignment and Transfer from Human–Object Keypoints for Zero-to-Few-shot Action Understanding
  • Multi-View Attention Multiple-Instance Learning Enhanced by LLM Reasoning for Cognitive Distortion Detection
  • CʜAIRO: Contextual Hierarchical Analogical Induction and Reasoning Optimization for LLMs
  • How Context Shapes Truth: Geometric Transformations of Statement-level Truth Representations in LLMs
  • Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
  • The Dominance of Text Space: Unveiling the Asymmetric Nature of Cross-Modal Alignment in Large Language Models
  • WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback
  • SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking
  • Joint Knowledge Base Completion and Question Answering by Combining Large Language Models and Small Language Models
  • The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
  • The Side Effects of Being Smart: Safety Risks in MLLMs’ Multi-Image Reasoning
  • Action Boundary Blindness: When LLM Agents Cannot Tell Where One Action Ends and Another Begins
  • ProMedical: Hierarchical Fine-Grained Criteria Modeling for Medical LLM Alignment via Explicit Injection
  • R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling
  • Frozen LLMs are Native Decoders for High-Norm Semantic Vectors
  • Glyph: Scaling Context Windows via Visual-Text Compression
  • TA-GRPO-d: Trajectory-Aware GRPO for Optimizing Denoising Trajectories in Diffusion LLMs
  • CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
  • Characterizing the Expressivity of Local Attention in Transformers
  • Zero-Shot Detection of LLM-Generated Text using Temperature Sensitivity
  • Revealing Procedural Reasoning Structures in Chain-of-Thought Training via Span-Level Gradient Organization
  • Social Dynamics as Critical Vulnerabilities that Undermine Objective Decision-Making in LLM Collectives
  • Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
  • Refining and Reusing Annotation Guidelines for LLM Annotation
  • AlignCultura: Towards Culturally Aligned Large Language Models?
  • UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic Languages
  • Dynamic Generation of Multi LLM Agents Communication Topologies with Graph Diffusion Models
  • TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
  • Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses
  • Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs
  • EvoRoute: Experience-Driven Self-Routing LLM Agent Systems
  • Foresight Optimization for Strategic Reasoning in Large Language Models
  • DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection
  • ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment
  • CodeRipple: Wavelet-Based Detection of LLM-Generated Code
  • CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling
  • SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
  • HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns
  • Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
  • Frame-Semantic Knowledge Injection for Event-Level Inference in LLMs
  • Teaching LLMs Human-Like Editing of Inappropriate Argumentation via Reinforcement Learning
  • FLAIR: Steering LLM Mathematical Problem Solving based on A Fuzzy-Logic-AssIsted Reasoner
  • Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning
  • G-IdiomAlign: A Gloss-Pivoted Benchmark for Cross-Lingual Idiom Alignment
  • SciCoQA: Quality Assurance for Scientific Paper–Code Alignment
  • ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following
  • Uncertainty-Aware Routing for Principled Alignment with MoE Dynamics
  • More Aligned, Less Diverse? Analyzing the Grammar and Lexicon of Two Generations of LLMs
  • Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic Views
  • Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
  • Polymorphic Universal Transformer
  • Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression
  • Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment
  • BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
  • Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language Models
  • Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding
  • Knowledge Injection Exists in MoE? Exploring Expert-Aware Contrast Decoding in MoE for Mitigating LLMs’ Hallucinations
  • Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs
  • Zero-shot Large Language Models for Automatic Readability Assessment
  • Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
  • Robust Membership Inference for Large Language Models under Adversarial Generative Corruption
  • ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs
  • LLM Safety From Within: Detecting Harmful Content with Internal Representations
  • Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks
  • MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis
  • Global Adaptive Momentum Meets Local Personalized Perturbation: Efficient Federated LLM Fine-Tuning with Zeroth-Order Gradients
  • Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching
  • Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
  • Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
  • Too Long, Do Re-weighting for Efficient LLM Reasoning Compression
  • GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs
  • Assessing the Belief Consistency of Large Language Models on the Logical Conversation Process
  • Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
  • Learning Uncertainty from Sequential Internal Dispersion in Large Language Models
  • Revisiting Evaluation of Question Answering Systems in Low-Resource Indic Languages: Bridging Human and Metric Alignment
  • Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study
  • From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
  • UrbanGeoEval: A City-Scale Benchmark for Evaluating Large Language Models in Geospatial Reasoning
  • Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech
  • GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap
  • BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMs
  • Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
  • MirrorQA: Benchmarking Multimodal LLMs on Mirror-Orientation Reasoning
  • CAP: Controllable Alignment Prompting for Unlearning in LLMs
  • Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms
  • CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty
  • Tiny Scales, Great Challenges: The Limits of Multimodal LLMs in Scale Recognition
  • From Selection to Refinement: Iterative Optimization for Instruction Data
  • Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive Domains
  • Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
  • HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human–LLM Collaborative Writing
  • Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
  • CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language
  • Thinking in Schemas: Robust Syllogistic Reasoning in LLMs
  • GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective Testing
  • Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain
  • Beyond Static Alignment: Adaptive Arbitration for Semantic Incongruence in Semi-Supervised Multimodal Sentiment Analysis
  • LLM Beliefs Are in Their Heads
  • One Pair Suffices: Unlocking Universal Zero-Shot Translation via Cross-Architecture Alignment
  • LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
  • Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation
  • Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
  • MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
  • Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language Models
  • Anchoring the Affective Manifold: Learning Canonical and Disentangled Representations via Generative Cross-Modal Alignment
  • Incomplete In-context Learning
  • Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective
  • Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models
  • Mechanisms of Prompt-Induced Hallucination in Vision–Language Models
  • LLM4Cell: Taxonomy and Evaluation of LLM and Agentic Models for Single-Cell Biology
  • From Nodes to Narratives: Explaining Graph Neural Networks with LLMs and Graph Context
  • Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment
  • From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
  • A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass Classification
  • Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams
  • A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
  • LLMSurgeon: Diagnosing Data Mixture of Large Language Models
  • ACBQ: Adaptive Cross-Block Quantization of Large Language Models
  • SecureGate: Learning When to Reveal PII Safely via Token-Gated Dual-Adapters for Federated LLMs
  • AdaFuse: Adaptive Ensemble Decoding for Large Language Models
  • TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
  • JW-SVD: Bridging the Cross-Modal Mismatch in Post-Training MLLM Compression
  • Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation
  • CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment
  • MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following
  • TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
  • Thinking Alignment of Scenario-Oriented User Simulation
  • AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache Reuse
  • ReActR: Reasoning through Error-Activated Reflection for LLM Post-Training
  • RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
  • Explain the Synth: Interpretable Evaluation of LLM Data Synthesis
  • Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
  • HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
  • Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
  • Do Morals Guide How LLMs Think? The Role of Ethical Perspectives in General Problem Solving
  • ViLL-E: Video LLM Embeddings for Retrieval
  • From Trajectories to Graphs: Contract-Checked Editing for Verifier-Guided LLM Reasoning
  • EdgeFormer: Latency-Aware Collaborative Multi-Head Attention of Transformer Inference in Edge Networks
  • FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs
  • EVOTOOL: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection
  • A Lightweight Explainable Guardrail for Prompt Safety
  • PodBench: A Comprehensive Benchmark for Instruction-Aware Audio-Oriented Podcast Script Generation
  • MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation
  • Knowledge Vector of Logical Reasoning in Large Language Models
  • SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter
  • Activation Decomposition and Steering for LLM Backdoor Remediation
  • A Survey of Large Language Models for Text-Guided Molecular Discovery: From Molecule Generation to Optimization
  • Reward Alignment Optimization: A Direct Point-wise Alignment Approach
  • Can You Make It Sound Like You? Post-Editing LLM-Generated Text for Personal Style
  • PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning
  • OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation
  • Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data
  • Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models
  • MTA:A Merge-then-Adapt Framework for Personalized Large Language Models
  • Investigating Counterfactual Unfairness in LLMs towards Identities through Humor
  • Nature-Inspired Population-Based Evolution of Large Language Models
  • MTRouter: Cost-Aware Multi-Turn LLM Routing with History–Model Joint Embeddings
  • ParaSuite: Boosting LLM Reasoning via Paradox Resolution
  • ReTRE: Benchmarking LLM Transfer Robustness with Structure-Preserving Variants
  • Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding
  • DarwinTOD: LLM-Driven Lifelong Self-evolution for Task-oriented Dialog Systems
  • Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
  • Understanding the Prompt Sensitivity
  • rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection
  • SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering
  • AIPO: Adaptive Information Guided Token-Level Reinforcement Learning for Large Language Model Reasoning
  • AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
  • INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
  • CLAOCS-TX: Cross-Lingual Triplet Extraction with Aspect-Opinion-Aware Code-Switched Prompting and LLM-Guided Contrastive Distillation
  • When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models
  • DialDefer: A Framework for Detecting and Mitigating LLM Dialogic Deference
  • Parallel Test-Time Scaling for Latent Reasoning Models
  • When Benchmarks Leak: Inference-Time Decontamination for LLMs
  • HSGraphAgent: Knowledge-Graph-Guided Large Language Models for Harmonized System Code Classification
  • Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning
  • TInR: Exploring Tool-Internalized Reasoning in Large Language Models
  • One Persona, Many Cues, Different Results: How Sociodemographic Cues Impact LLM Personalization
  • Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text
  • Building LLMs Like LEGO: Two-dimensional Architecture Reassembly of Large Language Models
  • How Long Reasoning Chains Influence LLMs’ Judgment of Answer Factuality
  • Revealing the Seen, Imagining the Beyond: A Survey of Image-Grounded Chain-of-Thought Reasoning in Multimodal LLMs
  • Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Language Models
  • TwiUSD: A Benchmark Dataset and Structure-Aware LLM Framework for User Stance Detection
  • Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
  • SHARP: Self-adaptive Harmful Category-aware Prompt Generation for Black-box Jailbreaking
  • Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal Responses
  • Cross-Prompt Automated Essay Scoring of Multiple Traits: Making Sense of the State of the Art
  • A Linguistics-Aware LLM Watermarking via Syntactic Predictability
  • SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models
  • Multi-Task Representation Alignment on Language Understanding: A Mutual Information Perspective
  • EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
  • LLM-Based Multi-Agent Systems for Clinical Workflows: A Survey of AI Hospitals
  • Mind’s Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
  • When High Accuracy Hides Poor Calibration: Rethinking Confidence Evaluation in Transformer-Based Text Classification with Balanced Brier Score
  • Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning
  • Reinforcement Learning for Diffusion LLMs via Energy-Based Gibbs Alignment
  • From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding
  • Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs
  • BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
  • COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs
  • Dual Alignment Between Language Model Layers and Human Sentence Processing
  • FactCorrector: A Graph-Inspired Approach to Long-Form Factuality Correction of Large Language Models
  • Decoupling Generalization and Adaptation in Meta-Learning for Large Language Models
  • DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
  • ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
  • From Words to Pixels: A Comprehensive Survey on Large Language Models in Visual Segmentation
  • Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts
  • Graph-Based Alternatives to LLMs for Human Simulation
  • GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs
  • OLA: Output Language Alignment in Code-Switched LLM Interactions
  • Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations
  • BatonVoice: An Operationalist Framework for Enhancing Controllable Speech Synthesis with Linguistic Intelligence from LLMs
  • Monotonic Scaffolding as a Diagnostic Lens for Legal Reasoning in LLMs
  • Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
  • Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
  • Factual Retrieval in LLMs Is a Redundant, Distributed and Non-Contiguous Process
  • What About the Scene With the Hitler Reference? HAUNT: A Framework to Probe LLMs’ Self-consistency in Closed Domains Via Adversarial Nudge
  • Knowledge without Wisdom: Measuring Misalignment between LLMs and Intended Impact
  • Apertus: Democratizing Open and Compliant LLMs for Global Language Environments
  • Adaptive Instruction Composition for Automated LLM Red-Teaming
  • CHOIR: Harmonizing Structured Persona Diversity for Robust Collaborative LLM Reasoning
  • Revisiting Non-Verbatim Memorization in Large Language Models: The Role of Entity Surface Forms
  • ChatAnime: Towards User-Centered Emotional Support in LLM-based Virtual Character Chat
  • SciPedia: Unlocking the Value of Scientific Data for Pre-training
  • Self-Guided Alignment: Adaptive Preference Sensing for Multi-Objective Generation
  • ReasMark: A Robust Watermark for Attributing LLM Reasoning Under Knowledge Distillation Attacks
  • Characterizing and Evaluating Working Emotion Vocabularies in Multilingual Large Language Models
  • Solve-Detect-Verify: Inference-Time Scaling with Flexible Generative Verifier
  • SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility
  • Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations
  • Toward Robust Evaluation for Multilingual Grammatical Error Correction: Can Large Language Models Replace Human References?
  • KARL: Reinforcement Learning for LLM Agents on Multi-Turn Knowledge-Intensive Agentic Tasks
  • TokDrift: When LLM Speaks in Subwords but Code Speaks in Grammar
  • REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
  • Do LLM Agents Mirror Socio-Cognitive Effects in Power-Asymmetric Conversations?
  • Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
  • Influence-based Online Experience Selection for Effective RLHF
  • SharVeT: Similarity-aware Parameter Sharing with Vector-based Tuning for Efficient LLM Compression
  • Beyond Variance: Knowledge-Aware LLM Compression via Fisher-Aligned Subspace Diagnostics
  • REMIND: Memorization and Unlearning in LLMs Through the Lens of Input Loss Landscapes
  • Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization
  • SELECting over Tokens: Curating Pre-training Data at Scale via Token Classification
  • TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
  • Constructing coherent spatial memory in LLM agents through graph rectification
  • JurisBench: A Deep Benchmark for Assessing Large Language Models in Professional Legal Practice
  • River-LLM: Large Language Model Seamless Exit Based on KV Share