- Published on
ACL 2026 — LLMs & Foundation Models
LLMs & Foundation Models
985 papers Links not yet available — ACL proceedings pending on ACL Anthology.
- Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models
- Rhetorical Questions in LLM Representations: A Linear Probing Study
- Different types of syntactic agreement recruit the same units within large language models
- Benchmarking LLM’s Capability in Reasoning over Conflicting Web References
- Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation
- Can Continual Pretraining Bridge the Performance Gap between General-purpose and Specialized Language Models in the Medical Domain?
- MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Long-tail Knowledge
- PR-XAI: PageRank-Based Feature Attribution for Transformers
- CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models
- Your Reasoning Model Knows What Counts: Self-Guided Chain-of-Thought Pruning for Efficient Reasoning
- How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior
- SACTOR: LLM-Driven Correct and Idiomatic C to Rust Translation with Static Analysis and FFI-Based Verification
- IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review
- Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
- Augur: Modeling Covariate Causal Associations in Time Series via Large Language Models
- AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering
- MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
- DecIF: Improving Instruction-Following through Decomposition
- NavA³: Understanding Any Instruction, Navigating Anywhere, Finding Anything
- MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
- CAPC-CG: A Large-Scale, Expert-Directed LLM-Annotated Corpus of Adaptive Policy Communication in China
- MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
- What Makes Good Instruction-Tuning Data? An In-Context Learning Perspective
- XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI Collaboration
- Learn to Relax with Large Language Models: Solving Constraint Optimization Problems via Bidirectional Coevolution
- Focusing Condition: Inference-Time Self-Contrastive Steering Elicits Better Conditional Text Embeddings in LLMs
- Exploring Attention Attractors in Large Language Models
- SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models
- CoreGaze: Core Subgraph-Driven Visual Gaze Diffusion for Training-Free Referring Multimodal Large Language Models
- RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification
- Beyond Detection: Evaluating Fallacy Awareness of LLMs in Interactive Scenarios
- Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining
- On the Emergence and Test-Time Use of Structural Information in Large Language Models
- SAGE: A Search-AuGmented Evaluation of Large Language Models on Free‑Form QA
- CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
- Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs
- Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
- Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning
- SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe
- Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness
- Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models
- What is a protest anyway? Codebook conceptualization is still a first-order concern in LLM-era classification
- Contextual Relevance and Adaptive Sampling for LLM-Based Document Reranking
- Quantifying Aleatoric Uncertainty of In-Context Learning for Robust Measure of LLM Prediction Confidence
- SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
- EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning
- From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization
- TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language Models
- MMCLIP: Cross-Modal Attention Masked Modelling for Medical Language-Image Pre-Training
- LaMI: Augmenting Large Language Models via Late Multi-Image Fusion
- Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning
- SDE-SQL: Enhancing Text-to-SQL Generation in Large Language Models via Self-Driven Exploration with SQL Probes
- Thinking beyond the anthropomorphic paradigm benefits LLM research
- LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
- SCAN: Structured Capability Assessment and Navigation for LLMs
- EMCEE: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context
- Can LLMs Learn to Map the World from Local Descriptions?
- ALIGN: Word Association Learning for Cultural Alignment in Large Language Models
- Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
- Beyond Examples: Towards Automated Thought-level In-Context Reasoning for Large Language Models
- Two-Stage Regularization-Based Structured Pruning for LLMs
- K-Merge: Online Continual Merging of Adapters for On-device Large Language Models
- TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation
- It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief
- Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders
- Evolutionary Guided Decoding: Iterative Value Refinement for LLMs
- KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM Evaluation
- BracketRank: Large Language Model Document Ranking via Reasoning-based Competitive Elimination
- Multi-component Causal Tracing in Large Language Models
- Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
- TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors
- OASIS: Online Sample Selection for Continual Instruction Tuning
- Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization
- CODERL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
- Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding
- LLM-XTM: Enhancing Cross-Lingual Topic Models with Large Language Models
- From Factuality to Meta-Factivity: A Cognitive Blueprint for Trustworthy LLMs
- From ID to LLM: Rethinking Representation Learning for Recommendation
- DMHM: Density-aware Manifold Learning and Hybrid Mahalanobis Energy for LLMs-generated Text Detection
- SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling
- Adam’s Law: Textual Frequency Law on Large Language Models
- Are Emotion and Rhetoric Neurons in LLM? Neuron Recognition and Adaptive Masking for Emotion-Rhetoric Prediction Steering
- Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training
- Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs
- Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with Constraints
- Thermometer of Thoughts: Enhancing LLM’s Exploration via Attention Temperature Modulation
- Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency
- Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
- Open Schrödinger’s Closed Box: Identifying Retrieval Augmented Generation in API-Accessible Large Language Model Services
- Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
- Multi-Granularity Semantic Revision for Large Language Model Distillation
- Instruction Data Selection via Answer Divergence
- Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation
- Instructions are all you need: Self-supervised Reinforcement Learning for Instruction Following
- Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization
- Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy Models
- MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
- Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
- MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
- Beyond the Crowd: LLM-Augmented Community Notes for Governing Health Misinformation
- Beyond the Final Actor: Modeling the Dual Roles of Creator and Editor for Fine-Grained LLM-Generated Text Detection
- PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models
- MSEarth: A Multimodal Benchmark for Earth Science Phenomenon Discovery with MLLMs
- Reasoning Structure Matters for Safety Alignment of Reasoning Models
- Who Wrote This Line? Evaluating the Detection of LLM-Generated Classical Chinese Poetry
- Representation Interventions Enable Lifelong Knowledge Memory Control in LLMs
- SLoRA: Balancing Plasticity and Forgetting in Large Language Models for Continual Learning
- Common to Whom? Regional Cultural Commonsense and LLM Bias in India
- Par-ITA: Benchmarking Seq2Seq and LLMs on a Human-Supervised Parallel Corpus for Italian Hyperpartisan Neutralization
- Demystifying Uncertainty in LLMs: Active Calibration between Concepts and Human Evaluations
- LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
- TiKMiX: Efficient Semi-Dynamic Data Mixture via Data Influence for LLM Pre-training
- FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation
- AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages
- What Does LLM Refinement Actually Improve? A Systematic Study on Document-Level Literary Translation
- OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
- Editing the Moving World: Model Editing for Video LLMs
- OCP: Outlier-Centric Probing for Dynamic Structured Pruning of LLMs
- Attention Sinks Are Provably Necessary in Softmax Transformers: Evidence from Trigger-Conditional Tasks
- AutoTaskEval: Towards Domain-Specific and Fine-Grained Evaluation for LLMs
- CiteGuard: Faithful Citation Attribution for LLMs via Retrieval-Augmented Validation
- From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models
- UniSpec: Training-Free Speculative Decoding for Robust LLM Acceleration Across Languages and Hardware
- Logical Consistency as a Bridge: Improving LLM Hallucination Detection via Label Constraint Modeling between Responses and Self-Judgments
- FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
- A Mechanistic Account of Attention Sinks in GPT-2: One Circuit, Broader Implications for Mitigation
- LLMs Enable Bag-of-Texts Representations for Short-Text Clustering
- TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs
- StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation
- Integrating Data Validation with Large Language Models for Regulation-Guided Tabular Anomaly Detection
- Faithful Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance
- Calibrating Inference Time Alignment with Sequence-level Risk Accumulation
- QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs
- HoWToBench: Holistic Evaluation for LLM’s Capability in Human-level Writing using Tree of Writing
- Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
- SeLaR: Selective Latent Reasoning in Large Language Models
- GRAPHIA: Harnessing Social Graph Data to Enhance LLM-Based Social Simulation
- SharedRequest: Privacy-Preserving Model‑Agnostic Inference for Large Language Models
- Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM Tutors
- When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges
- Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS
- Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI Recommendation
- Spectral Disentanglement: Rank-Aware Task Adaptation for Rehearsal-free Continual Learning in LLMs
- StructMem: Structured Memory for Long-Horizon Behavior in LLMs
- Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refinement
- Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
- Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
- ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch
- arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
- SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
- HCSpec: Two-Tier Horizontal Cascade Speculative Decoding for High-Efficiency Large Language Model Inference
- Revisiting the Reliability of Language Models in Instruction-Following
- EfficientLLM: Unified Pruning-Aware Pretraining for Auto-Designed Compact Language Models
- Enhancing the Transferability of Jailbreak Attacks on Large Language Models via Exploiting Reparameterization Invariance
- GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
- AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering
- ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
- From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning
- From Word to World: Can Large Language Models be Implicit Text-based World Models?
- GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
- Large Language Model-Enhanced Multi-Armed Bandits
- Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
- A Survey of Large Language Model-Based Search Agents
- The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination
- Protecting multimodal large language models against misleading visualizations
- Dual Activation-Weight Sparsity: A Training-Free Framework for Efficient Large Language Model Compression
- Repeated Sequences Reveal Gaps between Large Language Models and Natural Language
- Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
- InferenceDynamics: Adaptive LLM Routing through Structured Capability and Knowledge Profiling
- Beyond Monolingual Assumptions: A Survey on Code-Switched NLP in the Era of Large Language Models across Modalities
- Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
- ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs
- MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution
- When Correct Beliefs Collapse: Epistemic Resilience of LLMs under Clinical Pressure
- Dissecting Failure Dynamics in Large Language Model Reasoning
- SCVQ: Sparse-Compensated Vector Quantization for Large Language Models
- Efficient KL Divergence Estimation via Truncated Top-K Integration for Large Language Models
- VFA: Empoweing Multilingual MLLMs via Vision-Free Adaptation
- Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective
- Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization
- CoSToM: Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models
- ConlangCrafter: Constructing Languages with a Multi-Hop LLM Pipeline
- VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
- Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
- PAM: Enhancing General Alignment of Large Reasoning Models through Priority-Aware Metacognition
- One Battle After Another: Probing LLMs’ Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
- Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
- SGPVT: Self-Generated Proximal Visual Tokens for Mitigating Proximal Collateral Damage in MLLM Unlearning
- VIGIL: Defending LLM Agents Against Tool-Stream Injection via Verify-Before-Commit
- Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs
- SPEAK: Spiking Neurons as an Entropy-Aware Tokenizer for Large Language Models
- CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
- Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs
- PLAWBENCH: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
- MT³: A Synergistic Multi-Task RL Framework for Specializing MLLMs in Text Image Machine Translation
- Do LLMs Capture Embodied Cognition and Cultural Variation? Cross-Linguistic Evidence from Demonstratives
- SGT: Securing Open-Source LLMs Against Malicious Fine-tuning via Safety Guidance Trigger
- Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
- Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
- FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
- Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs
- From Experts to Bases: Orthogonal Subspace Mixture for Continual Multimodal Instruction Tuning
- Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness
- InstructDiff: Domain-Adaptive Data Selection via Contrastive Entropy for Efficient LLM Fine-Tuning
- Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
- GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models
- Musical Score Understanding Benchmark: Evaluating Large Language Models’ Comprehension of Complete Musical Scores
- Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
- How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study
- Sycophants in the Courtroom: Are LLMs Fragile to Juridical Authority and Evolving Legal Standards?
- Valid Survey Simulations with Limited Human Data: The Roles of Prompting, Fine-Tuning, and Rectification
- CuBridge: An LLM-Based Framework for Understanding and Reconstructing High-Performance Attention Kernels
- Defenses Against Prompt Attacks Learn Surface Heuristics
- Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data
- Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
- Learning from Evolving Training Dynamics: An Entropy-Maximizing Data Curation Strategy for LLM Supervised Post-Training
- Reinforcement Learning on Pre-Training Data
- CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
- Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring
- DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
- PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data
- SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
- LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
- HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
- Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER
- SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs
- Evolving Sparsity: Leveraging Token Importance Dynamics for Efficient LLM Decoding with Sparse Attention
- MOA: Multi-Objective Alignment for Role-Playing Agents
- Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs
- Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents
- Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
- Adaptive Prompt Structure Factorization: A Framework for Self-Discovering and Optimizing Compositional Prompt Programs
- Cognitive Alpha Mining via LLM-Driven Code-Based Evolution
- KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMs
- Fingerprinting LLMs via Prompt Injection
- Exploring Layer Activation Dynamic of CoT via Knowledge Probe
- From Trust to Compromise: Outcome-Verified LLM Phishing Simulation and Real-Time Defense
- DecoCal: Decoding with Calibration in Diffusion Large Language Models
- LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection
- Beyond “I Don’t Know”: Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty
- Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
- Diffusion-CAM: Faithful Visual Explanations for dMLLMs
- Beyond Noise: Characterizing Creative Potential in Unverifiable LLM Hallucinations
- LLM-SLM Collaborative Framework of Idiomatic Expression Generation
- Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing
- Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation
- Patches of Nonlinearity: Instruction Vectors in Large Language Models
- Reasoning Gets Harder for LLMs Inside A Dialogue
- PDR: A Plug-and-Play Positional Decay Framework for LLM Pre-training Data Detection
- Deep Kernel Fusion for Transformers
- Generative Gamer: Learning Equilibrium Strategy by LLM-driven Dynamic Deduction
- A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven Enhancement
- LLM-as-Scheduler: Agentic Workflow Dynamic Scheduling
- Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
- CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
- Making Large Language Models Efficient Dense Retrievers
- Lightweight LLM Agent Memory with Small Language Models
- HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
- Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility
- Vista-LLM: Decoupled Query-Guided Visual Token Pruning for Efficient Long-Video Large Language Models
- Scaling Law for Multimodal Large Language Model Supervised Fine-Tuning
- IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation
- Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs
- SpiderFlow: Efficient Topology-Aware Scheduling for LLM Training Across Decentralized GPU Clusters
- Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
- Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks
- HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents
- Can Factual Opinions Be Edited (Manipulated) in Large Language Models?
- Language of Thought Shapes Output Diversity in Large Language Models
- Aligning Backchannel and Dialogue Context Representations via Contrastive LLM Fine-Tuning
- Verifiable LLM-Generated Text Detection via Projected Semantic-Structural Distributions
- Communication-Efficient Desire Alignment for Proactive Embodied Human–Agent Interaction
- ICDAGENT: Empowering Agentic Large Language Models for Explainable Medical Coding
- Iterative Dual-Model Alignment for Story Evaluation
- LLMs Underperform Graph-Based Parsers on Supervised Relation Extraction for Complex Graphs
- Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals distinct Multi-Turn Behavior in LLMs
- What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context
- FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
- For-Value: Efficient Forward-Only Data Valuation for finetuning LLMs and VLMs
- PARASITE: Conditional System Prompt Poisoning to Hijack LLMs
- XMark: Reliable Multi-Bit Watermarking for LLM-Generated Texts
- CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories
- Language Models Struggle to Use Representations Learned In-Context
- Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights
- PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
- ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
- AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs
- The Imperfective Paradox in Large Language Models
- Attention Under Attack: Analog Noise Effects and Mechanistic Vulnerabilities in Transformer Models
- How to Improve LLMs’ Performance on Specific Languages: A Perspective on LLM-Derived Language Similarity
- MATCH: Modulating Attention via In‑Context Retrieval for Long‑Context Transformers
- Protecting Bystander Privacy via Selective Hearing in Audio LLMs
- LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs
- To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs
- Adaptive Constraint Propagation: Scaling Structured Inference for Large Language Models via Meta-Reinforcement Learning
- STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning
- Hallucination Detection in LLMs with Topological Divergence on Attention Graphs
- Mediocrity is the key for LLM as a Judge Anchor Selection
- To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT Examples
- ReproEvalCard: A Reporting Standard for Reproducible Evaluation of LLM Pipelines
- LLM Agents in Law: Taxonomy, Applications, and Challenges
- Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
- Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors
- MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs
- Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful Beliefs
- Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition
- Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities
- Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence
- Narrative License and Model Sycophancy in LLM Summaries of Scientific Work
- AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation
- CoAct: Co-Active LLM Preference Learning with Human-AI Synergy
- Label and Explanation Variation in LLM-Based Annotation: a Case Study in Natural Language Inference
- Text-Attributed Knowledge Graph Enrichment with Large Language Models for Medical Concept Representation
- Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
- Check Your Work: Structured Checklist Feedback for Improving Large Language Models
- LOKA: Conflict-Aware LLM Knowledge Update with Adaptive Knowledge Memory
- When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors
- Decoupling Task-Solving and Output Formatting in LLM Generation
- Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language Models
- Analyzing and Internalizing Complex Policy Documents for LLM Agents
- In-Context Representation Hijacking
- Quantifying Metric and Model Agreement in Bias Evaluation of Large Language Models
- MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
- Do LLMs Really Need 10+ Thoughts for “Find the Time 1000 Days Later”? Towards Structural Understanding of LLM Overthinking
- When One LLM Drools, Multi-LLM Collaboration Rules
- Select Before Use: On the Importance of Reference Model Selection in Preference Alignment
- VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs
- From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration
- What Do LLMs Learn First? Asymmetric Learning Dynamics of Input Complexity and Output Ambiguity in Preference Alignment
- Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation
- OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
- Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
- LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models
- FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware Fusion
- DiZiNER: Disagreement-guided Instruction Refinement via Simulating Pilot Annotation for Zero-shot Named Entity Recognition
- Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
- ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
- Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning
- On the Continued Value of Universal Dependencies in the Era of Large Language Models
- Adaptive Text2GQL: Integrating Structural Twig Linking and Evolutionary In-Context Learning
- XToM: Exploring the Multilingual Theory of Mind for Large Language Models
- Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support Conversation
- Immediate Inference: The Missing Foundation in Large Language Model Logical Reasoning
- Reference Attack: A New Cross-Modal Jailbreaking Attack against Multimodal Large Language Models
- POWSM: A Phonetic Open Whisper-Style Speech Foundation Model
- CIA: Inferring the Communication Topology from LLM-based Multi-Agent Systems
- AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following
- Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
- TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only
- Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts
- Would LLMs be Good Historical Linguists and Chinese Dialect Learners?
- Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
- CADMate: Generating CAD Assembly Plan with Geometric Chain-of-Thought and Spatial Physical Rewards
- Calibration-Aware Policy Optimization for Reasoning LLMs
- Beyond End-to-End: Dynamic Chain Optimization for Private LLM Adaptation on the Edge
- TalkLoRA: Communication-Aware Mixture of Low-Rank Adaptation for Large Language Models
- TARE: Lightweight Token-Aware Representation Editing for Fine-tuning Transformer-like Models
- Soft Orthogonal Low-Rank Adaptation for Knowledge Sharing in Large Language Model Continual Learning
- Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
- Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
- Enhancing Linguistic Competence of Language Models through Pre-training with Language Learning Tasks
- FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
- ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
- Closing the Modality Reasoning Gap for Speech Large Language Models
- Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning
- Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates
- TLSA: LLM-Guided Text-Label Space Alignment with Contrastive Learning for Generalized Category Discovery
- Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings
- StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation
- ODL-TempLLM: Ontology-Guided and Description Logic-Reasoned Temporal Reasoning with LLMs
- Your Students Don’t Use LLMs Like You Wish They Did
- BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
- Dynamics of Cognitive Heterogeneity: Investigating Behavioral Biases in Multi-Stage Supply Chains with LLM-Based Simulation
- Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
- CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
- Modeling LLM Unlearning as an Asymmetric Two-Task Learning Problem
- MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction
- Maximizing Local Entropy Where It Matters: Prefix-Aware Localized LLM Unlearning
- Language Acquisition Device in Large Language Models
- ReFL: Reflective Feedback Learning for Hallucination Detection of Large Language Models
- Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
- NaturalSloth: Revisiting Denial-of-Service Attacks on Large Language Models
- Distillation Traps and Guards: A Calibration Knob for LLM Distillability
- DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping
- IS-CoT: Breaking the Long-form Generation Collapse via Interleaved Structural Thinking
- Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems
- Why LLMs Hallucinate on Structured Knowledge: A Mechanistic Analysis of Reasoning over Linearized Representations
- Merlin’s Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
- CAKE: Causal-Guided Adaptive Knowledge Editing for LLMs
- Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention
- League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
- Rethinking Data Mixing from the Perspective of Large Language Models
- The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs
- Uncovering Sentiment Analysis Circuit in Large Language Model
- ReEfBench: Quantifying the Reasoning Efficiency of LLMs
- Beyond Ranking: Fine-Grained Diagnostics and Self-Improvement for MLLMs
- Bridging Internal Consistency and External Alignment: A Causal and Dynamic Interpretability Framework for LLM Generation
- Toward Robust In-Context Learning: Leveraging Out-of-distribution Proxies for Target Inaccessible Demonstration Retrieval
- Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models
- HiSVD: Principled Low-Rank Approximation of LLMs via Hierarchical Modeling of Information Capacity and Spectral Structure
- Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible Multilinguality
- Fisher-Driven Adaptive Locating for Knowledge Editing in Large Language Models
- From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons
- ExPerT: Personalizing LLM Responses to Users’ Domain Expertise via Query-Wise Semantic and Keystroke Behavioral Cues
- Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
- ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning
- MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
- Beyond the Context Window: Scaling Agentic RL via End-to-end Optimized Context Compression
- Probing the Safety Robustness of LLMs in Latent Space
- LoopTool: Closing the Data–Training Loop for Robust LLM Tool Calls
- USB: A COMPREHENSIVE AND UNIFIED SAFETY EVALUATION BENCHMARK FOR MULTIMODAL LARGE LANGUAGE MODELS
- LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
- Controllable LLM Reasoning via Sparse Autoencoder‑Based Steering
- The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models
- Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents
- Profiling-Free Mixed-Precision Quantization for MoE LLMs via Fuzzy Rule Interpolation
- EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
- MMAC: A Multilingual, Multimodal Alignment Framework for Cultural Grounding Evaluation
- Traffic-R1: Reinforced LLMs Bring Human-Like Reasoning to Traffic Signal Control Systems
- BoYaEval: Evaluating Multimodal Large Language Models on Understanding Ancient Chinese Musical Scores
- Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training
- How Can Synthetic Data Improve Multilingual Language Model Pretraining? A Data Quality Perspective
- Can Large Language Models Infer Causal Relationships from Real-World Text?
- Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models
- Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start Scenarios
- MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
- Markovian Linguistic-Temporal Bridge: Unlocking the Potential of LLMs for Time Series Forecasting
- FLARE: Fine-Grained Length-Aware Routing for Resource-Efficient Heterogeneous LLM Serving
- Bit-by-Bit: Progressive QAT Strategy with Outlier Channel Splitting for Stable Low-Bit LLMs
- Learning from Cognition: Enhancing RL Efficiency for LLM Reasoning via Hierarchical Metacognitive Decomposition and Refinement
- EpiCaR: Knowing What You Don’t Know Matters for Better Reasoning in LLMs
- Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
- SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science
- Causal2Vec: Improving Decoder-only LLMs as Embedding Models through a Contextual Token
- Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning
- See2Refine: Vision-Language Feedback Improves LLM-Based eHMI Action Designers
- A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions
- SADA: Bridging In-Context Learning and Fine-Tuning via State-Aligned Distillation Adapters
- Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions
- PROMPRINT: Prompt Fingerprinting via First-Token Response for LLM App Cloning Detection
- CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
- Make LLMs See Like Investigators, Not Just Think More: The Role of Structured Analysis in Investigative Reasoning
- From Narrow Unlearning to Emergent Misalignment in LLMs
- MUR: Momentum Uncertainty guided Reasoning for Large Language Models
- How Training Data Shapes the Use of Parametric and In-Context Knowledge in Language Models
- BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
- GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models
- Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection
- Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data
- Are they lovers or friends? Evaluating LLMs’ Social Reasoning in English and Korean Dialogues
- Detoxification for LLM: From Dataset Itself
- Instant Personalized Large Language Model Adaptation via Hypernetwork
- Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment
- See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs
- LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
- Gradient-Guided Multi-Judge Prompt Optimization
- IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
- Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
- Mnemis: Dual-Route Retrieval on Hierarchical Graphs for Long-Term LLM Memory
- Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
- Scaling Laws for Code: A More Data-Hungry Regime
- VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training
- Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
- KoCo: Conditioning Language Model Pre-training on Knowledge Coordinates
- Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies
- Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models
- SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning
- Looking Beyond the One: Operationalizing and Eliciting Visual Ambiguity in VLLMs
- Safe-FedLLM: Delving into the Safety of Federated Large Language Models
- ImCoref-CeS: An Improved Lightweight Pipeline for Coreference Resolution with LLM-based Checker-Splitter Refinement
- When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language Models
- WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
- Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy
- Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment
- Adaptive Spatial and Temporal Redundancy Optimization for Efficient Reasoning in Large Language Models
- AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin
- Learning to Edit Knowledge via Instruction-based Chain-of-Thought Prompting
- BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
- DFAMS: Dynamic-flow guided Federated Alignment based Multi-prototype Search
- PARIF: Pushing the Pareto Frontier of Instruction Following and Reasoning with Curriculum Reinforcement Learning
- GeoLaux: A Benchmark for Evaluating MLLMs’ Geometry Performance on Long-Step Problems Requiring Auxiliary Lines
- Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering
- Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries
- Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning
- IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
- Know Your Place: Diagnosing Implicit Social Adaptation Failures in Chinese Large Language Models
- Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents
- VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
- NiuTrans.LMT: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs
- MERIT Feedback Elicits Better Bargaining in LLM Negotiators
- GMFL: Efficient Global Masking for Federated LLM Fine-tuning
- AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement Learning
- MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
- ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
- Learning to Think on Hypergraph: HyperCoT for Structure-Guided N-ary Knowledge Graph Completion
- Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations
- LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech
- Latent-Condensed Transformer for Efficient Long Context Modeling
- CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
- ImF: Embedding an Implicit Fingerprint in Your Large Language Models
- Jailbreaking Multimodal Large Language Models using Multi-Clip Video
- Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation
- Selective Knowledge Distillation: Fusing LLM Semantic Strengths with DNN Efficiency for Binary Code Similarity Detection
- TransLLM: A Unified Multi-Task Large Language Model for Urban Transportation via Learnable Prompting
- Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
- Attention Basin: Why Contextual Position Matters in Large Language Models
- Beyond Surface Features: Advancing Medical Vision-Language Alignment via Dynamic Evidence-Guided Preference Optimization
- TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles
- Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models
- Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
- TimeSAF: Towards LLM-Guided Semantic Asynchronous Fusion for Time Series Forecasting
- Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs
- Cat-MoD: Accelerating Multimodal Alignment via Caption Token Guided Asymmetric Mixture-of-Depths
- Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
- Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
- TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment
- Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs
- MPBoCo: Multimodal Prompt-based Boundary-enhanced Continual Framework for Joint Entity and Relation Extraction
- Personalizing LLMs with Binary Feedback: A Preference-Calibrated Optimization Framework
- AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
- Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
- False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models
- LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
- A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ Integration into Upcycled MoE
- The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis
- Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?
- Human or LLM as Standardized Patients? A Comparative Study in Medical Education
- Harmonizing the Past, Present, and Future: A Null-Space Constrained Region-Specific Method for Continual Learning in LLMs
- Inertia in Moral and Value Judgments of Large Language Models
- LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations
- LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
- PACE: Predictive Adaptive Context Extraction for Long-Horizon LLM Agents
- Draft, Verify, Restore: Self-Refining Historical Inscription Restoration with a Unified MLLM
- SAM3-I: Segment Anything with Instructions
- Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
- CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs
- Demystifying Data Organization for Enhanced LLM Training
- Beyond Single View: A Comprehensive Benchmark for Medical Multimodal Large Language Models on Multi-Image Understanding
- When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs
- CuMA: Aligning LLMs with Sparse Cultural Values via Demographic-Aware Mixture of Adapters
- Selective Span-Level Unlearning for Large Language Models
- ToMMeR - Efficient Entity Mention Detection from Large Language Models
- Shuttle Between Symbolic Instructions and Neural Parameters of Large Language Models
- Efficient Hyperparameter Optimization for LLM Reinforcement Learning
- Hetero-Designer: Automated Design of Multi-Agent Systems with Heterogeneous LLMs
- Achieving Multi-Hop Calculation and Safe Abstention in Financial Numerical Reasoning by Metric Graph Constrained LLMs
- MemBuilder: Reinforcing LLMs for Long-Term Memory Construction via Attributed Dense Rewards
- Probing Semantic Alignment, Lexical Invariance, and Syntactic Influence in LLM Metaphor Processing
- MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
- Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA
- Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents
- LLM-MC-Affect: LLM-Based Monte Carlo Modeling of Affective Trajectories and Latent Ambiguity for Interpersonal Dynamic Insight
- UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
- VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision
- VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation Agents
- ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models
- VerilogLAVD: LLM-Aided Pattern Generation for Verilog CWE Detection
- Temporal Sampling for Forgotten Reasoning in LLMs
- STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training
- OASIS: Mitigating Harmful Fine-tuning Attacks on LLMs via Orthogonal and Adaptive Safety Alignment Strategy
- KoCo-Bench: Can Large Language Models Leverage Domain Knowledge in Software Development?
- MagicBench: Diagnosing Visual Agency Loss and Semantic Dependency in Multimodal LLMs
- Fair-CCD: Mitigating Bias in Large Language Models for Tabular Classification Through Context-Contrastive Decoding
- GMSA: Enhancing Context Compression via Group Merging and Layer Semantic Alignment
- From Knowing to Teaching: Scaffolding Pedagogical Decisions for LLM Agent
- Think Faster Than Words: Efficient LLM Chain-of-Thought Reasoning via Dynamic Shortcut Decoding
- AEA: Adaptive Expert Allocation Improves Sentence Embeddings from Mixture-of-Experts LLM
- N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
- Beyond Static Persona Consistency: Dynamic Persona Coherence in LLM Role-Playing
- Why Are We Moral? An LLM-based Agent Simulation Approach to the Study of Moral Evolution
- On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
- LaCo: Layer-wise Compensation for Pruned Large Language Models
- Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs
- LLMs in Sarcasm Detection? It’s elementary! (Or is it?)
- TLoRA: Task-aware Low Rank Adaptation of Large Language Models
- LLMs as Knowledge Graph Refiners: Mitigating Factual Inconsistencies in Generative Knowledge Extraction
- SILO-BENCH: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems
- Mitigating Structural Knowledge Collapse in Domain-Specific LLMs via Morpheme-Aware KV-Aggregation
- Whose Facts Win? LLM Source Preferences under Knowledge Conflicts
- EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering
- Detecting What Queries Seek: Steering LLM Safety with FFN Output Activation Monitoring
- Temporal Evidence Chain for Temporal Knowledge Graph Question Answering with Large Language Models
- UERLens: Understanding Event Relations in Large Language Models
- DEFT: Demystifying VLN Failures via a Unified Dual-View Explainability Framework for LLM-based Agents
- LLMs (Almost) Never Abstain Under Medical Uncertainty
- TOWER+: Bridging Generality and Translation Specialization in Multilingual LLMs
- Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation
- LongTutor: Benchmarking Large Language Models for Long-term Personalized Tutoring
- Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language Models
- Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination
- Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework
- Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models
- One Cognitive Loop Is Enough: SODA unlocks Pure-Text Spatial Reasoning in Large Language Models
- Compatibility-Aware Dynamic Fine-Tuning for Large Language Models
- Reusable Experiences: Latent Routing and Modular Composition in LLMs
- Controllable Contamination Detection for Reliable LLM Evaluation with Statistical Guarantees
- From 1,000,000 Users to Every User: Scaling Up Personalized Preference for User-level Alignment
- Beyond Atomic Characters: Glyph-Aware Sub-character Alignment for Low-Resource Multilingual OCR
- Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
- Towards Interpretable Tabular Reasoning: Enhancing LLM Reasoning on Tabular Data with Pre-Constructed Logic Graph
- Compressing LLM Knowledge into Graph Representations for Text-attributed Graphs Learning
- End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
- Understanding Emergent Misalignment via Feature Superposition Geometry
- Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning
- Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection
- Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks
- Beyond the Panorama: Training-Free Hierarchical Perception-Reasoning for Fine-Grained Vision in MLLMs
- To Judge or Not to Judge: Can Large Language Models Leverage the Dispute Focus in Legal Judgment?
- Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks
- ArgGenBench: Benchmarking the Complex Controlled Argument Generation Capability of Large Language Models
- Language-Aware Token Boosting: LLM Language Confusion Reduction Without Tuning
- HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment
- Do LLMs Encode Functional Importance of Reasoning Tokens ?
- EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment
- The “Knowledge–Behavior Gap” in Cultural Taboo Safety of Large Language Models
- UMPIRE: Unveiling LLM-generated Posts via Redundant Expressions
- Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models
- MirrorCAPTCHA: Wild CAPTCHA, Wild Distribution, Wild Web-based Platform Meet Multimodal LLM Agents
- GASE: Graph-Aware Semantic Embedding Learning with Frozen LLMs for Text-Attributed Graphs
- Compositional Steering of Large Language Models with Steering Tokens
- Pref-CTRL: Preference Driven LLM Alignment using Representation Editing
- Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing
- GiLT: Augmenting Transformer Language Models with Dependency Graphs
- TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems
- How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities
- Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
- A Survey of Inductive Reasoning for Large Language Models
- CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models
- VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
- SAFO: Stable Adaptive Fairness Optimization for LLM-Based Social Survey Simulation
- Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
- Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization
- Understanding LLM Performance Degradation in Multi-Instance Processing: The Roles of Instance Count and Context Length
- Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
- LLM-Generated Text May Harm Your Retrieval! A Robust Detection Strategy for Retrieval-Augmented Generation
- The Retrieval Bottleneck: Scaling Laws for Reinforcement Learning in RAG
- Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective
- Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
- Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge
- Self-SoftCoT: A Self-Consistent Framework via Position-Aware Latent Space Reinforcement Learning
- Routing with Generated Data: Annotation-Free LLM Skill Estimation and Expert Selection
- Injecting Context via Situation Working Memory for Logical Reasoning with LLMs
- ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs
- SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator
- Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs
- How Much Would a Clinician Edit This Draft? Evaluating LLM Alignment for Patient Message Response Drafting
- MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
- MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation
- Measuring Distribution Shift in User Prompts and Its Effects on LLM Performance
- TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation
- The Personalization Trap: How User Memory Alters Emotional Reasoning in LLMs
- Multimodal Large Language Models for Multi-Subject In-Context Image Generation
- Discourse Realization of Generics in Human and LLM-generated Texts
- SRA: Span Representation Alignment for Large Language Model Distillation
- Neuron-Aware Active Few-Shot Learning for LLMs
- Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
- LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
- RedCoder: Automated Multi-Turn Red Teaming for Code LLMs
- Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
- PIArena: A Platform for Prompt Injection Evaluation
- ChemReason-Bench: Benchmarking Large Language Models for Procedural Reasoning in Experimental Chemistry
- How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
- MARS²: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
- Ranking Reasoning LLMs under Test-Time Scaling
- PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations
- ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
- On the Rejection Criterion for Proxy-based Test-time Alignment
- Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
- IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering
- Do LLMs Really Memorize Personally Identifiable Information? Revisiting PII Leakage with a Cue-Controlled Memorization Framework
- Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop
- LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target
- CURA: Clinical Uncertainty Risk Alignment for Language Model–Based Risk Prediction
- EthicMind: A Risk-Aware Framework for Ethical-Emotional Alignment in Multi-Turn Dialogue
- Resolving the Security-Auditability Dilemma with Auditable Latent Chain-of-Thought Alignment
- ART: Attention Replacement Technique to Improve Factuality in LLMs
- More Thinking, Less Talking: Internalizing Deliberative Safety into LLM Parameters
- ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering
- Conjunctive Prompt Attacks in Multi-Agent LLM Systems
- Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation
- Trajectory Signatures of Deception in Large Language Models
- Improving the Distributional Alignment of LLMs using Supervision
- Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models
- SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
- Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
- What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
- Confident, Calibrated, or Complicit: Safety Alignment and Ideological Bias in LLM Hate Speech Detection
- Aligning Large Language Models via Fully Self-Synthetic Data
- GAM: Hierarchical Graph-based Agentic Memory for LLM Agents
- CypherSmith: Transforming Text-to-Cypher Generation for LLMs with Synthetic Data
- New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMs
- L2Dir: Integrating L₂-Norm and Directional Alignment for Unsupervised Contrastive Representation Learning in Multimodal Retrieval
- Towards Intrinsic Interpretability of Large Language Models: A Survey of Design Principles and Architectures
- What Deserves Memory: Adaptive Memory Distillation for LLM Agents
- MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language Models
- CaBSALLM: Efficient Context-Aware Batch Annotation of Conversational Streams with Large Language Models
- WSDPO: A Generative Word Sense Disambiguation Framework with Chain-of-Thought and Preference Optimization
- Lizard: An Efficient Linearization Framework for Large Language Models
- S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
- Can LLM Safety Be Ensured by Constraining Parameter Regions?
- CityVG: Contrastive Fine-Tuning and Reward-Based Chain-of-Thought Reasoning for Zero-Shot City-Scale 3D Visual Grounding
- E2EDev: Benchmarking Large Language Models in End-to-End Software Development Task
- Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers
- Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
- KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering
- Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs
- LeLoRA: Learnable Low-Rank Adaptation of Large Language Models
- Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs
- Octopus: Gated Selective Attention for Memory-Bounded Long-Context Inference in Large Language Models
- Escaping the Echo Trap: On Credit Assignment Failure in Multi-turn LLM Self-Reflection
- ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization
- SMART: Evaluating LLMs’ Mathematical Reasoning via a Human Cognitive Process-Inspired Benchmark
- LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation
- SeDev: Structured Semantic Exploration for LLM-Driven Code Generation
- User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios
- ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants
- NL → Schedule: Evaluate Multitask Scheduling Capability of Large Language Models
- SLICEFORMER: Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding
- SCOPE: Boosting LLM Efficiency with Scoped Position Encoding
- Debate-of-Thoughts: Resolving Knowledge Conflicts in LLMs Through Internal Deliberation
- Projecting Out the Malice: A Global Subspace Approach to LLM Detoxification
- From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
- GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding
- If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs
- Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models
- LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient
- Attn-GS: Attention-Guided Context Compression for Efficient Personalized LLMs
- Structured Semantic Information Helps Retrieve Better Examples for In-Context Learning Applied to Few-Shot Relation Extraction
- DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models
- METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
- PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
- “Excuse me, may I say something…” CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert Collaborations
- PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters’ Lack of Knowledge
- Memorization, Emergence, and Explaining Reversal Failures: A Controlled Study of Relational Semantics in LLMs
- Framing Political Bias in Multilingual LLMs Across Pakistani Languages
- InsAT: Instance-aware Semantic Alignment and Transfer from Human–Object Keypoints for Zero-to-Few-shot Action Understanding
- Multi-View Attention Multiple-Instance Learning Enhanced by LLM Reasoning for Cognitive Distortion Detection
- CʜAIRO: Contextual Hierarchical Analogical Induction and Reasoning Optimization for LLMs
- How Context Shapes Truth: Geometric Transformations of Statement-level Truth Representations in LLMs
- Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
- The Dominance of Text Space: Unveiling the Asymmetric Nature of Cross-Modal Alignment in Large Language Models
- WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback
- SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking
- Joint Knowledge Base Completion and Question Answering by Combining Large Language Models and Small Language Models
- The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
- The Side Effects of Being Smart: Safety Risks in MLLMs’ Multi-Image Reasoning
- Action Boundary Blindness: When LLM Agents Cannot Tell Where One Action Ends and Another Begins
- ProMedical: Hierarchical Fine-Grained Criteria Modeling for Medical LLM Alignment via Explicit Injection
- R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling
- Frozen LLMs are Native Decoders for High-Norm Semantic Vectors
- Glyph: Scaling Context Windows via Visual-Text Compression
- TA-GRPO-d: Trajectory-Aware GRPO for Optimizing Denoising Trajectories in Diffusion LLMs
- CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
- Characterizing the Expressivity of Local Attention in Transformers
- Zero-Shot Detection of LLM-Generated Text using Temperature Sensitivity
- Revealing Procedural Reasoning Structures in Chain-of-Thought Training via Span-Level Gradient Organization
- Social Dynamics as Critical Vulnerabilities that Undermine Objective Decision-Making in LLM Collectives
- Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
- Refining and Reusing Annotation Guidelines for LLM Annotation
- AlignCultura: Towards Culturally Aligned Large Language Models?
- UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic Languages
- Dynamic Generation of Multi LLM Agents Communication Topologies with Graph Diffusion Models
- TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
- Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses
- Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs
- EvoRoute: Experience-Driven Self-Routing LLM Agent Systems
- Foresight Optimization for Strategic Reasoning in Large Language Models
- DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection
- ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment
- CodeRipple: Wavelet-Based Detection of LLM-Generated Code
- CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling
- SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
- HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns
- Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
- Frame-Semantic Knowledge Injection for Event-Level Inference in LLMs
- Teaching LLMs Human-Like Editing of Inappropriate Argumentation via Reinforcement Learning
- FLAIR: Steering LLM Mathematical Problem Solving based on A Fuzzy-Logic-AssIsted Reasoner
- Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning
- G-IdiomAlign: A Gloss-Pivoted Benchmark for Cross-Lingual Idiom Alignment
- SciCoQA: Quality Assurance for Scientific Paper–Code Alignment
- ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following
- Uncertainty-Aware Routing for Principled Alignment with MoE Dynamics
- More Aligned, Less Diverse? Analyzing the Grammar and Lexicon of Two Generations of LLMs
- Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic Views
- Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
- Polymorphic Universal Transformer
- Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression
- Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment
- BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
- Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language Models
- Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding
- Knowledge Injection Exists in MoE? Exploring Expert-Aware Contrast Decoding in MoE for Mitigating LLMs’ Hallucinations
- Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs
- Zero-shot Large Language Models for Automatic Readability Assessment
- Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
- Robust Membership Inference for Large Language Models under Adversarial Generative Corruption
- ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs
- LLM Safety From Within: Detecting Harmful Content with Internal Representations
- Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks
- MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis
- Global Adaptive Momentum Meets Local Personalized Perturbation: Efficient Federated LLM Fine-Tuning with Zeroth-Order Gradients
- Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching
- Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
- Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
- Too Long, Do Re-weighting for Efficient LLM Reasoning Compression
- GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs
- Assessing the Belief Consistency of Large Language Models on the Logical Conversation Process
- Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
- Learning Uncertainty from Sequential Internal Dispersion in Large Language Models
- Revisiting Evaluation of Question Answering Systems in Low-Resource Indic Languages: Bridging Human and Metric Alignment
- Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study
- From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
- UrbanGeoEval: A City-Scale Benchmark for Evaluating Large Language Models in Geospatial Reasoning
- Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech
- GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap
- BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMs
- Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
- MirrorQA: Benchmarking Multimodal LLMs on Mirror-Orientation Reasoning
- CAP: Controllable Alignment Prompting for Unlearning in LLMs
- Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms
- CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty
- Tiny Scales, Great Challenges: The Limits of Multimodal LLMs in Scale Recognition
- From Selection to Refinement: Iterative Optimization for Instruction Data
- Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive Domains
- Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
- HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human–LLM Collaborative Writing
- Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
- CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language
- Thinking in Schemas: Robust Syllogistic Reasoning in LLMs
- GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective Testing
- Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain
- Beyond Static Alignment: Adaptive Arbitration for Semantic Incongruence in Semi-Supervised Multimodal Sentiment Analysis
- LLM Beliefs Are in Their Heads
- One Pair Suffices: Unlocking Universal Zero-Shot Translation via Cross-Architecture Alignment
- LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
- Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation
- Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
- MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
- Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language Models
- Anchoring the Affective Manifold: Learning Canonical and Disentangled Representations via Generative Cross-Modal Alignment
- Incomplete In-context Learning
- Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective
- Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models
- Mechanisms of Prompt-Induced Hallucination in Vision–Language Models
- LLM4Cell: Taxonomy and Evaluation of LLM and Agentic Models for Single-Cell Biology
- From Nodes to Narratives: Explaining Graph Neural Networks with LLMs and Graph Context
- Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment
- From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
- A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass Classification
- Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams
- A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
- LLMSurgeon: Diagnosing Data Mixture of Large Language Models
- ACBQ: Adaptive Cross-Block Quantization of Large Language Models
- SecureGate: Learning When to Reveal PII Safely via Token-Gated Dual-Adapters for Federated LLMs
- AdaFuse: Adaptive Ensemble Decoding for Large Language Models
- TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
- JW-SVD: Bridging the Cross-Modal Mismatch in Post-Training MLLM Compression
- Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation
- CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment
- MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following
- TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
- Thinking Alignment of Scenario-Oriented User Simulation
- AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache Reuse
- ReActR: Reasoning through Error-Activated Reflection for LLM Post-Training
- RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
- Explain the Synth: Interpretable Evaluation of LLM Data Synthesis
- Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
- HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
- Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
- Do Morals Guide How LLMs Think? The Role of Ethical Perspectives in General Problem Solving
- ViLL-E: Video LLM Embeddings for Retrieval
- From Trajectories to Graphs: Contract-Checked Editing for Verifier-Guided LLM Reasoning
- EdgeFormer: Latency-Aware Collaborative Multi-Head Attention of Transformer Inference in Edge Networks
- FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs
- EVOTOOL: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection
- A Lightweight Explainable Guardrail for Prompt Safety
- PodBench: A Comprehensive Benchmark for Instruction-Aware Audio-Oriented Podcast Script Generation
- MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation
- Knowledge Vector of Logical Reasoning in Large Language Models
- SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter
- Activation Decomposition and Steering for LLM Backdoor Remediation
- A Survey of Large Language Models for Text-Guided Molecular Discovery: From Molecule Generation to Optimization
- Reward Alignment Optimization: A Direct Point-wise Alignment Approach
- Can You Make It Sound Like You? Post-Editing LLM-Generated Text for Personal Style
- PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning
- OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation
- Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data
- Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models
- MTA:A Merge-then-Adapt Framework for Personalized Large Language Models
- Investigating Counterfactual Unfairness in LLMs towards Identities through Humor
- Nature-Inspired Population-Based Evolution of Large Language Models
- MTRouter: Cost-Aware Multi-Turn LLM Routing with History–Model Joint Embeddings
- ParaSuite: Boosting LLM Reasoning via Paradox Resolution
- ReTRE: Benchmarking LLM Transfer Robustness with Structure-Preserving Variants
- Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding
- DarwinTOD: LLM-Driven Lifelong Self-evolution for Task-oriented Dialog Systems
- Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
- Understanding the Prompt Sensitivity
- rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection
- SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering
- AIPO: Adaptive Information Guided Token-Level Reinforcement Learning for Large Language Model Reasoning
- AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
- INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
- CLAOCS-TX: Cross-Lingual Triplet Extraction with Aspect-Opinion-Aware Code-Switched Prompting and LLM-Guided Contrastive Distillation
- When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models
- DialDefer: A Framework for Detecting and Mitigating LLM Dialogic Deference
- Parallel Test-Time Scaling for Latent Reasoning Models
- When Benchmarks Leak: Inference-Time Decontamination for LLMs
- HSGraphAgent: Knowledge-Graph-Guided Large Language Models for Harmonized System Code Classification
- Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning
- TInR: Exploring Tool-Internalized Reasoning in Large Language Models
- One Persona, Many Cues, Different Results: How Sociodemographic Cues Impact LLM Personalization
- Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text
- Building LLMs Like LEGO: Two-dimensional Architecture Reassembly of Large Language Models
- How Long Reasoning Chains Influence LLMs’ Judgment of Answer Factuality
- Revealing the Seen, Imagining the Beyond: A Survey of Image-Grounded Chain-of-Thought Reasoning in Multimodal LLMs
- Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Language Models
- TwiUSD: A Benchmark Dataset and Structure-Aware LLM Framework for User Stance Detection
- Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
- SHARP: Self-adaptive Harmful Category-aware Prompt Generation for Black-box Jailbreaking
- Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal Responses
- Cross-Prompt Automated Essay Scoring of Multiple Traits: Making Sense of the State of the Art
- A Linguistics-Aware LLM Watermarking via Syntactic Predictability
- SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models
- Multi-Task Representation Alignment on Language Understanding: A Mutual Information Perspective
- EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
- LLM-Based Multi-Agent Systems for Clinical Workflows: A Survey of AI Hospitals
- Mind’s Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
- When High Accuracy Hides Poor Calibration: Rethinking Confidence Evaluation in Transformer-Based Text Classification with Balanced Brier Score
- Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning
- Reinforcement Learning for Diffusion LLMs via Energy-Based Gibbs Alignment
- From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding
- Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs
- BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
- COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs
- Dual Alignment Between Language Model Layers and Human Sentence Processing
- FactCorrector: A Graph-Inspired Approach to Long-Form Factuality Correction of Large Language Models
- Decoupling Generalization and Adaptation in Meta-Learning for Large Language Models
- DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
- ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
- From Words to Pixels: A Comprehensive Survey on Large Language Models in Visual Segmentation
- Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts
- Graph-Based Alternatives to LLMs for Human Simulation
- GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs
- OLA: Output Language Alignment in Code-Switched LLM Interactions
- Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations
- BatonVoice: An Operationalist Framework for Enhancing Controllable Speech Synthesis with Linguistic Intelligence from LLMs
- Monotonic Scaffolding as a Diagnostic Lens for Legal Reasoning in LLMs
- Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
- Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
- Factual Retrieval in LLMs Is a Redundant, Distributed and Non-Contiguous Process
- What About the Scene With the Hitler Reference? HAUNT: A Framework to Probe LLMs’ Self-consistency in Closed Domains Via Adversarial Nudge
- Knowledge without Wisdom: Measuring Misalignment between LLMs and Intended Impact
- Apertus: Democratizing Open and Compliant LLMs for Global Language Environments
- Adaptive Instruction Composition for Automated LLM Red-Teaming
- CHOIR: Harmonizing Structured Persona Diversity for Robust Collaborative LLM Reasoning
- Revisiting Non-Verbatim Memorization in Large Language Models: The Role of Entity Surface Forms
- ChatAnime: Towards User-Centered Emotional Support in LLM-based Virtual Character Chat
- SciPedia: Unlocking the Value of Scientific Data for Pre-training
- Self-Guided Alignment: Adaptive Preference Sensing for Multi-Objective Generation
- ReasMark: A Robust Watermark for Attributing LLM Reasoning Under Knowledge Distillation Attacks
- Characterizing and Evaluating Working Emotion Vocabularies in Multilingual Large Language Models
- Solve-Detect-Verify: Inference-Time Scaling with Flexible Generative Verifier
- SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility
- Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations
- Toward Robust Evaluation for Multilingual Grammatical Error Correction: Can Large Language Models Replace Human References?
- KARL: Reinforcement Learning for LLM Agents on Multi-Turn Knowledge-Intensive Agentic Tasks
- TokDrift: When LLM Speaks in Subwords but Code Speaks in Grammar
- REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
- Do LLM Agents Mirror Socio-Cognitive Effects in Power-Asymmetric Conversations?
- Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
- Influence-based Online Experience Selection for Effective RLHF
- SharVeT: Similarity-aware Parameter Sharing with Vector-based Tuning for Efficient LLM Compression
- Beyond Variance: Knowledge-Aware LLM Compression via Fisher-Aligned Subspace Diagnostics
- REMIND: Memorization and Unlearning in LLMs Through the Lens of Input Loss Landscapes
- Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization
- SELECting over Tokens: Curating Pre-training Data at Scale via Token Classification
- TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
- Constructing coherent spatial memory in LLM agents through graph rectification
- JurisBench: A Deep Benchmark for Assessing Large Language Models in Professional Legal Practice
- River-LLM: Large Language Model Seamless Exit Based on KV Share