R
Published on

ACL 2026 — Reasoning & Theorem Proving

Reasoning & Theorem Proving

448 papers Links not yet available — ACL proceedings pending on ACL Anthology.

  • OctoTools: A Multi-Agent Framework with Extensible Tools for Complex Reasoning
  • Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
  • Benchmarking LLM’s Capability in Reasoning over Conflicting Web References
  • SLR: Automated Synthesis for Scalable Logical Reasoning
  • CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models
  • Your Reasoning Model Knows What Counts: Self-Guided Chain-of-Thought Pruning for Efficient Reasoning
  • ImReasoner: Improving Memory-based Language Models for Reasoning-in-a-Haystack Tasks
  • Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
  • ReEx-SQL: Reasoning with Execution-Aware Reinforcement Learning for Text-to-SQL
  • MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
  • MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
  • ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval
  • Logic Matters in Lightweight Hallucination Classification for RAG System
  • Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning
  • ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
  • Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness
  • Act as you think: Reinforcing Consistent Reasoning in Medical Visual Question Answering
  • Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning
  • SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
  • From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization
  • ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering
  • MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological Generation
  • Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim Verification
  • LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
  • OneRec-Think: In-Text Reasoning for Generative Recommendation
  • Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning
  • EMCEE: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context
  • LEASH: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model
  • Beyond Examples: Towards Automated Thought-level In-Context Reasoning for Large Language Models
  • CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
  • CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization
  • Optimizing Length Compression in Large Reasoning Models
  • Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
  • COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context
  • BracketRank: Large Language Model Document Ranking via Reasoning-based Competitive Elimination
  • Retrieval as Generation: A Unified Framework with Self-Triggered Information Planning
  • Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs
  • Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language Models
  • RADO: Reasoning Audit-Driven Optimization for Rigorous Reasoning in High-Stakes Domains
  • D²Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning
  • Simple-VGC: Enhancing Visual Grounding in Multimodal Reasoning via Adaptive Tool Composition
  • Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning
  • PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models
  • Miner: Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
  • Reasoning Structure Matters for Safety Alignment of Reasoning Models
  • LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation
  • Modeling Human-Like Cognition for Stance Detection: Integrating Intuitive Judgment and Analytical Reasoning
  • Logical Consistency as a Bridge: Improving LLM Hallucination Detection via Label Constraint Modeling between Responses and Self-Judgments
  • TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs
  • DeReA: Improving Idiom Translation with Detect-Retrieve-Arbitrate Reasoning
  • Visually-Guided Policy Optimization for Multimodal Reasoning
  • From “Aha Moments” to Controllable Thinking: Toward Meta-Cognitive Reasoning in LRMs via Decoupled Reasoning and Control
  • Metaphor Reasoning is Meta-reasoning
  • SeLaR: Selective Latent Reasoning in Large Language Models
  • STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems
  • Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM Tutors
  • MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
  • Beyond Timestamps: Bridging Forward and Backward Reasoning in Temporal Numerical and Relational Understanding
  • Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI Recommendation
  • ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration
  • DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
  • Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
  • VideoPro: Adaptive Program Reasoning for Long Video Understanding
  • ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch
  • LePREC: Reasoning as Classification over Structured Factors for Assessing Relevance of Legal Issues
  • DART: Disambiguation-Aware Reasoning for Video-guided Machine Translation
  • SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
  • ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
  • Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error
  • Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
  • The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination
  • AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios
  • Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
  • ReportLogic: Evaluating Logical Quality in Deep Research Reports
  • Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
  • Revisiting Model Interpolation for Efficient Reasoning
  • MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning
  • Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning
  • From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
  • Dissecting Failure Dynamics in Large Language Model Reasoning
  • Visual Attention Reasoning via Hierarchical Search and Self-Verification
  • LearnerCoMPASS: Intelligent Tutoring System with Dynamic Cognitive Diagnosis and Multi-Model Path Planning
  • KCVR: Knowledge-Centric Video Reconstruction for Structured Pedagogical Summarization via Dynamic Graph Planning
  • CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
  • Empathy in Diversity: Personalized Depression and Anxiety Therapy via Dialogue State Tracking and Patient-Aware Planning
  • PAM: Enhancing General Alignment of Large Reasoning Models through Priority-Aware Metacognition
  • MuSe: Multi-Stage Graph Reasoning via Vision-Language Models
  • Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation
  • Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs
  • Beyond Single-View Detection: A Dual-Space Reasoning Framework for Interpretable Harmful Meme Understanding
  • Unified Thinker: A General Reasoning Core for Image Generation
  • Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex Text
  • Reasoning with Ontology Graph: Toward Type-Constrained Knowledge Graph Question Answering
  • Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
  • Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories
  • Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
  • ProgressLM: Towards Progress Reasoning in Vision-Language Models
  • Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
  • SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
  • Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
  • Why Do Emotions Change? Appraisal-Guided Reasoning for Emotion–Cause Triplet Extraction in Conversations
  • MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
  • Reasoning Gets Harder for LLMs Inside A Dialogue
  • Deriving Character Logic from Storyline as Codified Decision Trees
  • From Form to Logic: Masked Reconstruction and Reasoning Distillation for Short Video Fake News Detection
  • UR²: Unify RAG and Reasoning through Reinforcement Learning
  • Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models
  • CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
  • Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
  • Interleaved Tool-Call Reasoning for Protein Function Understanding
  • GLARE: Agentic Reasoning for Legal Judgment Prediction
  • Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs
  • Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models
  • Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
  • ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
  • Mitigating Legal Hallucinations via Symbolic Constraints and Analogical Precedents
  • How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them
  • From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning
  • DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
  • Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
  • When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning
  • DisCal: Distribution-Aware Calibration for Mathematical Reasoning Under Character-Level Noisy Inputs
  • FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
  • Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts
  • Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data
  • PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
  • ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
  • Reliable Use of Lemmas via Eligibility Reasoning and Section‑Aware Reinforcement Learning
  • MalruleLib: Large-Scale Executable Misconception Reasoning with Step Traces for Modeling Student Thinking in Mathematics
  • MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel Execution
  • STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning
  • Hallucination Detection in LLMs with Topological Divergence on Attention Graphs
  • CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs
  • BiMind: A Dual-Head Reasoning Model with Attention-Geometry Adapter for Incorrect Information Detection
  • Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers
  • Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
  • MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs
  • The Path Not Taken: Duality in Reasoning about Program Execution
  • APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI
  • PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering
  • From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation
  • SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
  • Your Reasoning Model is Secretly a Reward Model - Optimization-Free Verification from Experience
  • Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
  • Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
  • ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
  • Immediate Inference: The Missing Foundation in Large Language Model Logical Reasoning
  • LCR-RAG: Enhancing Logical Consistency in Retrieval-Augmented Generation via Neuro-symbolic Reinforcement Learning
  • Efficiently Learning To Reason or Not to Reason: Root-token Policy Optimization for Adaptive Thinking
  • Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
  • TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only
  • Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks
  • Model-Based Imaginative Planning for Embodied Agents
  • Semantic-Aware Logical Reasoning via a Semiotic Framework
  • Calibration-Aware Policy Optimization for Reasoning LLMs
  • Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action Memory
  • ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
  • Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
  • Adaptive Planning for Multi-Attribute Controllable Summarization with Monte Carlo Tree Search
  • Closing the Modality Reasoning Gap for Speech Large Language Models
  • Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning
  • Know the Known and the Unknown: Reasonable Answer Generation with Knowledge-Informed Citations
  • StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation
  • ODL-TempLLM: Ontology-Guided and Description Logic-Reasoned Temporal Reasoning with LLMs
  • Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
  • EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation
  • Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
  • RFS-Guard: Detecting Reasoning Hallucinations via Cross-Phase Routing Focus in Large Reasoning Models
  • Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
  • Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play
  • HTMR: Hybrid Token Masking Reinforcement Learning with Verifiable Rewards for Event Argument Extraction with Multi-Perspective Reasoning
  • Why LLMs Hallucinate on Structured Knowledge: A Mechanistic Analysis of Reasoning over Linearized Representations
  • Merlin’s Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
  • Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention
  • Leibniz: Theory-of-Mind Driven Neuro-Symbolic Logical Reasoning via Multi-Agent Collaboration
  • The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs
  • ReEfBench: Quantifying the Reasoning Efficiency of LLMs
  • Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning
  • THOR: A Theta-Gamma Hierarchical Oscillatory Reasoning Framework for Multi-hop QA
  • How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
  • AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
  • Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
  • Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning
  • GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
  • ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning
  • Controllable LLM Reasoning via Sparse Autoencoder‑Based Steering
  • Tailoring Diagnostic Modeling to Individual Learners: Personalized Distractor Generation via MCTS-Guided Reasoning Reconstruction
  • MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
  • Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
  • Traffic-R1: Reinforced LLMs Bring Human-Like Reasoning to Traffic Signal Control Systems
  • ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability
  • MAGIC: Deep Geometric Evolution with Structural Consensus for Temporal Knowledge Graph Reasoning
  • Efficient Prior-Guided Reasoning for Robust Retrieval-Augmented Generation under Conflicts
  • MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents
  • IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning
  • Learning from Cognition: Enhancing RL Efficiency for LLM Reasoning via Hierarchical Metacognitive Decomposition and Refinement
  • EpiCaR: Knowing What You Don’t Know Matters for Better Reasoning in LLMs
  • Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
  • NeuReasoner: Towards Explainable, Controllable, and Unified Reasoning via Mixture-of-Neurons
  • Red Teaming Large Reasoning Models
  • InsLogicBench: An Argumentation Logic Grounded Benchmark for Complex Insurance Claims Adjudication
  • SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science
  • Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
  • CamoQuery: Language-Guided Reasoning Camouflaged Object Segmentation
  • Make LLMs See Like Investigators, Not Just Think More: The Role of Structured Analysis in Investigative Reasoning
  • MUR: Momentum Uncertainty guided Reasoning for Large Language Models
  • PEAP: Proactive Embodied Action Sequence Planning with Joint Understanding of Vision and Audio Perception
  • Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling
  • MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
  • Are they lovers or friends? Evaluating LLMs’ Social Reasoning in English and Korean Dialogues
  • When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning
  • ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering
  • LegalChainReasoner: Grounding Criminal Judicial Opinion Generation via Structured Legal Chains
  • Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
  • ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints
  • Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies
  • SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning
  • Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
  • WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
  • Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy
  • FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models
  • Adaptive Spatial and Temporal Redundancy Optimization for Efficient Reasoning in Large Language Models
  • AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin
  • Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
  • PARIF: Pushing the Pareto Frontier of Instruction Following and Reasoning with Curriculum Reinforcement Learning
  • Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering
  • MED-COREASONER: Reducing Language Disparities in Medical Reasoning via Language-Informed Co-Reasoning
  • Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning
  • Agentic Oversight via Dialectic Reasoning
  • Agent Newsroom: Efficient Chronological Report Generation via Dynamic Multi-Agent Collaboration
  • MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning
  • From Logical to Computational Sparsity: Structure-Aware Block-Sparse Attention for Long-Code Completion
  • CogEvolve: A Multimodal Benchmark for Evaluating Relational Reasoning in Semantic Extension
  • Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
  • Reasoning Fails Where Step Flow Breaks
  • Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
  • ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification
  • SGVEF-LOOP: Coverage-Guided Progressive Topological Exploration and Fact-Grounded Metamorphic Evaluation for MCP Agents
  • MentalSeek-Dx: Towards Progressive Hypothetico-Deductive Reasoning for Real-world Psychiatric Diagnosis
  • AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
  • Data Pollination: An Emergent Ecological Process Driving AI Population Evolution
  • Extending First-Order Logic for Factual Reasoning over Knowledge Graphs
  • Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
  • LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
  • The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis
  • ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
  • PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
  • Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
  • When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs
  • Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry
  • Achieving Multi-Hop Calculation and Safe Abstention in Financial Numerical Reasoning by Metric Graph Constrained LLMs
  • CompTab: A Comprehensive Benchmark for Real-World TableQA with Complex Reasoning and Irregular Tables
  • OptiCo: Adaptive Distributed Training Optimization via Collaborative Agent Reasoning
  • MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
  • Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards
  • REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once
  • Temporal Sampling for Forgotten Reasoning in LLMs
  • Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection
  • Think Faster Than Words: Efficient LLM Chain-of-Thought Reasoning via Dynamic Shortcut Decoding
  • Beyond Itinerary Planning—A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
  • DIXITWORLD: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
  • Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
  • Think before Go: Hierarchical Reasoning for Image-goal Navigation
  • CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts
  • Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization
  • MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
  • CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution
  • Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework
  • One Cognitive Loop Is Enough: SODA unlocks Pure-Text Spatial Reasoning in Large Language Models
  • Think Better, Not Longer: Token-Level Marginal Utility for Efficient Reasoning in Large Reasoning Models
  • Communicating in Emergent Language with an Induced Morphological Phrasebook
  • Towards Interpretable Tabular Reasoning: Enhancing LLM Reasoning on Tabular Data with Pre-Constructed Logic Graph
  • Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation
  • MavenCoder: Competitive Code Generation via Model Adaptive Planning Strategies and Multi-Perspective Verification Enhancement
  • Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning
  • Beyond the Panorama: Training-Free Hierarchical Perception-Reasoning for Fine-Grained Vision in MLLMs
  • CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning
  • Do LLMs Encode Functional Importance of Reasoning Tokens ?
  • EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment
  • QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning
  • ReCreate: Reasoning and Creating Domain Agents Driven by Experience
  • Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing
  • Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
  • MIND Your Reasoning: A Meta-Cognitive Intuitive-Reflective Network for Dual-Reasoning in Multimodal Stance Detection
  • A Survey of Inductive Reasoning for Large Language Models
  • Disentangling Reasoning Logic to Resolve Explicit Knowledge Conflicts
  • ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
  • WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement
  • Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision
  • SeCuRepair: Semantics-Aligned, Curriculum-Driven, and Reasoning-Enhanced Vulnerability Repair Framework
  • Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective
  • RLSeek: Evidence-Grounded Reasoning for RAG Hallucination Detection
  • Injecting Context via Situation Working Memory for Logical Reasoning with LLMs
  • Quantifying and Understanding Uncertainty in Large Reasoning Models
  • The Personalization Trap: How User Memory Alters Emotional Reasoning in LLMs
  • Schoenfeld’s Anatomy of Mathematical Reasoning by Language Models
  • Enhanced Reasoning for Biomedical Document-Level Relation Extraction via a Novel Cascade Language Model Framework
  • Synthetic Data Generation for Training Diversified Commonsense Reasoning Models
  • Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
  • ChemReason-Bench: Benchmarking Large Language Models for Procedural Reasoning in Experimental Chemistry
  • How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
  • Ranking Reasoning LLMs under Test-Time Scaling
  • PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations
  • IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering
  • Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention
  • Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation
  • Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
  • What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
  • SAHM: A Benchmark for Arabic Financial and Shari’ah-Compliant Reasoning
  • Confident, Calibrated, or Complicit: Safety Alignment and Ideological Bias in LLM Hate Speech Detection
  • MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language Models
  • TPS-Bench: Evaluating AI Agents’ Tool Planning & Scheduling Abilities in Compounding Tasks
  • CityVG: Contrastive Fine-Tuning and Reward-Based Chain-of-Thought Reasoning for Zero-Shot City-Scale 3D Visual Grounding
  • Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers
  • DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
  • SMART: Evaluating LLMs’ Mathematical Reasoning via a Human Cognitive Process-Inspired Benchmark
  • HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation
  • Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models
  • METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
  • Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
  • LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning
  • Multi-View Attention Multiple-Instance Learning Enhanced by LLM Reasoning for Cognitive Distortion Detection
  • CʜAIRO: Contextual Hierarchical Analogical Induction and Reasoning Optimization for LLMs
  • An Existence Proof for Neural Language Models That Can Explain Garden-Path Effects via Surprisal
  • Probing Audio-Visual Reasoning in Multimodal Language Models through the Lens of Audio
  • Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
  • PaT: Planning-after-Trial for Efficient Test-Time Code Generation
  • Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
  • The Side Effects of Being Smart: Safety Risks in MLLMs’ Multi-Image Reasoning
  • Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning
  • R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling
  • From Detection to Understanding: Multi-Turn Reasoning for Video Misinformation Analysis
  • VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
  • Beyond Markovian Forgetfulness: Episodic Memory for Reasoning-Intensive Retrieval
  • CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
  • Adaptive Retrieval for Reasoning
  • On Emergent Social World Models — Evidence for Functional Integration of Theory of Mind and Pragmatic Reasoning in Language Models
  • LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning
  • TH-RAG : Topic-Based Hierarchical Knowledge Graphs for Robust Multi-hop Reasoning in Graph-based RAG Systems
  • R³: End-to-End Reasoning-based Planning for Multi-step Retrosynthesis via Reinforcement Learning
  • Execution as Verification: Fine-Grained Self-Correcting Reasoning for Complex KBQA
  • MARD: Module-Aware Reasoning Distillation for Language Models with Adaptive Supervision
  • Revealing Procedural Reasoning Structures in Chain-of-Thought Training via Span-Level Gradient Organization
  • StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
  • Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning Models
  • Foresight Optimization for Strategic Reasoning in Large Language Models
  • CheckRLM: Effective Knowledge–Thought Coherence Checking in Retrieval-Augmented Reasoning
  • FLAIR: Steering LLM Mathematical Problem Solving based on A Fuzzy-Logic-AssIsted Reasoner
  • Trait Activation in Silicon: A Situation-Aware Framework for Psychologically Grounded Role-Playing
  • ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following
  • ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
  • JoPR: Joint Emotion Perception and Reasoning for Conversational Emotion Recognition
  • Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic Views
  • One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
  • Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression
  • REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache Compression
  • Mitigating Safety Context Amnesia in Multimodal Reasoning Models via Intent-Guided Safety Reasoning
  • On-policy Reinforcement Fine-tuning with Offline reward for Multi-step Embodied Planning
  • Figure It Out: Improve the Frontier of Reasoning with Executable Visual States
  • NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise
  • Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
  • AttnPO: Attention-Guided Process Supervision for Efficient Reasoning
  • Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMs
  • Too Long, Do Re-weighting for Efficient LLM Reasoning Compression
  • Assessing the Belief Consistency of Large Language Models on the Logical Conversation Process
  • AdaMix: Adaptive Mixing for Short and Long Reasoning Adapters
  • UrbanGeoEval: A City-Scale Benchmark for Evaluating Large Language Models in Geospatial Reasoning
  • E-ViC: Reasoning Beyond Text via Embodied Visual Chain for Spatial Intelligence
  • GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap
  • LongVideoAgent: Multi-Agent Reasoning with Long Videos
  • Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
  • MirrorQA: Benchmarking Multimodal LLMs on Mirror-Orientation Reasoning
  • GeoRC: A Benchmark for Geolocation Reasoning Chains
  • Thinking in Schemas: Robust Syllogistic Reasoning in LLMs
  • Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
  • Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
  • MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
  • Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages
  • Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
  • Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models
  • Social Story Frames: Contextual Reasoning about Narrative Intent and Reception
  • A Survey of Reasoning-Intensive Retrieval: Progress and Challenges
  • LOGICAL-COMMONSENSEQA: A Benchmark for Logical Commonsense Reasoning
  • Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment
  • From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
  • PRBench: Large-Scale Expert Rubrics for Evaluating High-Stakes Professional Reasoning
  • A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
  • Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
  • EDUMATH: Generating Standards-aligned Educational Math Word Problems
  • Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards
  • BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning
  • Reasoning Traces Shape Outputs but Models Won’t Say So
  • AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
  • ReActR: Reasoning through Error-Activated Reflection for LLM Post-Training
  • Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception
  • From Trajectories to Graphs: Contract-Checked Editing for Verifier-Guided LLM Reasoning
  • SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive Thinking
  • MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation
  • Knowledge Vector of Logical Reasoning in Large Language Models
  • SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter
  • Programming over Thinking: Efficient and Robust Multi-Constraint Planning
  • LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
  • ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
  • PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning
  • ParaSuite: Boosting LLM Reasoning via Paradox Resolution
  • rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection
  • AIPO: Adaptive Information Guided Token-Level Reinforcement Learning for Large Language Model Reasoning
  • DialDefer: A Framework for Detecting and Mitigating LLM Dialogic Deference
  • Benchmarking Fine-Grained Error Detection in Multimodal Reasoning
  • Parallel Test-Time Scaling for Latent Reasoning Models
  • SciMDR: Advancing Scientific Multimodal Document Reasoning
  • Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning
  • VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
  • TInR: Exploring Tool-Internalized Reasoning in Large Language Models
  • How Long Reasoning Chains Influence LLMs’ Judgment of Answer Factuality
  • MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
  • Diagnosing and Remedying Representation Deficiencies for Deterministic Reasoning in KGQA
  • Revealing the Seen, Imagining the Beyond: A Survey of Image-Grounded Chain-of-Thought Reasoning in Multimodal LLMs
  • OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Models
  • Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
  • Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
  • Perception, Understanding and Reasoning: A Multimodal Benchmark for Video Fake News Detection
  • Rose-SQL: Role-State Evolution Guided Structured Reasoning for Multi-Turn Text-to-SQL
  • EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
  • Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
  • EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning
  • From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding
  • LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software
  • UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
  • Minimal Free Resolution Guided Adaptive Tree Reasoning
  • Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations
  • Monotonic Scaffolding as a Diagnostic Lens for Legal Reasoning in LLMs
  • Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
  • CHOIR: Harmonizing Structured Persona Diversity for Robust Collaborative LLM Reasoning
  • Protein-STORY: Semantic Text-Oriented Representation Yields biologically meaningful Protein embeddings
  • ReasMark: A Robust Watermark for Attributing LLM Reasoning Under Knowledge Distillation Attacks
  • MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
  • REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
  • ReasonAny: Incorporating Reasoning Capability to Any Model via Simple and Effective Model Merging
  • Tackling the Root of Misinformation by Teaching Laypeople about Logical Fallacies via Socratic Questioning and Critical Argumentation
  • Macaron: Controlled, Human-Written Benchmark for Multilingual and Multicultural Reasoning via Template-Filling
  • Reinforced Efficient Reasoning via Semantically Diverse Exploration
  • Towards a Mechanistic Understanding of Large Reasoning Models: A Survey of Training, Inference, and Failures