- Published on
ACL 2026 — Reasoning & Theorem Proving
Reasoning & Theorem Proving
448 papers Links not yet available — ACL proceedings pending on ACL Anthology.
- OctoTools: A Multi-Agent Framework with Extensible Tools for Complex Reasoning
- Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
- Benchmarking LLM’s Capability in Reasoning over Conflicting Web References
- SLR: Automated Synthesis for Scalable Logical Reasoning
- CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models
- Your Reasoning Model Knows What Counts: Self-Guided Chain-of-Thought Pruning for Efficient Reasoning
- ImReasoner: Improving Memory-based Language Models for Reasoning-in-a-Haystack Tasks
- Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
- ReEx-SQL: Reasoning with Execution-Aware Reinforcement Learning for Text-to-SQL
- MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
- MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
- ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval
- Logic Matters in Lightweight Hallucination Classification for RAG System
- Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning
- ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
- Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness
- Act as you think: Reinforcing Consistent Reasoning in Medical Visual Question Answering
- Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning
- SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
- From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization
- ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering
- MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological Generation
- Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim Verification
- LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
- OneRec-Think: In-Text Reasoning for Generative Recommendation
- Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning
- EMCEE: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context
- LEASH: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model
- Beyond Examples: Towards Automated Thought-level In-Context Reasoning for Large Language Models
- CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
- CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization
- Optimizing Length Compression in Large Reasoning Models
- Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
- COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context
- BracketRank: Large Language Model Document Ranking via Reasoning-based Competitive Elimination
- Retrieval as Generation: A Unified Framework with Self-Triggered Information Planning
- Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs
- Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language Models
- RADO: Reasoning Audit-Driven Optimization for Rigorous Reasoning in High-Stakes Domains
- D²Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning
- Simple-VGC: Enhancing Visual Grounding in Multimodal Reasoning via Adaptive Tool Composition
- Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning
- PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models
- Miner: Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
- Reasoning Structure Matters for Safety Alignment of Reasoning Models
- LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation
- Modeling Human-Like Cognition for Stance Detection: Integrating Intuitive Judgment and Analytical Reasoning
- Logical Consistency as a Bridge: Improving LLM Hallucination Detection via Label Constraint Modeling between Responses and Self-Judgments
- TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs
- DeReA: Improving Idiom Translation with Detect-Retrieve-Arbitrate Reasoning
- Visually-Guided Policy Optimization for Multimodal Reasoning
- From “Aha Moments” to Controllable Thinking: Toward Meta-Cognitive Reasoning in LRMs via Decoupled Reasoning and Control
- Metaphor Reasoning is Meta-reasoning
- SeLaR: Selective Latent Reasoning in Large Language Models
- STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems
- Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM Tutors
- MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
- Beyond Timestamps: Bridging Forward and Backward Reasoning in Temporal Numerical and Relational Understanding
- Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI Recommendation
- ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration
- DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
- Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
- VideoPro: Adaptive Program Reasoning for Long Video Understanding
- ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch
- LePREC: Reasoning as Classification over Structured Factors for Assessing Relevance of Legal Issues
- DART: Disambiguation-Aware Reasoning for Video-guided Machine Translation
- SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
- ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
- Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error
- Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
- The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination
- AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios
- Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
- ReportLogic: Evaluating Logical Quality in Deep Research Reports
- Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
- Revisiting Model Interpolation for Efficient Reasoning
- MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning
- Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning
- From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
- Dissecting Failure Dynamics in Large Language Model Reasoning
- Visual Attention Reasoning via Hierarchical Search and Self-Verification
- LearnerCoMPASS: Intelligent Tutoring System with Dynamic Cognitive Diagnosis and Multi-Model Path Planning
- KCVR: Knowledge-Centric Video Reconstruction for Structured Pedagogical Summarization via Dynamic Graph Planning
- CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
- Empathy in Diversity: Personalized Depression and Anxiety Therapy via Dialogue State Tracking and Patient-Aware Planning
- PAM: Enhancing General Alignment of Large Reasoning Models through Priority-Aware Metacognition
- MuSe: Multi-Stage Graph Reasoning via Vision-Language Models
- Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation
- Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs
- Beyond Single-View Detection: A Dual-Space Reasoning Framework for Interpretable Harmful Meme Understanding
- Unified Thinker: A General Reasoning Core for Image Generation
- Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex Text
- Reasoning with Ontology Graph: Toward Type-Constrained Knowledge Graph Question Answering
- Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
- Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories
- Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
- ProgressLM: Towards Progress Reasoning in Vision-Language Models
- Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
- SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
- Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
- Why Do Emotions Change? Appraisal-Guided Reasoning for Emotion–Cause Triplet Extraction in Conversations
- MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
- Reasoning Gets Harder for LLMs Inside A Dialogue
- Deriving Character Logic from Storyline as Codified Decision Trees
- From Form to Logic: Masked Reconstruction and Reasoning Distillation for Short Video Fake News Detection
- UR²: Unify RAG and Reasoning through Reinforcement Learning
- Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models
- CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
- Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
- Interleaved Tool-Call Reasoning for Protein Function Understanding
- GLARE: Agentic Reasoning for Legal Judgment Prediction
- Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs
- Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models
- Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
- ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning
- Mitigating Legal Hallucinations via Symbolic Constraints and Analogical Precedents
- How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them
- From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning
- DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
- Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
- When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning
- DisCal: Distribution-Aware Calibration for Mathematical Reasoning Under Character-Level Noisy Inputs
- FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
- Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts
- Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data
- PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
- ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
- Reliable Use of Lemmas via Eligibility Reasoning and Section‑Aware Reinforcement Learning
- MalruleLib: Large-Scale Executable Misconception Reasoning with Step Traces for Modeling Student Thinking in Mathematics
- MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel Execution
- STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning
- Hallucination Detection in LLMs with Topological Divergence on Attention Graphs
- CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs
- BiMind: A Dual-Head Reasoning Model with Attention-Geometry Adapter for Incorrect Information Detection
- Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers
- Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
- MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs
- The Path Not Taken: Duality in Reasoning about Program Execution
- APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI
- PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering
- From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation
- SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
- Your Reasoning Model is Secretly a Reward Model - Optimization-Free Verification from Experience
- Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
- Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
- ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
- Immediate Inference: The Missing Foundation in Large Language Model Logical Reasoning
- LCR-RAG: Enhancing Logical Consistency in Retrieval-Augmented Generation via Neuro-symbolic Reinforcement Learning
- Efficiently Learning To Reason or Not to Reason: Root-token Policy Optimization for Adaptive Thinking
- Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
- TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only
- Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks
- Model-Based Imaginative Planning for Embodied Agents
- Semantic-Aware Logical Reasoning via a Semiotic Framework
- Calibration-Aware Policy Optimization for Reasoning LLMs
- Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action Memory
- ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
- Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
- Adaptive Planning for Multi-Attribute Controllable Summarization with Monte Carlo Tree Search
- Closing the Modality Reasoning Gap for Speech Large Language Models
- Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning
- Know the Known and the Unknown: Reasonable Answer Generation with Knowledge-Informed Citations
- StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation
- ODL-TempLLM: Ontology-Guided and Description Logic-Reasoned Temporal Reasoning with LLMs
- Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
- EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation
- Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
- RFS-Guard: Detecting Reasoning Hallucinations via Cross-Phase Routing Focus in Large Reasoning Models
- Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
- Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play
- HTMR: Hybrid Token Masking Reinforcement Learning with Verifiable Rewards for Event Argument Extraction with Multi-Perspective Reasoning
- Why LLMs Hallucinate on Structured Knowledge: A Mechanistic Analysis of Reasoning over Linearized Representations
- Merlin’s Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
- Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention
- Leibniz: Theory-of-Mind Driven Neuro-Symbolic Logical Reasoning via Multi-Agent Collaboration
- The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs
- ReEfBench: Quantifying the Reasoning Efficiency of LLMs
- Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning
- THOR: A Theta-Gamma Hierarchical Oscillatory Reasoning Framework for Multi-hop QA
- How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
- AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
- Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
- Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning
- GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
- ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning
- Controllable LLM Reasoning via Sparse Autoencoder‑Based Steering
- Tailoring Diagnostic Modeling to Individual Learners: Personalized Distractor Generation via MCTS-Guided Reasoning Reconstruction
- MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
- Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
- Traffic-R1: Reinforced LLMs Bring Human-Like Reasoning to Traffic Signal Control Systems
- ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability
- MAGIC: Deep Geometric Evolution with Structural Consensus for Temporal Knowledge Graph Reasoning
- Efficient Prior-Guided Reasoning for Robust Retrieval-Augmented Generation under Conflicts
- MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents
- IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning
- Learning from Cognition: Enhancing RL Efficiency for LLM Reasoning via Hierarchical Metacognitive Decomposition and Refinement
- EpiCaR: Knowing What You Don’t Know Matters for Better Reasoning in LLMs
- Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
- NeuReasoner: Towards Explainable, Controllable, and Unified Reasoning via Mixture-of-Neurons
- Red Teaming Large Reasoning Models
- InsLogicBench: An Argumentation Logic Grounded Benchmark for Complex Insurance Claims Adjudication
- SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science
- Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
- CamoQuery: Language-Guided Reasoning Camouflaged Object Segmentation
- Make LLMs See Like Investigators, Not Just Think More: The Role of Structured Analysis in Investigative Reasoning
- MUR: Momentum Uncertainty guided Reasoning for Large Language Models
- PEAP: Proactive Embodied Action Sequence Planning with Joint Understanding of Vision and Audio Perception
- Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling
- MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
- Are they lovers or friends? Evaluating LLMs’ Social Reasoning in English and Korean Dialogues
- When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning
- ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering
- LegalChainReasoner: Grounding Criminal Judicial Opinion Generation via Structured Legal Chains
- Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
- ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints
- Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies
- SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning
- Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
- WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
- Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy
- FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models
- Adaptive Spatial and Temporal Redundancy Optimization for Efficient Reasoning in Large Language Models
- AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin
- Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
- PARIF: Pushing the Pareto Frontier of Instruction Following and Reasoning with Curriculum Reinforcement Learning
- Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering
- MED-COREASONER: Reducing Language Disparities in Medical Reasoning via Language-Informed Co-Reasoning
- Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning
- Agentic Oversight via Dialectic Reasoning
- Agent Newsroom: Efficient Chronological Report Generation via Dynamic Multi-Agent Collaboration
- MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning
- From Logical to Computational Sparsity: Structure-Aware Block-Sparse Attention for Long-Code Completion
- CogEvolve: A Multimodal Benchmark for Evaluating Relational Reasoning in Semantic Extension
- Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
- Reasoning Fails Where Step Flow Breaks
- Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
- ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification
- SGVEF-LOOP: Coverage-Guided Progressive Topological Exploration and Fact-Grounded Metamorphic Evaluation for MCP Agents
- MentalSeek-Dx: Towards Progressive Hypothetico-Deductive Reasoning for Real-world Psychiatric Diagnosis
- AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
- Data Pollination: An Emergent Ecological Process Driving AI Population Evolution
- Extending First-Order Logic for Factual Reasoning over Knowledge Graphs
- Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
- LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
- The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis
- ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
- PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
- Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
- When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs
- Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry
- Achieving Multi-Hop Calculation and Safe Abstention in Financial Numerical Reasoning by Metric Graph Constrained LLMs
- CompTab: A Comprehensive Benchmark for Real-World TableQA with Complex Reasoning and Irregular Tables
- OptiCo: Adaptive Distributed Training Optimization via Collaborative Agent Reasoning
- MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
- Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards
- REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once
- Temporal Sampling for Forgotten Reasoning in LLMs
- Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection
- Think Faster Than Words: Efficient LLM Chain-of-Thought Reasoning via Dynamic Shortcut Decoding
- Beyond Itinerary Planning—A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
- DIXITWORLD: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
- Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
- Think before Go: Hierarchical Reasoning for Image-goal Navigation
- CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts
- Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization
- MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
- CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution
- Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework
- One Cognitive Loop Is Enough: SODA unlocks Pure-Text Spatial Reasoning in Large Language Models
- Think Better, Not Longer: Token-Level Marginal Utility for Efficient Reasoning in Large Reasoning Models
- Communicating in Emergent Language with an Induced Morphological Phrasebook
- Towards Interpretable Tabular Reasoning: Enhancing LLM Reasoning on Tabular Data with Pre-Constructed Logic Graph
- Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation
- MavenCoder: Competitive Code Generation via Model Adaptive Planning Strategies and Multi-Perspective Verification Enhancement
- Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning
- Beyond the Panorama: Training-Free Hierarchical Perception-Reasoning for Fine-Grained Vision in MLLMs
- CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning
- Do LLMs Encode Functional Importance of Reasoning Tokens ?
- EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment
- QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning
- ReCreate: Reasoning and Creating Domain Agents Driven by Experience
- Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing
- Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
- MIND Your Reasoning: A Meta-Cognitive Intuitive-Reflective Network for Dual-Reasoning in Multimodal Stance Detection
- A Survey of Inductive Reasoning for Large Language Models
- Disentangling Reasoning Logic to Resolve Explicit Knowledge Conflicts
- ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
- WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement
- Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision
- SeCuRepair: Semantics-Aligned, Curriculum-Driven, and Reasoning-Enhanced Vulnerability Repair Framework
- Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective
- RLSeek: Evidence-Grounded Reasoning for RAG Hallucination Detection
- Injecting Context via Situation Working Memory for Logical Reasoning with LLMs
- Quantifying and Understanding Uncertainty in Large Reasoning Models
- The Personalization Trap: How User Memory Alters Emotional Reasoning in LLMs
- Schoenfeld’s Anatomy of Mathematical Reasoning by Language Models
- Enhanced Reasoning for Biomedical Document-Level Relation Extraction via a Novel Cascade Language Model Framework
- Synthetic Data Generation for Training Diversified Commonsense Reasoning Models
- Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
- ChemReason-Bench: Benchmarking Large Language Models for Procedural Reasoning in Experimental Chemistry
- How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
- Ranking Reasoning LLMs under Test-Time Scaling
- PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations
- IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering
- Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention
- Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation
- Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
- What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
- SAHM: A Benchmark for Arabic Financial and Shari’ah-Compliant Reasoning
- Confident, Calibrated, or Complicit: Safety Alignment and Ideological Bias in LLM Hate Speech Detection
- MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language Models
- TPS-Bench: Evaluating AI Agents’ Tool Planning & Scheduling Abilities in Compounding Tasks
- CityVG: Contrastive Fine-Tuning and Reward-Based Chain-of-Thought Reasoning for Zero-Shot City-Scale 3D Visual Grounding
- Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers
- DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
- SMART: Evaluating LLMs’ Mathematical Reasoning via a Human Cognitive Process-Inspired Benchmark
- HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation
- Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models
- METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
- Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
- LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning
- Multi-View Attention Multiple-Instance Learning Enhanced by LLM Reasoning for Cognitive Distortion Detection
- CʜAIRO: Contextual Hierarchical Analogical Induction and Reasoning Optimization for LLMs
- An Existence Proof for Neural Language Models That Can Explain Garden-Path Effects via Surprisal
- Probing Audio-Visual Reasoning in Multimodal Language Models through the Lens of Audio
- Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
- PaT: Planning-after-Trial for Efficient Test-Time Code Generation
- Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
- The Side Effects of Being Smart: Safety Risks in MLLMs’ Multi-Image Reasoning
- Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning
- R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling
- From Detection to Understanding: Multi-Turn Reasoning for Video Misinformation Analysis
- VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
- Beyond Markovian Forgetfulness: Episodic Memory for Reasoning-Intensive Retrieval
- CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
- Adaptive Retrieval for Reasoning
- On Emergent Social World Models — Evidence for Functional Integration of Theory of Mind and Pragmatic Reasoning in Language Models
- LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning
- TH-RAG : Topic-Based Hierarchical Knowledge Graphs for Robust Multi-hop Reasoning in Graph-based RAG Systems
- R³: End-to-End Reasoning-based Planning for Multi-step Retrosynthesis via Reinforcement Learning
- Execution as Verification: Fine-Grained Self-Correcting Reasoning for Complex KBQA
- MARD: Module-Aware Reasoning Distillation for Language Models with Adaptive Supervision
- Revealing Procedural Reasoning Structures in Chain-of-Thought Training via Span-Level Gradient Organization
- StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
- Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning Models
- Foresight Optimization for Strategic Reasoning in Large Language Models
- CheckRLM: Effective Knowledge–Thought Coherence Checking in Retrieval-Augmented Reasoning
- FLAIR: Steering LLM Mathematical Problem Solving based on A Fuzzy-Logic-AssIsted Reasoner
- Trait Activation in Silicon: A Situation-Aware Framework for Psychologically Grounded Role-Playing
- ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following
- ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
- JoPR: Joint Emotion Perception and Reasoning for Conversational Emotion Recognition
- Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic Views
- One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
- Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression
- REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache Compression
- Mitigating Safety Context Amnesia in Multimodal Reasoning Models via Intent-Guided Safety Reasoning
- On-policy Reinforcement Fine-tuning with Offline reward for Multi-step Embodied Planning
- Figure It Out: Improve the Frontier of Reasoning with Executable Visual States
- NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise
- Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
- AttnPO: Attention-Guided Process Supervision for Efficient Reasoning
- Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMs
- Too Long, Do Re-weighting for Efficient LLM Reasoning Compression
- Assessing the Belief Consistency of Large Language Models on the Logical Conversation Process
- AdaMix: Adaptive Mixing for Short and Long Reasoning Adapters
- UrbanGeoEval: A City-Scale Benchmark for Evaluating Large Language Models in Geospatial Reasoning
- E-ViC: Reasoning Beyond Text via Embodied Visual Chain for Spatial Intelligence
- GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap
- LongVideoAgent: Multi-Agent Reasoning with Long Videos
- Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
- MirrorQA: Benchmarking Multimodal LLMs on Mirror-Orientation Reasoning
- GeoRC: A Benchmark for Geolocation Reasoning Chains
- Thinking in Schemas: Robust Syllogistic Reasoning in LLMs
- Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
- Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
- MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
- Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages
- Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
- Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models
- Social Story Frames: Contextual Reasoning about Narrative Intent and Reception
- A Survey of Reasoning-Intensive Retrieval: Progress and Challenges
- LOGICAL-COMMONSENSEQA: A Benchmark for Logical Commonsense Reasoning
- Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment
- From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
- PRBench: Large-Scale Expert Rubrics for Evaluating High-Stakes Professional Reasoning
- A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
- Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
- EDUMATH: Generating Standards-aligned Educational Math Word Problems
- Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards
- BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning
- Reasoning Traces Shape Outputs but Models Won’t Say So
- AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
- ReActR: Reasoning through Error-Activated Reflection for LLM Post-Training
- Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception
- From Trajectories to Graphs: Contract-Checked Editing for Verifier-Guided LLM Reasoning
- SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive Thinking
- MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation
- Knowledge Vector of Logical Reasoning in Large Language Models
- SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter
- Programming over Thinking: Efficient and Robust Multi-Constraint Planning
- LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
- ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
- PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning
- ParaSuite: Boosting LLM Reasoning via Paradox Resolution
- rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection
- AIPO: Adaptive Information Guided Token-Level Reinforcement Learning for Large Language Model Reasoning
- DialDefer: A Framework for Detecting and Mitigating LLM Dialogic Deference
- Benchmarking Fine-Grained Error Detection in Multimodal Reasoning
- Parallel Test-Time Scaling for Latent Reasoning Models
- SciMDR: Advancing Scientific Multimodal Document Reasoning
- Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning
- VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
- TInR: Exploring Tool-Internalized Reasoning in Large Language Models
- How Long Reasoning Chains Influence LLMs’ Judgment of Answer Factuality
- MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
- Diagnosing and Remedying Representation Deficiencies for Deterministic Reasoning in KGQA
- Revealing the Seen, Imagining the Beyond: A Survey of Image-Grounded Chain-of-Thought Reasoning in Multimodal LLMs
- OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Models
- Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
- Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
- Perception, Understanding and Reasoning: A Multimodal Benchmark for Video Fake News Detection
- Rose-SQL: Role-State Evolution Guided Structured Reasoning for Multi-Turn Text-to-SQL
- EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
- Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
- EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning
- From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding
- LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software
- UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
- Minimal Free Resolution Guided Adaptive Tree Reasoning
- Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations
- Monotonic Scaffolding as a Diagnostic Lens for Legal Reasoning in LLMs
- Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
- CHOIR: Harmonizing Structured Persona Diversity for Robust Collaborative LLM Reasoning
- Protein-STORY: Semantic Text-Oriented Representation Yields biologically meaningful Protein embeddings
- ReasMark: A Robust Watermark for Attributing LLM Reasoning Under Knowledge Distillation Attacks
- MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
- REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
- ReasonAny: Incorporating Reasoning Capability to Any Model via Simple and Effective Model Merging
- Tackling the Root of Misinformation by Teaching Laypeople about Logical Fallacies via Socratic Questioning and Critical Argumentation
- Macaron: Controlled, Human-Written Benchmark for Multilingual and Multicultural Reasoning via Template-Filling
- Reinforced Efficient Reasoning via Semantically Diverse Exploration
- Towards a Mechanistic Understanding of Large Reasoning Models: A Survey of Training, Inference, and Failures