R
Published on

ACL 2026 — Agents & Multi-Agent Systems

Agents & Multi-Agent Systems

319 papers Links not yet available — ACL proceedings pending on ACL Anthology.

  • OctoTools: A Multi-Agent Framework with Extensible Tools for Complex Reasoning
  • No Reader Left Behind: Multi-Agent Summaries Everyone Can Understand
  • Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
  • PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation
  • WebSTAR: Scalable Data Synthesis for Computer Use Agents with Step-Level Filtering
  • How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior
  • IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review
  • AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering
  • MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
  • RAM-SD: Retrieval-Augmented Multi-agent framework for Sarcasm Detection
  • A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains
  • Reinforcement Learning for Self-Improving Agent with Skill Library
  • Grammar Search for Multi-Agent Systems
  • Explicit Trait Inference for Multi-Agent Coordination
  • Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning
  • GATE: Graph-based Adaptive Tool Evolution Across Diverse Tasks
  • Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
  • COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context
  • Mitigating Context Interference for Reliable and Efficient Search Agents
  • Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge Synergy
  • Can We Predict Before Executing Machine Learning Agents?
  • Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions
  • Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
  • D²Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning
  • Simple-VGC: Enhancing Visual Grounding in Multimodal Reasoning via Adaptive Tool Composition
  • AgentOCR: Reimagining Agent History via Optical Self-Compression
  • MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
  • Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection
  • Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving
  • OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
  • Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage
  • MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
  • ACE-Router: Generalizing History-Aware Routing from MCP Tools to the Agent Web
  • FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
  • TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs
  • Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search
  • Don’t Click That: Teaching Web Agents to Resist Deceptive Interfaces
  • MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents
  • Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
  • When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges
  • Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS
  • ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration
  • DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
  • AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
  • Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
  • NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning
  • AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering
  • Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
  • Taming “Zombie” Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution
  • A Survey of Large Language Model-Based Search Agents
  • The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination
  • AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios
  • MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution
  • From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
  • QBridge: Bridging Natural Language and SQL via Gold Query Rewriting with Agentic Refinement
  • Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
  • Experience-driven Multi-turn Reinforcement Learning for GUI Agents
  • OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
  • Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
  • IEvoAgent: Evolving Conversational Agent based on User Implicit Feedback
  • VIGIL: Defending LLM Agents Against Tool-Stream Injection via Verify-Before-Commit
  • EvoSci: A Bio-Inspired Multi-Agent Framework for the Evolution of Scientific Discovery
  • DREAM: Deep Research Evaluation with Agentic Metrics
  • Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
  • ACIArena: Toward Unified Evaluation for Agent Cascading Injection
  • VoxMind: An End-to-End Agentic Spoken Dialogue System
  • Reinforcing Agentic Search Via Reward Density Optimization
  • Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
  • Ready Jurist One: Benchmarking Language Agents for Legal Intelligence in Dynamic Environments
  • OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
  • When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
  • Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data
  • Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
  • The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents
  • SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
  • MOA: Multi-Objective Alignment for Role-Playing Agents
  • From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
  • Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents
  • MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
  • RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents
  • Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards
  • AgentMark: Utility-Preserving Behavioral Watermarking for Agents
  • No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning
  • LLM-as-Scheduler: Agentic Workflow Dynamic Scheduling
  • Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
  • CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
  • Lightweight LLM Agent Memory with Small Language Models
  • Interleaved Tool-Call Reasoning for Protein Function Understanding
  • Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
  • A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Task
  • GLARE: Agentic Reasoning for Legal Judgment Prediction
  • DORA: A Dual-Objective Reinforcement Learning Framework for Effective and Efficient Multimodal Agentic Search
  • CODESTRUCT: Code Agents over Structured Action Spaces
  • Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision
  • Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions
  • Current Agents Fail to Leverage World Model as Tool for Foresight
  • HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents
  • Communication-Efficient Desire Alignment for Proactive Embodied Human–Agent Interaction
  • ICDAGENT: Empowering Agentic Large Language Models for Explainable Medical Coding
  • Mango: Multi-Agent Web Navigation via Global-View Optimization
  • Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
  • When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning
  • TeamFusion: Supporting Open-ended Teamwork with Multi-Agent Systems
  • Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human–Agent Interaction
  • MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems
  • SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
  • YIELD: A Large-Scale Dataset and Evaluation Framework for Information Elicitation Agents
  • Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts
  • ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
  • AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs
  • Agentic Rubrics as Contextual Verifiers for SWE Agents
  • When “Correct” Is Not Safe: Can We Trust Functionally Correct Patches Generated by Code Agents?
  • Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate
  • SynthAgent: Adapting Web Agents with Synthetic Supervision
  • LLM Agents in Law: Taxonomy, Applications, and Challenges
  • BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks
  • Query-Efficient Agentic Graph Extraction Attacks on GraphRAG Systems
  • ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation
  • MARCH: Multi-Agent Radiology Clinical Hierarchy for CT Report Generation
  • Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition
  • Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities
  • RExBench: Can coding agents autonomously implement AI research extensions?
  • AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation
  • APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI
  • Evolving Agents
  • Analyzing and Internalizing Complex Policy Documents for LLM Agents
  • Anchor: Branch-Point Data Generation for GUI Agents
  • From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation
  • SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion
  • Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation
  • CIA: Inferring the Communication Topology from LLM-based Multi-Agent Systems
  • Model-Based Imaginative Planning for Embodied Agents
  • ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling Agents
  • GBV-SQL: Guided Generation and SQL2Text Back-Translation Validation for Multi-Agent Text2SQL
  • ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
  • CPT-Agent: A Cognitive Process Theory-driven Framework for Student Simulation in Writing Development
  • SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation
  • ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
  • GTA: Generating Long-horizon Tasks for Web Agents at Scale
  • Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults
  • UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
  • Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems
  • Leibniz: Theory-of-Mind Driven Neuro-Symbolic Logical Reasoning via Multi-Agent Collaboration
  • HSCodeComp: A Realistic and Expert-level Agent Benchmark for Hierarchical Rule Application
  • Don’t Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models
  • Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
  • Mem²Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation
  • Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning
  • Beyond the Context Window: Scaling Agentic RL via End-to-end Optimized Context Compression
  • LoopTool: Closing the Data–Training Loop for Robust LLM Tool Calls
  • Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents
  • WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning
  • Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
  • MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents
  • OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agents
  • BrowseComp-Plus: A Fair and Disentangled Evaluation Benchmark for Deep Search Agents
  • Agent-based Substructure Counting under Local Differential Privacy
  • SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science
  • Nested Browser-Use Learning for Agentic Information Seeking
  • CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
  • FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean
  • Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling
  • From Synthesis to Clinical Assistance: A Strategy-Aware Agent Framework for Autism Intervention based on Real Clinical Dataset
  • From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation
  • SPARK: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
  • Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
  • AT²PO: Agentic Turn-based Policy Optimization via Tree Search
  • SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios
  • WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
  • SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
  • BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
  • Agentic Oversight via Dialectic Reasoning
  • Agent Newsroom: Efficient Chronological Report Generation via Dynamic Multi-Agent Collaboration
  • Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents
  • WebSynthesis: World Model-Guided Monte Carlo Tree Search for Efficient WebAgent Trajectory Synthesis
  • AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement Learning
  • ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
  • Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision
  • Cognitive Scaffold: From Fluid Context to Crystallized Memory for Long-Horizon DeepResearch Agents
  • Temp-R1: A Unified Autonomous Agent for Complex Temporal KGQA via Reverse Curriculum Reinforcement Learning
  • HAG: Hierarchical Demographic Tree-based Agent Generation for Topic-Adaptive Simulation
  • Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
  • SGVEF-LOOP: Coverage-Guided Progressive Topological Exploration and Fact-Grounded Metamorphic Evaluation for MCP Agents
  • DocLens: A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
  • Beyond Self-Report: Bridging the Intention-Behavior Gap in Critical Thinking Assessment via Interpretable Multi-Agent System
  • ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
  • LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations
  • Enabling Agents to Communicate Entirely in Latent Space
  • DR-Arena: an Automated Evaluation Framework for Deep Research Agents
  • PACE: Predictive Adaptive Context Extraction for Long-Horizon LLM Agents
  • When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
  • A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item Generation
  • Hetero-Designer: Automated Design of Multi-Agent Systems with Heterogeneous LLMs
  • Trust Within? Seek Beyond? Knowledge Boundary Aware Policy Optimization for Agentic Search
  • FusionFlow: Enabling Deep Structural Exploration for Automated Agentic Workflow Generation
  • OptiCo: Adaptive Distributed Training Optimization via Collaborative Agent Reasoning
  • Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents
  • AgentAsk: Multi-Agent Systems Need to Ask
  • MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution
  • VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation Agents
  • Conflict-Aware Memory for Embodied Agents: Enhancing Vector Data Quality via Detection Rules
  • STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training
  • InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
  • GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling
  • From Knowing to Teaching: Scaffolding Pedagogical Decisions for LLM Agent
  • Why Are We Moral? An LLM-based Agent Simulation Approach to the Study of Moral Evolution
  • Beyond Itinerary Planning—A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
  • DIXITWORLD: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
  • MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation
  • SILO-BENCH: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems
  • DEFT: Demystifying VLN Failures via a Unified Dual-View Explainability Framework for LLM-based Agents
  • MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
  • AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems
  • End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
  • Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection
  • EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment
  • Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training
  • MirrorCAPTCHA: Wild CAPTCHA, Wild Distribution, Wild Web-based Platform Meet Multimodal LLM Agents
  • ReCreate: Reasoning and Creating Domain Agents Driven by Experience
  • Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing
  • TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems
  • MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection
  • Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
  • EmoMAS: Emotion-Aware Multi-Agent System for High-Stakes Edge-Deployable Negotiation with Bayesian Orchestration
  • Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
  • ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents
  • EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution
  • Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective
  • InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning
  • SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator
  • SimPBL: A Multi-Agent Framework for Project-Based Learning
  • A Multi-Agent Framework for High-Interaction Terminal Simulation
  • RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation
  • Neuro-Symbolic Agentic Reinforcement Learning for Long-Term Original Character Companionship and Interaction
  • Behavior Knowledge Merge in Reinforced Agentic Models
  • MARS²: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
  • NeuralFSM: Adaptive Multi-Agent Coordination via Learning Finite-State Execution Policy
  • UniDataBench: Evaluating Data Analytics Agents Across Structured and Unstructured Data
  • MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training
  • PExA: Parallel Exploration Agent for Complex Text-to-SQL
  • ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering
  • Conjunctive Prompt Attacks in Multi-Agent LLM Systems
  • GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
  • DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality
  • RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning
  • GAM: Hierarchical Graph-based Agentic Memory for LLM Agents
  • What Deserves Memory: Adaptive Memory Distillation for LLM Agents
  • TPS-Bench: Evaluating AI Agents’ Tool Planning & Scheduling Abilities in Compounding Tasks
  • SOAR: Supervision from Observation for Agentic Reinforcement Learning
  • HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation
  • ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants
  • PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
  • Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
  • Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
  • ARCHITECT: Uncertainty-Aware Dynamic Tool Learning via Causal Intervention for Open-World Agents
  • MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents
  • Action Boundary Blindness: When LLM Agents Cannot Tell Where One Action Ends and Another Begins
  • R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling
  • RISK: A Framework for GUI Agents in E-commerce Risk Management
  • ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution
  • LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning
  • Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents
  • Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities
  • FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation
  • AdaDPI: Document-level Translation Adaptive Agent via Dynamic Parametric Internalization
  • Dynamic Generation of Multi LLM Agents Communication Topologies with Graph Diffusion Models
  • EvoRoute: Experience-Driven Self-Routing LLM Agent Systems
  • When Efficiency Becomes a Vulnerability: Computational Cost Attacks on WebAgents
  • SPARKLE: A Structured and Plug-and-play Agentic Retrieval Policy for Adaptive RAG Models
  • BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
  • MARCH: Multi-Agent Reinforced Check for Hallucination
  • Towards Trustworthy Smart Contract Synthesis: A Multi-Agent Framework with Lean-Based Verification
  • LongVideoAgent: Multi-Agent Reasoning with Long Videos
  • Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors
  • CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty
  • Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
  • ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents
  • Multimodal Safety Evaluation in Generative Agent Social Simulations
  • LLM4Cell: Taxonomy and Evaluation of LLM and Agentic Models for Single-Cell Biology
  • From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
  • Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
  • Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
  • GCA Framework: A GCC Countries–Grounded Dataset and Agentic Pipeline for Climate Decision Support
  • Dialogue is the Plan: From Interface to Joint Action in Agentic AI
  • BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning
  • Value of Information: A Framework for Human–Agent Communication
  • How do Role Models Shape Collective Morality? Exemplar-Driven Moral Learning in Multi-Agent Simulation
  • Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception
  • C-World: A Computer Use Agent Environment Creator
  • Simple Agents, Biased Judges: Efficient Multi-Party Dialogue Generation & The Evaluation Gap
  • EVOTOOL: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection
  • MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization
  • Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data
  • The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check
  • Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents
  • Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models
  • GUI0: Self-Evolving Foundational GUI Agents in Super App Ecosystems
  • AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
  • MemRec: Collaborative Memory-Augmented Agentic Recommender System
  • HSGraphAgent: Knowledge-Graph-Guided Large Language Models for Harmonized System Code Classification
  • TInR: Exploring Tool-Internalized Reasoning in Large Language Models
  • PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts
  • Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents
  • JARVIS or Ultron? A Survey on the Safety and Security Threats of Computer-Using Agents
  • LLM-Based Multi-Agent Systems for Clinical Workflows: A Survey of AI Hospitals
  • Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning
  • BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
  • Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance
  • DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
  • TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
  • Agentic Very Long Video Understanding
  • Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations
  • KARL: Reinforcement Learning for LLM Agents on Multi-Turn Knowledge-Intensive Agentic Tasks
  • Do LLM Agents Mirror Socio-Cognitive Effects in Power-Asymmetric Conversations?
  • Constructing coherent spatial memory in LLM agents through graph rectification