- Published on
ACL 2026 — Agents & Multi-Agent Systems
Agents & Multi-Agent Systems
319 papers Links not yet available — ACL proceedings pending on ACL Anthology.
- OctoTools: A Multi-Agent Framework with Extensible Tools for Complex Reasoning
- No Reader Left Behind: Multi-Agent Summaries Everyone Can Understand
- Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
- PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation
- WebSTAR: Scalable Data Synthesis for Computer Use Agents with Step-Level Filtering
- How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior
- IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review
- AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering
- MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
- RAM-SD: Retrieval-Augmented Multi-agent framework for Sarcasm Detection
- A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains
- Reinforcement Learning for Self-Improving Agent with Skill Library
- Grammar Search for Multi-Agent Systems
- Explicit Trait Inference for Multi-Agent Coordination
- Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning
- GATE: Graph-based Adaptive Tool Evolution Across Diverse Tasks
- Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
- COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context
- Mitigating Context Interference for Reliable and Efficient Search Agents
- Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge Synergy
- Can We Predict Before Executing Machine Learning Agents?
- Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions
- Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
- D²Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning
- Simple-VGC: Enhancing Visual Grounding in Multimodal Reasoning via Adaptive Tool Composition
- AgentOCR: Reimagining Agent History via Optical Self-Compression
- MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
- Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection
- Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving
- OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
- Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage
- MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
- ACE-Router: Generalizing History-Aware Routing from MCP Tools to the Agent Web
- FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
- TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs
- Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search
- Don’t Click That: Teaching Web Agents to Resist Deceptive Interfaces
- MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents
- Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
- When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges
- Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS
- ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration
- DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
- AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
- Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
- NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning
- AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering
- Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
- Taming “Zombie” Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution
- A Survey of Large Language Model-Based Search Agents
- The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination
- AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios
- MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution
- From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
- QBridge: Bridging Natural Language and SQL via Gold Query Rewriting with Agentic Refinement
- Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
- Experience-driven Multi-turn Reinforcement Learning for GUI Agents
- OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
- Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
- IEvoAgent: Evolving Conversational Agent based on User Implicit Feedback
- VIGIL: Defending LLM Agents Against Tool-Stream Injection via Verify-Before-Commit
- EvoSci: A Bio-Inspired Multi-Agent Framework for the Evolution of Scientific Discovery
- DREAM: Deep Research Evaluation with Agentic Metrics
- Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
- ACIArena: Toward Unified Evaluation for Agent Cascading Injection
- VoxMind: An End-to-End Agentic Spoken Dialogue System
- Reinforcing Agentic Search Via Reward Density Optimization
- Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
- Ready Jurist One: Benchmarking Language Agents for Legal Intelligence in Dynamic Environments
- OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
- When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
- Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data
- Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
- The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents
- SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
- MOA: Multi-Objective Alignment for Role-Playing Agents
- From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
- Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents
- MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
- RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents
- Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards
- AgentMark: Utility-Preserving Behavioral Watermarking for Agents
- No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning
- LLM-as-Scheduler: Agentic Workflow Dynamic Scheduling
- Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
- CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
- Lightweight LLM Agent Memory with Small Language Models
- Interleaved Tool-Call Reasoning for Protein Function Understanding
- Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
- A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Task
- GLARE: Agentic Reasoning for Legal Judgment Prediction
- DORA: A Dual-Objective Reinforcement Learning Framework for Effective and Efficient Multimodal Agentic Search
- CODESTRUCT: Code Agents over Structured Action Spaces
- Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision
- Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions
- Current Agents Fail to Leverage World Model as Tool for Foresight
- HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents
- Communication-Efficient Desire Alignment for Proactive Embodied Human–Agent Interaction
- ICDAGENT: Empowering Agentic Large Language Models for Explainable Medical Coding
- Mango: Multi-Agent Web Navigation via Global-View Optimization
- Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
- When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning
- TeamFusion: Supporting Open-ended Teamwork with Multi-Agent Systems
- Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human–Agent Interaction
- MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems
- SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
- YIELD: A Large-Scale Dataset and Evaluation Framework for Information Elicitation Agents
- Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts
- ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
- AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs
- Agentic Rubrics as Contextual Verifiers for SWE Agents
- When “Correct” Is Not Safe: Can We Trust Functionally Correct Patches Generated by Code Agents?
- Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate
- SynthAgent: Adapting Web Agents with Synthetic Supervision
- LLM Agents in Law: Taxonomy, Applications, and Challenges
- BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks
- Query-Efficient Agentic Graph Extraction Attacks on GraphRAG Systems
- ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation
- MARCH: Multi-Agent Radiology Clinical Hierarchy for CT Report Generation
- Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition
- Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities
- RExBench: Can coding agents autonomously implement AI research extensions?
- AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation
- APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI
- Evolving Agents
- Analyzing and Internalizing Complex Policy Documents for LLM Agents
- Anchor: Branch-Point Data Generation for GUI Agents
- From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation
- SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion
- Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation
- CIA: Inferring the Communication Topology from LLM-based Multi-Agent Systems
- Model-Based Imaginative Planning for Embodied Agents
- ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling Agents
- GBV-SQL: Guided Generation and SQL2Text Back-Translation Validation for Multi-Agent Text2SQL
- ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
- CPT-Agent: A Cognitive Process Theory-driven Framework for Student Simulation in Writing Development
- SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation
- ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
- GTA: Generating Long-horizon Tasks for Web Agents at Scale
- Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults
- UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
- Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems
- Leibniz: Theory-of-Mind Driven Neuro-Symbolic Logical Reasoning via Multi-Agent Collaboration
- HSCodeComp: A Realistic and Expert-level Agent Benchmark for Hierarchical Rule Application
- Don’t Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models
- Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
- Mem²Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation
- Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning
- Beyond the Context Window: Scaling Agentic RL via End-to-end Optimized Context Compression
- LoopTool: Closing the Data–Training Loop for Robust LLM Tool Calls
- Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents
- WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning
- Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
- MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents
- OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agents
- BrowseComp-Plus: A Fair and Disentangled Evaluation Benchmark for Deep Search Agents
- Agent-based Substructure Counting under Local Differential Privacy
- SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science
- Nested Browser-Use Learning for Agentic Information Seeking
- CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
- FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean
- Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling
- From Synthesis to Clinical Assistance: A Strategy-Aware Agent Framework for Autism Intervention based on Real Clinical Dataset
- From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation
- SPARK: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
- Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
- AT²PO: Agentic Turn-based Policy Optimization via Tree Search
- SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios
- WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
- SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
- BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
- Agentic Oversight via Dialectic Reasoning
- Agent Newsroom: Efficient Chronological Report Generation via Dynamic Multi-Agent Collaboration
- Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents
- WebSynthesis: World Model-Guided Monte Carlo Tree Search for Efficient WebAgent Trajectory Synthesis
- AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement Learning
- ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
- Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision
- Cognitive Scaffold: From Fluid Context to Crystallized Memory for Long-Horizon DeepResearch Agents
- Temp-R1: A Unified Autonomous Agent for Complex Temporal KGQA via Reverse Curriculum Reinforcement Learning
- HAG: Hierarchical Demographic Tree-based Agent Generation for Topic-Adaptive Simulation
- Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
- SGVEF-LOOP: Coverage-Guided Progressive Topological Exploration and Fact-Grounded Metamorphic Evaluation for MCP Agents
- DocLens: A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
- Beyond Self-Report: Bridging the Intention-Behavior Gap in Critical Thinking Assessment via Interpretable Multi-Agent System
- ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
- LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations
- Enabling Agents to Communicate Entirely in Latent Space
- DR-Arena: an Automated Evaluation Framework for Deep Research Agents
- PACE: Predictive Adaptive Context Extraction for Long-Horizon LLM Agents
- When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
- A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item Generation
- Hetero-Designer: Automated Design of Multi-Agent Systems with Heterogeneous LLMs
- Trust Within? Seek Beyond? Knowledge Boundary Aware Policy Optimization for Agentic Search
- FusionFlow: Enabling Deep Structural Exploration for Automated Agentic Workflow Generation
- OptiCo: Adaptive Distributed Training Optimization via Collaborative Agent Reasoning
- Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents
- AgentAsk: Multi-Agent Systems Need to Ask
- MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution
- VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation Agents
- Conflict-Aware Memory for Embodied Agents: Enhancing Vector Data Quality via Detection Rules
- STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training
- InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
- GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling
- From Knowing to Teaching: Scaffolding Pedagogical Decisions for LLM Agent
- Why Are We Moral? An LLM-based Agent Simulation Approach to the Study of Moral Evolution
- Beyond Itinerary Planning—A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
- DIXITWORLD: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
- MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation
- SILO-BENCH: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems
- DEFT: Demystifying VLN Failures via a Unified Dual-View Explainability Framework for LLM-based Agents
- MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
- AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems
- End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
- Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection
- EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment
- Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training
- MirrorCAPTCHA: Wild CAPTCHA, Wild Distribution, Wild Web-based Platform Meet Multimodal LLM Agents
- ReCreate: Reasoning and Creating Domain Agents Driven by Experience
- Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing
- TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems
- MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection
- Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
- EmoMAS: Emotion-Aware Multi-Agent System for High-Stakes Edge-Deployable Negotiation with Bayesian Orchestration
- Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
- ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents
- EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution
- Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective
- InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning
- SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator
- SimPBL: A Multi-Agent Framework for Project-Based Learning
- A Multi-Agent Framework for High-Interaction Terminal Simulation
- RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation
- Neuro-Symbolic Agentic Reinforcement Learning for Long-Term Original Character Companionship and Interaction
- Behavior Knowledge Merge in Reinforced Agentic Models
- MARS²: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
- NeuralFSM: Adaptive Multi-Agent Coordination via Learning Finite-State Execution Policy
- UniDataBench: Evaluating Data Analytics Agents Across Structured and Unstructured Data
- MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training
- PExA: Parallel Exploration Agent for Complex Text-to-SQL
- ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering
- Conjunctive Prompt Attacks in Multi-Agent LLM Systems
- GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
- DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality
- RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning
- GAM: Hierarchical Graph-based Agentic Memory for LLM Agents
- What Deserves Memory: Adaptive Memory Distillation for LLM Agents
- TPS-Bench: Evaluating AI Agents’ Tool Planning & Scheduling Abilities in Compounding Tasks
- SOAR: Supervision from Observation for Agentic Reinforcement Learning
- HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation
- ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants
- PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
- Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
- Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
- ARCHITECT: Uncertainty-Aware Dynamic Tool Learning via Causal Intervention for Open-World Agents
- MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents
- Action Boundary Blindness: When LLM Agents Cannot Tell Where One Action Ends and Another Begins
- R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling
- RISK: A Framework for GUI Agents in E-commerce Risk Management
- ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution
- LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning
- Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents
- Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities
- FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation
- AdaDPI: Document-level Translation Adaptive Agent via Dynamic Parametric Internalization
- Dynamic Generation of Multi LLM Agents Communication Topologies with Graph Diffusion Models
- EvoRoute: Experience-Driven Self-Routing LLM Agent Systems
- When Efficiency Becomes a Vulnerability: Computational Cost Attacks on WebAgents
- SPARKLE: A Structured and Plug-and-play Agentic Retrieval Policy for Adaptive RAG Models
- BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
- MARCH: Multi-Agent Reinforced Check for Hallucination
- Towards Trustworthy Smart Contract Synthesis: A Multi-Agent Framework with Lean-Based Verification
- LongVideoAgent: Multi-Agent Reasoning with Long Videos
- Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors
- CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty
- Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
- ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents
- Multimodal Safety Evaluation in Generative Agent Social Simulations
- LLM4Cell: Taxonomy and Evaluation of LLM and Agentic Models for Single-Cell Biology
- From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
- Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
- Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
- GCA Framework: A GCC Countries–Grounded Dataset and Agentic Pipeline for Climate Decision Support
- Dialogue is the Plan: From Interface to Joint Action in Agentic AI
- BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning
- Value of Information: A Framework for Human–Agent Communication
- How do Role Models Shape Collective Morality? Exemplar-Driven Moral Learning in Multi-Agent Simulation
- Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception
- C-World: A Computer Use Agent Environment Creator
- Simple Agents, Biased Judges: Efficient Multi-Party Dialogue Generation & The Evaluation Gap
- EVOTOOL: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection
- MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization
- Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data
- The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check
- Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents
- Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models
- GUI0: Self-Evolving Foundational GUI Agents in Super App Ecosystems
- AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
- MemRec: Collaborative Memory-Augmented Agentic Recommender System
- HSGraphAgent: Knowledge-Graph-Guided Large Language Models for Harmonized System Code Classification
- TInR: Exploring Tool-Internalized Reasoning in Large Language Models
- PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts
- Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents
- JARVIS or Ultron? A Survey on the Safety and Security Threats of Computer-Using Agents
- LLM-Based Multi-Agent Systems for Clinical Workflows: A Survey of AI Hospitals
- Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning
- BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
- Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance
- DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
- TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
- Agentic Very Long Video Understanding
- Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations
- KARL: Reinforcement Learning for LLM Agents on Multi-Turn Knowledge-Intensive Agentic Tasks
- Do LLM Agents Mirror Socio-Cognitive Effects in Power-Asymmetric Conversations?
- Constructing coherent spatial memory in LLM agents through graph rectification