- Published on
ACL 2026 — Datasets & Benchmarks
Datasets & Benchmarks
340 papers Links not yet available — ACL proceedings pending on ACL Anthology.
- Benchmarking LLM’s Capability in Reasoning over Conflicting Web References
- MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Long-tail Knowledge
- SenseRel: A Sense-Level Benchmark for Denotational and Connotational Meaning Relations
- Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
- VALU: A Benchmark for Video Anomaly Temporal Localization and Understanding at Multiple Semantic Levels
- Is EEG-to-Text Feasible in Real-World Scenarios? An In-Depth Analysis Using a Neuropsychology-Inspired Benchmark
- SAGE: A Search-AuGmented Evaluation of Large Language Models on Free‑Form QA
- A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains
- Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness
- AraVQA: Building a New Arabic Factoid Visual Question Answering Dataset from Wikipedia
- SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
- MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological Generation
- Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner
- RealTalk-CN: A Realistic Chinese Speech Task-Oriented Dialogue Benchmark with Cross-Modal Analysis
- Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders
- KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM Evaluation
- A Comprehensive Survey of Process Reward Models: Data Generation, Model Construction, and Usage
- SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness
- Looking at Radiology Report Generation through a Causal Lens: A Survey
- Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
- CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
- Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
- Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation
- Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language Models
- MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
- Rethinking Meeting Effectiveness: A Benchmark and Framework for Temporal Fine-grained Automatic Meeting Effectiveness Evaluation
- CEDAR: A Chinese Evaluation Dataset for Computational Argumentation
- MSEarth: A Multimodal Benchmark for Earth Science Phenomenon Discovery with MLLMs
- GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance
- Par-ITA: Benchmarking Seq2Seq and LLMs on a Human-Supervised Parallel Corpus for Italian Hyperpartisan Neutralization
- ROSE: An Intent-Centered Evaluation Metric for NL2SQL
- Demystifying Uncertainty in LLMs: Active Calibration between Concepts and Human Evaluations
- OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
- MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
- AutoTaskEval: Towards Domain-Specific and Fine-Grained Evaluation for LLMs
- UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
- Annotating Dimensions of Social Perception in Text: A Sentence-Level Dataset of Warmth and Competence
- Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration
- MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents
- HoWToBench: Holistic Evaluation for LLM’s Capability in Human-level Writing using Tree of Writing
- DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
- AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
- arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
- Responsible Evaluation of AI for Mental Health
- SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
- Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
- Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
- A Survey of Large Language Model-Based Search Agents
- AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios
- Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
- Beyond Monolingual Assumptions: A Survey on Code-Switched NLP in the Era of Large Language Models across Modalities
- From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
- RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository
- CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
- “Newspaper Eat” Means “Not Tasty”: A Taxonomy and Benchmark for Coded Language in Real-World Chinese Online Reviews
- One Battle After Another: Probing LLMs’ Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework
- Benchmarking and Learning Real-World Customer Service Dialogue
- DREAM: Deep Research Evaluation with Agentic Metrics
- ACIArena: Toward Unified Evaluation for Agent Cascading Injection
- PLAWBENCH: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
- Ready Jurist One: Benchmarking Language Agents for Legal Intelligence in Dynamic Environments
- Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex Text
- All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection
- Musical Score Understanding Benchmark: Evaluating Large Language Models’ Comprehension of Complete Musical Scores
- Valid Survey Simulations with Limited Human Data: The Roles of Prompting, Fine-Tuning, and Rectification
- Limited Linguistic Diversity in Embodied AI Datasets
- CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval
- WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
- LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection
- BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources
- Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation
- Author-in-the-Loop Response Generation and Evaluation: Integrating Author Expertise and Intent in Responses to Peer Review
- Reward Modeling for Scientific Writing Evaluation
- Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
- Stereotype Bias in a Bilingual Setting: A Culturally Grounded Evaluation in Kazakhstan
- FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise Prediction
- FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
- From Charts to Code: A Hierarchical Benchmark for Multimodal Models
- Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation
- Omni-RewardBench: Toward a Comprehensive Evaluation of Generative Reward Models Across Modalities
- Iterative Dual-Model Alignment for Story Evaluation
- FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
- YIELD: A Large-Scale Dataset and Evaluation Framework for Information Elicitation Agents
- Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights
- PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering
- AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs
- LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs
- VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models
- ReproEvalCard: A Reporting Standard for Reproducible Evaluation of LLM Pipelines
- BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks
- MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs
- AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation
- ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios
- Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
- Quantifying Metric and Model Agreement in Bias Evaluation of Large Language Models
- MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
- Bidirectional LMs are Better Knowledge Memorizers? A Benchmark for Real-world Knowledge Injection
- From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation
- Subject-level Inference for Realistic Text Anonymization Evaluation
- VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs
- CaseFacts: A Benchmark for Legal Fact-Checking and Precedent Retrieval
- Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation
- Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
- Tracing Logit Trajectories Across Layer Depth: Dataset-Level Explainability for Language Models
- AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following
- PRiSM: Benchmarking Phone Realization in Speech Models
- Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks
- Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations
- Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts
- EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation
- CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
- When Bigger Isn’t Better: A Comprehensive Fairness Evaluation of Political Bias in Multi-News Summarisation
- Region-Grounded Report Generation for 3D Medical Imaging: A Fine-Grained Dataset and Graph-Enhanced Framework
- Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems
- MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
- SubTokenTest: A Practical Benchmark for Real-World Sub-token Understanding
- Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders
- League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
- RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora
- SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks
- Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning
- HSCodeComp: A Realistic and Expert-level Agent Benchmark for Hierarchical Rule Application
- Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
- USB: A COMPREHENSIVE AND UNIFIED SAFETY EVALUATION BENCHMARK FOR MULTIMODAL LARGE LANGUAGE MODELS
- LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
- AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images
- The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models
- LexRel: Benchmarking Legal Relation Extraction for Chinese Civil Cases
- MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
- Community-Aware Assessment of Social Textual Engagement and Resonance: A Human-Centric Perspective on User-Generated Content Evaluation
- EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
- MMAC: A Multilingual, Multimodal Alignment Framework for Cultural Grounding Evaluation
- Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
- Translation or Recitation? Calibrating Evaluation Scores for Machine Translation of Extremely Low-Resource Languages
- Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
- BrowseComp-Plus: A Fair and Disentangled Evaluation Benchmark for Deep Search Agents
- LitVISTA: A Benchmark for Narrative Orchestration in Literary Text
- Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
- InsLogicBench: An Argumentation Logic Grounded Benchmark for Complex Insurance Claims Adjudication
- A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions
- Automated Creativity Evaluation of Language Models Across Open-Ended Tasks
- Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling
- From Synthesis to Clinical Assistance: A Strategy-Aware Agent Framework for Autism Intervention based on Real Clinical Dataset
- MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
- Detoxification for LLM: From Dataset Itself
- LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
- IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
- Knowledge Beyond Language: Bridging the Gap in Multilingual Machine Unlearning Evaluation
- SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios
- ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints
- Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies
- JanusMM: A Benchmark for Self-Deprecation Understanding in Real-World Multimodal Conversations
- Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
- When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language Models
- GeoLaux: A Benchmark for Evaluating MLLMs’ Geometry Performance on Long-Step Problems Requiring Auxiliary Lines
- IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
- Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents
- CUB: Benchmarking Context Utilisation Techniques for Language Models
- MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
- Chart-MRAG: Benchmarking Multimodal Retrieval Augmented Generation on Chart-based Documents
- Revisiting Metric Reliability for Fine-grained Evaluation of Machine Translation and Summarization in Indian Languages
- CogEvolve: A Multimodal Benchmark for Evaluating Relational Reasoning in Semantic Extension
- Reliable Evaluation Protocol for Low-Precision Retrieval
- Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation
- TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking
- When More Words Say Less: Decoupling Length and Specificity in Image Description Evaluation
- SGVEF-LOOP: Coverage-Guided Progressive Topological Exploration and Fact-Grounded Metamorphic Evaluation for MCP Agents
- Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
- ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
- LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations
- DR-Arena: an Automated Evaluation Framework for Deep Research Agents
- Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
- Beyond Single View: A Comprehensive Benchmark for Medical Multimodal Large Language Models on Multi-Image Understanding
- Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry
- RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
- CompTab: A Comprehensive Benchmark for Real-World TableQA with Complex Reasoning and Irregular Tables
- Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards
- Benchmarking Deflection and Hallucination in Large Vision-Language Models
- Bloom-Eval: A Hierarchical Evaluation Benchmark for Automatic Survey Generation Based on Bloom’s Taxonomy
- FactVerse: A Benchmark for Factual Consistency in Interleaved Image–Text Generation
- EIFFEL: a novel benchmark to measure bias of English heavy training on French idiomatic expressions
- It’s High Time: A Survey of Temporal Question Answering
- Beyond Itinerary Planning—A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
- Persona-E²: A Human-Grounded Dataset for Personality-Shaped Emotional Responses to Textual Events
- Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation
- LongTutor: Benchmarking Large Language Models for Long-term Personalized Tutoring
- GOLEMcoref: A Multilingual Coreference Dataset of Fiction
- MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
- Controllable Contamination Detection for Reliable LLM Evaluation with Statistical Guarantees
- KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions
- PersonalityDBench: A Dataset for Personality Disorders - from Modeling to Controlled Generation
- Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline
- ArgGenBench: Benchmarking the Complex Controlled Argument Generation Capability of Large Language Models
- QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning
- OSCBench: Benchmarking Object State Change in Text-to-Video Generation
- Evaluation Pitfalls and Challenges in Multimedia Event Extraction
- Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models
- Can AI-Generated Persuasion Be Detected? Persuaficial Benchmark and AI vs. Human Linguistic Differences
- SwissGov-RSD: A Human-annotated, Cross-lingual Benchmark for Token-level Recognition of Semantic Differences Between Related Documents
- TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems
- How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities
- RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation
- A Survey of Inductive Reasoning for Large Language Models
- CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models
- CITE: Benchmarking Heterogeneous Text-Attributed Graph Models
- SAFO: Stable Adaptive Fairness Optimization for LLM-Based Social Survey Simulation
- GQLBench: A Large-Scale Cross-Domain, Cross-Dialect Benchmark for NL2GQL
- Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs
- Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
- MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
- RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation
- The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen Consultations
- PIArena: A Platform for Prompt Injection Evaluation
- ChemReason-Bench: Benchmarking Large Language Models for Procedural Reasoning in Experimental Chemistry
- CL²GEC: A Multi-Discipline Benchmark for Continual Learning in Chinese Literature Grammatical Error Correction
- CloneMem: Benchmarking Long-Term Memory for AI Clones
- VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
- MQM Re-Annotation: A Technique for Collaborative Evaluation of Machine Translation
- ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
- MMSciCode: Real-world Evaluation of Multilingual Multi-Discipline Scientific Research Coding
- GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
- DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality
- ClaimDB: A Fact Verification Benchmark over Large Structured Data
- PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media
- CASS: Nvidia to AMD Transpilation with Data, Models, and Benchmark
- SAHM: A Benchmark for Arabic Financial and Shari’ah-Compliant Reasoning
- Towards Intrinsic Interpretability of Large Language Models: A Survey of Design Principles and Architectures
- ScholaWrite: A Dataset of End-to-End Scholarly Writing
- E2EDev: Benchmarking Large Language Models in End-to-End Software Development Task
- Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs
- DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
- DefGen-Bench: A Benchmark for Chinese Criminal Defence Opinion Generation in LegalAI
- SMART: Evaluating LLMs’ Mathematical Reasoning via a Human Cognitive Process-Inspired Benchmark
- Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models
- EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
- Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction
- GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding
- LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient
- LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation
- SAD: A Large-Scale Strategic Argumentative Dialogue Dataset
- Pub-LawBench: Public-Oriented Benchmarking for LegalAI
- Diversity in Unity, Theory in Practice: Hierarchical Multitask Benchmarks for Chinese Minority Languages
- Test of Time: Rethinking Temporal Signal of Benchmark Contamination
- IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation
- VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
- MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
- Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation
- Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation
- TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
- Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses
- HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns
- v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
- G-IdiomAlign: A Gloss-Pivoted Benchmark for Cross-Lingual Idiom Alignment
- HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
- EmoS: A High‑Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding
- HowToNarrate: A General-Domain Benchmark for Synchronized Video Narration with External Knowledge
- Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment
- False Friends or Cognates? A Cross-lingual Semantic Ambiguity Evaluation for Galician, Portuguese and Spanish
- A Survey of Deep Learning for Geometry Problem Solving
- NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise
- MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis
- Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
- Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
- GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs
- Revisiting Evaluation of Question Answering Systems in Low-Resource Indic Languages: Bridging Human and Metric Alignment
- UrbanGeoEval: A City-Scale Benchmark for Evaluating Large Language Models in Geospatial Reasoning
- GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap
- MirrorQA: Benchmarking Multimodal LLMs on Mirror-Orientation Reasoning
- DimABSA: Building Multilingual and Multidomain Datasets for Dimensional Aspect-Based Sentiment Analysis
- GeoRC: A Benchmark for Geolocation Reasoning Chains
- M³-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
- Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
- HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human–LLM Collaborative Writing
- CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language
- ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents
- Multimodal Safety Evaluation in Generative Agent Social Simulations
- Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation
- Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language Models
- Sign-Language Datasets at Scale: A Comprehensive Survey on Resources, Benchmarks, and Annotation Standards
- LLM4Cell: Taxonomy and Evaluation of LLM and Agentic Models for Single-Cell Biology
- RealChart2Code: Bridging the Gap in Real-World Chart-to-Code Generation via Multi-Task Evaluation
- VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking
- A Survey of Reasoning-Intensive Retrieval: Progress and Challenges
- LOGICAL-COMMONSENSEQA: A Benchmark for Logical Commonsense Reasoning
- PEAR: Pairwise Evaluation for Automatic Relative Scoring in Machine Translation
- Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams
- A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
- HypoEval: Hypothesis-Guided Evaluation for Natural Language Generation
- GCA Framework: A GCC Countries–Grounded Dataset and Agentic Pipeline for Climate Decision Support
- Explain the Synth: Interpretable Evaluation of LLM Data Synthesis
- Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
- Simple Agents, Biased Judges: Efficient Multi-Party Dialogue Generation & The Evaluation Gap
- Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety
- ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services
- PodBench: A Comprehensive Benchmark for Instruction-Aware Audio-Oriented Podcast Script Generation
- A Survey of Large Language Models for Text-Guided Molecular Discovery: From Molecule Generation to Optimization
- OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation
- CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation
- POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
- ReTRE: Benchmarking LLM Transfer Robustness with Structure-Preserving Variants
- Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding
- Automatic and Reliable Evaluation for Academic Caption-to-Figure Generation with LMMs
- AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
- INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
- DAC-Bench: A Decision-Aware Benchmark for Compositional Mobile GUI Tasks
- Benchmarking Fine-Grained Error Detection in Multimodal Reasoning
- When Benchmarks Leak: Inference-Time Decontamination for LLMs
- MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
- PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts
- Revealing the Seen, Imagining the Beyond: A Survey of Image-Grounded Chain-of-Thought Reasoning in Multimodal LLMs
- OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Models
- TwiUSD: A Benchmark Dataset and Structure-Aware LLM Framework for User Stance Detection
- Perception, Understanding and Reasoning: A Multimodal Benchmark for Video Fake News Detection
- JARVIS or Ultron? A Survey on the Safety and Security Threats of Computer-Using Agents
- SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation
- SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models
- LLM-Based Multi-Agent Systems for Clinical Workflows: A Survey of AI Hospitals
- Mind’s Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
- Interpretable Coreference Resolution Evaluation Using Explicit Semantics
- When High Accuracy Hides Poor Calibration: Rethinking Confidence Evaluation in Transformer-Based Text Classification with Balanced Brier Score
- CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models
- From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding
- BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
- Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
- MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse Events
- TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
- From Words to Pixels: A Comprehensive Survey on Large Language Models in Visual Segmentation
- TabReX: Tabular Referenceless eXplainable Evaluation
- From Word Sequences to Behavioral Sequences: Adapting Modeling and Evaluation Paradigms for Longitudinal NLP
- Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations
- Toward Robust Evaluation for Multilingual Grammatical Error Correction: Can Large Language Models Replace Human References?
- MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
- REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
- A Multilingual Social Bias Benchmark Incorporating Thinking Processes
- NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks
- Macaron: Controlled, Human-Written Benchmark for Multilingual and Multicultural Reasoning via Template-Filling
- Towards a Mechanistic Understanding of Large Reasoning Models: A Survey of Training, Inference, and Failures
- JurisBench: A Deep Benchmark for Assessing Large Language Models in Professional Legal Practice