R
Published on

ACL 2026 — Trust & Safety

Trust & Safety

181 papers Links not yet available — ACL proceedings pending on ACL Anthology.

  • MauBERT: Universal Phonetic Inductive Biases for Few-Shot Acoustic Units Discovery
  • Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
  • Efficient Provably Secure Linguistic Steganography via Range Coding
  • Anchored Sliding Window: Toward Robust and Imperceptible Linguistic Steganography
  • SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models
  • Identifying Bias in Machine-generated Text Detection
  • Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning
  • Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning
  • Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
  • Debiased Orthogonal Boundary-Driven Efficient Noise Mitigation
  • APPSI-139: A Parallel Corpus of English Application Privacy Policy Summarization and Interpretation
  • Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs
  • AFT-Tab: Adversarial Fine-Tuning for Tabular Data Synthesis with Long Text Columns
  • Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation
  • Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization
  • PII-Bench: Evaluating Query-Aware Privacy Protection Systems
  • Reasoning Structure Matters for Safety Alignment of Reasoning Models
  • Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion Models
  • Common to Whom? Regional Cultural Commonsense and LLM Bias in India
  • LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation
  • Compete to Complete: Co-opetition Adversarial Learning for Retrieval-Augmented Generation
  • LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
  • ContextLens: Modeling Imperfect Privacy and Safety Context for Legal Compliance
  • QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs
  • Empirical Analysis of Decoding Biases in Masked Diffusion Models
  • On the Hidden Objective Biases of Group-based Reinforcement Learning
  • SharedRequest: Privacy-Preserving Model‑Agnostic Inference for Large Language Models
  • Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS
  • All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG
  • Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
  • Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
  • JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
  • Enhancing the Transferability of Jailbreak Attacks on Large Language Models via Exploiting Reparameterization Invariance
  • GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
  • Detecting RAG Extraction Attack via Dual-Path Runtime Integrity Game
  • MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning
  • Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models
  • Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling
  • OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
  • SGT: Securing Open-Source LLMs Against Malicious Fine-tuning via Safety Guidance Trigger
  • GKnow: Measuring the Entanglement of Gender Bias and Factual Gender
  • Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
  • Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
  • Defenses Against Prompt Attacks Learn Surface Heuristics
  • Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
  • DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
  • XOXO: Stealthy Cross-Origin Context Poisoning Attacks against AI Coding Assistants
  • Provably Safe Offline-to-Online RL: Decoupling Learning from Data-Driven Safety Enforcement
  • SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs
  • AgentMark: Utility-Preserving Behavioral Watermarking for Agents
  • Stereotype Bias in a Bilingual Setting: A Culturally Grounded Evaluation in Kazakhstan
  • When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning
  • XMark: Reliable Multi-Bit Watermarking for LLM-Generated Texts
  • Attention Under Attack: Analog Noise Effects and Mechanistic Vulnerabilities in Transformer Models
  • Protecting Bystander Privacy via Selective Hearing in Audio LLMs
  • To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs
  • When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias
  • VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models
  • Query-Efficient Agentic Graph Extraction Attacks on GraphRAG Systems
  • CoLA: A Choice Leakage Attack Framework to Expose Privacy Risks in Subset Training
  • Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
  • Quantifying Metric and Model Agreement in Bias Evaluation of Large Language Models
  • Privacy-preserving Prosody Representation Learning
  • Activation-Guided Local Editing for Jailbreaking Attacks
  • Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning
  • Reference Attack: A New Cross-Modal Jailbreaking Attack against Multimodal Large Language Models
  • Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations
  • Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
  • Dynamics of Cognitive Heterogeneity: Investigating Behavioral Biases in Multi-Stage Supply Chains with LLM-Based Simulation
  • Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation
  • When Bigger Isn’t Better: A Comprehensive Fairness Evaluation of Political Bias in Multi-News Summarisation
  • NaturalSloth: Revisiting Denial-of-Service Attacks on Large Language Models
  • Preconditioned Test-Time Adaptation for Out-of-Distribution Debiasing in Narrative Generation
  • Backdoor Collapse: Eliminating Unknown Threats Via Known Backdoor Aggregation In Language Models
  • How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
  • Probing the Safety Robustness of LLMs in Latent Space
  • USB: A COMPREHENSIVE AND UNIFIED SAFETY EVALUATION BENCHMARK FOR MULTIMODAL LARGE LANGUAGE MODELS
  • Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
  • Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
  • CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models
  • Debiasing Reward Models via Causally Motivated Inference-Time Intervention
  • Steganography Beyond Pixels: Reimagining Image Steganography as Cross-Modal Linguistic Communication
  • Agent-based Substructure Counting under Local Differential Privacy
  • DEBAR: Mitigating Contextual Bias in Cross-Document Relation Extraction via Dual-Stream Decoupling
  • InsideOut: Measuring and Mitigating Insider–Outsider Bias in Interview Script Generation
  • Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models
  • Safe-FedLLM: Delving into the Safety of Federated Large Language Models
  • When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language Models
  • Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment
  • Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries
  • PRISP: Privacy-Safe Few-Shot Personalization via Lightweight Adaptation
  • MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
  • SafetyMem: Adaptive Jailbreak Defense via Dual-Component Safety Memory
  • CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
  • Jailbreaking Multimodal Large Language Models using Multi-Clip Video
  • Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation
  • Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
  • Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
  • TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment
  • Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
  • When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
  • SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models
  • You Can Have a Second Chance: Unbiased and Multi-bit Watermarking for Diffusion Language Models with Regret-based Remasking
  • OASIS: Mitigating Harmful Fine-tuning Attacks on LLMs via Orthogonal and Adaptive Safety Alignment Strategy
  • Fair-CCD: Mitigating Bias in Large Language Models for Tabular Classification Through Context-Contrastive Decoding
  • Selective Test-Time Debiasing for CLIP via Reward Gating
  • EIFFEL: a novel benchmark to measure bias of English heavy training on French idiomatic expressions
  • N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
  • On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
  • Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs
  • Detecting What Queries Seek: Steering LLM Safety with FFN Output Activation Monitoring
  • Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented Generation
  • Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks
  • Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks
  • Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications
  • The “Knowledge–Behavior Gap” in Cultural Taboo Safety of Large Language Models
  • TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems
  • ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
  • SAFO: Stable Adaptive Fairness Optimization for LLM-Based Social Survey Simulation
  • Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
  • Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
  • Defense Against Knowledge Poisoning Attack on GraphRAG
  • MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Knowledge Poisoning Attacks
  • Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop
  • Resolving the Security-Auditability Dilemma with Auditable Latent Chain-of-Thought Alignment
  • More Thinking, Less Talking: Internalizing Deliberative Safety into LLM Parameters
  • Conjunctive Prompt Attacks in Multi-Agent LLM Systems
  • SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
  • Confident, Calibrated, or Complicit: Safety Alignment and Ideological Bias in LLM Hate Speech Detection
  • New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMs
  • Can LLM Safety Be Ensured by Constraining Parameter Regions?
  • Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
  • SAME: Safety-Aware Model Editing Guided by Safety Transformation
  • ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization
  • User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios
  • Challenging the Explanation Based on Preceding Tokens: Discovering Transferable Non-Literal Biasing
  • SWAN: Semantic Watermarking with Abstract Meaning Representation
  • Framing Political Bias in Multilingual LLMs Across Pakistani Languages
  • SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking
  • The Side Effects of Being Smart: Safety Risks in MLLMs’ Multi-Image Reasoning
  • From TDMA to CDMA: A Multi-bit Watermark for Diffusion Language Models
  • FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation
  • When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
  • When Efficiency Becomes a Vulnerability: Computational Cost Attacks on WebAgents
  • BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes
  • BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
  • Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language Models
  • Mitigating Safety Context Amnesia in Multimodal Reasoning Models via Intent-Guided Safety Reasoning
  • Robust Membership Inference for Large Language Models under Adversarial Generative Corruption
  • DARM: Distribution-Aware Reward Modeling by Alleviating Biases from Low Preference-Context Dependency Data
  • ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs
  • LLM Safety From Within: Detecting Harmful Content with Internal Representations
  • Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
  • HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human–LLM Collaborative Writing
  • Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
  • LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
  • Multimodal Safety Evaluation in Generative Agent Social Simulations
  • SafeMT: Multi-turn Safety for Multimodal Language Models
  • Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation
  • AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
  • Simple Agents, Biased Judges: Efficient Multi-Party Dialogue Generation & The Evaluation Gap
  • Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety
  • FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs
  • A Lightweight Explainable Guardrail for Prompt Safety
  • Activation Decomposition and Steering for LLM Backdoor Remediation
  • Investigating Counterfactual Unfairness in LLMs towards Identities through Humor
  • Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
  • Don’t Corrupt the Fact: A Trustworthy RAG Watermarking Framework based on Dual Factual Shield
  • Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration
  • Adversarial Metric Learning for Fine-Grained Emotion Classification
  • SHARP: Self-adaptive Harmful Category-aware Prompt Generation for Black-box Jailbreaking
  • JARVIS or Ultron? A Survey on the Safety and Security Threats of Computer-Using Agents
  • Evaluating Structure-Aware Retrieval and Safety in Statute-Centric Legal QA
  • A Linguistics-Aware LLM Watermarking via Syntactic Predictability
  • Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning
  • Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
  • What About the Scene With the Hitler Reference? HAUNT: A Framework to Probe LLMs’ Self-consistency in Closed Domains Via Adversarial Nudge
  • ReasMark: A Robust Watermark for Attributing LLM Reasoning Under Knowledge Distillation Attacks
  • A Multilingual Social Bias Benchmark Incorporating Thinking Processes
  • TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards