- Published on
ACL 2026 — Trust & Safety
Trust & Safety
181 papers Links not yet available — ACL proceedings pending on ACL Anthology.
- MauBERT: Universal Phonetic Inductive Biases for Few-Shot Acoustic Units Discovery
- Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
- Efficient Provably Secure Linguistic Steganography via Range Coding
- Anchored Sliding Window: Toward Robust and Imperceptible Linguistic Steganography
- SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models
- Identifying Bias in Machine-generated Text Detection
- Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning
- Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning
- Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
- Debiased Orthogonal Boundary-Driven Efficient Noise Mitigation
- APPSI-139: A Parallel Corpus of English Application Privacy Policy Summarization and Interpretation
- Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs
- AFT-Tab: Adversarial Fine-Tuning for Tabular Data Synthesis with Long Text Columns
- Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation
- Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization
- PII-Bench: Evaluating Query-Aware Privacy Protection Systems
- Reasoning Structure Matters for Safety Alignment of Reasoning Models
- Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion Models
- Common to Whom? Regional Cultural Commonsense and LLM Bias in India
- LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation
- Compete to Complete: Co-opetition Adversarial Learning for Retrieval-Augmented Generation
- LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment
- ContextLens: Modeling Imperfect Privacy and Safety Context for Legal Compliance
- QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs
- Empirical Analysis of Decoding Biases in Masked Diffusion Models
- On the Hidden Objective Biases of Group-based Reinforcement Learning
- SharedRequest: Privacy-Preserving Model‑Agnostic Inference for Large Language Models
- Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS
- All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG
- Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
- Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization
- JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
- Enhancing the Transferability of Jailbreak Attacks on Large Language Models via Exploiting Reparameterization Invariance
- GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
- Detecting RAG Extraction Attack via Dual-Path Runtime Integrity Game
- MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning
- Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models
- Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling
- OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
- SGT: Securing Open-Source LLMs Against Malicious Fine-tuning via Safety Guidance Trigger
- GKnow: Measuring the Entanglement of Gender Bias and Factual Gender
- Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
- Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
- Defenses Against Prompt Attacks Learn Surface Heuristics
- Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
- DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
- XOXO: Stealthy Cross-Origin Context Poisoning Attacks against AI Coding Assistants
- Provably Safe Offline-to-Online RL: Decoupling Learning from Data-Driven Safety Enforcement
- SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs
- AgentMark: Utility-Preserving Behavioral Watermarking for Agents
- Stereotype Bias in a Bilingual Setting: A Culturally Grounded Evaluation in Kazakhstan
- When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning
- XMark: Reliable Multi-Bit Watermarking for LLM-Generated Texts
- Attention Under Attack: Analog Noise Effects and Mechanistic Vulnerabilities in Transformer Models
- Protecting Bystander Privacy via Selective Hearing in Audio LLMs
- To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs
- When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias
- VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models
- Query-Efficient Agentic Graph Extraction Attacks on GraphRAG Systems
- CoLA: A Choice Leakage Attack Framework to Expose Privacy Risks in Subset Training
- Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
- Quantifying Metric and Model Agreement in Bias Evaluation of Large Language Models
- Privacy-preserving Prosody Representation Learning
- Activation-Guided Local Editing for Jailbreaking Attacks
- Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning
- Reference Attack: A New Cross-Modal Jailbreaking Attack against Multimodal Large Language Models
- Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations
- Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
- Dynamics of Cognitive Heterogeneity: Investigating Behavioral Biases in Multi-Stage Supply Chains with LLM-Based Simulation
- Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation
- When Bigger Isn’t Better: A Comprehensive Fairness Evaluation of Political Bias in Multi-News Summarisation
- NaturalSloth: Revisiting Denial-of-Service Attacks on Large Language Models
- Preconditioned Test-Time Adaptation for Out-of-Distribution Debiasing in Narrative Generation
- Backdoor Collapse: Eliminating Unknown Threats Via Known Backdoor Aggregation In Language Models
- How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
- Probing the Safety Robustness of LLMs in Latent Space
- USB: A COMPREHENSIVE AND UNIFIED SAFETY EVALUATION BENCHMARK FOR MULTIMODAL LARGE LANGUAGE MODELS
- Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
- Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
- CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models
- Debiasing Reward Models via Causally Motivated Inference-Time Intervention
- Steganography Beyond Pixels: Reimagining Image Steganography as Cross-Modal Linguistic Communication
- Agent-based Substructure Counting under Local Differential Privacy
- DEBAR: Mitigating Contextual Bias in Cross-Document Relation Extraction via Dual-Stream Decoupling
- InsideOut: Measuring and Mitigating Insider–Outsider Bias in Interview Script Generation
- Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models
- Safe-FedLLM: Delving into the Safety of Federated Large Language Models
- When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language Models
- Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment
- Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries
- PRISP: Privacy-Safe Few-Shot Personalization via Lightweight Adaptation
- MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
- SafetyMem: Adaptive Jailbreak Defense via Dual-Component Safety Memory
- CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
- Jailbreaking Multimodal Large Language Models using Multi-Clip Video
- Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation
- Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
- Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
- TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment
- Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
- When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
- SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models
- You Can Have a Second Chance: Unbiased and Multi-bit Watermarking for Diffusion Language Models with Regret-based Remasking
- OASIS: Mitigating Harmful Fine-tuning Attacks on LLMs via Orthogonal and Adaptive Safety Alignment Strategy
- Fair-CCD: Mitigating Bias in Large Language Models for Tabular Classification Through Context-Contrastive Decoding
- Selective Test-Time Debiasing for CLIP via Reward Gating
- EIFFEL: a novel benchmark to measure bias of English heavy training on French idiomatic expressions
- N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
- On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
- Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs
- Detecting What Queries Seek: Steering LLM Safety with FFN Output Activation Monitoring
- Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented Generation
- Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks
- Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks
- Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications
- The “Knowledge–Behavior Gap” in Cultural Taboo Safety of Large Language Models
- TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems
- ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
- SAFO: Stable Adaptive Fairness Optimization for LLM-Based Social Survey Simulation
- Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
- Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
- Defense Against Knowledge Poisoning Attack on GraphRAG
- MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Knowledge Poisoning Attacks
- Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop
- Resolving the Security-Auditability Dilemma with Auditable Latent Chain-of-Thought Alignment
- More Thinking, Less Talking: Internalizing Deliberative Safety into LLM Parameters
- Conjunctive Prompt Attacks in Multi-Agent LLM Systems
- SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
- Confident, Calibrated, or Complicit: Safety Alignment and Ideological Bias in LLM Hate Speech Detection
- New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMs
- Can LLM Safety Be Ensured by Constraining Parameter Regions?
- Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
- SAME: Safety-Aware Model Editing Guided by Safety Transformation
- ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization
- User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios
- Challenging the Explanation Based on Preceding Tokens: Discovering Transferable Non-Literal Biasing
- SWAN: Semantic Watermarking with Abstract Meaning Representation
- Framing Political Bias in Multilingual LLMs Across Pakistani Languages
- SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking
- The Side Effects of Being Smart: Safety Risks in MLLMs’ Multi-Image Reasoning
- From TDMA to CDMA: A Multi-bit Watermark for Diffusion Language Models
- FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation
- When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
- When Efficiency Becomes a Vulnerability: Computational Cost Attacks on WebAgents
- BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes
- BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
- Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language Models
- Mitigating Safety Context Amnesia in Multimodal Reasoning Models via Intent-Guided Safety Reasoning
- Robust Membership Inference for Large Language Models under Adversarial Generative Corruption
- DARM: Distribution-Aware Reward Modeling by Alleviating Biases from Low Preference-Context Dependency Data
- ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs
- LLM Safety From Within: Detecting Harmful Content with Internal Representations
- Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
- HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human–LLM Collaborative Writing
- Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
- LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
- Multimodal Safety Evaluation in Generative Agent Social Simulations
- SafeMT: Multi-turn Safety for Multimodal Language Models
- Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation
- AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
- Simple Agents, Biased Judges: Efficient Multi-Party Dialogue Generation & The Evaluation Gap
- Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety
- FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs
- A Lightweight Explainable Guardrail for Prompt Safety
- Activation Decomposition and Steering for LLM Backdoor Remediation
- Investigating Counterfactual Unfairness in LLMs towards Identities through Humor
- Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
- Don’t Corrupt the Fact: A Trustworthy RAG Watermarking Framework based on Dual Factual Shield
- Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration
- Adversarial Metric Learning for Fine-Grained Emotion Classification
- SHARP: Self-adaptive Harmful Category-aware Prompt Generation for Black-box Jailbreaking
- JARVIS or Ultron? A Survey on the Safety and Security Threats of Computer-Using Agents
- Evaluating Structure-Aware Retrieval and Safety in Statute-Centric Legal QA
- A Linguistics-Aware LLM Watermarking via Syntactic Predictability
- Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning
- Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
- What About the Scene With the Hitler Reference? HAUNT: A Framework to Probe LLMs’ Self-consistency in Closed Domains Via Adversarial Nudge
- ReasMark: A Robust Watermark for Attributing LLM Reasoning Under Knowledge Distillation Attacks
- A Multilingual Social Bias Benchmark Incorporating Thinking Processes
- TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards