R
Published on

ICLR 2026 — Trust & Safety

Trust & Safety

442 papers (0 oral)

Benchmarking Empirical Privacy Protection for Adaptations of Large Language Models

Invisible Safety Threat: Malicious Finetuning for LLM via Steganography

The Shape of Adversarial Influence: Characterizing LLM Latent Spaces with Persistent Homology

Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning

LLM Fingerprinting via Semantically Conditioned Watermarks

Modality-free Graph In-context Alignment

Learning with Dual-level Noisy Correspondence for Multi-modal Entity Alignment

GLASS Flows: Efficient Inference for Reward Alignment of Flow and Diffusion Models

EigenBench: A Comparative Behavioral Measure of Value Alignment

SWINGARENA: Adversarial Programming Arena for Long-context GitHub Issue Solving

SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety

Train-before-Test Harmonizes Language Model Rankings

SAFETY-GUIDED FLOW (SGF): A UNIFIED FRAMEWORK FOR NEGATIVE GUIDANCE IN SAFE GENERATION

RedTeamCUA: Realistic Adversarial Testing of Computer-Use Agents in Hybrid Web-OS Environments

CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering

Spherical Watermark: Encryption-Free, Lossless Watermarking for Diffusion Models

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

6. Enhancing Sparse Event Detection in Healthcare Time-Series via Adaptive Gate of Context–Detail Interaction

  • Topics: Medical & Healthcare

SafeMoE: Safe Fine-Tuning for MoE LLMs by Aligning Harmful Input Routing

12. FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents

  • Topics: LLMs & Foundation Models, Agents & Tool Use, Data-centric & Curation

BA-LoRA: Bias-Alleviating Low-Rank Adaptation to Mitigate Catastrophic Inheritance in Large Language Models

16. GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation

  • Topics: Multi-modal & Vision-Language

Teach to Reason Safely: Policy-Guided Safety Tuning for MLRMs

32. Learning to Interpret Weight Differences in Language Models

  • Topics: LLMs & Foundation Models

AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework

SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment

Align-SAM: Seeking Flatter Minima for Better Cross-Subset Alignment

Dynamic Reflections: Probing Video Representations with Text Alignment

KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models

Alignment-Enhanced Integration of Connectivity and Spectral Sparsity in Dynamic Sparse Training of LLM

Learning Dynamics of Logits Debiasing for Long-Tailed Semi-Supervised Learning

Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding

PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment

Video-LevelGauge: Investigating Contextual Positional Bias in Video Language Models.

Token Alignment Heads: Unveiling Attention's Role in LLM Multilingual Translation

DVLA-RL: Dual-Level Vision–Language Alignment with Reinforcement Learning Gating for Few-Shot Learning

Privacy Beyond Pixels: Latent Anonymization for Privacy-Preserving Video Understanding

Privacy-Protected Causal Survival Analysis Under Distribution Shift

Reducing information dependency does not cause training data privacy. Adversarially non-robust features do.

Reliable Poisoned Sample Detection against Backdoor Attacks Enhanced by Sharpness Aware Minimization

GAVEL: Towards Rule-Based Safety through Activation Monitoring

Concept-Aware Privacy Mechanisms for Defending Embedding Inversion Attacks

TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models

Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence

Learning to Lie: Adversarial Attacks on Human-AI Teams and LLMs

Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models

Scalable Energy-Based Models via Adversarial Training: Unifying Discrimination and Generation

ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack

A Statistical Learning Perspective on Semi-dual Adversarial Neural Optimal Transport Solvers

Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks

When Thinking Backfires: Mechanistic Insights into Reason-induced Misalignment

Vision Language Models are Biased

Watermarking Diffusion Language Models

SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests

MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs

Assessing Robustness via Score-Based Adversarial Image Generation

414. Towards Anomaly-Aware Pre-Training and Fine-Tuning for Graph Anomaly Detection

  • Topics: LLMs & Foundation Models, Graph Neural Networks, Graphs & Combinatorial

FARI: Robust One-Step Inversion for Watermarking in Diffusion Models

From Evaluation to Defense: Advancing Safety in Video Large Language Models

STEDiff: Revealing the Spatial and Temporal Redundancy of Backdoor Attacks in Text-to-Image Diffusion Models

Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense

Robust Adversarial Quantification via Conflict-Aware Evidential Deep Learning

Benchmarking Stochastic Approximation Algorithms for Fairness-Constrained Training of Deep Neural Networks

Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization

SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks

BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models

Fine-Grained Privacy Extraction from Retrieval-Augmented Generation Systems by Exploiting Knowledge Asymmetry

PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm

WaterDrum: Watermark-based Data-centric Unlearning Metric

Efficient Adversarial Attacks on High-dimensional Offline Bandits

Learnability and Privacy Vulnerability are Entangled in a Few Critical Weights

Enabling Fine-Tuning of Direct Feedback Alignment via Feedback-Weight Matching

GradPCA: Leveraging NTK Alignment for Reliable Out-of-Distribution Detection

PALC: Preference Alignment via Logit Calibration

Implicit Bias and Loss of Plasticity in Matrix Completion: Depth Promotes Low-Rankness

Tackling Heavy-Tailed Q-Value Bias in Offline-to-Online Reinforcement Learning with Laplace-Robust Modeling

Steerable Adversarial Scenario Generation through Test-Time Preference Alignment

Aligned Agents, Biased Swarm: Measuring Bias Amplification in Multi-Agent Systems

Bridging Past and Future: Distribution-Aware Alignment for Time Series Forecasting

Towards Multimodal Time Series Anomaly Detection with Semantic Alignment and Condensed Interaction

On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

SELF-HARMONY: LEARNING TO HARMONIZE SELF-SUPERVISION AND SELF-PLAY IN TEST-TIME REINFORCEMENT LEARNING

Towards Understanding Valuable Preference Data for Large Language Model Alignment

Enforcing Axioms for AI Alignment under Loss-Based Rules

Representational Alignment Across Model Layers and Brain Regions with Multi-Level Optimal Transport

Enhancing Vision-Language Model with Unmasked Token Alignment

821. AB-UPT: Scaling Neural CFD Surrogates for High- Fidelity Automotive Aerodynamics Simulations via Anchored- Branched Universal Physics Transformers

  • Topics: LLMs & Foundation Models

822. Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

  • Topics: Diffusion Models & Generative AI, Computer Vision, Efficiency & Compression

DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment

Robust Preference Alignment via Directional Neighborhood Consensus

Adaptive Methods Are Preferable in High Privacy Settings: An SDE Perspective

How does the optimizer implicitly bias the model merging loss landscape?

Analyzing and Evaluating Unbiased Language Model Watermark

α\alpha-DPO: Robust Preference Alignment for Diffusion Models via α\alpha Divergence

NoisePrints: Distortion-Free Watermarks for Authorship in Private Diffusion Models

Adaptive Debiasing Tsallis Entropy for Test-Time Adaptation

Improving Semantic Proximity in Information Retrieval through Cross-Lingual Alignment

MOSAIC: Multi-Subject Personalized Generation via Correspondence-Aware Alignment and Disentanglement

NGS-Marker: Robust Native Watermarking for 3D Gaussian Splatting

SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense

Divide, Harmonize, Then Conquer It: Shooting Multi-Commodity Flow Problems with Multimodal Language Models

Harmonized Cone for Feasible and Non-conflict Directions in Training Physics-Informed Neural Networks

Hyperbolic Aware Minimization: Implicit Bias for Sparsity

Improving the Trade-off Between Watermark Strength and Speculative Sampling Efficiency for Language Models

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

Guided Speculative Inference for Efficient Test-Time Alignment of LLMs

Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks

ScaleCap: Scalable Image Captioning via Dual-Modality Debiasing

QPrompt-R1: Real-Time Reasoning for Domain-Generalized Semantic Segmentation via Group-Relative Query Alignment

Searching for Privacy Risks in LLM Agents via Simulation

SMOTE and Mirrors: Exposing Privacy Leakage from Synthetic Minority Oversampling

Towards Privacy-Guaranteed Label Unlearning in Vertical Federated Learning: Few-Shot Forgetting Without Disclosure

DeRaDiff: Denoising Time Realignment of Diffusion Models

Prediction with Expert Advice under Local Differential Privacy

Fairness via Independence: A General Regularization Framework for Machine Learning

PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach

GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver

Annotation-Efficient Honesty Alignment via Confidence Elicitation and Calibration

Fairness-Aware Multi-view Evidential Learning with Adaptive Prior

Test-Time Poisoned Sample Detection by Exploiting Shallow Malicious Matching in Backdoored CLIP

On the Impossibility of Separating Intelligence from Judgment: The Computational Intractability of Filtering for AI Alignment

Towards Sequence Modeling Alignment between Tokenizer and Autoregressive Model

AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models

Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training

CodeGenGuard: A Watermark for Code Generation Models

From Sure" to Sorry": Detecting Jailbreak in Large Vision Language Model via JailNeurons

On the Interaction of Compressibility and Adversarial Robustness

Automatic Dialectic Jailbreak: A Framework for Generating Effective Jailbreak Strategies

When Flatness Does (Not) Guarantee Adversarial Robustness

Beyond Match Maximization and Fairness: Retention-Optimized Two-Sided Matching

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

STAR: Strategy-driven Automatic Jailbreak Red-teaming For Large Language Model

Fair Graph Machine Learning under Adversarial Missingness Processes

BiasScope: Towards Automated Detection of Bias in LLM-as-a-Judge Evaluation

Pretrain–Test Task Alignment Governs Generalization in In-Context Learning

BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses

LLMS ON TRIAL: Evaluating Judicial Fairness For Large Language Models

Superficial Safety Alignment Hypothesis

The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs

Learning Adaptive Distribution Alignment with Neural Characteristic Function for Graph Domain Adaptation

Architecture-Agnostic Test-Time Adaptation via Backprop-Free Embedding Alignment

GRADIEND: Feature Learning within Neural Networks Exemplified through Biases

Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model

Aligner, Diagnose Thyself: A Meta-Learning Paradigm for Fusing Intrinsic Feedback in Preference Alignment

Can SAEs reveal and mitigate racial biases of LLMs in healthcare?

Towards Cognitively-Faithful Decision-Making Models to Improve AI Alignment

When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training

Multi-objective Large Language Model Alignment with Hierarchical Experts

PAMDP: Interact to Persona Alignment via a Partially Observable Markov Decision Process

Breaking Safety Paradox with Feasible Dual Policy Iteration

PLANETALIGN: A Comprehensive Python Library for Benchmarking Network Alignment

Robust Spiking Neural Networks Against Adversarial Attacks

When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger

DistDF: Time-series Forecasting Needs Joint-distribution Wasserstein Alignment

ProSafePrune: Projected Safety Pruning for Mitigating Over-Refusal in LLMs

Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models

Meta-Learning Theory-Informed Inductive Biases using Deep Kernel Gaussian Processes

MindMix: A Multimodal Foundation Model for Auditory Perception Decoding via Deep Neural-Acoustic Alignment

Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance

Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check

Unified Vision–Language Modeling via Concept Space Alignment

Closing the Safety Gap: Surgical Concept Erasure in Visual Autoregressive Models

AMLRIS: Alignment-aware Masked Learning for Referring Image Segmentation

Transformers with Endogenous In-Context Learning: Bias Characterization and Mitigation

DeLiVR: Differential Spatiotemporal Lie Bias for Efficient Video Deraining

No, of Course I Can! Deeper Fine-Tuning Attacks That Bypass Token-Level Safety Mechanisms

Missingness Bias Calibration in Feature Attribution Explanations

Information Theoretic Guarantees For Policy Alignment In Large Language Models

1814. Adjusting Prediction Model Through Wasserstein Geodesic for Causal Inference

  • Topics: Efficiency & Compression

Decoupling Primitive with Experts: Dynamic Feature Alignment for Compositional Zero-Shot Learning

ORION: Decoupling and Alignment for Unified Autoregressive Understanding and Generation

GAPrune: Gradient-Alignment Pruning for Domain-Aware Embeddings

Path Matters: Unveiling Geometric Implicit Bias via Curvature-Aware Sparse View Optimization

Two-Way Is Better Than One: Bidirectional Alignment with Cycle Consistency for Exemplar-Free Class-Incremental Learning

Reversible Primitive–Composition Alignment for Continual Vision–Language Learning

Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence

Detecting Temporal Misalignment Attacks in Multimodal Fusion for Autonomous Driving

The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss

Exponential-Wrapped Mechanisms: Differential Privacy on Hadamard Manifolds Made Practical

Membership Privacy Risks of Sharpness Aware Minimization

Unified Privacy Guarantees for Decentralized Learning via Matrix Factorization

PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints

Beyond Membership: Limitations of Add/Remove Adjacency in Differential Privacy

AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models

Understanding Sensitivity of Differential Attention through the Lens of Adversarial Robustness

Defending against Backdoor Attacks via Module Switching

SecP-Tuning: Efficient Privacy-Preserving Prompt Tuning for Large Language Models via MPC

Structurally Human, Semantically Biased: Detecting LLM-Generated References with Embeddings and GNNs

RESFL: An Uncertainty-Aware Framework for Responsible Federated Learning by Balancing Privacy, Fairness and Utility

Online Conformal Prediction with Adversarial Semi-bandit Feedback via Regret Minimization

MUSE: Model-Agnostic Tabular Watermarking via Multi-Sample Selection

Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning

DRIFT: Divergent Response in Filtered Transformations for Robust Adversarial Defense

DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation

Priors in time: Missing inductive biases for language model interpretability

OpenAgentSafety: A Comprehensive Framework For Evaluating Real-World AI Agent Safety

Bridging Fairness and Explainability: Can Input-Based Explanations Promote Fairness in Hate Speech Detection?

When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment

VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety

CompMarkGS: Robust Watermarking for Compressed 3D Gaussian Splatting

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

Robust Deep Reinforcement Learning against Adversarial Behavior Manipulation

SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

Closed-form ℓr\ell_r norm scaling with data for overparameterized linear regression and diagonal linear networks under ℓp\ell_p bias

Cultivating Pluralism In Algorithmic Monoculture: The Community Alignment Dataset

Gradient Intrinsic Dimensionality Alignment:Narrowing The Gap Between Low-Rank Adaptation and Full Fine-Tuning

Unbiased Gradient Estimation for Event Binning via Functional Backpropagation

Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners

Adaptive Data-Knowledge Alignment in Genetic Perturbation Prediction

Primal-Dual Policy Optimization for Linear CMDPs with Adversarial Losses

Reward Model Routing in Alignment

Improving Human-AI Coordination through Online Adversarial Training and Generative Models

Latent Wasserstein Adversarial Imitation Learning

Model Predictive Adversarial Imitation Learning for Planning from Observation

Watermark-based Attribution of AI-Generated Content

Measuring and Mitigating Rapport Bias of Large Language Models under Multi-Agent Social Interactions

Bures-Isotropy Alignment: Manifold Learning of Generalized Category Discovery

HarmonyGNNs: Harmonizing Heterophily and Homophily in GNNs via Self-Supervised Node Encoding

Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization

TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

Representation Alignment for Diffusion Transformers without External Components

PCPO: Proportionate Credit Policy Optimization for Preference Alignment of Image Generation Models

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

Tug-of-War No More: Harmonizing Accuracy and Robustness in Vision-Language Models via Stability-Aware Task Vector Merging

Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment

Only Brains Align with Brains: Cross-Region Alignment Patterns Expose Limits of Normative Models

Low-Pass Filtering Improves Behavioral Alignment of Vision Models

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

Debiased and Denoised Representation Learning for Incomplete Multi-view Clustering

NAIPv2: Debiased Pairwise Learning for Efficient Paper Quality Estimation

Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs

The Alignment Waltz: Jointly Training Agents to Collaborate for Safety

Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction

An Ensemble Framework for Unbiased Language Model Watermarking

Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Reasoning Large Language Models

Debiased Front-Door Learners for Heterogeneous Effects

SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training

SIGMark: Scalable In-Generation Watermark with Blind Extraction for Video Diffusion

Reconstruction Alignment Improves Unified Multimodal Models

Relationship Alignment for View-aware Multi-view Clustering

UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels

LCA: Local Classifier Alignment for Continual Learning

Towards One-step Causal Video Generation via Adversarial Self-Distillation

HiTeA: Hierarchical Temporal Alignment for Training-Free Long-Video Temporal Grounding

Shuffling the Data, Extrapolating the Step: Sharper Bias In Constant Step-Size SGD

Inconsistency Biases in Dynamic Data Pruning

IA2: Alignment with ICL Activations improves Supervised Fine-Tuning

Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment

Operationalizing Data Minimization for Privacy-Preserving LLM Prompting

Natural Identifiers for Privacy and Data Audits in Large Language Models

Mitigating Privacy Risk via Forget Set-Free Unlearning

Winter Soldier: Backdooring Language Models at Pre-Training with Indirect Data Poisoning

INO-SGD: Addressing Utility Imbalance under Individualized Differential Privacy

Convergent Differential Privacy Analysis for General Federated Learning

Don't Shift the Trigger: Robust Gradient Ascent for Backdoor Unlearning

Adversarial Déjà Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks

Inference-Time Personalized Safety Control via Paired Difference-in-Means Intervention

Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference

JULI: Jailbreak Large Language Models by Self-Introspection

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

Diffusion & Adversarial Schrödinger Bridges via Iterative Proportional Markovian Fitting

On the trade-off between expressivity and privacy in graph representation learning

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods

Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs

GraphShield: Graph-Theoretic Modeling of Network-Level Dynamics for Robust Jailbreak Detection

Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion

Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework

Robust Adversarial Attacks Against Unknown Disturbance via Inverse Gradient Sample

Fine-Grained Class-Conditional Distribution Balancing for Debiased Learning

Doubly-Regressing Approach for Subgroup Fairness

Zero-Sacrifice Persistent-Robustness Adversarial Defense for Pre-Trained Encoders

Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth

Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study

Saddle-To-Saddle Dynamics in Deep ReLU Networks: Low-Rank Bias in the First Saddle Escape

Saddle-to-Saddle Dynamics Explains A Simplicity Bias Across Neural Network Architectures

When Bias Meets Trainability: Connecting Theories of Initialization

Property-Driven Protein Inverse Folding with Multi-Objective Preference Alignment

Fast and Interpretable Protein Substructure Alignment via Optimal Transport

RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks

AsyncBEV: Cross-modal flow alignment in Asynchronous 3D Object Detection

Mirage or Method? How Model–Task Alignment Induces Divergent RL Conclusions

ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents

Understanding the Implicit Biases of Design Choices for Time Series Foundation Models

GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving

Defending Against Unknown Corrupted Agents: Reinforcement Learning of Adversarially Robust Nash Equilibria

3399. SciTS: Scientific Time Series Understanding and Generation with LLMs

  • Topics: LLMs & Foundation Models, Graphs & Structured Data

Verification and Co-Alignment via Heterogeneous Consistency for Preference-Aligned LLM Annotations

RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment

Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning

What matters for Representation Alignment: Global Information or Spatial Structure?

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

Discrete Diffusion Trajectory Alignment via Stepwise Decomposition

The Matthew Effect of AI Programming Assistants: A Hidden Bias in Software Evolution

When Language Models Lose Their Mind: The Consequences of Brain Misalignment

Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization

JailNewsBench: Multi-Lingual and Regional Benchmark for Fake News Generation under Jailbreak Attacks

AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization

SAGA: Structural Aggregation Guided Alignment with Dynamic View and Neighborhood Order Selection for Multiview Graph Domain Adaptation

Humanline: Online Alignment as Perceptual Loss

DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning

Understanding and Improving Continuous LLM Adversarial Training via In-context Learning Theory

Dual-Branch Representations with Dynamic Gated Fusion and Triple-Granularity Alignment for Deep Multi-View Clustering

Beyond Instance-Level Alignment: Dual-Level Optimal Transport for Audio-Text Retrieval

On the Alignment Between Supervised and Self-Supervised Contrastive Learning

Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis

MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models

Verification of the Implicit World Model in a Generative Model via Adversarial Sequences

Expert Merging: Model Merging with Unsupervised Expert Alignment and Importance-Guided Layer Chunking

CHROMA: Consistent Harmonization of Multi-View Appearance via Bilateral Grid Prediction

Scaling Direct Feedback Learning with Jacobian Alignment Guarantees

Deep Latent Variable Model based Vertical Federated Learning with Flexible Alignment and Labeling Scenarios

Disentangling Length Bias in Preference Learning via Response-Conditioned Modeling

NatADiff: Adversarial Boundary Guidance for Natural Adversarial Diffusion

Noisy-Pair Robust Representation Alignment for Positive-Unlabeled Learning

EAMET: ROBUST MASSIVE MODEL EDITING VIA EMBEDDING ALIGNMENT OPTIMIZATION

Federated Learning of Quantile Inference under Local Differential Privacy

Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models

Dual-Path Condition Alignment for Diffusion Transformers

Transferable and Stealthy Adversarial Attacks on Large Vision-Language Models

Identifying Robust Neural Pathways: Few-Shot Adversarial Mask Tuning for Vision-Language Models

TriQDef: Disrupting Semantic and Gradient Alignment to Prevent Adversarial Patch Transferability in Quantized Neural Networks

Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

On Fairness of Task Arithmetic: The Role of Task Vectors

CheckMate! Watermarking Graph Diffusion Models in Polynomial Time

Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models

PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of mUlti-turn jailbrEaks

Adversarial Robustness of Graph Transformers

4040. Explainable Mixture Models through Differentiable Rule Learning

  • Topics: Interpretability & Mechanistic Interpretability

Sampling-aware Adversarial Attacks Against Large Language Models

WRING Out The Bias: A Rotation-Based Alternative To Projection Debiasing

CERTIFIED VS. EMPIRICAL ADVERSARIAL ROBUSTNESS VIA HYBRID CONVOLUTIONS WITH ATTENTION STOCHASTICITY

Reward Models Inherit Value Biases from Pretraining

Why Adversarially Train Diffusion Models?

FERD: Fairness-Enhanced Data-Free Adversarial Robustness Distillation

Are Deep Speech Denoising Models Robust to Adversarial Noise?

Concept-based Adversarial Attack: a Probabilistic Perspective

Fine-Grained Iterative Adversarial Attacks with Limited Computation Budget

THE SELF-RE-WATERMARKING TRAP: FROM EXPLOIT TO RESILIENCE

Implicit bias produces neural scaling laws in learning curves, from perceptrons to deep networks

Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges

Regulating Internal Alignment Flows for Robust Learning Under Spurious Correlations

Risk Phase Transitions in Spiked Regression: Alignment Driven Benign and Catastrophic Overfitting

JailbreakLoRA: Your Downloaded LoRA from Sharing Platforms might be Unsafe

Reasoning Boosts Opinion Alignment in LLMs

Bandit Learning in Matching Markets Robust to Adversarial Corruptions

Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime

Minor First, Major Last: A Depth-Induced Implicit Bias of Sharpness-Aware Minimization

GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance

Moving Beyond Medical Exams: A Clinician-Annotated Fairness Dataset of Real-World Tasks and Ambiguity in Mental Healthcare

Minimax Optimal Adversarial Reinforcement Learning

sleep2vec: Unified Cross-Modal Alignment for Heterogeneous Nocturnal Biosignals

Keep the Best, Forget the Rest: Reliable Alignment with Order-Aware Preference Optimization

ComPhy: Composing Physical Models with end-to-end Alignment

Test-Time Alignment for Large Language Models via Textual Model Predictive Control

Data Selection for LLM Alignment Using Fine-Grained Preferences

On the Tension Between Optimality and Adversarial Robustness in Policy Optimization

Learning From Dictionary: Enhancing Robustness of Machine-Generated Text Detection in Zero-Shot Language via Adversarial Training

Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment

Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models

Beyond Markovian Drifts: Action-Biased Geometric Walks with Memory for Personalized Summarization

In-Context Watermarks for Large Language Models

Jailbreak Transferability Emerges from Shared Representations

Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution

Near-Optimal Second-Order Guarantees for Model-Based Adversarial Imitation Learning

Discovering alternative solutions beyond the simplicity bias in recurrent neural networks

References Improve LLM Alignment in Non-Verifiable Domains

Entropy-Guided Dynamic Tokens for Graph-LLM Alignment in Molecular Understanding

BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment

Persona Features Control Emergent Misalignment

SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback

Nasty Adversarial Training: A Probability Sparsity Perspective for Robustness Enhancement

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds

TIGaussian: Disentangle Gaussians for Spatial-Awared Text-Image-3D Alignment

Adversarial Encoding Perturbation and Synthesis for Set Representation Auxiliary Learning

DR-Submodular Maximization with Stochastic Biased Gradients: Classical and Quantum Gradient Algorithms

FedMuon: Federated Learning with Bias-corrected LMO-based Optimization

SCAD: Super-Class-Aware Debiasing for Long-Tailed Semi-Supervised Learning

Diffusion Alignment as Variational Expectation-Maximization

Rethinking LoRA for Privacy-Preserving Federated Learning in Large Models

Improved Object-Centric Diffusion Learning with Registers and Contrastive Alignment

Traceable Black-Box Watermarks For Federated Learning

SABRE-FL: Selective and Accurate Backdoor Rejection for Federated Prompt Learning

Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment

A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space

Guidance Watermarking for Diffusion Models

Dissecting Representation Misalignment in Contrastive Learning via Influence Function

Discrete Latent Features Ablate Adversarial Attack: A Robust Prompt Tuning Framework for VLMs

Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

Eliciting Harmful Capabilities by Fine-Tuning on Safeguarded Outputs

Adaptive Logit Adjustment for Debiasing Multimodal Language Models

Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

FLoRG: Federated Fine-tuning with Low-rank Gram Matrices and Procrustes Alignment

A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models

Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer

Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs

Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots

Harnessing Hyperbolic Geometry for Harmful Prompt Detection and Sanitization

Bias Similarity Measurement: A Black-Box Audit of Fairness Across LLMs

Beyond Linear Probes: Dynamic Safety Monitoring for Language Models

The First Impression Problem: Internal Bias Triggers Overthinking in Reasoning Models

Beyond Pairwise: Empowering LLM Alignment With (Ranked) Choice Modeling

DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning

Remotely Detectable Robot Policy Watermarking

Unlocking the Value of Text: Event-Driven Reasoning and Multi-Level Alignment for Time Series Forecasting

ATGen: Adversarial Reinforcement Learning for Test Case Generation

IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment

Fluent Alignment with Disfluent Judges: Post-training for lower-resource languages

Is On-Policy Data always the Best Choice for Direct Preference Optimization-Based LM Alignment?

Learning to Generate Unit Test via Adversarial Reinforcement Learning

OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment

Emergent Misalignment is Easy, Narrow Misalignment is Hard

ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment

The Mind's Transformer: Computational Neuroanatomy of LLM-Brain Alignment

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

Multi-Marginal Flow Matching with Adversarially Learnt Interpolants

Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance

Optimizing Canaries for Privacy Auditing with Metagradient Descent

AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning

Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models

An Improved Model-free Decision-estimation Coefficient with Applications in Adversarial MDPs

It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization

Feature compression is the root cause of adversarial fragility in neural networks

Deconstructing Positional Information: From Attention Logits to Training Biases

From Gradient Volume to Shapley Fairness: Towards Fair Multi-Task Learning