R
Published on

ICLR 2026 — Diffusion Models & Generative AI

Diffusion Models & Generative AI

672 papers (0 oral)

Half-order Fine-Tuning for Diffusion Model: A Recursive Likelihood Ratio Optimizer

Invisible Safety Threat: Malicious Finetuning for LLM via Steganography

Improving Diffusion Models for Class-imbalanced Training Data via Capacity Manipulation

Let Features Decide Their Own Solvers: Hybrid Feature Caching for Diffusion Transformers

DiffusionNFT: Online Diffusion Reinforcement with Forward Process

Universal Inverse Distillation for Matching Models with Real-Data Supervision (No GANs)

GLASS Flows: Efficient Inference for Reward Alignment of Flow and Diffusion Models

Neon: Negative Extrapolation From Self-Training Improves Image Generation

Generative Human Geometry Distribution

P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling

Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation

SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer

Generative Universal Verifier as Multimodal Meta-Reasoner

Partition Generative Modeling: Masked Modeling Without Masks

NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale

VibeVoice: Expressive Podcast Generation with Next-Token Diffusion

Exploratory Diffusion Model for Unsupervised Reinforcement Learning

Pareto-Conditioned Diffusion Models for Offline Multi-Objective Optimization

Compositional Diffusion with Guided search for Long-Horizon Planning

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

Diffusion Language Model Knows the Answer Before It Decodes

On the Reasoning Abilities of Masked Diffusion Language Models

Planner Aware Path Learning in Diffusion Language Models Training

MotionStream: Real-Time Video Generation with Interactive Motion Controls

TRACE: Your Diffusion Model is Secretly an Instance Edge Detector

Quotient-Space Diffusion Models

The Spacetime of Diffusion Models: An Information Geometry Perspective

Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute

Structured Flow Autoencoders: Learning Structured Probabilistic Representations with Flow Matching

Spherical Watermark: Encryption-Free, Lossless Watermarking for Diffusion Models

MADFormer\textit{MADFormer}: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation

10. ARINBEV: Bird's-Eye View Layout Estimation with Conditional Autoregressive Model

  • Topics: LLMs & Foundation Models

Forget Many, Forget Right: Scalable and Precise Concept Unlearning in Diffusion Models

Dynamic Classifier-Free Diffusion Guidance via Online Feedback

I-DRUID: Layout to image generation via instance-disentangled representation and unpaired data

GDR-learners: Orthogonal Learning of Generative Models for Potential Outcomes

Error as Signal: Stiffness-Aware Diffusion Sampling via Embedded Runge-Kutta Guidance

Multi-Scale Diffusion-Guided Graph Learning with Power-Smoothing Random Walk Contrast for Multi-View Clustering

LapFlow: Laplacian Multi-scale Flow Matching for Generative Modeling

Long-Text-to-Image Generation via Compositional Prompt Decomposition

Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?

FlowCast: Trajectory Forecasting for Scalable Zero-Cost Speculative Flow Matching

GRACE: Generative Representation Learning via Contrastive Policy Optimization

UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers

Turbo-DDCM: Fast and Flexible Zero-Shot Diffusion-Based Image Compression

ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks

CIAR: Interval-based Collaborative Decoding for Image Generation Acceleration

NeuralOS: Towards Simulating Operating Systems via Neural Generative Models

FSD-CAP: Fractional Subgraph Diffusion with Class-Aware Propagation for Graph Feature Imputation

MVCustom: Multi-View Customized Diffusion via Geometric Latent Rendering and Completion

UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings

MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement

D-AR: Diffusion via Autoregressive Models

Diffusion Models as Dataset Distillation Priors

Detecting and Mitigating Memorization in Diffusion Models through Anisotropy of the Log-Probability

Recover Cell Tensor: Diffusion-Equivalent Tensor Completion for Fluorescence Microscopy Imaging

Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models

Beyond Uniformity: Sample and Frequency Meta Weighting for Post-Training Quantization of Diffusion Models

Cross-ControlNet: Training-Free Fusion of Multiple Conditions for Text-to-Image Generation

Gradient-Aligned Calibration for Post-Training Quantization of Diffusion Models

Point Prompting: Counterfactual Tracking with Video Diffusion Models

Bridging the Distribution Gap to Harness Pretrained Diffusion Priors for Super-Resolution

Score-Based Density Estimation from Pairwise Comparisons

RNE: plug-and-play diffusion inference-time control and energy-based training

Faster Diffusion Through Temporal Attention Decomposition

122. Video-As-Prompt: Unified Semantic Control for Video Generation

  • Topics: Diffusion Models & Generative AI, Robotics & Control

Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation

Enhanced Generative Model Evaluation with Clipped Density and Coverage

Native Adaptive Solution Expansion for Diffusion-based Combinatorial Optimization

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

Provably Accelerated Imaging with Restarted Inertia and Score-based Image Priors

Proximal Diffusion Neural Sampler

Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving

Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models

ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning

gen2seg: Generative Models Enable Generalizable Instance Segmentation

SceneTransporter: Optimal Transport-Guided Compositional Latent Diffusion for Single-Image Structured 3D Scene Generation

GenDR: Lighten Generative Detail Restoration

On the Mechanisms of Collaborative Learning in VAE Recommenders

Unveiling the Potential of Diffusion Large Language Model in Controllable Generation

Carré du champ flow matching: better quality-generalisation tradeoff in generative models

Stage-wise Dynamics of Classifier-Free Guidance in Diffusion Models

Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation

Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding

Diagnosing and Improving Diffusion Models by Estimating the Optimal Loss Value

ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping

Riemannian Variational Flow Matching for Material and Protein Design

Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models

Continual Unlearning for Text-to-Image Diffusion Models: A Regularization Perspective

Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization

UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models

Generalization of Diffusion Models Arises with a Balanced Representation Space

GGBall: Graph Generative Model on Poincaré Ball

Watermarking Diffusion Language Models

Provable Separations between Memorization and Generalization in Diffusion Models

Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance

Eliminating VAE for Fast and High-Resolution Generative Detail Restoration

Assessing Robustness via Score-Based Adversarial Image Generation

414. Towards Anomaly-Aware Pre-Training and Fine-Tuning for Graph Anomaly Detection

  • Topics: LLMs & Foundation Models, Graph Neural Networks, Graphs & Combinatorial

FARI: Robust One-Step Inversion for Watermarking in Diffusion Models

GeoDiv: Framework for Measuring Geographical Diversity in Text-to-Image Models

STEDiff: Revealing the Spatial and Temporal Redundancy of Backdoor Attacks in Text-to-Image Diffusion Models

SDErasure: Concept-Specific Trajectory Shifting for Concept Erasure via Adaptive Diffusion Classifier

Finite-Time Convergence Analysis of ODE-based Generative Models for Stochastic Interpolants

Early Signs of Steganographic Capabilities in Frontier LLMs

Towards Knowledge‑and‑Data‑Driven Organic Reaction Prediction: RAG‑Enhanced and Reasoning‑Powered Hybrid System with LLMs

Geometric Graph Neural Diffusion for Stable Molecular Dynamics Simulations

Shrinking Proteins with Diffusion

A Joint Diffusion Model with Pre-Trained Priors for RNA Sequence-Structure Co-Design

Online Decision Making with Generative Action Sets

STABLE: Shift-Tolerant Allocation via Black-Litterman Using Conditional Diffusion Estimates

WebArbiter: A Generative Reasoning Process Reward Model for Web Agents

Aurora: Towards Universal Generative Multimodal Time Series Forecasting

TS-DDAE: A Novel Temporal-Spectral Denoising Diffusion AutoEncoder for Wireless Signal Recognition Model Pre-training

Flow Caching for Autoregressive Video Generation

Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies

MemGen: Weaving Generative Latent Memory for Self-Evolving Agents

MAS2^2: Self-Generative, Self-Configuring, Self-Rectifying Multi-Agent Systems

Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles

FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark

Stroke3D: Lifting 2D strokes into rigged 3D model via latent diffusion models

Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

Scalable Spatio-Temporal SE(3) Diffusion for Long-Horizon Protein Dynamics

Flow Along the KK-Amplitude for Generative Modeling

Uncovering Semantic Selectivity of Latent Groups in Higher Visual Cortex with Mutual Information-Guided Diffusion

Uniform Discrete Diffusion with Metric Path for Video Generation

MoGen: Detailed Neuronal Morphology Generation via Point Cloud Flow Matching

Think Then Embed: Generative Context Improves Multimodal Embedding

Efficient Zero-shot Inpainting with Decoupled Diffusion Guidance

Latent Denoising Makes Good Tokenizers

MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation

NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment

Pretraining Scaling Laws for Generative Evaluations of Language Models

Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making

Much Ado About Noising: Dispelling the Myths of Generative Robotic Control

Fastcar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

WithAnyone: Toward Controllable and ID Consistent Image Generation

SIGMA-Gen: Structure and Identity Guided Multi-Subject Assembly for Image Generation

α\alpha-DPO: Robust Preference Alignment for Diffusion Models via α\alpha Divergence

VMDiff: Visual Mixing Diffusion for Limitless Cross-Object Synthesis

Autoregressive Image Generation with Randomized Parallel Decoding

Culture in Action: Evaluating Text-to-Image Models through Social Activities

Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model

Deconstructing Guidance: A Semantic Hierarchy for Precise Diffusion Model Editing

NoisePrints: Distortion-Free Watermarks for Authorship in Private Diffusion Models

Trust but Verify: Adaptive Conditioning for Reference-Based Diffusion Super-Resolution via Implicit Reference Correlation Modeling

Let LLMs Speak Embedding Languages: Generative Text Embeddings via Iterative Contrastive Refinement

OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot

SimpleGVR: A Simple Baseline for Latent-Cascaded Generative Video Super-Resolution

ImageRAG: Dynamic Image Retrieval for Reference-Guided Image Generation

DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models

FreeAdapt: Unleashing Diffusion Priors for Ultra-High-Definition Image Restoration

BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation

MoSA: Motion-Coherent Human Video Generation via Structure-Appearance Decoupling

VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation

Self-Forcing++: Towards Minute-Scale High-Quality Video Generation

Diffusion Negative Preference Optimization Made Simple

MIMIC: Mask-Injected Manipulation Video Generation with Interaction Control

PixNerd: Pixel Neural Field Diffusion

Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions

Learnable Sparsity for Vision Generative Models

LiveMoments: Reselected Key Photo Restoration in Live Photos via Reference-guided Diffusion

Generative Diffusion Prior Distillation for Long-Context Knowledge Transfer

CREPE: Controlling diffusion with REPlica Exchange

A Statistical Benchmark for Diffusion-Posterior-Sampling Algorithms

Distributionally Robust Optimization via Generative Ambiguity Modeling

DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation

ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs

TEST-TIME SCALING IN DIFFUSION LLMS VIA HIDDEN SEMI-AUTOREGRESSIVE EXPERTS

Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models

Variational Autoencoding Discrete Diffusion with Enhanced Dimensional Correlations Modeling

Your VAR Model is Secretly an Efficient and Explainable Generative Classifier

Avoid Catastrophic Forgetting with Rank-1 Fisher from Diffusion Models

GenCape: Structure-Inductive Generative Modeling for Category-Agnostic Pose Estimation

Taming Score-Based Denoisers in ADMM: A Convergent Plug-and-Play Framework

FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring

Consistent Text-to-Image Generation via Scene De-Contextualization

AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport

Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct

Membership Inference Attacks Against Fine-tuned Diffusion Language Models

Learn to Guide Your Diffusion Model

DriftLite: Lightweight Drift Control for Inference-Time Scaling of Diffusion Models

DeRaDiff: Denoising Time Realignment of Diffusion Models

On the Design of One-step Diffusion via Shortcutting Flow Paths

Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models

Noise-Adaptive Diffusion Sampling for Inverse Problems Without Task-Specific Tuning

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

SCOPED: Score–Curvature Out-of-distribution Proximity Evaluator for Diffusion

Scaling Laws for Diffusion Transformers

Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective

GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver

Texture Vector-Quantization and Reconstruction Aware Prediction for Generative Super-Resolution

ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding

ConfHit: Conformal Generative Design with Oracle-Free Guarantees

Edit-Based Flow Matching for Temporal Point Processes

Fine-Tuning Diffusion Models via Intermediate Distribution Shaping

AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models

TrajFlow: Nation-wide Pseudo GPS Trajectory Generation with Flow Matching Models

Flow Matching with Semidiscrete Couplings

Forward-Learned Discrete Diffusion: Learning how to noise to denoise faster

HoloPart: Generative 3D Part Amodal Segmentation

Projected Coupled Diffusion for Test-Time Constrained Joint Generation

AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size

Low-Rank Few-Shot Node Classification by Node-Level Graph Diffusion

GenCtrl -- A Formal Controllability Toolkit for Generative Models

The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs

Constrained Diffusion for Protein Design with Hard Structural Constraints

MarS-FM: Generative Modeling of Molecular Dynamics via Markov State Models

Iterative Distillation for Reward-Guided Fine-Tuning of Diffusion Models in Biomolecular Design

BioMD: All-atom Generative Model for Biomolecular Dynamics Simulation

Enhancing Diffusion-Based Sampling with Molecular Collective Variables

Mirror Flow Matching with Heavy-Tailed Priors for Generative Modeling on Convex Domains

Flow Matching Policy Gradients

Improving 2D Diffusion Models for 3D Medical Imaging with Inter‑Slice Consistent Stochasticity

Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning

Contractive Diffusion Policies

Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation

Block-wise Adaptive Caching for Accelerating Diffusion Policy

Masked Generative Policy for Robotic Control

Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion

HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denosing Diffusion Process

MMPD: Diverse Time Series Forecasting via Multi-Mode Patch Diffusion Loss

ICDiffAD: Implicit Conditioning Diffusion Model for Time Series Anomaly Detection

Revisiting Long-context Modeling from Context Denoising Perspective

Gauge Flow Matching: Efficient Constrained Generative Modeling over General Convex Set and Beyond

Reinforcing Diffusion Models by Direct Group Preference Optimization

Token-Based Audio Inpainting via Discrete Diffusion

SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation

Phantom-Data: Towards a General Subject-Consistent Video Generation Dataset

Ctrl-World: A Controllable Generative World Model for Robot Manipulation

A Noise is Worth Diffusion Guidance

AC-Sampler: Accelerate and Correct Diffusion Sampling with Metropolis-Hastings Algorithm

NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation

AlignSep: Temporally-Aligned Video-Queried Sound Separation with Flow Matching

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

Relational Feature Caching for Accelerating Diffusion Transformers

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

NewtonGen: Physics-consistent and Controllable Text-to-Video Generation via Neural Newtonian Dynamics

VMoBA: Mixture-of-Block Attention for Video Diffusion Models

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Latent Diffusion Model without Variational Autoencoder

TINKER: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization

Towards Better Optimization For Listwise Preference in Diffusion Models

DiffSDA: Unsupervised Diffusion Sequential Disentanglement Across Modalities

Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models

Learning Patient-Specific Disease Dynamics With Latent Flow Matching For Longitudinal Imaging Generation

Scale-wise Distillation of Diffusion Models

CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design

Light-X: Generative 4D Video Rendering with Camera and Illumination Control

Purrception: Variational Flow Matching for Vector-Quantized Image Generation

Time-to-Move: Training-Free Motion-Controlled Video Generation via Dual-Clock Denoising

Realtime Video Frame Interpolation using One-Step Diffusion Sampling

Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection

ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion

PQGAN: Product-Quantised Image Representation for High-Quality Image Synthesis

STORK: Faster Diffusion and Flow Matching Sampling by Resolving both Stiffness and Structure-Dependence

CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models

3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation

Target-Aware Video Diffusion Models

Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model

DiffPBR: Point-Based Rendering via Spatial-Aware Residual Diffusion

Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching

G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior

Condition Matters in Full-head 3D GANs

Clustering by Denoising: Latent plug-and-play diffusion for single-cell embeddings

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

DoFlow: Flow-based Generative Models for Interventional and Counterfactual Forecasting on Time Series

On Discriminative vs. Generative classifiers: Rethinking MLLMs for Action Understanding

Beyond Text-to-Image: Liberating Generation with a Unified Discrete Diffusion Model

Automatic Image-Level Morphological Trait Annotation for Organismal Images

Generative Bayesian Optimization: Generative Models as Acquisition Functions

Constrained Decoding of Diffusion LLMs with Context-Free Grammars

Cross-Timestep: 3D Diffusion Model with Trans-temporal Memory LSTM and Adaptive Priori Decoding Strategy for Medical Segmentation

Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models

FSOD-VFM: Few-Shot Object Detection with Vision Foundation Models and Graph Diffusion

Divergence-Free Neural Networks with Application to Image Denoising

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

Adaptive Moments are Surprisingly Effective for Plug-and-Play Diffusion Sampling

Improving Classifier-Free Guidance in Masked Diffusion: Low-Dim Theoretical Insights with High-Dim Impact

Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning

SparseD: Sparse Attention for Diffusion Language Models

SoFlow: Solution Flow Models for One-Step Generative Modeling

TEN-DM: Topology-Enhanced Diffusion Model for Spatio-Temporal Event Prediction

DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation

A Study of Posterior Stability in Time-Series Latent Diffusion

The Diffusion Duality, Chapter II: Ψ\Psi-Samplers and Efficient Curriculum

Generative Modeling from Black-Box Corruptions via Self-Consistent Stochastic Interpolants

FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion

Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding

Sample Reward Soups: Query-efficient Multi-Reward Guidance for Text-to-Image Diffusion Models

Soft-Masked Diffusion Language Models

Diverse Text-to-Image Generation via Contrastive Noise Optimization

Composition of Pretrained Diffusion Models: A Logic-Based Calculus

Antithetic Noise in Diffusion Models

Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function

Dual-Solver: A Generalized ODE Solver for Diffusion Models with Dual Prediction

Patronus: Interpretable Diffusion Models with Prototypes

Generative Value Conflicts Reveal LLM Priorities

Denoising Neural Reranker for Recommender Systems

Learning Flexible Forward Trajectories for Masked Molecular Diffusion

Global and Local Topology-Aware Graph Generation via Dual Conditioning Diffusion

Controllable diffusion-based generation for multi-channel biological data

Doloris: Dual Conditional Diffusion Implicit Bridges with Sparsity Masking Strategy for Unpaired Single-Cell Perturbation Estimation

scDFM: Distributional Flow Matching Model for Robust Single-Cell Perturbation Prediction

Physics vs Distributions: Pareto Optimal Flow Matching with Physics Constraints

Incomplete Data, Complete Dynamics: A Diffusion Approach

Vid2World: Crafting Video Diffusion Models to Interactive World Models

Improving Human-AI Coordination through Online Adversarial Training and Generative Models

VITA: Vision-to-Action Flow Matching Policy

LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning

Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing

Planned Diffusion

ProteinAE: Protein Diffusion Autoencoders for Structure Encoding

Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers

NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization

Scaling Speech Tokenizers with Diffusion Autoencoders

Inpainting-Guided Policy Optimization for Diffusion Large Language Models

HiCache: A Plug-in Scaled-Hermite Upgrade for Taylor-Style Cache-then-Forecast Diffusion Acceleration

Representation Alignment for Diffusion Transformers without External Components

PCPO: Proportionate Credit Policy Optimization for Preference Alignment of Image Generation Models

CL-DPS: A Contrastive Learning Approach to Blind Nonlinear Inverse Problem Solving via Diffusion Posterior Sampling

Scaling Behavior of Discrete Diffusion Language Models

Functional MRI Time Series Generation via Wavelet-Based Image Transform and Spectral Flow Matching for Brain Disorder Identification

Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction

Quantization-Aware Diffusion Models For Maximum Likelihood Training

BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving

Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency

Diffusion Transformers with Representation Autoencoders

Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction

Astraea: A Token-wise Acceleration Framework for Video Diffusion Transformers

ZeroGR: A Generalizable and Scalable Framework for Zero-Shot Generative Retrieval

Conditionally Whitened Generative Models for Probabilistic Time Series Forecasting

GenSR: Symbolic regression based on equation generative space

Multi-agent Coordination via Flow Matching

ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask

Generative Blocks World: Moving Things Around in Pictures

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training

TTOM: Test-Time Optimization and Memorization for Compositional Video Generation

FastFlow: Accelerating The Generative Flow Matching Models with Bandit Inference

SIGMark: Scalable In-Generation Watermark with Blind Extraction for Video Diffusion

FilMaster: Bridging Cinematic Principles and Generative AI for Automated Film Generation

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

Object Fidelity Diffusion for Remote Sensing Image Generation

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation

MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

RefAny3D: 3D Asset-Referenced Diffusion Models for Image Generation

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

AdaViewPlanner: Adapting Video Diffusion Models for Viewpoint Planning in 4D Scenes

Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation

Streaming Autoregressive Video Generation via Diagonal Distillation

DiffVax: Optimization-Free Image Immunization Against Diffusion-Based Editing

Towards One-step Causal Video Generation via Adversarial Self-Distillation

Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control

Condition Errors Refinement in Autoregressive Image Generation with Diffusion Loss

MeanCache: From Instantaneous to Average Velocity for Accelerating Flow Matching Inference

BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

MoCa: Modeling Object Consistency for 3D Camera Control in Video Generation

ACCORD: Alleviating Concept Coupling through Dependence Regularization for Text-to-Image Diffusion Personalization

A Minimum Variance Path Principle for Accurate and Stable Score-Based Density Ratio Estimation

Source-Guided Flow Matching

From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation

Diffusion and Flow-based Copulas: Forgetting and Remembering Dependencies

There and Back Again: On the relation between Noise and Image Inversions in Diffusion Models

Rethinking Global Text Conditioning in Diffusion Transformers

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

Preserve and Personalize: Personalized Text-to-Image Diffusion Models without Distributional Drift

Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing

Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation

Gen-DFL: Decision-Focused Generative Learning for Robust Decision Making

ViMo: A Generative Visual GUI World Model for App Agents

Bridging Generalization Gap of Heterogeneous Federated Clients Using Generative Models

H2OFlow: Grounding Human-Object Affordances with 3D Generative Models and Dense Diffused Flows

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

Stochastic Self-Organization in Multi-Agent Systems

Spatial CAPTCHA: Generatively Benchmarking Spatial Reasoning for Human-Machine Differentiation

Hierarchy Decoding: A Training-free Parallel Decoding Strategy for Diffusion Large Language Models

KernelFusion: Zero-Shot Blind Super-Resolution via Patch Diffusion

DiffuDETR: Rethinking Detection Transformers with Denoising Diffusion Process

Massive Memorization with Hundreds of Trillions of Parameters for Sequential Transducer Generative Recommenders

DPad: Efficient Diffusion Language Models with Suffix Dropout

GoR: A Unified and Extensible Generative Framework for Ordinal Regression

FAST‑DIPS: Adjoint‑Free Analytic Steps and Hard‑Constrained Likelihood Correction for Diffusion‑Prior Inverse Problems

NeRV-Diffusion: Diffuse Implicit Neural Representation for Video Synthesis

Measurement Score-Based Diffusion Model

Entering the Era of Discrete Diffusion Models: A Benchmark for Schrödinger Bridges and Entropic Optimal Transport

VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip

Secure Inference for Diffusion Models via Unconditional Scores

Mitigating Semantic Collapse in Generative Personalization with Test-Time Embedding Adjustment

STEER AWAY FROM MODE COLLISIONS: IMPROVING COMPOSITION IN DIFFUSION MODELS

wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models

Steering Diffusion Models Towards Credible Content Recommendation

A Probabilistic Hard Concept Bottleneck for Steerable Generative Models

Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

Harpoon: Generalised Manifold Guidance for Conditional Tabular Diffusion

HOG-Diff: Higher-Order Guided Diffusion for Graph Generation

Co-occurring Associated REtained concepts in Diffusion Unlearning

Video-GPT via Next Clip Diffusion

Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference

Contrastive Diffusion Guidance for Spatial Inverse Problems

Topological Flow Matching

Bures-Wasserstein Flow Matching for Graph Generation

Diffusion & Adversarial Schrödinger Bridges via Iterative Proportional Markovian Fitting

VFScale: Intrinsic Reasoning through Verifier-Free Test-time Scalable Diffusion Model

A Unification of Discrete, Gaussian, and Simplicial Diffusion

Discovering and Steering Interpretable Concepts in Large Generative Music Models

Learning Energy-Based Generative Models via Potential Flow: A Variational Principle Approach to Probability Density Homotopy Matching

3112. Localizing Task Recognition and Task Learning in In-Context Learning via Attention Head Analysis

  • Topics: Other / Unclassified

Improving Black-Box Generative Attacks via Generator Semantic Consistency

TRACEDET: HALLUCINATION DETECTION FROM THE DECODING TRACE OF DIFFUSION LARGE LANGUAGE MODELS

Gradient Descent Dynamics of Rank-One Matrix Denoising

Continual Low-Rank Adapters for LLM-based Generative Recommender Systems

FragFM: Hierarchical Framework for Efficient Molecule Generation via Fragment-Level Discrete Flow Matching

h-MINT: Modeling Pocket-Ligand Binding with Hierarchical Molecular Interaction Network

OXtal: An All-Atom Diffusion Model for Organic Crystal Structure Prediction

MolEditRL: Structure-Preserving Molecular Editing via Discrete Diffusion and Reinforcement Learning

Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models

Latent-to-Data Cascaded Diffusion Models for Unconditional Time Series Generation

PINFDiT: Energy-Based Physics-Informed Diffusion Transformers for General-purpose Time Series Tasks

GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving

Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning

SpeechOp: Inference-Time Task Composition for Generative Speech Processing

Weak-to-Strong Diffusion with Reflection

Computational Bottlenecks for Denoising Diffusions

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

Discrete Diffusion Trajectory Alignment via Stepwise Decomposition

Market Games for Generative Models: Equilibria, Welfare, and Strategic Entry

TAVAE: A VAE with Adaptable Priors Explains Contextual Modulation in the Visual Cortex

Discrete Diffusion for Bundle Construction

Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task?

WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning

Any-Order Flexible Length Masked Diffusion

Guaranteed Simply Connected Mesh Reconstruction from an Unorganized Point Cloud

Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation

EA3D: Event-Augmented 3D Diffusion for Generalizable Novel View Synthesis

SpikeGen: Decoupled “Rods and Cones” Visual Representation Processing with Latent Generative Framework

La-Proteina: Atomistic Protein Generation via Partially Latent Flow Matching

Astra: General Interactive World Model with Autoregressive Denoising

GenCompositor: Generative Video Compositing with Diffusion Transformer

Mixture of Contexts for Long Video Generation

DistillKac: Few-Step Image Generation via Damped Wave Equations

Composition of Memory Experts for Diffusion World Models

Score-based Greedy Search for Structure Identification of Partially Observed Causal Models

Consistent Noisy Latent Rewards for Trajectory Preference Optimization in Diffusion Models

AttriCtrl: A Generalizable Framework for Controlling Semantic Attribute Intensity in Diffusion Models

VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis

Generative View Stitching

Arbitrary Generative Video Interpolation

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Mitigating Noise Shift in Denoising Generative Models with Noise Awareness Guidance

Concept-TRAK: Understanding how diffusion models learn concepts through concept attribution

BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models

MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models

Verification of the Implicit World Model in a Generative Model via Adversarial Sequences

RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning

EasyTune: Efficient Step-Aware Fine-Tuning for Diffusion-Based Motion Generation

SteinsGate: Adding Causality to Diffusions for Long Video Generation via Path Integral

Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings

Directional Textual Inversion for Personalized Text-to-Image Generation

LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference

BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching

Real-Time Motion-Controllable Autoregressive Video Diffusion

ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing

Generalized Compressed Sensing for Image Reconstruction with Diffusion Probabilistic Models

3760. In-Context Learning of Temporal Point Processes with Foundation Inference Models

  • Topics: Efficiency & Compression

Alternating Diffusion for Proximal Sampling with Zeroth Order Queries

ReSplat: Degradation-agnostic Feed-forward Gaussian Splatting via Self-guided Residual Diffusion

Diffusion-DFL: Decision-focused Diffusion Models for Stochastic Optimization

A Sharp KL Convergence Analysis for Diffusion Models under Minimal Assumptions

Strictly Constrained Generative Modeling via Split Augmented Langevin Sampling

Test-Time Scaling with Reflective Generative Model

NatADiff: Adversarial Boundary Guidance for Natural Adversarial Diffusion

Logit‑KL Flow Matching: Non‑Autoregressive Text Generation via Sampling‑Hybrid Inference

EnvSocial-Diff: A Diffusion-Based Crowd Simulation Model with Environmental Conditioning and Individual-Group Interaction

TEDM: Time Series Forecasting with Elucidated Diffusion Models

What Exactly Does Guidance Do in Masked Discrete Diffusion Models

DeepWeightFlow: Re-Basined Flow Matching for Generating Neural Network Weights

Text-Aware Image Restoration with Diffusion Models

Quartet of Diffusions: Structure-Aware Point Cloud Generation through Part and Symmetry Guidance

On the Interpolation Effect of Score Smoothing in Diffusion Models

Universal Multi-Domain Translation via Diffusion Routers

Energy-oriented Diffusion Bridge for Image Restoration with Foundational Diffusion Models

Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models

There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-Training

Dual-Path Condition Alignment for Diffusion Transformers

Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains

Delay Flow Matching

SPREAD: Sampling-based Pareto front Refinement via Efficient Adaptive Diffusion

Generalised Flow Maps for Few-Step Generative Modelling on Riemannian Manifolds

CheckMate! Watermarking Graph Diffusion Models in Polynomial Time

Foresight Diffusion: Improving Sampling Consistency in Predictive Diffusion Models

Why Adversarially Train Diffusion Models?

Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability

Are Deep Speech Denoising Models Robust to Adversarial Noise?

Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders

On Powerful Ways to Generate: Autoregression, Diffusion, and Beyond

PepTri: Tri-Guided All-Atom Diffusion for Peptide Design via Physics, Evolution, and Mutual Information

PoseX: AI Defeats Physics-based Methods on Protein Ligand Cross-Docking

SAIR: Enabling Deep Learning for Protein-Ligand Interactions with a Synthetic Structural Dataset

Interpolation-Based Conditioning of Flow Matching Models for Bioisosteric Ligand Design

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

FlowCast: Advancing Precipitation Nowcasting with Conditional Flow Matching

SigmaDock: Untwisting Molecular Docking with Fragment-Based SE(3) Diffusion

RIDER: 3D RNA Inverse Design with Reinforcement Learning-Guided Diffusion

An Optimal Diffusion Approach to Quadratic Rate-Distortion Problems: New Solution and Approximation Methods

Inference-Time Scaling of Discrete Diffusion Models via Importance Weighting and Optimal Proposal Design

GAS: Enhancing Reward-Cost Balance of Generative Model-assisted Offline Safe RL

One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning

GenCP: Towards Generative Modeling Paradigm of Coupled physics

Bridging Successor Measure and Online Policy Learning with Flow Matching-Based Representations

Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI

Abstracting Robot Manipulation Skills via Mixture-of-Experts Diffusion Policies

DAK-UCB: Diversity-Aware Prompt Routing for LLMs and Generative Models

Compositional Visual Planning via Inference-Time Diffusion Scaling

Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning

Confident and Adaptive Generative Speech Recognition via Risk Control

LongLive: Real-time Interactive Long Video Generation

Smarter Not Harder: Generative Process Evaluation with Intrinsic-Signal Driving and Ability‑Adaptive Reward Shaping

Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models

SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse–Linear Attention

SpatialHand: Generative Object Manipulation from 3D Prespective

Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution

Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM

BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment

Diffusion Language Models are Provably Optimal Parallel Samplers

DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding

Deforming Videos to Masks: Flow Matching for Referring Video Segmentation

Reconciling Visual Perception and Generation in Diffusion Models

SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback

RAPID3^3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

AttTok: Marrying Attribute Tokens with Generative Pre-trained Vision-Language Models towards Medical Image Understanding

Dichotomous Diffusion Policy Optimization

Rolling Forcing: Autoregressive Long Video Diffusion in Real Time

CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation

Frozen Priors, Fluid Forecasts: Prequential Uncertainty for Low-Data Deployment with Pretrained Generative Models

Evolutionary Caching to Accelerate Your Off-the-Shelf Diffusion Model

ReactID: Synchronizing Realistic Actions and Identity in Personalized Video Generation

Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective

Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization

DiCache: Let Diffusion Model Determine Its Own Cache

Anchor Frame Bridging for Coherent First-Last Frame Video Generation

Group Critical-token Policy Optimization for Autoregressive Image Generation

HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models

SPEED: Scalable, Precise, and Efficient Concept Erasure for Diffusion Models

SPRINT: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers

QVGen: Pushing the Limit of Quantized Video Generative Models

Arbitrary-Shaped Image Generation via Spherical Neural Field Diffusion

Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling

TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation

LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

WILD-Diffusion: A WDRO Inspired Training Method for Diffusion Models under Limited Data

Controllable Video Generation with Provable Disentanglement

From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation

Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer

Disentanglement of Variations with Multimodal Generative Modeling

PI-Light: Physics-Inspired Diffusion for Full-Image Relighting

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

Motion Prior Distillation in Time Reversal Sampling for Generative Inbetweening

TPDiff: Temporal Pyramid Video Diffusion Model

PreciseCache: Precise Feature Caching for Efficient and High-fidelity Video Generation

Test-Time Iterative Error Correction for Efficient Diffusion Models

CoDi: Subject-Consistent and Pose-Diverse Text-to-Image Generation

Latent Wavelet Diffusion For Ultra High-Resolution Image Synthesis

Disentangled Hierarchical VAE for 3D Human-Human Interaction Generation

TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models

DSA: Efficient Inference For Video Generation Models via Distributed Sparse Attention

Geometric Image Editing via Effects-Sensitive In-Context Inpainting with Diffusion Transformers

Scaling Sequence-to-Sequence Generative Neural Rendering

Query-Aware Flow Diffusion for Graph-Based RAG with Retrieval Guarantees

d2^2Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive Caching

Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models

Attention Is All You Need for KV Cache in Diffusion LLMs

Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall

FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models

Self-Speculative Masked Diffusions

Information Estimation with Discrete Diffusion

KinemaDiff: Towards Diffusion for Coherent and Physically Plausible Human Motion Prediction

LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale Diffusion Transformer

ProtoKV: Long-context Knowledges Are Already Well-Organized Before Your Query

Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs

One step further with Monte-Carlo sampler to guide diffusion better

Shortcut Diffusion Training with Cumulative Consistency Loss: An Optimal Control View

Animating the Uncaptured: Humanoid Mesh Animation with Video Diffusion Models

Diffusion Alignment as Variational Expectation-Maximization

DM4CT: Benchmarking Diffusion Models for Computed Tomography Reconstruction

Parallel Sampling from Masked Diffusion Models via Conditional Independence Testing

Neodragon: Mobile Video Generation Using Diffusion Transformer

Improved Object-Centric Diffusion Learning with Registers and Contrastive Alignment

High-dimensional Mean-Field Games by Particle-based Flow Matching

CardioComposer: Leveraging Differentiable Geometry for Compositional Control of Anatomical Diffusion Models

Multiplicative Diffusion Models: Beyond Gaussian Latents

EigenScore: OOD Detection using Posterior Covariance in Diffusion Models

SERUM: Simple, Efficient, Robust, and Unifying Marking for Diffusion-based Image Generation

Guidance Watermarking for Diffusion Models

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models

Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models

GDGB: A Benchmark for Generative Dynamic Text-Attributed Graph Learning

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

Pallatom-Ligand: an All-Atom Diffusion Model for Designing Ligand-Binding Proteins

Graph Diffusion Transformers are In-Context Molecular Designers

Polynomial Convergence of Riemannian Diffusion Models

SafeFlowMatcher: Safe and Fast Planning using Flow Matching with Control Barrier Functions

H3^3DP: Triply‑Hierarchical Diffusion Policy for Visuomotor Learning

Demystifying Robot Diffusion Policies: Action Memorization and a Simple Lookup Table Alternative

DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving

DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning

Geometry-aware 4D Video Generation for Robot Manipulation

Time-Gated Multi-Scale Flow Matching for Time-Series Imputation

GCGNet: Graph-Consistent Generative Network for Time Series Forecasting with Exogenous Variables

SE-Diff: Simulator and Experience Enhanced Diffusion Model for Comprehensive ECG Generation

GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent System

KL-Regularized Reinforcement Learning for Generative Modelling is Designed to Mode Collapse

What Generative Search Engines Like and How to Optimize Web Content Cooperatively

DreamOn: Diffusion Language Models For Code Infilling Beyond Fixed-size Canvas

CoCoDiff: Correspondence-Consistent Diffusion Model for Fine-grained Style Transfer

Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution Network for Few-step High-Fidelity Audio Generation

StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models

SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models

Guidance Matters: Rethinking the Evaluation Pitfall for Text-to-Image Generation

Score Distillation Beyond Acceleration: Generative Modeling from Corrupted Data

MindPilot: Closed-loop Visual Stimulation Optimization for Brain Modulation with EEG-guided Diffusion

Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts

iFusion: Integrating Dynamic Interest Streams via Diffusion Model for Click-Through Rate Prediction

Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models

Multi-Marginal Flow Matching with Adversarially Learnt Interpolants

Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers

Fast-dLLM v2: Efficient Block-Diffusion LLM

Landing with the Score: Riemannian Optimization through Denoising

SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling

Interleaving Reasoning for Better Text-to-Image Generation

CryoNet.Refine: A One-step Diffusion Model for Rapid Refinement of Structural Models with Cryo-EM Density Map Restraints

TrustGen: A Platform of Dynamic Benchmarking on the Trustworthiness of Generative Foundation Models

Implicit Regularisation in Diffusion Models: An Algorithm-Dependent Generalisation Analysis

Step-Aware Residual-Guided Diffusion for EEG Spatial Super-Resolution