Diffusion-LM Improves Controllable Text Generation
2022/05/27 by Xiang Lisa Li, John Thickstun, Li, Xiang Lisa +8 · 226 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling #cs.AI #cs.CL #cs.LG
paper · pdf · doi:10.48550/arxiv.2205.14217
arxiv created 2022/05/27 · openalex publication_date 2022/05/27 · arxiv updated 2022/05/31 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
Controlling the behavior of language models (LMs) without re-training is a major open problem in natural language generation. While recent works have demonstrated successes on controlling simple sentence attributes (e.g., sentiment), there has been little progress on complex, fine-grained controls (e.g., syntactic structure). To address this challenge, we develop a new non-autoregressive language model based on continuous diffusions that we call Diffusion-LM. Building upon the recent successes of diffusion models in continuous domains, Diffusion-LM iteratively denoises a sequence of Gaussian vectors into word vectors, yielding a sequence of intermediate latent variables. The continuous, hierarchical nature of these intermediate variables enables a simple gradient-based algorithm to perform complex, controllable generation tasks. We demonstrate successful control of Diffusion-LM for six challenging fine-grained control tasks, significantly outperforming prior work.
Cited by
- dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning
- On the Role of Discreteness in Diffusion LLMs
- Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
- Lessons from Neuroscience for AI: How integrating Actions, Compositional Structure and Episodic Memory could enable Safe, Interpretable and Human-Like AI
- Reverse-Time Diffusion Processes for Discrete Time Linear and Nonlinear Systems with non-Gaussian Noise
- Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
- PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention
- TRE: Training-Free Hallucination Detection for Diffusion Language Models
- FRIGID: Scaling Diffusion-Based Molecular Generation from Mass Spectra at Training and Inference Time
- Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning
- IGDMRec: Behavior Conditioned Item Graph Diffusion for Multimodal Recommendation
- Corrective Diffusion Language Models
- DEER: Draft with Diffusion, Verify with Autoregressive Models
- Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
- LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
- Diffusion Language Model Inference with Monte Carlo Tree Search
- Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
- Guided Transfer Learning for Discrete Diffusion Models
- Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs
- PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning
- From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs
- dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
- Decoding Large Language Diffusion Models with Foreseeing Movement
- SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
- Masked Diffusion for Generative Recommendation
- Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
- CDLM: Consistency Diffusion Language Models For Faster Sampling
- Generation, Evaluation, and Explanation of Novelists' Styles with Single-Token Prompts
- REFLEX: Self-Refining Explainable Fact-Checking via Disentangling Truth into Style and Substance
- PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion
- Time Matters: Enhancing Sequential Recommendations with Time-Guided Graph Neural ODEs
- UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
- DiffuGR: Generative Document Retrieval with Diffusion Language Models
- Dynamic Population Distribution Aware Human Trajectory Generation with Diffusion Model
- Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction
- Diffusion Models at the Drug Discovery Frontier: A Review on Generating Small Molecules versus Therapeutic Peptides
- Optimal Convergence Analysis of DDPM for General Distributions
- Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
- Masked Diffusion Captioning for Visual Feature Learning
- Don't Let It Fade: Preserving Edits in Diffusion Language Models via Token Timestep Allocation
- Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
- From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models
- TGCM: Topic-Guided Consistency Modeling for One-Step Disentanglement of Interleaved APT Technique Sequences
- Information-Theoretic Discrete Diffusion
- Variational Masked Diffusion Models
- Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
- CANDI: Hybrid Discrete-Continuous Diffusion Models
- Attention Sinks in Diffusion Language Models
- From Masks to Worlds: A Hitchhiker's Guide to World Models
- Latent-Augmented Discrete Diffusion Models
- Soft-Masked Diffusion Language Models
- Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model
- Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning
- Attention Is All You Need for KV Cache in Diffusion LLMs
- Diffusion Models for Reinforcement Learning: Foundations, Taxonomy, and Development
- Unlocking the Potential of Diffusion Language Models through Template Infilling
- Discrete State Diffusion Models: A Sample Complexity Perspective
- Robust Learning of Diffusion Models with Extremely Noisy Conditions
- SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
- Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
- Guided Star-Shaped Masked Diffusion
- Next Semantic Scale Prediction via Hierarchical Diffusion Language Models
- Controllable Stylistic Text Generation with Train-Time Attribute-Regularized Diffusion
- Deep Generative Model for Human Mobility Behavior
- Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models
- Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
- ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs
- LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
- Exploring the Power of Diffusion Large Language Models for Software Engineering: An Empirical Investigation
- Diffusion-Assisted Distillation for Self-Supervised Graph Representation Learning with MLPs
- Self Speculative Decoding for Diffusion Large Language Models
- Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
- Drax: Speech Recognition with Discrete Flow Matching
- Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner
- Syntax-Guided Diffusion Language Models with User-Integrated Personalization
- Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability
- Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
- TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models
- RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
- Why mask diffusion does not work
- Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
- Alternatives To Next Token Prediction In Text Generation -- A Survey
- Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
- Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
- Diff-3DCap: Shape Captioning with Diffusion Models
- DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
- High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling
- Filtering with Confidence: When Data Augmentation Meets Conformal Prediction
- FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
- DynaFlow: Dynamics-embedded Flow Matching for Physically Consistent Motion Generation from State-only Demonstrations
- ELF: Embedded Language Flows
- MolMark: Safeguarding Molecular Structures through Learnable Atom-Level Watermarking
- Discrete-Time Diffusion-Like Models for Speech Synthesis
- Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- Variational Shape Inference for Grasp Diffusion on SE(3)
- DSFT: Inspiring Diffusion Large Language Models to Comprehend Mathematical and Logical Patterns
- AgentCTG: Harnessing Multi-Agent Collaboration for Fine-Grained Precise Control in Text Generation
- A Statistical Benchmark for Diffusion Posterior Sampling Algorithms
- Inpainting-Guided Policy Optimization for Diffusion Large Language Models
- Generative Diffusion Contrastive Network for Multi-View Clustering
- Astra: A Multi-Agent System for GPU Kernel Performance Optimization
- Painting the market: generative diffusion models for financial limit order book simulation and forecasting
- A Sharp KL-Convergence Analysis for Diffusion Models under Minimal Assumptions
- Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling
- Dream-Coder 7B: An Open Diffusion Language Model for Code
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- Reward-Weighted Sampling: Enhancing Non-Autoregressive Characteristics in Masked Diffusion LLMs
- Igniting Creative Writing in Small Language Models: LLM-as-a-Judge versus Multi-Agent Refined Rewards
- The Ramon Llull's Thinking Machine for Automated Ideation
- Dream 7B: Diffusion Large Language Models
- Cross-Modality Controlled Molecule Generation with Diffusion Language Model
- DPad: Efficient Diffusion Language Models with Suffix Dropout
- MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
- Diffusion is a code repair operator and generator
- Projected Coupled Diffusion for Test-Time Constrained Joint Generation
- Non-asymptotic convergence bound of conditional diffusion models
- Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models
- Intention-Aware Diffusion Model for Pedestrian Trajectory Prediction
- Vec2Summ: Text Summarization via Probabilistic Sentence Embeddings
- SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens
- Sculptor: Empowering LLMs with Cognitive Agency via Active Context Management
- Intention Enhanced Diffusion Model for Multimodal Pedestrian Trajectory Prediction
- The Bidirectional Process Reward Model
- LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
- TreeDiff: AST-Guided Code Generation with Diffusion LLMs
- DiffuMeta: Algebraic Language Models for Inverse Design of Metamaterials via Diffusion Transformers
- Modeling Human Gaze Behavior with Diffusion Models for Unified Scanpath Prediction
- Cluster Purge Loss: Structuring Transformer Embeddings for Equivalent Mutants Detection
- Diffusion Beats Autoregressive in Data-Constrained Settings
- MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
- Wide-In, Narrow-Out: Revokable Decoding for Efficient and Effective DLLMs
- Continuous Diffusion Models Can Obey Formal Syntax
- Language Models for Controllable DNA Sequence Design
- The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models
- Diffusion Models for Time Series Forecasting: A Survey
- The Serial Scaling Hypothesis
- Similarity-Guided Diffusion for Contrastive Sequential Recommendation
- A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search
- Diffusion Decoding for Peptide De Novo Sequencing
- DiffSBR: A diffusion model for session-based recommendation
- TextOmics-Guided Diffusion for Hit-like Molecular Generation
- A Survey on Latent Reasoning
- Clustering via Self-Supervised Diffusion
- FAROS: Fair Graph Generation via Attribute Switching Mechanisms
- AC-Refiner: Efficient Arithmetic Circuit Optimization Using Conditional Diffusion Models
- LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning
- Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
- Context-Driven Knowledge Graph Completion with Semantic-Aware Relational Message Passing
- Flow-Modulated Scoring for Semantic-Aware Knowledge Graph Completion
- Ctrl-Z Sampling: Diffusion Sampling with Controlled Random Zigzag Explorations
- Unraveling the Potential of Diffusion Models in Small Molecule Generation
- DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
- SceneCrafter: Controllable Multi-View Driving Scene Editing
- Alleviating User-Sensitive bias with Fair Generative Sequential Recommendation Model
- Exact Conditional Score-Guided Generative Modeling for Amortized Inference in Uncertainty Quantification
- DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation
- AI Methods for Antimicrobial Peptides: Progress and Challenges
- Evolvable Conditional Diffusion
- Generative or Discriminative? Revisiting Text Classification in the Era of Transformers
- PPDiff: Diffusing in Hybrid Sequence-Structure Space for Protein-Protein Complex Design
- What Exactly Does Guidance Do in Masked Discrete Diffusion Models
- The Diffusion Duality
- Constrained Sampling for Language Models Should Be Easy: An MCMC Perspective
- A Generative Adaptive Replay Continual Learning Model for Temporal Knowledge Graph Reasoning
- Solving Inverse Problems via Diffusion-Based Priors: An Approximation-Free Ensemble Sampling Approach
- Esoteric Language Models: A Family of Any-Order Diffusion LLMs
- Wasserstein Convergence of Score-based Generative Models under Semiconvexity and Discontinuous Gradients
- Local Manifold Approximation and Projection for Manifold-Aware Diffusion Planning
- DLM-One: Diffusion Language Models for One-Step Sequence Generation
- Gaussian mixture models as a proxy for interacting language models
- Unifying Continuous and Discrete Text Diffusion with Non-simultaneous Diffusion Processes
- Breaking AR's Sampling Bottleneck: Provable Acceleration via Diffusion Language Models
- Exploring the Hidden Capacity of LLMs for One-Step Text Generation
- Discrete Markov Bridge
- Energy-based generator matching: A neural sampler for general state space
- Adaptive Classifier-Free Guidance via Dynamic Low-Confidence Masking
- FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities
- Smoothie: Smoothing Diffusion on Token Embeddings for Text Generation
- Anchored Diffusion Language Model
- Beyond Masked and Unmasked: Discrete Diffusion Models via Partial Masking
- Diffusion Self-Weighted Guidance for Offline Reinforcement Learning
- Improved Sample Complexity For Diffusion Model Training Without Empirical Risk Minimizer Access
- Deeper Diffusion Models Amplify Bias
- Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey
- Learning Flexible Forward Trajectories for Masked Molecular Diffusion
- LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
- EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning
- dKV-Cache: The Cache for Diffusion Language Models
- DeltaFlow: Noise-Adaptive Bidirectional Gated Delta Networks for Embedded Language Flows
- CtrlDiff: Boosting Large Diffusion Language Models with Dynamic Block Prediction and Controllable Generation
- Diffmv: A Unified Diffusion Framework for Healthcare Predictions with Random Missing Views and View Laziness
- Foundation Models for AI-Enabled Biological Design
- LD-Scene: LLM-Guided Diffusion for Controllable Generation of Adversarial Safety-Critical Driving Scenarios
- Recent Advances in Diffusion Models for Hyperspectral Image Processing and Analysis: A Review
- Prior-Guided Diffusion Planning for Offline Reinforcement Learning
- Can Large Language Models Correctly Interpret Equations with Errors?
- Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance
- Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics
- Computationally Efficient Diffusion Models in Medical Imaging: A Comprehensive Review
- Just on Time: Token-Level Early Stopping for Diffusion Language Models
- A Survey on Generative Diffusion Models
- Diffusion Language Models: An Experimental Analysis
- Discrete Flow Maps
- Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models
- DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
- ForceGen: End-to-end de novo protein generation based on nonlinear mechanical unfolding responses using a protein language diffusion model
- A Time-Series Data Augmentation Model through Diffusion and Transformer Integration
- Think First, Diffuse Fast: Improving Diffusion Language Model Reasoning via Autoregressive Plan Conditioning
- LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
- Sparse-to-Sparse Training of Diffusion Models
- DDPS: Discrete Diffusion Posterior Sampling for Paths in Layered Graphs
- FOCUS: DLLMs Know How to Tame Their Compute Bound
- Sequence Diffusion Model for Temporal Link Prediction in Continuous-Time Dynamic Graph
- Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution
- Language Models Are Implicitly Continuous
- DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech
- Target Concrete Score Matching: A Holistic Framework for Discrete Diffusion
- DDPT: Diffusion-Driven Prompt Tuning for Large Language Model Code Generation
- Intent-aware Diffusion with Contrastive Learning for Sequential Recommendation
- Beyond Words: Augmenting Discriminative Richness via Diffusions in Unsupervised Prompt Learning
- Generalized Visual Relation Detection with Diffusion Models
- ProtFlow: Fast Protein Sequence Design via Flow Matching on Compressed Protein Language Model Embeddings
- D2iT: Dynamic Diffusion Transformer for Accurate Image Generation
- Diffusion Models for Robotic Manipulation: A Survey
- Self-Steering Language Models
Related