Mean Flows for One-step Generative Modeling
2025/05/19 by Zhengyang Geng, Mingyang Deng, Geng, Zhengyang +7 · 3 voices · 147 citations
Computer Science · Engineering · Physics and Astronomy · #3D Shape Modeling and Analysis #Generative Adversarial Networks and Image Synthesis #Model Reduction and Neural Networks #cs.CV #cs.LG
paper · pdf · doi:10.48550/arxiv.2505.13447
openalex publication_date 2025/05/19 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
We propose a principled and effective framework for one-step generative modeling. We introduce the notion of average velocity to characterize flow fields, in contrast to instantaneous velocity modeled by Flow Matching methods. A well-defined identity between average and instantaneous velocities is derived and used to guide neural network training. Our method, termed the MeanFlow model, is self-contained and requires no pre-training, distillation, or curriculum learning. MeanFlow demonstrates strong empirical performance: it achieves an FID of 3.43 with a single function evaluation (1-NFE) on ImageNet 256x256 trained from scratch, significantly outperforming previous state-of-the-art one-step diffusion/flow models. Our study substantially narrows the gap between one-step diffusion/flow models and their multi-step predecessors, and we hope it will motivate future research to revisit the foundations of these powerful models.
Cited by
- Temporal Difference Learning for Diffusion Models
- Fast Organic Crystal Structure Prediction with Unit Cell Flow Matching
- ReDiF: Reinforced Distillation for Few Step Diffusion
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- Self-Evaluation Unlocks Any-Step Text-to-Image Generation
- PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation
- Normalizing Trajectory Models
- FlowCTS: On-policy Continuous Trajectory Supervision of Flow Models
- FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation
- Autoregressive One-Step Generative Modeling for Dynamical System Forecasting
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- OMP: One-step Meanflow Policy with Directional Alignment
- MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
- ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation
- SoFlow: Solution Flow Models for One-Step Generative Modeling
- WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
- Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
- Few-Step Distillation for Text-to-Image Generation: A Practical Guide
- Bidirectional Normalizing Flow: From Data to Noise and Back
- What matters for Representation Alignment: Global Information or Spatial Structure?
- FALCON: Few-step Accurate Likelihoods for Continuous Flows
- Pathway to O(√(d)) Complexity bound under Wasserstein metric of flow-based models
- StreamFlow: Theory, Algorithm, and Implementation for High-Efficiency Rectified Flow Generation
- One-Step Generative Channel Estimation via Average Velocity Field
- ReflexFlow: Rethinking Learning Objective for Exposure Bias Alleviation in Flow Matching
- On the Design of One-step Diffusion via Shortcutting Flow Paths
- TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows
- RELIC: Interactive Video World Model with Long-Horizon Memory
- Glance: Accelerating Diffusion Models with 1 Sample
- From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
- Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models
- EfficientFlow: Efficient Equivariant Flow Policy Learning for Embodied AI
- Improved Mean Flows: On the Challenges of Fastforward Generative Models
- Much Ado About Noising: Dispelling the Myths of Generative Robotic Control
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing
- Reversible Inversion for Training-Free Exemplar-guided Image Editing
- Cosine-Similarity Methods for Efficient Training and Sampling in High-Dimensional Latent Spaces
- Overcoming the Curvature Bottleneck in MeanFlow
- Test-time scaling of diffusions with flow maps
- Adversarial Flow Models
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- One-Step Generative Policies with Q-Learning: A Reformulation of MeanFlow
- MeanFlow Transformers with Representation Autoencoders
- FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation
- Rectified SpaAttn: Revisiting Attention Sparsity for Efficient Video Generation
- Terminal Velocity Matching
- Efficient Transferable Optimal Transport via Min-Sliced Transport Plans
- Flow Map Distillation Without Data
- Understanding, Accelerating, and Improving MeanFlow Training
- L1 Sample Flow for Efficient Visuomotor Learning
- Generative Augmented Reality: Paradigms, Technologies, and Future Applications
- LiSTAR: Ray-Centric World Models for 4D LiDAR Sequences in Autonomous Driving
- Functional Mean Flow in Hilbert Space
- MFI-ResNet: Efficient ResNet Architecture Optimization via MeanFlow Compression and Selective Incubation
- Learning Straight Flows: Variational Flow Matching for Efficient Generation
- WaveC2R: Wavelet-Driven Coarse-to-Refined Hierarchical Learning for Radar Retrieval
- Hierarchical Schedule Optimization for Fast and Robust Diffusion Model Sampling
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- VEDA: 3D Molecular Generation via Variance-Exploding Diffusion with Annealing
- TimeFlow: Towards Stochastic-Aware and Efficient Time Series Generation via Flow Matching Modeling
- Neodragon: Mobile Video Generation using Diffusion Transformer
- Physics-Informed Design of Input Convex Neural Networks for Consistency Optimal Transport Flow Matching
- Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals
- Simplex-to-Euclidean Bijections for Categorical Flow Matching
- Off-policy Reinforcement Learning with Model-based Exploration Augmentation
- Flow Map Learning via Nongradient Vector Flow
- Amortized Moment Matching for Visual Generation
- Autoregressive Boltzmann Generators
- FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
- Generative Modeling via Drifting
- Meta Flow Maps enable scalable reward alignment
- Balanced conic rectified flow
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- Generalised Flow Maps for Few-Step Generative Modelling on Riemannian Manifolds
- Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
- AlphaFlow: Understanding and Improving MeanFlow Models
- Imitation Learning Policy based on Multi-Step Consistent Integration Shortcut Model
- One-step Diffusion Models with Bregman Density Ratio Matching
- AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport
- Learning an Image Editing Model without Image Editing Pairs
- Exploring Cross-Modal Flows for Few-Shot Learning
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- Adapting Noise to Data: Generative Flows from 1D Processes
- Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance
- Your VAR Model is Secretly an Efficient and Explainable Generative Classifier
- Y-shaped Generative Flows
- Offline Reinforcement Learning with Generative Trajectory Policies
- SoundReactor: Frame-level Online Video-to-Audio Generation
- One Pass Is Not Enough: Recursive Latent Refinement for Generative Models
- MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
- DM1: MeanFlow with Dispersive Regularization for 1-Step Robotic Manipulation
- IntMeanFlow: Few-step Speech Generation with Integral Velocity Distillation
- Deep Neural Networks Inspired by Differential Equations
- Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
- SkipSR: Faster Super Resolution with Token Skipping
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- Flow Matching with Semidiscrete Couplings
- CMT: Mid-Training for Efficient Learning of Consistency, Mean Flow, and Flow Map Models
- Hyperspherical Latents Improve Continuous-Token Autoregressive Generation
- Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
- DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
- SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement
- Scalable GANs with Transformers
- Training Agents Inside of Scalable World Models
- OAT-FM: Optimal Acceleration Transport for Improved Flow Matching
- Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis
- FlowLUT: Efficient Image Enhancement via Differentiable LUTs and Iterative Flow Matching
- HunyuanImage 3.0 Technical Report
- MeanFlowSE: One-Step Generative Speech Enhancement via MeanFlow
- Stochastic Interpolants via Conditional Dependent Coupling
- Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings
- Transport Based Mean Flows for Generative Modeling
- Universal Inverse Distillation for Matching Models with Real-Data Supervision (No GANs)
- Shortcut Flow Matching for Speech Enhancement: Step-Invariant flows via single stage training
- MeanSE: Efficient Generative Speech Enhancement with Mean Flows
- PlatformBid: An Auto-Bidding Benchmark from a Unified Advertising Platform's Perspective
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- ELF: Embedded Language Flows
- A Gradient Flow Approach to Solving Inverse Problems with Latent Diffusion Models
- FinFlowRL: An Imitation-Reinforcement Learning Framework for Adaptive Stochastic Control in Finance
- A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
- Compose Yourself: Average-Velocity Flow Matching for One-Step Speech Enhancement
- MeanFlowSE: one-step generative speech enhancement via conditional mean flow
- Modular MeanFlow: Towards Stable and Scalable One-Step Generative Modeling
- Chord: Chain of Rendering Decomposition for PBR Material Estimation from Generated Texture Images
- MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
- Any-Step Density Ratio Estimation via Interval-Annealed Secant Alignment
- Few-step Flow for 3D Generation via Marginal-Data Transport Distillation
- Transition Models: Rethinking the Generative Learning Objective
- From Editor to Dense Geometry Estimator
- Latent Space Single-Pixel Imaging Under Low-Sampling Conditions
- FinFlowRL: An Imitation-Reinforcement Learning Framework for Adaptive Stochastic Control in Finance
- Fractal Flow: Hierarchical and Interpretable Normalizing Flow via Topic Modeling and Recursive Strategy
- Efficient Identification of Critical Transitions via Flow Matching: A Scalable Generative Approach for Many-Body Systems
- One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning
- UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling
- PureSample: Neural Materials Learned by Sampling Microgeometry
- Towards High-Order Mean Flow Generative Models: Feasibility, Expressivity, and Provably Efficient Criteria
- Elastic Diffusion Transformer
- OM2P: Offline Multi-Agent Mean-Flow Policy
- MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
- SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
- MolSnap: Snap-Fast Molecular Generation with Latent Variational Mean Flow
- LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
- One-Step Flow Policy Mirror Descent
Discussions
Related