Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
2024/03/05 by Patrick Esser, Sumith Kulal, Esser, Patrick +31 · 2 voices · 1,607 citations
Computer Science · #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Generative Adversarial Networks and Image Synthesis #cs.CV
paper · pdf · doi:10.48550/arxiv.2403.03206
Abstract
Diffusion models create data from noise by inverting the forward paths of data towards noise and have emerged as a powerful generative modeling technique for high-dimensional, perceptual data such as images and videos. Rectified flow is a recent generative model formulation that connects data and noise in a straight line. Despite its better theoretical properties and conceptual simplicity, it is not yet decisively established as standard practice. In this work, we improve existing noise sampling techniques for training rectified flow models by biasing them towards perceptually relevant scales. Through a large-scale study, we demonstrate the superior performance of this approach compared to established diffusion formulations for high-resolution text-to-image synthesis. Additionally, we present a novel transformer-based architecture for text-to-image generation that uses separate weights for the two modalities and enables a bidirectional flow of information between image and text tokens, improving text comprehension, typography, and human preference ratings. We demonstrate that this architecture follows predictable scaling trends and correlates lower validation loss to improved text-to-image synthesis as measured by various metrics and human evaluations. Our largest models outperform state-of-the-art models, and we will make our experimental data, code, and model weights publicly available.
Cited by
- Marrying Autoregressive Transformer and Diffusion with Multi-Reference Autoregression
- UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback
- LongCat-Image Technical Report
- FlowLPS: Langevin-Proximal Sampling for Flow-based Inverse Problem Solvers
- ThinkGen: Generalized Thinking for Visual Generation
- D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
- HY-Motion 1.0: Scaling Flow Matching Models for Text-To-Motion Generation
- Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
- On the Inverse Flow Matching Problem in the One-Dimensional and Gaussian Cases
- RS-Prune: Training-Free Data Pruning at High Ratios for Efficient Remote Sensing Diffusion Foundation Models
- GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
- REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
- Fast Organic Crystal Structure Prediction with Unit Cell Flow Matching
- Revisiting [CLS] and Patch Token Interaction in Vision Transformers
- ShapeR: Robust Conditional 3D Shape Generation from Casual Captures
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
- Parallel Diffusion Solver via Residual Dirichlet Policy Optimization
- Energy-Guided Flow Matching Enables Few-Step Conformer Generation and Ground-State Identification
- EmoCtrl: Controllable Emotional Image Content Generation
- Self-Evaluation Unlocks Any-Step Text-to-Image Generation
- Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
- LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments
- LU-500: A Logo Benchmark for Concept Unlearning
- Learning Sampling Parameters for Diffusion Models
- VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation
- MobileWan: Closing the Quality Gap for Mobile Video Diffusion
- Normalizing Trajectory Models
- Bridging Your Imagination with Audio-Video Generation via a Unified Director
- OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models
- Post-FWI Injection of Learned Priors Using a Flow Matching Model
- UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation
- PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation
- TreeAdapter: Hierarchical Taxonomy-Guided Adapter Composition for Fine-Grained Species Image Generation
- UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling
- FlowCTS: On-policy Continuous Trajectory Supervision of Flow Models
- PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation
- DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models
- Sense it with your eyes: Sensation Generation and Understanding for Advertisements
- ScaleResfusion: Residual Rectified Flow based on Residual Vector Field
- Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering
- FMOPF: Latent Flow Matching with Constraint-Aware Interaction Priors for AC Optimal Power Flow
- Layering Virtual Try-On
- ProEdit: Inversion-based Editing From Prompts Done Right
- Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
- AI-generated Images Challenge Visual Trust in High-risk Scenarios
- Text-based Tactile Graphics Generation for the Visually Impaired
- ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving
- NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning
- ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing
- Concept-based Visual Counterfactual Explanations with Diffusion Models
- DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces
- FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer
- InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation
- Tilt Matching for Scalable Sampling and Fine-Tuning
- PhysFire-WM: A Physics-Informed World Model for Emulating Fire Spread Dynamics
- Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space
- EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal
- DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
- Generative Multi-Focus Image Fusion
- ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision
- Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
- Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations
- MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
- UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images
- TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
- Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking
- SemanticGen: Video Generation in Semantic Space
- Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
- StoryMem: Multi-shot Long Video Storytelling with Memory
- Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation
- OMP: One-step Meanflow Policy with Directional Alignment
- VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
- Finer-Personalization Rank: Fine-Grained Retrieval Examines Identity Preservation for Personalized Generation
- MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture
- RMLer: Synthesizing Novel Objects across Diverse Categories via Reinforcement Mixing Learning
- EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer
- Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers
- Region-Constraint In-Context Generation for Instructional Video Editing
- Is There a Better Source Distribution than Gaussian? Exploring Source Distributions for Image Flow Matching
- Efficient Zero-Shot Inpainting with Decoupled Diffusion Guidance
- Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing
- LumiCtrl : Learning Illuminant Prompts for Lighting Control in Personalized Text-to-Image Models
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- MatLat: Material Latent Space for PBR Texture Generation
- Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation
- The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text
- Next-Embedding Prediction Makes Strong Vision Learners
- VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
- Alchemist: Unlocking Efficiency in Text-to-Image Model Training via Meta-Gradient Data Selection
- GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
- Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation
- DeContext as Defense: Safe Image Editing in Diffusion Transformers
- Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models
- DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
- End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
- Large Video Planner Enables Generalizable Robot Control
- SoFlow: Solution Flow Models for One-Step Generative Modeling
- IC-Effect: Precise and Efficient Video Effects Editing via In-Context Learning
- FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervision
- Copyright Infringement Risk Reduction via Chain-of-Thought and Task Instruction Prompting
- Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
- MMMamba: A Versatile Cross-Modal In Context Fusion Framework for Pan-Sharpening and Zero-Shot Image Enhancement
- Robust and Calibrated Detection of Authentic Multimedia Content
- 3DProxyImg: Controllable 3D-Aware Animation Synthesis from Single Image via 2D-3D Aligned Proxy Embedding
- Spatia: Video Generation with Updatable Spatial Memory
- FlowBind: Efficient Any-to-Any Generation with Bidirectional Flows
- Visual-textual Dermatoglyphic Animal Biometrics: A First Case Study on Panthera tigris
- Native and Compact Structured Latents for 3D Generation
- Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity
- HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face Fusion
- Towards Transferable Defense Against Malicious Image Edits
- ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body
- ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Discrete Diffusion Models
- The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
- Beyond surface form: A pipeline for semantic analysis in Alzheimer's Disease detection from spontaneous speech
- World Models for Learning Dexterous Hand-Object Interactions from Human Videos
- Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
- Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation
- Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10×
- LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
- RecTok: Reconstruction Distillation along Rectified Flow
- KlingAvatar 2.0 Technical Report
- ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement
- BézierFlow: Learning Bézier Stochastic Interpolant Schedulers for Few-Step Generation
- STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
- What Happens Next? Next Scene Prediction with a Unified Video Model
- MineTheGap: Automatic Mining of Biases in Text-to-Image Models
- JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing
- Exploring the Design Space of Transition Matching
- GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation
- Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment
- Boosting Monocular Metric Depth Estimation via Bokeh Rendering
- WATOS: Efficient LLM Training Strategies and Architecture Co-exploration for Wafer-scale Chip
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- Flowception: Temporally Expansive Flow Matching for Video Generation
- FutureX: Enhance End-to-End Autonomous Driving via Latent Chain-of-Thought World Model
- Beyond Memorization: Selective Learning for Copyright-Safe Diffusion Model Training
- Reframing Music-Driven 2D Dance Pose Generation as Multi-Channel Image Generation
- SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
- AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path
- AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
- Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
- Bidirectional Normalizing Flow: From Data to Noise and Back
- What matters for Representation Alignment: Global Information or Spatial Structure?
- Learning by Analogy: A Causal Framework for Composition Generalization
- TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection
- MR-FlowDPO: Multi-Reward Direct Preference Optimization for Flow-Matching Text-to-Music Generation
- DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation
- Composing Concepts from Images and Videos via Concept-prompt Binding
- StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
- LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations
- OmniPSD: Layered PSD Generation with Diffusion Transformer
- TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
- DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
- Food Image Generation on Multi-Noun Categories
- AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models
- Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration
- UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
- CARLoS: Retrieval via Concise Assessment Representation of LoRAs at Scale
- Early Estimation of Language to Latent Alignment in Diffusion Models
- Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
- ContextDrag: Precise Drag-Based Image Editing via Context-Preserving Token Injection and Position-Aligned Attention
- PAVAS: Physics-Aware Video-to-Audio Synthesis
- TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Repulsor: Accelerating Generative Modeling with a Contrastive Memory Bank
- Scalable Offline Model-Based RL with Action Chunks
- Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality
- OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
- Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment
- MoCA: Mixture-of-Components Attention for Scalable Compositional 3D Generation
- Training-Free Vector Quantization via Gaussian VAEs
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
- SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation
- From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images
- ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
- JoPano: Unified Panorama Generation via Joint Modeling
- Spatial Retrieval Augmented Autonomous Driving
- VDOT: Efficient Unified Video Creation via Optimal Transport Distillation
- VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
- EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
- Evaluating Concept Filtering Defenses against Child Sexual Abuse Material Generation by Text-to-Image Models
- ProPhy: Progressive Physical Alignment for Dynamic World Simulation
- Value Gradient Guidance for Flow Matching Alignment
- TV2TV: A Unified Framework for Interleaved Language and Video Generation
- SA-IQA: Redefining Image Quality Assessment for Spatial Aesthetics with Multi-Dimensional Rewards
- BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
- StreamFlow: Theory, Algorithm, and Implementation for High-Efficiency Rectified Flow Generation
- Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models
- Efficient Generative Transformer Operators For Million-Point PDEs
- Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion
- EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
- COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence
- Refaçade: Editing Object with Given Reference Texture
- VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory
- Data-regularized Reinforcement Learning for Diffusion Models at Scale
- Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
- ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories
- Beyond Boundary Frames: Talking-Head Inbetweening via Context-Aware Motion Modeling
- TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows
- Highly Efficient Test-Time Scaling for T2I Diffusion Models with Text Embedding Perturbation
- UniLight: A Unified Representation for Lighting
- MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
- Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
- TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond
- Glance: Accelerating Diffusion Models with 1 Sample
- From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
- PGP-DiffSR: Phase-Guided Progressive Pruning for Efficient Diffusion-based Image Super-Resolution
- RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
- YingVideo-MV: Music-Driven Multi-Stage Video Generation
- WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
- Understanding and Harnessing Sparsity in Unified Multimodal Models
- Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
- Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
- Iterative Tilting for Diffusion Fine-Tuning
- Spatiotemporal Pyramid Flow Matching for Climate Emulation
- FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
- Generative Video Motion Editing with 3D Point Tracks
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing
- FlowEO: Generative Unsupervised Domain Adaptation for Earth Observation
- FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution
- Reversible Inversion for Training-Free Exemplar-guided Image Editing
- DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy
- Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe
- Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models
- ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
- DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models
- Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model
- Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
- Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards
- Cosine-Similarity Methods for Efficient Training and Sampling in High-Dimensional Latent Spaces
- RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
- WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
- InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models
- SAIDO: Generalizable Detection of AI-Generated Images via Scene-Aware and Importance-Guided Dynamic Optimization in Continual Learning
- FR-TTS: Test-Time Scaling for NTP-based Image Generation with Effective Filling-based Reward Signal
- Visual Generation Tuning
- VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
- Vision Bridge Transformer at Scale
- REVEAL: Reasoning-Enhanced Forensic Evidence Analysis for Explainable AI-Generated Image Detection
- GOATex: Geometry & Occlusion-Aware Texturing
- Guiding Visual Autoregressive Models through Spectrum Weakening
- One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer
- Ovis-Image Technical Report
- Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
- Generative Anchored Fields: Controlled Data Generation via Emergent Velocity Fields and Transport Algebra
- Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation
- AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
- Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration
- Adversarial Flow Models
- Canvas-to-Image: Compositional Image Generation with Multimodal Controls
- Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage
- PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and Fuzz Optimization
- MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices
- One-Step Generative Policies with Q-Learning: A Reformulation of MeanFlow
- CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation
- 3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation
- Deep Parameter Interpolation for Scalar Conditioning
- Inversion-Free Style Transfer with Dual Rectified Flows
- Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation
- DINO-Tok: Adapting DINO for Visual Tokenizers
- PixelDiT: Pixel Diffusion Transformers for Image Generation
- iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation
- MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models
- The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
- Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
- HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
- STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows
- Block Cascading: Training Free Acceleration of Block-Causal Video Models
- A Training-Free Approach for Multi-ID Customization via Attention Adjustment and Spatial Control
- The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
- PromptMoG: Enhancing Diversity in Long-Prompt Image Generation via Prompt Embedding Mixture-of-Gaussian Sampling
- Restora-Flow: Mask-Guided Image Restoration with Flow Matching
- CREward: A Type-Specific Creativity Reward Model
- OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
- SONIC: Spectral Optimization of Noise for Inpainting with Consistency
- EmoFeedback2: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback
- HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
- Low-Resolution Editing is All You Need for High-Resolution Editing
- LumiTex: Towards High-Fidelity PBR Texture Generation with Illumination Context
- ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding
- Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization
- TReFT: Taming Rectified Flow Models For One-Step Image Translation
- Terminal Velocity Matching
- Are Image-to-Video Models Good Zero-Shot Image Editors?
- Flow Map Distillation Without Data
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- SyncMV4D: Synchronized Multi-view Joint Diffusion of Appearance and Motion for Hand-Object Interaction Synthesis
- BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment
- Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation
- One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control
- HunyuanVideo 1.5 Technical Report
- DiP: Taming Diffusion Models in Pixel Space
- STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution
- Rethinking Garment Conditioning in Diffusion-based Virtual Try-On
- DriveFlow: Rectified Flow Adaptation for Robust 3D Object Detection in Autonomous Driving
- Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer
- VeCoR -- Velocity Contrastive Regularization for Flow Matching
- Test-Time Preference Optimization for Image Restoration
- ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion
- Breaking the Likelihood-Quality Trade-off in Diffusion Models by Merging Pretrained Experts
- Zero-Shot Video Deraining with Video Diffusion Models
- InstructAudio: Unified speech and music generation with natural language instruction
- ConsistCompose: Unified Multimodal Layout Control for Image Composition
- Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models
- Video4Edit: Viewing Image Editing as a Degenerate Temporal Process
- UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios
- Plan-X: Instruct Video Generation via Semantic Planning
- Score-Regularized Joint Sampling with Importance Weights for Flow Matching
- EvDiff: High Quality Video with an Event Camera
- Refracting Reality: Generating Images with Realistic Transparent Objects
- Diversity Has Always Been There in Your Visual Autoregressive Models
- One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
- RoomPlanner: Explicit Layout Planner for Easier LLM-Driven 3D Room Generation
- Energy Scaling Laws for Diffusion Models: Quantifying Compute and Carbon Emissions in Image Generation
- Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features
- Align & Invert: Solving Inverse Problems with Diffusion and Flow-based Models via Representation Alignment
- Designing and Generating Diverse, Equitable Face Image Datasets for Face Verification Tasks
- Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation
- SceneDesigner: Controllable Multi-Object Image Generation with 9-DoF Pose Manipulation
- Loomis Painter: Reconstructing the Painting Process
- TRIM: Scalable 3D Gaussian Diffusion Inference with Temporal and Spatial Trimming
- Time dependent loss reweighting for flow matching and diffusion models is theoretically justified
- Saving Foundation Flow-Matching Priors for Inverse Problems
- Controllable Layer Decomposition for Reversible Multi-Layer Image Generation
- Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers
- How Noise Benefits AI-generated Image Detection
- AMS-KV: Adaptive KV Caching in Multi-Scale Visual Autoregressive Transformers
- Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
- Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes
- Exact Stochastic Differential Equations for Quantum Reverse Diffusion
- UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment
- Neo: Real-Time On-Device 3D Gaussian Splatting with Reuse-and-Update Sorting Acceleration
- SplitFlux: Learning to Decouple Content and Style from a Single Image
- Insert In Style: A Zero-Shot Generative Framework for Harmonious Cross-Domain Object Composition
- BokehFlow: Depth-Free Controllable Bokeh Rendering via Flow Matching
- UniHOI: Unified Human-Object Interaction Understanding via Unified Token Space
- Towards Stable and Structured Time Series Generation with Perturbation-Aware Flow Matching
- DIR-TIR: Dialog-Iterative Refinement for Text-to-Image Retrieval
- ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
- Coffee: Controllable Diffusion Fine-tuning
- 3D-Guided Scalable Flow Matching for Generating Volumetric Tissue Spatial Transcriptomics from Serial Histology
- DGS-Net: Distillation-Guided Gradient Surgery for CLIP Fine-Tuning in AI-Generated Image Detection
- Distribution Matching Distillation Meets Reinforcement Learning
- TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction
- Which Way from B to A: The role of embedding geometry in image interpolation for Stable Diffusion
- DINO-Detect: A Simple yet Effective Framework for Blur-Robust AI-Generated Image Detection
- HiGFA: Hierarchical Guidance for Fine-grained Data Augmentation with Diffusion Models
- Learning Straight Flows: Variational Flow Matching for Efficient Generation
- Explainable AI-Generated Image Detection RewardBench
- Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
- GeoMVD: Geometry-Enhanced Multi-View Generation Model Based on Geometric Information Extraction
- FIA-Edit: Frequency-Interactive Attention for Efficient and High-Fidelity Inversion-Free Text-Guided Image Editing
- ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
- The Persistence of Cultural Memory: Investigating Multimodal Iconicity in Diffusion Models
- StyleQoRA: Quality-Aware Low-Rank Adaptation for Few-Shot Multi-Style Editing
- One Small Step in Latent, One Giant Leap for Pixels: Fast Latent Upscale Adapter for Your Diffusion Models
- Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS
- MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
- Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition
- WDT-MD: Wavelet Diffusion Transformers for Microaneurysm Detection in Fundus Images
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- Simulating the Visual World with Artificial Intelligence: A Roadmap
- Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
- HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization
- Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation
- StableMorph: High-Quality Face Morph Generation with Stable Diffusion
- Laytrol: Preserving Pretrained Knowledge in Layout Control for Multimodal Diffusion Transformers
- Rectified Noise: A Generative Model Using Positive-incentive Noise
- Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?
- NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
- Generating an Image From 1,000 Words: Enhancing Text-to-Image With Structured Captions
- VAEVQ: Enhancing Discrete Visual Tokenization through Variational Modeling
- Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention Guidance
- JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework
- Latent Refinement via Flow Matching for Training-free Linear Inverse Problem Solving
- MALeR: Improving Compositional Fidelity in Layout-Guided Generation
- Neodragon: Mobile Video Generation using Diffusion Transformer
- Culture in Action: Evaluating Text-to-Image Models through Social Activities
- On Flow Matching KL Divergence
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation
- Tortoise and Hare Guidance: Accelerating Diffusion Model Inference with Multirate Integration
- Evolutionary Optimization Trumps Adam Optimization on Embedding Space Exploration
- Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
- A New Perspective on Precision and Recall for Generative Models
- Dexterous Robotic Piano Playing at Scale
- Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
- EraseFlow: Learning Concept Erasure Policies via GFlowNet-Driven Alignment
- ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
- MagicView: Multi-View Consistent Identity Customization via Priors-Guided In-Context Learning
- Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals
- Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
- Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
- Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
- BlurGuard: A Simple Approach for Robustifying Image Protection Against AI-Powered Editing
- Emu3.5: Native Multimodal Models are World Learners
- Distributional Multi-objective Black-box Optimization for Diffusion-model Inference-time Multi-Target Generation
- SplitFlow: Flow Decomposition for Inversion-Free Text-to-Image Editing
- Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation
- ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
- MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
- SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion
- Flow Map Learning via Nongradient Vector Flow
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
- ServerlessT2I: Efficient Text-to-Image Workflow Serving on a Serverless Platform
- LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models
- Product-Quantised Image Representation for High-Quality Image Synthesis
- TridentServe: A Stage-level Serving System for Diffusion Pipelines
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
- PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization
- AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
- FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
- SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
- Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
- Balanced conic rectified flow
- Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
- Uniform Discrete Diffusion with Metric Path for Video Generation
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- Group Relative Attention Guidance for Image Editing
- DiffusionX: Efficient Edge-Cloud Collaborative Image Generation with Multi-Round Prompt Evolution
- Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models
- Compositional Image Synthesis with Inference-Time Scaling
- Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- World Simulation with Video Foundation Models for Physical AI
- Semantic-Guided Cross-Sensor Super Resolution of Remote Sensing Images: A Gated Dual Conditioning Flow Matching Model
- More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
- FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time
- UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
- M3T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
- LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
- RoboSVG: A Unified Framework for Interactive SVG Generation with Multi-modal Guidance
- Human-Centred Evaluation of Text-to-Image Generation Models for Self-expression of Mental Distress: A Dataset Based on GPT-4o
- Open Multimodal Retrieval-Augmented Factual Image Generation
- GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping
- T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
- LongCat-Video Technical Report
- Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
- FlowOpt: Fast Optimization Through Whole Flow Processes for Training-Free Editing
- BachVid: Training-Free Video Generation with Consistent Background and Character
- Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
- Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation
- ArtiLatent: Realistic Articulated 3D Object Generation via Structured Latents
- TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation
- FairImagen: Post-Processing for Bias Mitigation in Text-to-Image Models
- Improved Training Technique for Shortcut Models
- Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
- Generative Point Tracking with Flow Matching
- HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
- Preventing Shortcuts in Adapter Training via Providing the Shortcuts
- Positional Encoding Field
- Target-aware Image Editing via Cycle-consistent Constraints
- RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
- PEDRA: Evaluating the Realism of Pedestrian Dynamics in Video Generation
- DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion
- AlphaFlow: Understanding and Improving MeanFlow Models
- Exploring Conditions for Diffusion models in Robotic Control
- UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
- GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation Models
- Seed3D 1.0: From Images to High-Fidelity Simulation-Ready 3D Assets
- A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation
- The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models
- Exposing Blindspots: Cultural Bias Evaluation in Generative Image Models
- MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation
- UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
- DP2O-SR: Direct Perceptual Preference Optimization for Real-World Image Super-Resolution
- Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model
- Latent-Augmented Discrete Diffusion Models
- Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
- Demystifying Transition Matching: When and Why It Can Beat Flow Matching
- ConsistEdit: Highly Consistent and Precise Training-free Visual Editing
- VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
- GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver
- UniRL-Zero: Reinforcement Learning on Unified Models with Joint Language Model and Diffusion Model Experts
- L2P: Unlocking Latent Potential for Pixel Generation
- Fine-tuning Flow Matching Generative Models with Intermediate Feedback
- Personalized Image Filter: Mastering Your Photographic Style
- Latent Diffusion Model without Variational Autoencoder
- The Face of Persuasion: Analyzing Bias and Generating Culture-Aware Ads
- ReCon: Region-Controllable Data Augmentation with Rectification and Alignment for Object Detection
- AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport
- Learning an Image Editing Model without Image Editing Pairs
- WithAnyone: Towards Controllable and ID Consistent Image Generation
- DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation
- ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- Consistent text-to-image generation via scene de-contextualization
- Exploring Cross-Modal Flows for Few-Shot Learning
- NANO3D: A Training-Free Approach for Efficient 3D Editing Without Masks
- Salient Concept-Aware Generative Data Augmentation
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas
- Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator
- Only-Style: Stylistic Consistency in Image Generation without Content Leakage
- Counting Hallucinations in Diffusion Models
- End-to-End Multi-Modal Diffusion Mamba
- UniCalli: A Unified Diffusion Framework for Column-Level Generation and Recognition of Chinese Calligraphy
- Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
- Generative Universal Verifier as Multimodal Meta-Reasoner
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- A Connection Between Score Matching and Local Intrinsic Dimension
- UniFusion: Vision-Language Model as Unified Encoder in Image Generation
- BIGFix: Bidirectional Image Generation with Token Fixing
- G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior
- Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward Feedback
- Diffusion Transformers with Representation Autoencoders
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- Diffusion Models for Reinforcement Learning: Foundations, Taxonomy, and Development
- Improving Text-to-Image Generation with Input-Side Inference-Time Scaling
- DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
- Test-Time Anchoring for Discrete Diffusion Posterior Sampling
- Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
- Demystifying Numerosity in Diffusion Models -- Limitations and Remedies
- VLM-Guided Adaptive Negative Prompting for Creative Generation
- DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing
- DAWP: A framework for global observation forecasting via Data Assimilation and Weather Prediction in satellite observation space
- DreamMakeup: Face Makeup Customization using Latent Diffusion Models
- Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- AdaViewPlanner: Adapting Video Diffusion Models for Viewpoint Planning in 4D Scenes
- UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
- SoundReactor: Frame-level Online Video-to-Audio Generation
- Fine-Tuning Flow Matching via Maximum Likelihood Estimation of Reconstructions
- EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
- ReMix: Towards a Unified View of Consistent Character Generation and Editing
- Asymmetric Flow Models
- Few-shot multi-token DreamBooth with LoRa for style-consistent character generation
- Stable Video Infinity: Infinite-Length Video Generation with Error Recycling
- MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
- Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
- Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
- Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
- HeadsUp! High-Fidelity Portrait Image Super-Resolution
- Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation
- UniVideo: Unified Understanding, Generation, and Editing for Videos
- Expressive Value Learning for Scalable Offline Reinforcement Learning
- UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
- CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
- Rectified-CFG++ for Flow Based Models
- FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring
- RePainter: Empowering E-commerce Object Removal via Spatial-matting Reinforcement Learning
- Reinforcing Diffusion Models by Direct Group Preference Optimization
- FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control
- Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
- Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency
- SkipSR: Faster Super Resolution with Token Skipping
- TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
- Pixel-Perfect Depth with Semantics-Prompted Diffusion Transformers
- MATRIX: Mask Track Alignment for Interaction-aware Video Generation
- MV-Performer: Taming Video Diffusion Model for Faithful and Synchronized Multi-view Performer Synthesis
- Growing Visual Generative Capacity for Pre-Trained MLLMs
- Resolving the Identity Crisis in Text-to-Image Generation
- NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation
- Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
- VUGEN: Visual Understanding priors for GENeration
- OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot
- Text-to-Image Models Leave Identifiable Signatures: Implications for Leaderboard Security
- Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
- Efficient High-Resolution Image Editing with Hallucination-Aware Loss and Adaptive Tiling
- Redefining Generalization in Visual Domains: A Two-Axis Framework for Fake Image Detection with FusionDetect
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- ShapeGen4D: Towards High Quality 4D Shape Generation from Videos
- VChain: Chain-of-Visual-Thought for Reasoning in Video Generation
- Factuality Matters: When Image Generation and Editing Meet Structured Visuals
- SAEdit: Token-level control for continuous image editing via Sparse AutoEncoder
- FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation
- StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- SONA: Learning Conditional, Unconditional, and Mismatching-Aware Discriminator
- TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- TBStar-Edit: From Image Editing Pattern Shifting to Consistency Enhancement
- Glocal Information Bottleneck for Time Series Imputation
- ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
- Scaling Sequence-to-Sequence Generative Neural Rendering
- Fine-Grained GRPO for Precise Preference Alignment in Flow Models
- Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL
- OneFlow: Concurrent Mixed-Modal and Interleaved Generation with Edit Flows
- Learning Robust Diffusion Models from Imprecise Supervision
- PocketSR: The Super-Resolution Expert in Your Pocket Mobiles
- TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
- SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos
- Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models
- Purrception: Variational Flow Matching for Vector-Quantized Image Generation
- Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models
- Align Your Query: Representation Alignment for Multimodality Medical Object Detection
- Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner
- Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models
- ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
- Riemannian Consistency Model
- Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents
- Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack
- UCD: Unconditional Discriminator Promotes Nash Equilibrium in GANs
- Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment
- InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution
- Learn to Guide Your Diffusion Model
- Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
- BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
- Flow Autoencoders are Effective Protein Tokenizers
- Stitch: Training-Free Position Control in Multimodal Diffusion Transformers
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
- DiffCamera: Arbitrary Refocusing on Images
- EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model
- PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
- Revoking Amnesia: RL-based Trajectory Optimization to Resurrect Erased Concepts in Diffusion Models
- Training-Free Reward-Guided Image Editing via Trajectory Optimal Control
- Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
- Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs
- How Diffusion Models Memorize
- Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples
- PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
- LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
- IRIS: Intrinsic Reward Image Synthesis
- Flow Matching with Semidiscrete Couplings
- FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
- Score Distillation of Flow Matching Models
- STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation
- SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation
- Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner
- CMT: Mid-Training for Efficient Learning of Consistency, Mean Flow, and Flow Map Models
- RapidMV: Leveraging Spatio-Angular Representations for Efficient and Consistent Text-to-Multi-View Synthesis
- UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
- UniVid: The Open-Source Unified Video Model
- An Efficient 3D Latent Diffusion Model for T1-contrast Enhanced MRI Generation
- TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning for Discrete Diffusion
- GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models
- DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
- An AI-guided framework for automated map point symbol generation through template rendering
- Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
- Personalized Vision via Visual In-Context Learning
- Scalable GANs with Transformers
- Training Agents Inside of Scalable World Models
- SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
- Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
- OAT-FM: Optimal Acceleration Transport for Improved Flow Matching
- Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
- UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception
- FlowLUT: Efficient Image Enhancement via Differentiable LUTs and Iterative Flow Matching
- HunyuanImage 3.0 Technical Report
- Flow Matching for Robust Simulation-Based Inference under Model Misspecification
- Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling
- Follow-Your-Preference: Towards Preference-Aligned Image Inpainting
- Planning with Unified Multimodal Models
- Unleashing Flow Policies with Distributional Critics
- Beyond the Prompt: Gender Bias in Text-to-Image Models, with a Case Study on Hospital Professions
- Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings
- RefAM: Attention Magnets for Zero-Shot Referral Segmentation
- Group Critical-token Policy Optimization for Autoregressive Image Generation
- LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale Diffusion Transformer
- MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning
- RAPID3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- REFINE-CONTROL: A Semi-supervised Distillation Method For Conditional Image Generation
- Universal Multi-Domain Translation via Diffusion Routers
- Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation
- MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
- Taming Flow-based I2V Models for Creative Video Editing
- Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching
- Drag4D: Align Your Motion with Text-Driven 3D Scene Generation
- InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions
- X-Streamer: Unified Human World Modeling with Audiovisual Interaction
- SD3.5-Flash: Distribution-Guided Distillation of Generative Flows
- Does FLUX Already Know How to Perform Physically Plausible Image Composition?
- Un-Doubling Diffusion: LLM-guided Disambiguation of Homonym Duplication
- Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
- A Unified Framework for Diffusion Model Unlearning with f-Divergence
- Flow Matching in the Low-Noise Regime: Pathologies and a Contrastive Remedy
- FerretNet: Efficient Synthetic Image Detection via Local Pixel Dependencies
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- Efficient Encoder-Free Pose Conditioning and Pose Control for Virtual Try-On
- ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
- MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
- Latent Iterative Refinement Flow: A Geometric-Constrained Approach for Few-Shot Generation
- InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
- FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference
- RFMSR: Residual Flow Matching for Image Super-Resolution
- From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data
- VETO: Towards Protecting Images From Frontier AI Editing
- BeCARE: Budgeted Cache Refresh for Diffusion Transformer Acceleration
- ELF: Embedded Language Flows
- Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
- Harnessing Synthetic Data from Generative AI for Statistical Inference
- Instant Preference Alignment for Text-to-Image Diffusion Models
- One-shot Embroidery Customization via Contrastive LoRA Modulation
- Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters
- OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment
- Flow marching for a generative PDE foundation model
- OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
- CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- MEF: A Systematic Evaluation Framework for Text-to-Image Models
- ComposeMe: Attribute-Specific Image Prompts for Controllable Human Image Generation
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs
- Stencil: Subject-Driven Generation with Context Guidance
- VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
- InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
- FakeChain: Exposing Shallow Cues in Multi-Step Deepfake Detection
- Preference Trajectory Modeling via Flow Matching for Sequential Recommendation
- JCo-MVTON: Jointly Controllable Multi-Modal Diffusion Transformer for Mask-Free Virtual Try-on
- OS-DiffVSR: Towards One-step Latent Diffusion Model for High-detailed Real-world Video Super-Resolution
- FG-Attn: Leveraging Fine-Grained Sparse Attention in Video Diffusion Models
- Dynamic Objects Relocalization in Changing Environments with Flow Matching
- MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
- AcT2I: Evaluating and Improving Action Depiction in Text-to-Image Models
- ArchesClimate: Probabilistic Decadal Ensemble Generation With Flow Matching
- SAGE: Semantic-Aware Shared Sampling for Efficient Diffusion
- SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling
- Lynx: Towards High-Fidelity Personalized Video Generation
- Latent Zoning Network: A Unified Principle for Generative Modeling, Representation Learning, and Classification
- PolyJuice Makes It Real: Black-Box, Universal Red Teaming for Synthetic Image Detectors
- DiffusionNFT: Online Diffusion Reinforcement with Forward Process
- LowDiff: Efficient Diffusion Sampling with Low-Resolution Condition
- RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
- Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation
- T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
- Radiology Report Conditional 3D CT Generation with Multi Encoder Latent diffusion Model
- FlowCast-ODE: Continuous Hourly Weather Forecasting with Dynamic Flow Matching and ODE Solver
- MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks
- TinySR: Pruning Diffusion for Real-World Image Super-Resolution
- Modular MeanFlow: Towards Stable and Scalable One-Step Generative Modeling
- AToken: A Unified Tokenizer for Vision
- Condition Weaving Meets Expert Modulation: Towards Universal and Controllable Image Generation
- DiCache: Let Diffusion Model Determine Its Own Cache
- LLM-I: LLMs are Naturally Interleaved Multimodal Creators
- PosBridge: Multi-View Positional Embedding Transplant for Identity-Aware Image Editing
- BiasMap: Leveraging Cross-Attentions to Discover and Mitigate Hidden Social Biases in Text-to-Image Generation
- LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection
- Hunyuan3D Studio: End-to-End AI Pipeline for Game-Ready 3D Asset Generation
- From reactive to cognitive: brain-inspired spatial intelligence for embodied agents
- LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence
- Beyond Sliders: Mastering the Art of Diffusion-based Image Manipulation
- PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
- TrueSkin: Towards Fair and Accurate Skin Tone Recognition and Generation
- HiCache: Training-free Acceleration of Diffusion Models via Hermite Polynomial-based Feature Caching
- MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
- FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
- Fine-Grained Customized Fashion Design with Image-into-Prompt benchmark and dataset from LMM
- Integrating Anatomical Priors into a Causal Diffusion Model
- RewardDance: Reward Scaling in Visual Generation
- RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction
- SplatFill: 3D Scene Inpainting via Depth-Guided Gaussian Splatting
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- Universal Few-Shot Spatial Control for Diffusion Models
- Testing chatbots on the creation of encoders for audio conditioned image generation
- Reconstruction Alignment Improves Unified Multimodal Models
- UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Reward
- LLaDA-VLA: Vision Language Diffusion Action Models
- MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
- Interleaving Reasoning for Better Text-to-Image Generation
- Moment- and Power-Spectrum-Based Gaussianity Regularization for Text-to-Image Models
- Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control
- DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
- Home-made Diffusion Model from Scratch to Hatch
- Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching
- Effectively obtaining acoustic, visual and textual data from videos
- CardiacFlow: 3D+t Four-Chamber Cardiac Shape Completion and Generation via Flow Matching
- EditIDv2: Editable ID Customization with Data-Lubricated ID Feature Integration for Text-to-Image Generation
- FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies
- ScoreMix: Synthetic Data Generation by Score Composition in Diffusion Models Improves Recognition
- Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models
- Transition Models: Rethinking the Generative Learning Objective
- Hyper Diffusion Avatars: Dynamic Human Avatar Generation using Network Weight Space Diffusion
- MEPG:Multi-Expert Planning and Generation for Compositionally-Rich Image Generation
- Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
- PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
- OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
- SAGE: Exploring the Boundaries of Unsafe Concept Domain with Semantic-Augment Erasing
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- A-FloPS: Accelerating Diffusion Sampling with Adaptive Flow Path Sampler
- Distribution estimation via Flow Matching with Lipschitz guarantees
- Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
- MOSAIC: Multi-Subject Personalized Generation via Correspondence-Aware Alignment and Disentanglement
- On the Collapse Errors Induced by the Deterministic Sampler for Diffusion Models
- InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information
- Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
- FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework
- GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
- ManiFlow: A General Robot Manipulation Policy via Consistency Flow Training
- Mixture of Global and Local Experts with Diffusion Transformer for Controllable Face Generation
- DevilSight: Augmenting Monocular Human Avatar Reconstruction through a Virtual Perspective
- Domain Generalization in-the-Wild: Disentangling Classification from Domain-Aware Representations
- PHD: Personalized 3D Human Body Fitting with Point Diffusion
- Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
- Lattice Random Walk Discretisations of Stochastic Differential Equations
- CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
- Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent
- Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation
- Mixture of Contexts for Long Video Generation
- Waver: Wave Your Way to Lifelike Video Generation
- Train-Once Plan-Anywhere Kinodynamic Motion Planning via Diffusion Trees
- Veritas: Generalizable Deepfake Detection via Pattern-Aware Reasoning
- Phased One-Step Adversarial Equilibrium for Video Diffusion Models
- AudioStory: Generating Long-Form Narrative Audio with Large Language Models
- MotionFlux: Efficient Text-Guided Motion Generation through Rectified Flow Matching and Preference Alignment
- ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion
- Color Bind: Exploring Color Perception in Text-to-Image Models
- VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D Space
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
- CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis
- USO: Unified Style and Subject-Driven Generation via Disentangled and Reward Learning
- The Mind's Eye: A Multi-Faceted Reward Framework for Guiding Visual Metaphor Generation
- PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
- ROSE: Remove Objects with Side Effects in Videos
- Follow My Hold: Hand-Object Interaction Reconstruction through Geometric Guidance
- Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
- Scaling Group Inference for Diverse and High-Quality Generation
- Efficient Identification of Critical Transitions via Flow Matching: A Scalable Generative Approach for Many-Body Systems
- CurveFlow: Curvature-Guided Flow Matching for Image Generation
- Compute-Optimal Scaling for Value-Based Deep RL
- Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering
- MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion
- CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
- Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization
- Disentanglement in T-space for Faster and Distributed Training of Diffusion Models with Fewer Latent-states
- OmniTry: Virtual Try-On Anything without Masks
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning
- ID-Card Synthetic Generation: Toward a Simulated Bona fide Dataset
- Creative4U: MLLMs-based Advertising Creative Image Selector with Comparative Reasoning
- EgoTwin: Dreaming Body and View in First Person
- Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
- CTFlow: Video-Inspired Latent Flow Matching for 3D CT Synthesis
- Next Visual Granularity Generation
- MIRAGE: Towards AI-Generated Image Detection in the Wild
- LoRAtorio: An intrinsic approach to LoRA Skill Composition
- ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing
- Ultra-High-Definition Reference-Based Landmark Image Super-Resolution with Generative Diffusion Prior
- NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
- MDNS: Masked Diffusion Neural Sampler via Stochastic Optimal Control
- Increasing the Utility of Synthetic Images through Chamfer Guidance
- A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation
- Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models
- BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation
- Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
- Story2Board: A Training-Free Approach for Expressive Storyboard Generation
- A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation
- Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
- OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
- MUJICA: Reforming SISR Models for PBR Material Super-Resolution via Cross-Map Attention
- MangaDiT: Reference-Guided Line Art Colorization with Hierarchical Attention in Diffusion Transformers
- Images Speak Louder Than Scores: Failure Mode Escape for Enhancing Generative Quality
- Gen-AFFECT: Generation of Avatar Fine-grained Facial Expressions with Consistent identiTy
- Edge General Intelligence Through World Models and Agentic AI: Fundamentals, Solutions, and Challenges
- Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
- Leveraging Failed Samples: A Few-Shot and Training-Free Framework for Generalized Deepfake Detection
- X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents
- Per-Query Visual Concept Learning
- Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation
- Yan: Foundational Interactive Video Generation
- Elucidating Rectified Flow with Deterministic Sampler: Polynomial Discretization Complexity for Multi and One-step Models
- Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip
- Cut2Next: Generating Next Shot via In-Context Tuning
- Learning User Preferences for Image Generation Model
- TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning
- Score Augmentation for Diffusion Models
- X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning
- Generative Video Matting
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
- Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
- MIMIC: Multimodal Inversion for Model Interpretation and Conceptualization
- Enhancing Small-Scale Dataset Expansion with Triplet-Connection-based Sample Re-Weighting
- OMGSR: You Only Need One Mid-timestep Guidance for Real-World Image Super-Resolution
- Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers
- DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation
- CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
- MultiRef: Controllable Image Generation with Multiple Visual References
- Towards High-Order Mean Flow Generative Models: Feasibility, Expressivity, and Provably Efficient Criteria
- Elastic Diffusion Transformer
- ∇NABLA: Neighborhood Adaptive Block-Level Attention
- ReSim: Reliable World Simulation for Autonomous Driving
- OM2P: Offline Multi-Agent Mean-Flow Policy
- SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
- MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
- SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
- Learning 3D Texture-Aware Representations for Parsing Diverse Human Clothing and Body Parts
- Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
- DreamVE: Unified Instruction-based Image and Video Editing
- Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
- KnapFormer: An Online Load Balancer for Efficient Diffusion Transformers Training
- DAFMSVC: One-Shot Singing Voice Conversion with Dual Attention Mechanism and Flow Matching
- Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
- WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
- UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
- MetaDiT: Enabling Fine-grained Constraints in High-degree-of Freedom Metasurface Design
- DualMat: PBR Material Estimation via Coherent Dual-Path Diffusion
- MAISI-v2: Accelerated 3D High-Resolution Medical Image Synthesis with Rectified Flow and Region-specific Contrastive Loss
- Voost: A Unified and Scalable Diffusion Transformer for Bidirectional Virtual Try-On and Try-Off
- HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models
- TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
- Likelihood Matching for Diffusion Models
- Draw Your Mind: Personalized Generation via Condition-Level Modeling in Text-to-Image Diffusion Models
- READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
- SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
- RAAG: Ratio Aware Adaptive Guidance
- UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
- Injecting Measurement Information Yields a Fast and Noise-Robust Diffusion-Based Inverse Problem Solver
- LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing
- LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
- REFLECT: Rectified Flows for Efficient Brain Anomaly Correction Transport
- DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework
- Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct Methods
- Qwen-Image Technical Report
- DreamPainter: Image Background Inpainting for E-commerce Scenarios
- EarthCrafter: Scalable 3D Earth Generation via Dual-Sparse Latent Diffusion
- StrandDesigner: Towards Practical Strand Generation with Sketch Guidance
- The Promise of RL for Autoregressive Image Editing
- ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
- SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
- AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
- SDMatte: Grafting Diffusion Models for Interactive Matting
- DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent Space
- LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer
- Video Generators are Robot Policies
- FMPlug: Plug-In Foundation Flow-Matching Priors for Inverse Problems
- One-Step Flow Policy Mirror Descent
- DivControl: Knowledge Diversion for Controllable Image Generation
- Imbalance in Balance: Online Concept Balancing in Generation Models
- PixNerd: Pixel Neural Field Diffusion
- UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
- H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation
- On the Expressiveness of Softmax Attention: A Recurrent Neural Network Perspective
- A Practical Investigation of Spatially-Controlled Image Generation with Transformers
- Taming Diffusion Transformer for Efficient Mobile Video Generation in Seconds
- On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations
- X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
- Enhancing Generalization in Data-free Quantization via Mixup-class Prompting
- MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
- PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking
- HDR Environment Map Estimation with Latent Diffusion Models
- JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment
- Compositional Video Synthesis by Temporal Object-Centric Learning
- Investigation of Accuracy and Bias in Face Recognition Trained with Synthetic Data
- Harnessing Diffusion-Yielded Score Priors for Image Restoration
- MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation
- Fine-structure Preserved Real-world Image Super-resolution via Transfer VAE Training
- CHORDS: Diffusion Sampling Accelerator with Multi-core Hierarchical ODE Solvers
- FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers
- LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs
- Latent Denoising Makes Good Tokenizers
- ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking
- VITA: Vision-to-Action Flow Matching Policy
- Back to the Features: DINO as a Foundation for Video World Models
- GS-Occ3D: Scaling Vision-only Occupancy Reconstruction with Gaussian Splatting
- RealisVSR: Detail-enhanced Diffusion for Real-World 4K Video Super-Resolution
- Enhancing Reward Models for High-quality Image Generation: Beyond Text-Image Alignment
- Orbis: Overcoming Challenges of Long-Horizon Prediction in Driving World Models
- A Survey of Multimodal Hallucination Evaluation and Detection
- AEDR: Training-Free AI-Generated Image Attribution via Autoencoder Double-Reconstruction
- LoViC: Efficient Long Video Generation with Context Compression
- Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis
- TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive Generation
- TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance
- Identifying Prompted Artist Names from Generated Images
- OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
- Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA
- SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models
- R2MoE: Redundancy-Removal Mixture of Experts for Lifelong Concept Learning
- Qwen-Image-Flash: Beyond Objective Design
- Qwen-Image-2.0 Technical Report
- Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning
- PositionIC: Unified Position and Identity Consistency for Image Customization
- Detail++: Training-Free Detail Enhancer for Text-to-Image Diffusion Models
- An h-space Based Adversarial Attack for Protection Against Few-shot Personalization
- SADA: Stability-guided Adaptive Diffusion Acceleration
- Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling
- SplitMeanFlow: Interval Splitting Consistency in Few-Step Generative Modeling
- DREAM: Scalable Red Teaming for Text-to-Image Generative Systems via Distribution Modeling
- TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
- Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling
- METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark
- A High-Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation
- Hierarchical Rectified Flow Matching with Mini-Batch Couplings
- FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers
- Minimalist Concept Erasure in Generative Models
- Compositional Discrete Latent Code for High Fidelity, Productive Diffusion Models
- Elevating 3D Models: High-Quality Texture and Geometry Refinement from a Low-Quality Model
- CharaConsist: Fine-Grained Consistent Character Generation
- Token Perturbation Guidance for Diffusion Models
- FastFLUX: Pruning FLUX with Block-wise Replacement and Sandwich Training
- Seedance 1.0: Exploring the Boundaries of Video Generation Models
- Bias Analysis in Unconditional Image Generative Models
- Product of Experts for Visual Generation
- Robust 3D-Masked Part-level Editing in 3D Gaussian Splatting with Regularized Score Distillation Sampling
- FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
- MP1: MeanFlow Tames Policy Learning in 1-step for Robotic Manipulation
- DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
- Latent Diffusion Models with Masked AutoEncoders
- IGD: Instructional Graphic Design with Multimodal Layer Generation
- Flows and Diffusions on the Neural Manifold
- Flow Diverse and Efficient: Learning Momentum Flow Matching via Stochastic Velocity Field Sampling
- Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
- From Wardrobe to Canvas: Wardrobe Polyptych LoRA for Part-level Controllable Human Image Generation
- OpenGCRAM: An Open-Source Gain Cell Compiler Enabling Design-Space Exploration for AI Workloads
- Spatial Reasoners for Continuous Variables in Any Domain
- How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
- Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance
- MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models
- WordCraft: Interactive Artistic Typography with Attention Awareness and Noise Blending
- CADmium: Fine-Tuning Code Language Models for Text-Driven Sequential CAD Design
- Universal Physics Simulation: A Foundational Diffusion Approach
- Demystifying Flux Architecture
- La-Proteina: Atomistic Protein Generation via Partially Latent Flow Matching
- Physics vs Distributions: Pareto Optimal Flow Matching with Physics Constraints
- CAIRe: Cultural Attribution of Images by Retrieval-Augmented Evaluation
- CoVAE: Consistency Training of Variational Autoencoders
- Exploiting Leaderboards for Large-Scale Distribution of Malicious Models
- Theory-Informed Improvements to Classifier-Free Guidance for Discrete Diffusion Models
- Lumos-1: On Autoregressive Video Generation from a Unified Model Perspective
- FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency
- Upsample What Matters: Region-Adaptive Latent Sampling for Accelerated Diffusion Transformers
- CoDi: Subject-Consistent and Pose-Diverse Text-to-Image Generation
- CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics
- WaiT for the Signal: Simple Frequency-Aware Flow-Matching
- MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization
- Divergence Minimization Preference Optimization for Diffusion Model Alignment
- ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation
- Towards Evaluating Robustness of Prompt Adherence in Text to Image Models
- A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality
- Bridging the Last Mile of Prediction: Enhancing Time Series Forecasting with Conditional Guided Flow Matching
- Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
- Evaluating Attribute Confusion in Fashion Text-to-Image Generation
- Concept-TRAK: Understanding how diffusion models learn concepts through concept-level attribution
- Scaling can lead to compositional generalization
- NeoBabel: A Multilingual Open Tower for Visual Generation
- LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion
- Integrating Diffusion-based Multi-task Learning with Online Reinforcement Learning for Robust Quadruped Robot Control
- Rethinking Layered Graphic Design Generation with a Top-Down Approach
- MolFORM: Multi-modal Flow Matching for Structure-Based Drug Design
- Effort-Optimized, Accuracy-Driven Labelling and Validation of Test Inputs for DL Systems: A Mixed-Integer Linear Programming Approach
- DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
- From Imitation to Innovation: The Emergence of AI Unique Artistic Styles and the Challenge of Copyright Protection
- A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets
- QR-LoRA: Efficient and Disentangled Fine-tuning via QR Decomposition for Customized Generation
- ICAS: Detecting Training Data from Autoregressive Image Generative Models
- StraightDP: Geometry-Aware Differential Privacy for Rectified-Flow Transformers
- Meshy T2: Fast Native Mesh Generation with Flow Matching
- Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
- CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step
- SeqTex: Generate Mesh Textures in Video Sequence
- TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
- Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation
- DNF-Intrinsic: Deterministic Noise-Free Diffusion for Indoor Inverse Rendering
- Implicit Regularisation in Diffusion Models: An Algorithm-Dependent Generalisation Analysis
- LACONIC: A 3D Layout Adapter for Controllable Image Creation
- MoDA: Multi-modal Diffusion Architecture for Talking Head Generation
- DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation
- Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
- CompoSE: Compositional Synthesis and Editing of 3D Shapes via Part-Aware Control
- RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
- FairHuman: Boosting Hand and Face Quality in Human Image Generation with Minimum Potential Delay Fairness in Diffusion Models
- UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation
- AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
- Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers
- Lost in Latent Space: An Empirical Study of Latent Diffusion Models for Physics Emulation
- ActionParty: Multi-Subject Action Binding in Generative Video Games
- IC-Custom: Diverse Image Customization via In-Context Learning
- TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking
- ReFlex: Text-Guided Editing of Real Images in Rectified Flow via Mid-Step Feature Extraction and Attention Adaptation
- Beyond Overcorrection: Evaluating Diversity in T2I Models with DivBench
- Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation
- DAM-VSR: Disentanglement of Appearance and Motion for Video Super-Resolution
- UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis
- Posterior Inference in Latent Space for Scalable Constrained Black-box Optimization
- ARIG: Autoregressive Interactive Head Generation for Real-time Conversations
- Parameter-aware high-fidelity microstructure generation using stable diffusion
- Latent Posterior-Mean Rectified Flow for Higher-Fidelity Perceptual Face Restoration
- Edit Flows: Flow Matching with Edit Operations
- Calligrapher: Freestyle Text Image Customization
- StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
- Breaking Data Silos: Towards Open and Scalable Mobility Foundation Models via Generative Continual Learning
- SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation
- TurboVSR: Fantastic Video Upscalers and Where to Find Them
- Transition Matching: Scalable and Flexible Generative Modeling
- A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation
- Interactive Interface For Semantic Segmentation Dataset Synthesis
- Towards foundational LiDAR world models with efficient latent flow matching
- A Unified Framework for Stealthy Adversarial Generation via Latent Optimization and Transferability Enhancement
- JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
- Pyramidal Patchification Flow for Visual Generation
- Dreamland: Controllable World Creation with Simulator and Generative Models
- Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers
- MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting
- VisualPrompter: Prompt Optimization with Visual Feedback for Text-to-Image Synthesis
- Ovis-U1 Technical Report
- SongBloom: Coherent Song Generation via Interleaved Autoregressive Sketching and Diffusion Refinement
- TADA: Improved Diffusion Sampling with Training-free Augmented Dynamics
- TanDiT: Tangent-Plane Diffusion Transformer for High-Quality 360° Panorama Generation
- WordCon: Word-level Typography Control in Scene Text Rendering
- Boosting Domain Generalized and Adaptive Detection with Diffusion Models: Fitness, Generalization, and Transferability
- Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
- MediQ-GAN: Quantum-Inspired GAN for High Resolution Medical Image Generation
- Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
- Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation
- BitMark: Watermarking Bitwise Autoregressive Image Generative Models
- DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing
- The Aging Multiverse: Generating Condition-Aware Facial Aging Tree via Training-Free Diffusion
- XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation
- ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
- Generative Blocks World: Moving Things Around in Pictures
- HiWave: Training-Free High-Resolution Image Generation via Wavelet-Based Diffusion Sampling
- From Ideal to Real: Unified and Data-Efficient Dense Prediction for Real-World Scenarios
- OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment
- MultiHuman-Testbench: Benchmarking Image Generation for Multiple Humans
- GenHSI: Controllable Generation of Human-Scene Interaction Videos
- Improving Progressive Generation with Decomposable Flow Matching
- Diffuse Everything: Multimodal Diffusion Models on Arbitrary State Spaces
- SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution
- Orthogonal Finetuning Made Scalable
- Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
- Style Transfer: A Decade Survey
- When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators
- Guidance in the Frequency Domain Enables High-Fidelity Sampling at Low CFG Scales
- Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
- OmniGen2: Towards Instruction-Aligned Multimodal Generation
- SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
- R3D2: Realistic 3D Asset Insertion via Diffusion for Autonomous Driving Simulation
- CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing
- VIVAT: Virtuous Improving VAE Training through Artifact Mitigation
- OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation
- Instability in Diffusion ODEs: An Explanation for Inaccurate Image Reconstruction
- ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
- VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
- DreamCube: 3D Panorama Generation via Multi-plane Synchronization
- UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
- Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition
- The Hidden Cost of an Image: Quantifying the Energy Consumption of AI Image Generation
- Exploring the Usage of Generative AI for Group Project-Based Offline Art Courses in Elementary Schools
- Fast and Stable Diffusion Planning through Variational Adaptive Weighting
- Generative Modeling of Weights: Generalization or Memorization?
- Emergent Temporal Correspondences from Video Diffusion Transformers
- How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
- PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement
- DT-UFC: Universal Large Model Feature Coding via Peaky-to-Balanced Distribution Transformation
- FlowRAM: Grounding Flow Matching Policy with Region-Aware Mamba Framework for Robotic Manipulation
- Improving Rectified Flow with Boundary Conditions
- Evolutionary Caching to Accelerate Your Off-the-Shelf Diffusion Model
- Evaluating Robustness in Latent Diffusion Models via Embedding Level Augmentation
- Show-o2: Improved Native Unified Multimodal Models
- Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material
- PairEdit: Learning Semantic Variations for Exemplar-based Image Editing
- Difference Inversion: Interpolate and Isolate the Difference with Token Consistency for Image Analogy Generation
- Between Regulation and Accessibility: How Chinese University Students Navigate Global and Domestic Generative AI
- FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
- Align Your Flow: Scaling Continuous-Time Flow Map Distillation
- LHM++: An Efficient Large Human Reconstruction Model for Pose-free Images to 3D
- Diagnosing and Improving Diffusion Models by Estimating the Optimal Loss Value
- EchoShot: Multi-Shot Portrait Video Generation
- iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer
- ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies
- EraserDiT: Fast Video Inpainting with Diffusion Transformer Model
- Hi-VAE: Efficient Video Autoencoding with Global and Detailed Motion
- AR-RAG: Autoregressive Retrieval Augmentation for Image Generation
- Auditing Data Provenance in Real-world Text-to-Image Diffusion Models for Privacy and Copyright Protection
- Where and How to Perturb: On the Design of Perturbation Guidance in Diffusion and Flow Models
- GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning
- Symmetrical Flow Matching: Unified Image Generation, Segmentation, and Classification with Score-Based Generative Models
- Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation
- M4V: Multimodal Mamba for Efficient Text-to-Video Generation
- VINCIE: Unlocking In-context Image Editing from Video
- DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers
- PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework
- Geometric Regularity in Deterministic Sampling of Diffusion-based Generative Models
- AnimateAnyMesh: A Feed-Forward 4D Foundation Model for Text-Driven Universal Mesh Animation
- DGAE: Diffusion-Guided Autoencoder for Efficient Latent Representation Learning
- Consistent Story Generation: Unlocking the Potential of Zigzag Sampling
- STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis
- AQUATIC-Diff: Additive Quantization for Truly Tiny Compressed Diffusion Models
- FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech
- Does CLIP perceive art the same way we do?
- Flow-GRPO: Training Flow Matching Models via Online RL
- FontAdapter: Instant Font Adaptation in Visual Text Generation
- GenIR: Generative Visual Feedback for Mental Image Retrieval
- Contrastive Flow Matching
- Rectified Point Flow: Generic Point Cloud Pose Estimation
- Aligning Latent Spaces with Flow Priors
- DIMCIM: A Quantitative Evaluation Framework for Default-mode Diversity and Generalization in Text-to-Image Generative Models
- FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion
- PartCrafter: Structured 3D Mesh Generation via Compositional Latent Diffusion Transformers
- FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
- ContentV: Efficient Training of Video Generation Models with Limited Compute
- Towards Reliable Identification of Diffusion-based Image Manipulations
- FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing
- Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
- DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable
- Defining and Quantifying Creative Behavior in Popular Image Generators
- Unleashing the Power of Text: Text-Guided Flow Matching for Image Fusion under Complex Degradations
- MeshGen: Generating PBR Textured Mesh with Render-Enhanced Auto-Encoder and Generative Data Augmentation
- RAID: A Dataset for Testing the Adversarial Robustness of AI-Generated Image Detectors
- HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
- AgentSGEN: Multi-Agent LLM in the Loop for Semantic Collaboration and GENeration of Synthetic Data
- Resolving Task Objective Conflicts in Unified Model via Task-Aware Mixture-of-Experts
- Multimodal Benchmarking and Recommendation of Text-to-Image Generation Models
- Image Editing As Programs with Diffusion Models
- Generating Pedagogically Meaningful Visuals for Math Word Problems: A New Benchmark and Analysis of Text-to-Image Models
- HuGeDiff: 3D Human Generation via Diffusion with Gaussian Splatting
- Algorithm- and Data-Dependent Generalization Bounds for Diffusion Models
- Negative-Guided Subject Fidelity Optimization for Zero-Shot Subject-Driven Generation
- DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
- RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions
- Rectified Flows for Fast Multiscale Fluid Flow Modeling
- DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models
- Solving Inverse Problems with FLAIR
- Native-Resolution Image Synthesis
- Controllable Human-centric Keyframe Interpolation with Generative Prior
- Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences
- Rethinking Machine Unlearning in Image Generation Models
- Chipmunk: Training-Free Acceleration of Diffusion Transformers with Dynamic Column-Sparse Deltas
- FlexPainter: Flexible and Multi-View Consistent Texture Generation
- UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
- Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers
- DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization
- EDITOR: Effective and Interpretable Prompt Inversion for Text-to-Image Diffusion Models
- Dual-Process Image Generation
- Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences
- Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
- Playing with Transformer at 30+ FPS via Next-Frame Diffusion
- PointT2I: LLM-based text-to-image generation via keypoints
- Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation
- TIIF-Bench: How Does Your T2I Model Follow Your Instructions?
- Diff2Flow: Training Flow Matching Models via Diffusion Model Alignment
- Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks
- Enhancing Diffusion-based Unrestricted Adversarial Attacks via Adversary Preferences Alignment
- Image Generation from Contextually-Contradictory Prompts
- DNAEdit: Direct Noise Alignment for Text-Guided Rectified Flow Editing
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation
- Feature-Aware (Hyper)graph Generation via Next-Scale Prediction
- DeepVerse: 4D Autoregressive Video Generation as a World Model
- DS-VTON: An Enhanced Dual-Scale Coarse-to-Fine Framework for Virtual Try-On
- FourierFlow: Frequency-aware Flow Matching for Generative Turbulence Modeling
- Breaking Latent Prior Bias in Detectors for Generalizable AIGC Image Detection
- SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
- Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
- Autoregressive Images Watermarking through Lexical Biasing: An Approach Resistant to Regeneration Attack
- Humanoid World Models: Open World Foundation Models for Humanoid Robotics
- Latent Wavelet Diffusion For Ultra-High-Resolution Image Synthesis
- Parallel Rescaling: Rebalancing Consistency Guidance for Personalized Diffusion Models
- A Comprehensive Survey of Large AI Models for Future Communications: Foundations, Applications and Challenges
- Seg2Any: Open-set Segmentation-Mask-to-Image Generation with Precise Shape and Semantic Control
- SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation
- Inference-Time Alignment of Diffusion Models via Evolutionary Algorithms
- TumorGen: Boundary-Aware Tumor-Mask Synthesis with Rectified Flow Matching
- EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering
- ComposeAnything: Composite Object Priors for Text-to-Image Generation
- STORK: Faster Diffusion And Flow Matching Sampling By Resolving Both Stiffness And Structure-Dependence
- FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
- FlexiAct: Towards Flexible Action Control in Heterogeneous Scenarios
- ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL
- PDE-Transformer: Efficient and Versatile Transformers for Physics Simulations
- ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
- GenSpace: Benchmarking Spatially-Aware Image Generation
- Accelerated Sampling from Masked Diffusion Models via Entropy Bounded Unmasking
- LoRAShop: Training-Free Multi-Concept Image Generation and Editing with Rectified Flow Transformers
- Distribution-Conditional Generation: From Class Distribution to Creative Generation
- D-AR: Diffusion via Autoregressive Models
- Inference-time Scaling of Diffusion Models through Classical Search
- Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
- Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization
- Fine-Tuning Next-Scale Visual Autoregressive Models with Group Relative Policy Optimization
- Dimension-Reduction Attack! Video Generative Models are Experts on Controllable Image Synthesis
- FlowAlign: Trajectory-Regularized, Inversion-Free Flow-based Image Editing
- Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data
- HyperMotion: DiT-Based Pose-Guided Human Image Animation of Complex Motions
- R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
- Fooling the Watchers: Breaking AIGC Detectors via Semantic Prompt Attacks
- LayerPeeler: Autoregressive Peeling for Layer-wise Image Vectorization
- Test-Time Training Done Right
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- UniTEX: Universal High Fidelity Generative Texturing for 3D Shapes
- Implicit Inversion turns CLIP into a Decoder
- EquiReg: Equivariance Regularized Diffusion for Inverse Problems
- Re-ttention: Ultra Sparse Visual Generation via Attention Statistical Reshape
- What Makes for Text to 360-degree Panorama Generation with Stable Diffusion?
- Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
- SineLoRAΔ: Sine-Activated Delta Compression
- Physics-Informed Distillation of Diffusion Models for PDE-Constrained Generation
- PacTure: Efficient PBR Texture Generation on Packed Views with Visual Autoregressive Models
- ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation
- Streaming Flow Policy: Simplifying diffusion/flow-matching policies by treating action trajectories as flow trajectories
- Inference-Time Scaling of Discrete Diffusion Models via Importance Weighting and Optimal Proposal Design
- Versatile Cardiovascular Signal Generation with a Unified Diffusion Transformer
- Scaling Offline RL via Efficient and Expressive Shortcut Models
- Identity-Preserving Text-to-Image Generation via Dual-Level Feature Decoupling and Expert-Guided Fusion
- HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
- ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
- SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model
- T2S: High-resolution Time Series Generation with Text-to-Series Diffusion Models
- Differentiable Solver Search for Fast Diffusion Sampling
- SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing
- FastFace: Tuning Identity Preservation in Distilled Diffusion via Guidance and Attention
- InstGenIE: Generative Image Editing Made Efficient with Mask-aware Caching and Scheduling
- Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction
- Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed Individuals
- Score Replacement with Bounded Deviation for Rare Prompt Generation
- MagicTryOn: Harnessing Diffusion Transformer for Garment-Preserving Video Virtual Try-on
- LeDiFlow: Learned Distribution-guided Flow Matching to Accelerate Image Generation
- Policy Optimized Text-to-Image Pipeline Design
- Red-Teaming Text-to-Image Systems by Rule-based Preference Modeling
- Advancing high-fidelity 3D and Texture Generation with 2.5D latents
- OVERT: A Benchmark for Over-Refusal Evaluation on Text-to-Image Models
- Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models
- What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
- Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
- No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
- MUSAR: Exploring Multi-Subject Customization from Single-Subject Dataset via Attention Routing
- USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
- StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
- Preserve and Personalize: Personalized Text-to-Image Diffusion Models without Distributional Drift
- ViewCraft3D: High-Fidelity and View-Consistent 3D Vector Graphics Synthesis
- Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning
- In-Context Brush: Zero-shot Customized Subject Insertion with Context-Aware Latent Space Manipulation
- Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
- MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models
- VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval
- ImgEdit: A Unified Image Editing Dataset and Benchmark
- HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
- Decision Flow Policy Optimization
- FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities
- Alchemist: Turning Public Text-to-Image Data into Generative Gold
- Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
- JEDI: The Force of Jensen-Shannon Divergence in Disentangling Diffusion Models
- Jodi: Unification of Visual Generation and Understanding via Joint Modeling
- Querying Kernel Methods Suffices for Reconstructing their Training Data
- Training-free Stylized Text-to-Image Generation with Fast Inference
- STRICT: Stress Test of Rendering Images Containing Text
- GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation
- CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design
- Fast Kernel-Space Diffusion for Remote Sensing Pansharpening
- Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation
- Equivariant Flow Matching for Point Cloud Assembly
- So-Fake: Benchmarking and Explaining Social Media Image Forgery Detection
- Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment
- Mod-Adapter: Tuning-Free and Versatile Multi-concept Personalization via Modulation Adapter
- OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
- Localizing Knowledge in Diffusion Transformers
- VORTA: Efficient Video Diffusion via Routing Sparse Attention
- OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
- LiveLight: Real-time Streaming Video Relighting with Interactive Control
- Diffusion Classifiers Understand Compositionality, but Conditions Apply
- ComfyMind: Toward General-Purpose Generation via Tree-Based Planning and Reactive Feedback
- Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model
- Scaling Image and Video Generation via Test-Time Evolutionary Search
- InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO
- RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning
- Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
- Efficient compression of neural networks and datasets
- FLEX: A Backbone for Diffusion-Based Modeling of Spatio-temporal Physical Systems
- Taming Diffusion for Dataset Distillation with High Representativeness
- Direct3D-S2: Gigascale 3D Generation Made Easy with Spatial Sparse Attention
- Applications of Modular Co-Design for De Novo 3D Molecule Generation
- T2VUnlearning: A Concept Erasing Method for Text-to-Video Diffusion Models
- TokBench: Evaluating Your Visual Tokenizer before Visual Generation
- Creatively Upscaling Images with Global-Regional Priors
- DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?
- Training-Free Efficient Video Generation via Dynamic Token Carving
- REPA Works Until It Doesn't: Early-Stopped, Holistic Alignment Supercharges Diffusion Training
- Disagree to Accelerate: Closing the Loop on Diffusion Feature Forecasts
- Flow Matching based Sequential Recommender Model
- GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
- Conditional Panoramic Image Generation via Masked Autoregressive Modeling
- From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation
- Masked Conditioning for Deep Generative Models
- Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
- Angle Domain Guidance: Latent Diffusion Requires Rotation Rather Than Extrapolation
- Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
- Scaling Diffusion Transformers Efficiently via μP
- SPARE: Structural Parameter-Free Affinity Regularization for Flow Matching
- My Face Is Mine, Not Yours: Facial Protection Against Diffusion Model Face Swapping
- MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing
- Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
- Interspatial Attention for Efficient 4D Human Video Generation
- HaptoFlow: High-Fidelity Real-Time Vibrotactile Generation via Flow Matching for Virtual Reality
- dKV-Cache: The Cache for Diffusion Language Models
- Emerging Properties in Unified Multimodal Pretraining
- Riemannian Flow Matching for Brain Connectivity Matrices via Pullback Geometry
- CtrlDiff: Boosting Large Diffusion Language Models with Dynamic Block Prediction and Controllable Generation
- Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
- Communication-Efficient Diffusion Denoising Parallelization via Reuse-then-Predict Mechanism
- Replace in Translation: Boost Concept Alignment in Counterfactual Text-to-Image
- Fine-tuning Quantized Neural Networks with Zeroth-order Optimization
- RoPECraft: Training-Free Motion Transfer with Trajectory-Guided RoPE Optimization on Diffusion Transformers
- PiT: Progressive Diffusion Transformer
- PhySense: Sensor Placement Optimization for Accurate Physics Sensing
- Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them
- VSA: Faster Video Diffusion with Trainable Sparse Attention
- Mean Flows for One-step Generative Modeling
- Synthetic History: Evaluating Visual Representations of the Past in Diffusion Models
- Is Artificial Intelligence Generated Image Detection a Solved Problem?
- Video-GPT via Next Clip Diffusion
- UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction
- PSDiffusion: Harmonized Multi-Layer Image Generation via Layout and Appearance Alignment
- CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks
- DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
- CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback
- Where Does Generative Difficulty Reside? An Empirical Study of Target Representations
- DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning
- DRAGON: A Large-Scale Dataset of Realistic Images Generated by Diffusion Models
- Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching
- DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation
- Towards Self-Improvement of Diffusion Models via Group Preference Optimization
- QVGen: Pushing the Limit of Quantized Video Generative Models
- Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
- MTVCrafter: 4D Motion Tokenization for Open-World Human Image Animation
- Path Gradients after Flow Matching
- CheXGenBench: A Unified Benchmark For Fidelity, Privacy and Utility of Synthetic Chest Radiographs
- Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
- FlowDreamer: A RGB-D World Model with Flow-based Motion Representations for Robot Manipulation
- FDIR: Harmonizing Fidelity and Human-Machine Preference in Lossy Compression Image Restoration
- Aquarius: A Family of Industry-Level Video Generation Models for Marketing Scenarios
- Gimbal360: Canonicalizing Planar Diffusion for Spherical Panorama Completion
- Plug-and-Play Guidance for Discrete Diffusion Models via Gradient-Informed Logit Correction
- Fast Text-to-Audio Generation with Adversarial Post-Training
- Distilling Drifting Transformers with Representation Autoencoders
- FLUXSynID: A Framework for Identity-Controlled Synthetic Face Generation with Document and Live Images
- DanceGRPO: Unleashing GRPO on Visual Generation
- Improving Trajectory Stitching with Flow Models
- Addressing degeneracies in latent interpolation for diffusion models
- H3DP: Triply-Hierarchical Diffusion Policy for Visuomotor Learning
- ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models
- You Only Look One Step: Accelerating Backpropagation in Diffusion Sampling with Gradient Shortcuts
- Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
- The ML.ENERGY Benchmark: Toward Automated Inference Energy Measurement and Optimization
- Accelerating Diffusion Transformer via Increment-Calibrated Caching with Channel-Aware Singular Value Decomposition
- From Pixels to Perception: Interpretable Predictions via Instance-wise Grouped Feature Selection
- InstanceGen: Image Generation with Instance-level Instructions
- Face-D(2)CL: Multi-Domain Synergistic Representation with Dual Continual Learning for Facial DeepFake Detection
- ARGen: Affect-Reinforced Generative Augmentation towards Vision-based Dynamic Emotion Perception
- Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation
- Video Generation Models are General-Purpose Vision Learners
- VSC: Visual Search Compositional Text-to-Image Diffusion Model
- Improving Editability in Image Generation with Layer-wise Memory
- Diffusion Language Models: An Experimental Analysis
- Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models
- Taming Outlier Tokens in Diffusion Transformers
- Envisioning the Future, One Step at a Time
- BitDance: Scaling Autoregressive Generative Models with Binary Tokens
- Learning Hamiltonian Flow Maps: Mean Flow Consistency for Large-Timestep Molecular Dynamics
- Sat-JEPA-Diff: Bridging Self-Supervised Learning and Generative Diffusion for Remote Sensing
- CytoSyn: a Foundation Diffusion Model for Histopathology -- Tech Report
- Semantic-level Backdoor Attack against Text-to-Image Diffusion Models
- V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising
- Quantum Generative Diffusion Model for Real-World Time Series
- JointDiT: Enhancing RGB-Depth Joint Modeling with Diffusion Transformers
- The Latent Color Subspace: Emergent Order in High-Dimensional Chaos
- Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
- InterleaveThinker: Reinforcing Agentic Interleaved Generation
- Latent Spatial Memory for Video World Models
- Geometric Autoencoder for Diffusion Models
- UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving
- Helios: Real Real-Time Long Video Generation Model
- Multi-Modal Language Models as Text-to-Image Model Evaluators
- BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation
- Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge
- Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation
- Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
- Beyond Language Modeling: An Exploration of Multimodal Pretraining
- Image Generation with a Sphere Encoder
- WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL
- Representation Forcing for Bottleneck-Free Unified Multimodal Models
- On the Relationship Between Activation Outliers and Feature Death in Sparse Autoencoders
- Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- BlazeEdit: Generalist Image Editing on Mobile Devices with Image-to-Image Diffusion Models
- Why Compress What You Can Generate? When GPT-4o Generation Ushers in Image Compression Fields
- AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images
- ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
- Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space
- SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
- Large Language Models are Universal Reasoners for Visual Generation
- X-Fusion: Introducing New Modality to Frozen Large Language Models
- PRISM-DP: Spatial Pose-based Observations for Diffusion-Policies via Segmentation, Mesh Generation, and Pose Tracking
- ADiff4TPP: Asynchronous Diffusion Models for Temporal Point Processes
- Antidote: A Unified Framework for Mitigating LVLM Hallucinations in Counterfactual Presupposition and Object Perception
- TrueFake: A Real World Case Dataset of Last Generation Fake Images also Shared on Social Networks
- Interactive Discovery and Exploration of Visual Bias in Generative Text-to-Image Models
- DiVE: Efficient Multi-View Driving Scenes Generation Based on Video Diffusion Transformer
- Signal or Noise? Understanding Generative Models for Real-World Sensor Time Series
- DanceOPD: On-Policy Generative Field Distillation
- WEAVER, Better, Faster, Longer: An Effective World Model for Robotic Manipulation
- PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
- Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation
- RewardFlow: Generate Images by Optimizing What You Reward
- Tstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Items
- Diamond Maps: Efficient Reward Alignment via Stochastic Flow Maps
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- RepText: Rendering Visual Text via Replicating
- SynergyAmodal: Deocclude Anything with Text Control
- Learning to Drive from a World Model
- IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos
- REED-VAE: RE-Encode Decode Training for Iterative Image Editing with Diffusion Models
- TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
- Inspiration Seeds: Learning Non-Literal Visual Combinations for Generative Exploration
- Where Do the Joules Go? Diagnosing Inference Energy Consumption
- MapPFN: Learning Causal Perturbation Maps in Context
- Flow-based Extremal Mathematical Structure Discovery
- SDiT: Semantic Region-Adaptive for Diffusion Transformers
- R3DPA: Leveraging 3D Representation Alignment and RGB Pretrained Priors for LiDAR Scene Generation
- RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing
- Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds
- Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging
- Predictive Enhancement Calibration for Latent Breast MRI Virtual Contrast Enhancement
- Can Text-to-Image Models Draw from the Right Frame of Reference?
- Dual Prompting Image Restoration with Diffusion Transformers
- Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models
- Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates
- Step1X-Edit: A Practical Framework for General Image Editing
- When does training on downscaled images yield the same gradients?
- Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution
- Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models
- Simile Understanding in Text-to-Image Models: An Evaluation Framework
- STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models
- DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech
- MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
- Learning Direct Control Policies with Flow Matching for Autonomous Driving
- UniCSG: Unified High-Fidelity Content-Constrained Style-Driven Generation via Staged Semantic and Frequency Disentanglement
- Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation
- Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute
- Foundation Models for Software Engineering of Cyber-Physical Systems: the Road Ahead
- DreamO: A Unified Framework for Image Customization
- UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
- Generalized Neighborhood Attention: Multi-dimensional Sparse Attention at the Speed of Light
- From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning
- FreeGraftor: Training-Free Cross-Image Feature Grafting for Subject-Driven Text-to-Image Generation
- DiTPainter: Efficient Video Inpainting with Diffusion Transformers
- π0.5: a Vision-Language-Action Model with Open-World Generalization
- Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
- Acquire and then Adapt: Squeezing out Text-to-Image Model for Image Restoration
- "I Know It When I See It": Mood Spaces for Connecting and Expressing Visual Concepts
- DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation
- RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild
- OmniAudio: Generating Spatial Audio from 360-Degree Video
- GainSight: A Unified Framework for Data Lifetime Profiling and Heterogeneous Memory Composition
- Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
- UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
- SUDO: Enhancing Text-to-Image Diffusion Models with Self-Supervised Direct Preference Optimization
- Turbo2K: Towards Ultra-Efficient and High-Quality 2K Video Synthesis
- Towards Explainable Fake Image Detection with Multi-Modal Large Language Models
- PRISM: A Unified Framework for Photorealistic Reconstruction and Intrinsic Scene Modeling
- Learning Joint ID-Textual Representation for ID-Preserving Image Synthesis
- LLM-Enabled Style and Content Regularization for Personalized Text-to-Image Generation
- Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
- ESPLoRA: Enhanced Spatial Precision with Low-Rank Adaption in Text-to-Image Diffusion Models for High-Definition Synthesis
- MusFlow: Multimodal Music Generation via Conditional Flow Matching
- U-Shape Mamba: State Space Model for faster diffusion
- Early Timestep Zero-Shot Candidate Selection for Instruction-Guided Image Editing
- On the minimax optimality of Flow Matching through the connection to kernel density estimation
- MGT: Extending Virtual Try-Off to Multi-Garment Scenarios
- DiTaiListener: Controllable High Fidelity Listener Video Generation with Diffusion
- UniEdit-Flow: Unleashing Inversion and Editing in the Era of Flow Models
- Set You Straight: Auto-Steering Denoising Trajectories to Sidestep Unwanted Concepts
- DMM: Building a Versatile Image Generation Model via Distillation-Based Model Merging
- The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation
- Instruction-augmented Multimodal Alignment for Image-Text and Element Matching
- InstantCharacter: Personalize Any Characters with a Scalable Diffusion Transformer Framework
- LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction
- Hierarchical Flow Matching for 3D Point Cloud Generation
- Rethinking Automatic Music Mixing as Sequential Stem Blending
- SDEIT: Semantic-Driven Electrical Impedance Tomography
- CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation
- Faster and Better Alignment for Flow Matching Models via Step-aware Advantages
- Seedream 3.0 Technical Report
- ADT: Tuning Diffusion Models with Adversarial Supervision
- SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL
- REPA-E: Unlocking VAE for End-to-End Tuning with Latent Diffusion Transformers
- Anchor Token Matching: Implicit Structure Locking for Training-free AR Image Editing
- Hierarchical and Step-Layer-Wise Tuning of Attention Specialty for Multi-Instance Synthesis in Diffusion Transformers
- Efficient Generative Model Training via Embedded Representation Warmup
- H3AE: High Compression, High Speed, and High Quality AutoEncoder for Video Diffusion Models
- On Equivariance and Fast Sampling in Video Diffusion Models Trained with Warped Noise
- D2iT: Dynamic Diffusion Transformer for Accurate Image Generation
- Flux Already Knows -- Activating Subject-Driven Image Generation without Training
- LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
- MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
- Generating Fine Details of Entity Interactions
- LookingGlass: Generative Anamorphoses via Laplacian Pyramid Warping
- Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model
- PixelFlow: Pixel-Space Generative Models with Flow
- VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
- DiverseFlow: Sample-Efficient Diverse Mode Coverage in Flows
- Latent Diffusion U-Net Representations Contain Positional Embeddings and Anomalies
- EIDT-V: Exploiting Intersections in Diffusion Trajectories for Model-Agnostic, Zero-Shot, Training-Free Text-to-Video Generation
- PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text Rendering
- TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-to-Audio Synthesis
- HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
- Flash Sculptor: Modular 3D Worlds from Objects
- Studying Image Diffusion Features for Zero-Shot Video Object Segmentation
- GARF: Learning Generalizable 3D Reassembly for Real-World Fractures
- Gaussian Mixture Flow Matching Models
- Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
- Disentangling Instruction Influence in Diffusion Transformers for Parallel Multi-Instruction-Guided Image Editing
- FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis
- Autonomous and Self-Adapting System for Synthetic Media Detection and Attribution
- Detection Limits and Statistical Separability of Tree Ring Watermarks in Rectified Flow-based Text-to-Image Generation Models
- Generating ensembles of spatially-coherent in-situ forecasts using flow matching
- Fine-Tuning Visual Autoregressive Models for Subject-Driven Generation
Discussions
Related