Qwen-Image Technical Report
2025/08/04 by Wu, Chenfei, Li, Jiahao, Zhou, Jingren +36 · 239 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
paper · doi:10.48550/arxiv.2508.02324
Abstract
We present Qwen-Image, an image generation foundation model in the Qwen series that achieves significant advances in complex text rendering and precise image editing. To address the challenges of complex text rendering, we design a comprehensive data pipeline that includes large-scale data collection, filtering, annotation, synthesis, and balancing. Moreover, we adopt a progressive training strategy that starts with non-text-to-text rendering, evolves from simple to complex textual inputs, and gradually scales up to paragraph-level descriptions. This curriculum learning approach substantially enhances the model's native text rendering capabilities. As a result, Qwen-Image not only performs exceptionally well in alphabetic languages such as English, but also achieves remarkable progress on more challenging logographic languages like Chinese. To enhance image editing consistency, we introduce an improved multi-task training paradigm that incorporates not only traditional text-to-image (T2I) and text-image-to-image (TI2I) tasks but also image-to-image (I2I) reconstruction, effectively aligning the latent representations between Qwen2.5-VL and MMDiT. Furthermore, we separately feed the original image into Qwen2.5-VL and the VAE encoder to obtain semantic and reconstructive representations, respectively. This dual-encoding mechanism enables the editing module to strike a balance between preserving semantic consistency and maintaining visual fidelity. Qwen-Image achieves state-of-the-art performance, demonstrating its strong capabilities in both image generation and editing across multiple benchmarks.
Citations
Cited by
- EgoPlay: Event-Triggered Video Editing for Egocentric Streams
- MIRA: Multimodal Iterative Reasoning Agent for Image Editing
- LongCat-Image Technical Report
- Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
- LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation
- ThinkGen: Generalized Thinking for Visual Generation
- D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
- PaperBanana: Automating Academic Illustration for AI Scientists
- EgoReAct: Egocentric Video-Driven 3D Human Reaction Generation
- IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation
- DreamOmni3: Scribble-based Editing and Generation
- JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
- Normalizing Trajectory Models
- UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling
- Breaking the Synthetic-Real Domain Shortcut for Training-Free Generative Replay-based Class Incremental Learning
- DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models
- Sense it with your eyes: Sensation Generation and Understanding for Advertisements
- HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document
- Layering Virtual Try-On
- Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests
- ID-V2V: Identity-Preserving Video Restylization
- Text-based Tactile Graphics Generation for the Visually Impaired
- DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation
- Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
- CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation
- dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models
- VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
- 3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory
- Efficient Zero-Shot Inpainting with Decoupled Diffusion Guidance
- UmniBench: Unified Understand and Generation Model Oriented Omni-dimensional Benchmark
- GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
- Kling-Omni Technical Report
- Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models
- TextEditBench: Evaluating Reasoning-aware Text Editing Beyond Rendering
- MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator
- SketchAssist: A Practical Assistant for Semantic Edits and Precise Local Redrawing
- OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
- The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy
- Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
- ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement
- CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
- Few-Step Distillation for Text-to-Image Generation: A Practical Guide
- Test-Time Modification: Inverse Domain Transformation for Robust Perception
- MineTheGap: Automatic Mining of Biases in Text-to-Image Models
- FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning
- Adaptive Detector-Verifier Framework for Zero-Shot Polyp Detection in Open-World Settings
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- CineLOG: A Training Free Approach for Cinematic Long Video Generation
- Exploring MLLM-Diffusion Information Transfer with MetaCanvas
- AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
- DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation
- IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
- StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
- AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models
- ContextDrag: Precise Drag-Based Image Editing via Context-Preserving Token Injection and Position-Aligned Attention
- OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
- Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality
- Relational Visual Similarity
- OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
- D3-Predictor: Noise-Free Deterministic Diffusion for Dense Prediction
- EditThinker: Unlocking Iterative Reasoning for Any Image Editor
- EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
- Self-Supervised AI-Generated Image Detection: A Camera Metadata Perspective
- EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
- COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence
- I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
- UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
- ConvRot: Rotation-Based Plug-and-Play 4-bit Quantization for Diffusion Transformers
- TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows
- MagicQuillV2: Precise and Interactive Image Editing with Layered Visual Cues
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation
- WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
- UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits
- Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing
- Reversible Inversion for Training-Free Exemplar-guided Image Editing
- PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
- PhotoFramer: Multi-modal Image Composition Instruction
- MM-ACT: Learn from Multimodal Parallel Generation to Act
- Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
- RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
- WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
- Vision Bridge Transformer at Scale
- REVEAL: Reasoning-enhanced Forensic Evidence Analysis for Explainable AI-generated Image Detection
- Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework
- Ovis-Image Technical Report
- JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization
- World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models
- AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
- Canvas-to-Image: Compositional Image Generation with Multimodal Controls
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- Pygmalion Effect in Vision: Image-to-Clay Translation for Reflective Geometry Reconstruction
- From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition
- Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward
- HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
- STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows
- MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts
- The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
- PromptMoG: Enhancing Diversity in Long-Prompt Image Generation via Prompt Embedding Mixture-of-Gaussian Sampling
- OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
- Are Image-to-Video Models Good Zero-Shot Image Editors?
- Flow Map Distillation Without Data
- SPQR: A Standardized Benchmark for Modern Safety Alignment Methods in Text-to-Image Diffusion Models
- Understanding, Accelerating, and Improving MeanFlow Training
- FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
- VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- MagicWand: A Universal Agent for Generation and Evaluation Aligned with User Preference
- ConsistCompose: Unified Multimodal Layout Control for Image Composition
- Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models
- Plan-X: Instruct Video Generation via Semantic Planning
- Counterfactual World Models via Digital Twin-conditioned Video Diffusion
- Refracting Reality: Generating Images with Realistic Transparent Objects
- One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
- Loomis Painter: Reconstructing the Painting Process
- EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
- Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers
- Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes
- First Frame Is the Place to Go for Video Content Customization
- Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
- ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
- TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
- SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design
- Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
- A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space
- GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
- T2IBias: Uncovering Societal Bias Encoded in the Latent Space of Text-to-Image Generative Models
- MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
- SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
- UniREditBench: A Unified Reasoning-based Image Editing Benchmark
- Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?
- NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
- Culture in Action: Evaluating Text-to-Image Models through Social Activities
- Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Proto-LeakNet: Towards Signal-Leak Aware Attribution in Synthetic Human Face Imagery
- Evolutionary Optimization Trumps Adam Optimization on Embedding Space Exploration
- MIFO: Learning and Synthesizing Multi-Instance from One Image
- ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
- MagicView: Multi-View Consistent Identity Customization via Priors-Guided In-Context Learning
- From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection
- Emu3.5: Native Multimodal Models are World Learners
- RegionE: Adaptive Region-Aware Generation for Efficient Image Editing
- Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation
- FreeShadow: Training-Free Shadow Removal via Illumination Transfer and Selective Content Preservation in Diffusion Models
- Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models
- InstructPLM-mu: 1-Hour Fine-Tuning of ESM2 Beats ESM3 in Protein Mutation Predictions
- FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
- SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
- Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
- Uniform Discrete Diffusion with Metric Path for Video Generation
- Group Relative Attention Guidance for Image Editing
- Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
- Rethinking Visual Intelligence: Insights from Video Pretraining
- ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
- OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation
- FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time
- OmniDexGrasp: Generalizable Dexterous Grasping via Foundation Model and Force Feedback
- Sample By Step, Optimize By Chunk: Chunk-Level GRPO For Text-to-Image Generation
- Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
- Positional Encoding Field
- Target-aware Image Editing via Cycle-consistent Constraints
- LayerComposer: Multi-Human Personalized Generation via Layered Canvas
- Data-Centric Lessons To Improve Speech-Language Pretraining
- A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation
- The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models
- Exposing Blindspots: Cultural Bias Evaluation in Generative Image Models
- UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
- PICABench: How Far Are We from Physically Realistic Image Editing?
- L2P: Unlocking Latent Potential for Pixel Generation
- Personalized Image Filter: Mastering Your Photographic Style
- Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
- BLIP3o-NEXT: Next Frontier of Native Image Generation
- In-Context Learning with Unpaired Clips for Instruction-based Video Editing
- WithAnyone: Towards Controllable and ID Consistent Image Generation
- UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE
- Generative Universal Verifier as Multimodal Meta-Reasoner
- UniFusion: Vision-Language Model as Unified Encoder in Image Generation
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- Demystifying Numerosity in Diffusion Models -- Limitations and Remedies
- UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
- Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
- ReMix: Towards a Unified View of Consistent Character Generation and Editing
- Asymmetric Flow Models
- DisCo: Reinforcement with Diversity Constraints for Multi-Human Generation
- Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation
- UniVideo: Unified Understanding, Generation, and Editing for Videos
- Ctrl-VI: Controllable Video Synthesis via Variational Inference
- Growing Visual Generative Capacity for Pre-Trained MLLMs
- Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
- DreamOmni2: Multimodal Instruction-based Editing and Generation
- Factuality Matters: When Image Generation and Editing Meet Structured Visuals
- TBStar-Edit: From Image Editing Pattern Shifting to Consistency Enhancement
- ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
- Let Features Decide Their Own Solvers: Hybrid Feature Caching for Diffusion Transformers
- UniShield: An Adaptive Multi-Agent Framework for Unified Forgery Image Detection and Localization
- TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
- To Compress or Not? Pushing the Frontier of Lossless GenAI Model Weights Compression with Exponent Concentration
- Stitch: Training-Free Position Control in Multimodal Diffusion Transformers
- RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark
- Exploring Opportunities to Support Novice Visual Artists' Inspiration and Ideation with Generative AI
- Fidelity-Aware Data Composition for Robust Robot Generalization
- EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling
- MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
- Blueprint-Bench: Comparing spatial intelligence of LLMs, agents and image models
- SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers
- FitPro: A Zero-Shot Framework for Interactive Text-based Pedestrian Retrieval in Open World
- MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
- MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks
- GenExam: A Multidisciplinary Text-to-Image Exam
- Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
- DiCache: Let Diffusion Model Determine Its Own Cache
- CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion
- Hunyuan3D Studio: End-to-End AI Pipeline for Game-Ready 3D Asset Generation
- HiCache: Training-free Acceleration of Diffusion Models via Hermite Polynomial-based Feature Caching
- MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
- FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
- RewardDance: Reward Scaling in Visual Generation
- Reconstruction Alignment Improves Unified Multimodal Models
- UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
- OmniStyle2: Learning to Stylize by Learning to Destylize
- Symbolic Graphics Programming with Large Language Models
- Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
- DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models
- PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
- USO: Unified Style and Subject-Driven Generation via Disentangled and Reward Learning
- Collaborative Multi-Modal Coding for High-Quality 3D Generation
- Visual Autoregressive Modeling for Instruction-Guided Image Editing
- CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance
- NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
- Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
- TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning
- CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing
- Elastic Diffusion Transformer
- RAAG: Ratio Aware Adaptive Guidance
- When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models
Related