T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models
2023/02/16 by Chong Mou, Mou, Chong, Xintao Wang +12 · 159 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Machine Learning (cs.LG) #Multimedia (cs.MM)
paper · pdf · doi:10.48550/arxiv.2302.08453
openalex publication_date 2023/02/16 · openalex created_date 2023/02/18 · openalex updated_date 2026/07/28
Abstract
The incredible generative ability of large-scale text-to-image (T2I) models has demonstrated strong power of learning complex structures and meaningful semantics. However, relying solely on text prompts cannot fully take advantage of the knowledge learned by the model, especially when flexible and accurate controlling (e.g., color and structure) is needed. In this paper, we aim to ``dig out" the capabilities that T2I models have implicitly learned, and then explicitly use them to control the generation more granularly. Specifically, we propose to learn simple and lightweight T2I-Adapters to align internal knowledge in T2I models with external control signals, while freezing the original large T2I models. In this way, we can train various adapters according to different conditions, achieving rich control and editing effects in the color and structure of the generation results. Further, the proposed T2I-Adapters have attractive properties of practical value, such as composability and generalization ability. Extensive experiments demonstrate that our T2I-Adapter has promising generation quality and a wide range of applications.
Cited by
- EmoCtrl: Controllable Emotional Image Content Generation
- Meta-information Guided Cross-domain Synergistic Diffusion Model for Low-dose PET Reconstruction
- ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition
- ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision
- 3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory
- DVI: Disentangling Semantic and Visual Identity for Training-Free Personalized Generation
- In-Context Audio Control of Video Diffusion Transformers
- Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers
- Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
- Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation
- DeContext as Defense: Safe Image Editing in Diffusion Transformers
- Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding
- Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution
- Quality-Driven and Diversity-Aware Sample Expansion for Robust Marine Obstacle Segmentation
- Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs
- SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- StereoSpace: Depth-Free Synthesis of Stereo Geometry via End-to-End Diffusion in a Canonical Space
- VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification
- FlowSteer: Conditioning Flow Field for Consistent Image Restoration
- Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation
- MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition
- Training-free Clothing Region of Interest Self-correction for Virtual Try-On
- VDOT: Efficient Unified Video Creation via Optimal Transport Distillation
- Rectifying Latent Space for Generative Single-Image Reflection Removal
- 2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency
- NeuralRemaster: Phase-Preserving Diffusion for Structure-Aligned Generation
- Object Reconstruction under Occlusion with Generative Priors and Contact-induced Constraints
- ICM-SR: Image-Conditioned Manifold Regularization for Image Super-Resolution
- Training for Identity, Inference for Controllability: A Unified Approach to Tuning-Free Face Personalization
- Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
- MVRoom: Controllable 3D Indoor Scene Generation with Multi-View Diffusion Models
- MagicQuillV2: Precise and Interactive Image Editing with Layered Visual Cues
- Glance: Accelerating Diffusion Models with 1 Sample
- PGP-DiffSR: Phase-Guided Progressive Pruning for Efficient Diffusion-based Image Super-Resolution
- FlowEO: Generative Unsupervised Domain Adaptation for Earth Observation
- Reversible Inversion for Training-Free Exemplar-guided Image Editing
- TokenPure: Watermark Removal through Tokenized Appearance and Structural Guidance
- DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models
- Match-and-Fuse: Consistent Generation from Unstructured Image Sets
- TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model
- MedCondDiff: Lightweight, Robust, Semantically Guided Diffusion for Medical Image Segmentation
- DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline
- Vision Bridge Transformer at Scale
- MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
- Canvas-to-Image: Compositional Image Generation with Multimodal Controls
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
- ConsistCompose: Unified Multimodal Layout Control for Image Composition
- FeRA: Frequency-Energy Constrained Routing for Effective Diffusion Adaptation Fine-Tuning
- SceneDesigner: Controllable Multi-Object Image Generation with 9-DoF Pose Manipulation
- Generative Augmented Reality: Paradigms, Technologies, and Future Applications
- SplitFlux: Learning to Decouple Content and Style from a Single Image
- Semantic Context Matters: Improving Conditioning for Autoregressive Models
- Diffusion Algorithm for Metalens Optical Aberration Correction
- A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space
- Simulating the Visual World with Artificial Intelligence: A Roadmap
- Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications
- PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- CPO: Condition Preference Optimization for Controllable Image Generation
- Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models
- Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
- From Pixels to Paths: A Multi-Agent Framework for Editable Scientific Illustration
- AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency
- Generating metamers of human scene understanding
- Beyond Inference Intervention: Identity-Decoupled Diffusion for Face Anonymization
- Neural USD: An object-centric framework for iterative editing and control
- SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency
- GeoDiffusion: A Training-Free Framework for Accurate 3D Geometric Conditioning in Image Generation
- Enhancing Video Inpainting with Aligned Frame Interval Guidance
- LightsOut: Diffusion-based Outpainting for Enhanced Lens Flare Removal
- TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation
- Video-As-Prompt: Unified Semantic Control for Video Generation
- EchoDistill: Bidirectional Concept Distillation for One-Step Diffusion Personalization
- LayerComposer: Multi-Human Personalized Generation via Layered Canvas
- ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention
- Exploring Image Representation with Decoupled Classical Visual Descriptors
- NANO3D: A Training-Free Approach for Efficient 3D Editing Without Masks
- Salient Concept-Aware Generative Data Augmentation
- FedMMKT:Co-Enhancing a Server Text-to-Image Model and Client Task Models in Multi-Modal Federated Learning
- A Framework for Low-Effort Training Data Generation for Urban Semantic Segmentation
- Jigsaw3D: Disentangled 3D Style Transfer via Patch Shuffling and Masking
- ReMix: Towards a Unified View of Consistent Character Generation and Editing
- Few-shot multi-token DreamBooth with LoRa for style-consistent character generation
- X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering
- UniVideo: Unified Understanding, Generation, and Editing for Videos
- UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
- VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
- scPPDM: A Diffusion Model for Single-Cell Drug-Response Prediction
- SIGMA-GEN: Structure and Identity Guided Multi-subject Assembly for Image Generation
- Efficient Conditional Generation on Scale-based Visual Autoregressive Models
- AgeBooth: Controllable Facial Aging and Rejuvenation via Diffusion Models
- VChain: Chain-of-Visual-Thought for Reasoning in Video Generation
- Learning to Generate Rigid Body Interactions with Video Diffusion Models
- Stitch: Training-Free Position Control in Multimodal Diffusion Transformers
- IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance
- PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
- CO3: Contrasting Concepts Compose Better
- Guided Diffusion for the Discovery of New Superconductors
- Environment-Aware Satellite Image Generation with Diffusion Models
- Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
- Universal Multi-Domain Translation via Diffusion Routers
- SemanticControl: A Training-Free Approach for Handling Loosely Aligned Visual Conditions in ControlNet
- DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
- Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets
- MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation
- One-shot Embroidery Customization via Contrastive LoRA Modulation
- Towards Application Aligned Synthetic Surgical Image Synthesis
- Semantic and Visual Crop-Guided Diffusion Models for Heterogeneous Tissue Synthesis in Histopathology
- SISMA: Semantic Face Image Synthesis with Mamba
- CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration
- WorldForge: Unlocking Emergent 3D/4D Generation in Video Diffusion Model via Training-Free Guidance
- Towards Robust Defense against Customization via Protective Perturbation Resistant to Diffusion-based Purification
- Generative Image Coding with Diffusion Prior
- ANYPORTAL: Zero-Shot Consistent Video Background Replacement
- Universal Few-Shot Spatial Control for Diffusion Models
- UniView: Enhancing Novel View Synthesis From A Single Image By Unifying Reference Features
- FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image Generation
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation
- Visually Grounded Narratives: Reducing Cognitive Burden in Researcher-Participant Interaction
- MedShift: Implicit Conditional Transport for X-Ray Domain Adaptation
- Generative AI for Industrial Contour Detection: A Language-Guided Vision System
- FastFit: Accelerating Multi-Reference Virtual Try-On via Cacheable Diffusion Models
- Articulate3D: Zero-Shot Text-Driven 3D Object Posing
- Generative AI in Map-Making: A Technical Exploration and Its Implications for Cartographers
- SAT-SKYLINES: 3D Building Generation from Satellite Imagery and Coarse Geometric Priors
- See it. Say it. Sorted: Agentic System for Compositional Diagram Generation
- GSFix3D: Diffusion-Guided Repair of Novel Views in Gaussian Splatting
- Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering
- Sketch3DVE: Sketch-based 3D-Aware Scene Video Editing
- OmniTry: Virtual Try-On Anything without Masks
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- PQ-DAF: Pose-driven Quality-controlled Data Augmentation for Data-scarce Driver Distraction Detection
- Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion
- Animate-X++: Universal Character Image Animation with Dynamic Backgrounds
- CObL: Toward Zero-Shot Ordinal Layering without User Prompting
- Canvas3D: Empowering Precise Spatial Control for Image Generation with Constraints from a 3D Virtual Canvas
- 4DVD: Cascaded Dense-view Video Diffusion Model for High-quality 4D Content Generation
- Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm
- DreamPainter: Image Background Inpainting for E-commerce Scenarios
- AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
- Personalized Safety Alignment for Text-to-Image Diffusion Models
- The Promise of RL for Autoregressive Image Editing
- TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models
- Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence
- Adaptively Distilled ControlNet: Accelerated Training and Superior Sampling for Medical Image Synthesis
- DivControl: Knowledge Diversion for Controllable Image Generation
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
- Subtyping Breast Lesions via Generative Augmentation based Long-tailed Recognition in Ultrasound
- See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs
- Compositional Video Synthesis by Temporal Object-Centric Learning
- Fine-structure Preserved Real-world Image Super-resolution via Transfer VAE Training
- KB-DMGen: Knowledge-Based Global Guidance and Dynamic Pose Masking for Human Image Generation
- LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs
- SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations
- SCALAR: Scale-wise Controllable Visual Autoregressive Learning
- Joint Holistic and Lesion Controllable Mammogram Synthesis via Gated Conditional Diffusion Model
- Cross-Subject Mind Decoding from Inaccurate Representations
Related