Evaluating Text-to-Visual Generation with Image-to-Text Generation
2024/04/01 by Zhiqiu Lin, Deepak Pathak, Lin, Zhiqiu +13 · 1 voice · 118 citations
Arts and Humanities · Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Digital Humanities and Scholarship #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimedia (cs.MM) #cs.AI #cs.CL #cs.CV #cs.LG #cs.MM
paper · pdf · doi:10.48550/arxiv.2404.01291
openalex publication_date 2024/04/01 · arxiv published 2024/04/01 · arxiv updated 2024/06/18 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
Despite significant progress in generative AI, comprehensive evaluation remains challenging because of the lack of effective metrics and standardized benchmarks. For instance, the widely-used CLIPScore measures the alignment between a (generated) image and text prompt, but it fails to produce reliable scores for complex prompts involving compositions of objects, attributes, and relations. One reason is that text encoders of CLIP can notoriously act as a "bag of words", conflating prompts such as "the horse is eating the grass" with "the grass is eating the horse". To address this, we introduce the VQAScore, which uses a visual-question-answering (VQA) model to produce an alignment score by computing the probability of a "Yes" answer to a simple "Does this figure show 'text'?" question. Though simpler than prior art, VQAScore computed with off-the-shelf models produces state-of-the-art results across many (8) image-text alignment benchmarks. We also compute VQAScore with an in-house model that follows best practices in the literature. For example, we use a bidirectional image-question encoder that allows image embeddings to depend on the question being asked (and vice versa). Our in-house model, CLIP-FlanT5, outperforms even the strongest baselines that make use of the proprietary GPT-4V. Interestingly, although we train with only images, VQAScore can also align text with video and 3D models. VQAScore allows researchers to benchmark text-to-visual generation using complex texts that capture the compositional structure of real-world prompts. We introduce GenAI-Bench, a more challenging benchmark with 1,600 compositional text prompts that require parsing scenes, objects, attributes, relationships, and high-order reasoning like comparison and logic. GenAI-Bench also offers over 15,000 human ratings for leading image and video generation models such as Stable Diffusion, DALL-E 3, and Gen2.
Cited by
- REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
- Sense it with your eyes: Sensation Generation and Understanding for Advertisements
- Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed
- HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale
- ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition
- CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation
- RMLer: Synthesizing Novel Objects across Diverse Categories via Reinforcement Mixing Learning
- Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
- GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
- GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
- Unveiling the Attribute Misbinding Threat in Identity-Preserving Models
- IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation
- TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
- Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models
- GeoLoom: High-quality Geometric Diagram Generation from Textual Input
- Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment
- Generating Storytelling Images with Rich Chains-of-Reasoning
- An Efficient Test-Time Scaling Approach for Image Generation
- ShadowDraw: From Any Object to Shadow-Drawing Compositional Art
- I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
- Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation
- Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
- Glance: Accelerating Diffusion Models with 1 Sample
- PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling
- FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
- PAT3D: Physics-Augmented Text-to-3D Scene Generation
- VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
- McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning
- Canvas-to-Image: Compositional Image Generation with Multimodal Controls
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
- CaptionQA: Is Your Caption as Useful as the Image Itself?
- MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models
- Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward
- AlignBench: Benchmarking Fine-Grained Image-Text Alignment with Synthetic Image-Caption Pairs
- PromptMoG: Enhancing Diversity in Long-Prompt Image Generation via Prompt Embedding Mixture-of-Gaussian Sampling
- Q-Save: Towards Scoring and Attribution for Generated Video Evaluation
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- Synthetic Curriculum Reinforces Compositional Text-to-Image Generation
- Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- EduMod-LLM: A Modular Approach for Designing Flexible and Transparent Educational Assistants
- Physics-Based Benchmarking Metrics for Multimodal Synthetic Images
- UniHOI: Unified Human-Object Interaction Understanding via Unified Token Space
- Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
- Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation
- How Bias Binds: Measuring Hidden Associations for Bias Control in Text-to-Image Compositions
- Argus: Quality-Aware High-Throughput Text-to-Image Inference Serving System
- Culture in Action: Evaluating Text-to-Image Models through Social Activities
- Multimodal Language Models Cannot Spot Spatial Inconsistencies
- PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement
- M3T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
- FairJudge: MLLM Judging for Social Attributes and Prompt Image Alignment
- LayerComposer: Multi-Human Personalized Generation via Layered Canvas
- The Intricate Dance of Prompt Complexity, Quality, Diversity, and Consistency in T2I Models
- Exposing Blindspots: Cultural Bias Evaluation in Generative Image Models
- Training-free Online Video Step Grounding
- The Face of Persuasion: Analyzing Bias and Generating Culture-Aware Ads
- Cost Savings from Automatic Quality Assessment of Generated Images
- Procedural Scene Programs for Open-Universe Scene Generation: LLM-Free Error Correction via Program Search
- DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation
- DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
- FraQAT: Quantization Aware Training with Fractional bits
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- UniFusion: Vision-Language Model as Unified Encoder in Image Generation
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- COCO-Tree: Compositional Hierarchical Concept Trees for Enhanced Reasoning in Vision Language Models
- Asymmetric Flow Models
- Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models
- Growing Visual Generative Capacity for Pre-Trained MLLMs
- Factuality Matters: When Image Generation and Editing Meet Structured Visuals
- SAEdit: Token-level control for continuous image editing via Sparse AutoEncoder
- Zero-Shot Fine-Grained Image Classification Using Large Vision-Language Models
- Fine-Tuning Diffusion Models via Intermediate Distribution Shaping
- EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
- Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
- Reference-Free Rating of LLM Responses via Latent Information
- Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection
- VMDiff: Visual Mixing Diffusion for Limitless Cross-Object Synthesis
- Follow-Your-Preference: Towards Preference-Aligned Image Inpainting
- LLMs Behind the Scenes: Enabling Narrative Scene Illustration
- FailureAtlas:Mapping the Failure Landscape of T2I Models via Active Exploration
- Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
- LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
- SCORE: Scaling audio generation using Standardized COmposite REwards
- ConViS-Bench: Estimating Video Similarity Through Semantic Concepts
- AGSwap: Overcoming Category Boundaries in Object Fusion via Adaptive Group Swapping
- CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration
- InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
- Dynamic Classifier-Free Diffusion Guidance via Online Feedback
- T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
- GenExam: A Multidisciplinary Text-to-Image Exam
- SpecDiff: Accelerating Diffusion Model Inference with Self-Speculation
- What Makes a Good Generated Image? Investigating Human and Multimodal LLM Image Preference Alignment
- FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
- Virtual Fitting Room: Generating Arbitrarily Long Videos of Virtual Try-On from a Single Image -- Technical Preview
- Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
- Dress&Dance: Dress up and Dance as You Like It - Technical Preview
- Color Bind: Exploring Color Perception in Text-to-Image Models
- Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
- SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
- CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance
- NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
- Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
- Story2Board: A Training-Free Approach for Expressive Storyboard Generation
- Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
- SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs
- MultiRef: Controllable Image Generation with Multiple Visual References
- StyleTailor: Towards Personalized Fashion Styling via Hierarchical Negative Feedback
- VQA support to Arabic Language Learning Educational Tool
- Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
- Trade-offs in Image Generation: How Do Different Dimensions Interact?
- See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs
- Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
- T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation
- A Survey on Generative Model Unlearning: Fundamentals, Taxonomy, Evaluation, and Future Direction
- A Survey of Multimodal Hallucination Evaluation and Detection
Discussions
Related