Evaluating Object Hallucination in Large Vision-Language Models
2023/05/17 by Yifan Li, Yifan Du, Li, Yifan +9 · 255 citations
Computer Science · Engineering · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Ferroelectric and Negative Capacitance Devices #Multimedia (cs.MM) #Multimodal Machine Learning Applications
paper · pdf · doi:10.48550/arxiv.2305.10355
openalex publication_date 2023/05/17 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
Inspired by the superior language abilities of large language models (LLM), large vision-language models (LVLM) have been recently explored by integrating powerful LLMs for improving the performance on complex multimodal tasks. Despite the promising progress on LVLMs, we find that LVLMs suffer from the hallucination problem, i.e. they tend to generate objects that are inconsistent with the target images in the descriptions. To investigate it, this work presents the first systematic study on object hallucination of LVLMs. We conduct the evaluation experiments on several representative LVLMs, and show that they mostly suffer from severe object hallucination issue. We further discuss that the visual instructions may influence the hallucination, and find that: objects that frequently occur in the visual instructions or co-occur with the image objects, are obviously prone to be hallucinated by LVLMs. Besides, we find that existing evaluation methods might be affected by the input instructions and generation styles of LVLMs. Thus, we further design an improved evaluation method for object hallucination by proposing a polling-based query method called POPE. Experiment results demonstrate that our POPE can evaluate the object hallucination in a more stable and flexible way. Our codes and data are publicly available at https://github.com/RUCAIBox/POPE.
Cited by
- DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding
- Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation
- Same or Not? Enhancing Visual Perception in Vision-Language Models
- CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models
- Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
- Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
- Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs
- Detect Before You Leap: Mirage Detection in Vision-Language Models
- A Unified Definition of Hallucination, Or: It's the World Model, Stupid
- Benchmarking and Enhancing VLM for Compressed Image Understanding
- FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
- IPCV: Information-Preserving Compression for MLLM Visual Encoders
- Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models
- Revealing Perception and Generation Dynamics in LVLMs: Mitigating Hallucinations via Validated Dominance Correction
- OpenView: Empowering MLLMs with Out-of-view VQA
- Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
- HyDRA: Hierarchical and Dynamic Rank Adaptation for Mobile Vision Language Model
- Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification
- Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
- Collaborative Edge-to-Server Inference for Vision-Language Models
- The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs
- HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
- SuperCLIP: CLIP with Simple Classification Supervision
- Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection
- STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
- DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
- VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
- VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
- VL-JEPA: Joint Embedding Predictive Architecture for Vision-language
- TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection
- Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding
- Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
- Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
- Multilingual VLM Training: Adapting an English-Trained VLM to French
- ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
- Towards Lossless Ultimate Vision Token Compression for VLMs
- The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
- HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
- SAVE: Sparse Autoencoder-Driven Visual Information Enhancement for Mitigating Object Hallucination
- HalluShift++: Bridging Language and Vision through Internal Representation Shifts for Hierarchical Hallucinations in MLLMs
- All You Need Are Random Visual Tokens? Demystifying Token Pruning in VLLMs
- Toward More Reliable Artificial Intelligence: Reducing Hallucinations in Vision-Language Models
- Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
- Conscious Gaze: Adaptive Attention Mechanisms for Hallucination Mitigation in Vision-Language Models
- Towards Cross-View Point Correspondence in Vision-Language Models
- Jina-VLM: Small Multilingual Vision Language Model
- DIQ-H: Evaluating Hallucination Persistence in VLMs Under Temporal Visual Degradation
- AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
- V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
- ViDiC: Video Difference Captioning
- HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restoration
- VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
- Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
- Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding
- AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent
- Quantized-Tinyllava: a new multimodal foundation model enables efficient split learning
- VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
- From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
- AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
- Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
- Text-Guided Semantic Image Encoder
- AlignBench: Benchmarking Fine-Grained Image-Text Alignment with Synthetic Image-Caption Pairs
- Object-Centric Vision Token Pruning for Vision Language Models
- VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
- Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention
- Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering
- INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
- UniGame: Turning a Unified Multimodal Model Into Its Own Adversary
- CLASH: A Benchmark for Cross-Modal Contradiction Detection
- Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
- Thinking Ahead: Foresight Intelligence in MLLMs and World Models
- Towards Efficient VLMs: Information-Theoretic Driven Compression via Adaptive Structural Pruning
- SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
- Attention Guided Alignment in Efficient Vision-Language Models
- SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
- Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
- Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
- SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
- Build AI Assistants using Large Language Models and Agents to Enhance the Engineering Education of Biomechanics
- A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
- CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training
- Suppressing VLM Hallucinations with Spectral Representation Filtering
- TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
- PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
- Viper-F1: Fast and Fine-Grained Multimodal Understanding with Cross-Modal State-Space Modulation
- Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models
- Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
- Role-SynthCLIP: A Role Play Driven Diverse Synthetic Data Approach
- NVIDIA Nemotron Nano V2 VL
- SynQuE: Estimating Synthetic Dataset Quality Without Annotations
- What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes
- Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
- Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond
- Generating Accurate and Detailed Captions for High-Resolution Images
- MM-OPERA: Benchmarking Open-ended Association Reasoning for Large Vision-Language Models
- PairUni: Pairwise Training for Unified Multimodal Language Models
- TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models
- Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
- CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering
- VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
- SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense
- RL makes MLLMs see better than SFT
- SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
- Modeling Expert Interactions in Sparse Mixture of Experts via Graph Structures
- EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
- MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
- Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation
- VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
- ARGenSeg: Image Segmentation with Autoregressive Image Generation Model
- HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
- Why LVLMs Are More Prone to Hallucinations in Longer Responses: The Role of Context
- KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls
- PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache Pruning
- ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
- Beyond Single Models: Mitigating Multimodal Hallucinations via Adaptive Token Ensemble Decoding
- SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
- Token-Level Inference-Time Alignment for Vision-Language Models
- ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
- Train a Unified Multimodal Data Quality Classifier with Synthetic Data
- From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
- DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
- Spatial Preference Rewarding for MLLMs Spatial Understanding
- Vision-Centric Activation and Coordination for Multimodal Large Language Models
- Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
- NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
- Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
- Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
- ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution
- FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models
- UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
- When Images Speak Louder: Mitigating Language Bias-induced Hallucinations in VLMs through Cross-Modal Guidance
- Reallocating Attention Across Layers to Reduce Multimodal Hallucination
- CoIDO: Efficient Data Selection for Visual Instruction Tuning via Coupled Importance-Diversity Optimization
- Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping
- Unleashing Perception-Time Scaling to Multimodal Reasoning Models
- Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation
- ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
- Growing Visual Generative Capacity for Pre-Trained MLLMs
- Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
- ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
- OASIS: A Multilingual and Multimodal Dataset for Culturally Grounded Spoken Visual QA
- Visual Representations inside the Language Model
- Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs
- Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
- Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories
- Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
- Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model Explanations
- Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
- Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
- Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
- Vision Function Layer in Multimodal LLMs
- Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models
- MedMMV: A Controllable Multimodal Multi-Agent Framework for Reliable and Verifiable Clinical Reasoning
- When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
- GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- AutoPrune: Each Complexity Deserves a Pruning Policy
- HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
- LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models
- HIVTP: A Training-Free Method to Improve VLMs Efficiency via Hierarchical Visual Token Pruning Using Middle-Layer-Based Importance Score
- Uncovering Grounding IDs: How External Cues Shape Multimodal Binding
- Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
- Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
- AttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention Anchors
- Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models
- GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting
- UniMIC: Token-Based Multimodal Interactive Coding for Human-AI Collaboration
- Color Names in Vision-Language Models
- Chimera: Diagnosing Shortcut Learning in Visual-Language Understanding
- Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors
- ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
- From Bias to Balance: Exploring and Mitigating Spatial Bias in LVLMs
- Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
- Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching
- Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
- DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning
- MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models
- Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models
- Can Vision-Language Models Reason about AI Edits in Images?
- VCE: A Zero-Cost Hallucination Mitigation Method of LVLMs via Visual Contrastive Editing
- Geometric Risk Control for Vision-Language Model OCR
- PoRe: Position-Reweighted Visual Token Pruning for Vision Language Models
- OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment
- Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models
- ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?
- Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models
- Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception
- FitPro: A Zero-Shot Framework for Interactive Text-based Pedestrian Retrieval in Open World
- Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance
- Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
- ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models
- ORCA: Agentic Reasoning For Hallucination and Adversarial Robustness in Vision-Language Models
- Explain Before You Answer: A Survey on Compositional Visual Reasoning
- HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
- AsyMoE: Leveraging Modal Asymmetry for Enhanced Expert Specialization in Large Vision-Language Models
- MaRVL-QA: A Benchmark for Mathematical Reasoning over Visual Landscapes
- Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
- Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
- 3D Aware Region Prompted Vision Language Model
- Pathological Truth Bias in Vision-Language Models
- Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
- VARCO-VISION-2.0 Technical Report
- Measuring Epistemic Humility in Multimodal Large Language Models
- MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models
- Visual Representation Alignment for Multimodal Large Language Models
- Tracing and Mitigating Hallucinations in Multimodal LLMs via Dynamic Attention Localization
- Reconstruction Alignment Improves Unified Multimodal Models
- Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
- Towards Open World Detection: A Survey
- The Telephone Game: Evaluating Semantic Drift in Unified Models
- VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality
- Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection
- Improving Large Vision and Language Models by Learning from a Panel of Peers
- OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
- Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
- Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
- Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety
- GLSim: Detecting Object Hallucinations in LVLMs via Global-Local Similarity
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs
- Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
- Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
- Hallucinations in medical devices
- Learning to Steer: Input-dependent Steering for Multimodal LLMs
- Thyme: Think Beyond Images
- Controlling Multimodal LLMs via Reward-guided Decoding
- Agentic Design Review System
- Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
- MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
- MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
- SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs
- Never compromise with vulnerabilities: a comprehensive survey on AI governance
- Reinforcement Learning for Large Model: A Survey
- MCITlib: Multimodal Continual Instruction Tuning Library and Benchmark
- AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
- Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
- VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
- ChartCap: Mitigating Hallucination of Dense Chart Captioning
- Evaluating Variance in Visual Question Answering Benchmarks
- VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions
- A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
- What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?
- MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing
- MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
- Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment
- X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
- MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
- ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
- TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs
- METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
- Enhancing Large Multimodal Models with Adaptive Sparsity and KV Cache Compression
- Annotation-Free Human Sketch Quality Assessment
- A Survey of Token Compression for Efficient Multimodal Large Language Models
- Region-based Cluster Discrimination for Visual Representation Learning
- A Survey of Multimodal Hallucination Evaluation and Detection
Related