Microsoft COCO: Common Objects in Context
2014/05/01 by Lin, Tsung-Yi, Maire, Michael, Belongie, Serge +7 · 1412 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
paper · doi:10.48550/arxiv.1405.0312
Abstract
We present a new dataset with the goal of advancing the state-of-the-art in object recognition by placing the question of object recognition in the context of the broader question of scene understanding. This is achieved by gathering images of complex everyday scenes containing common objects in their natural context. Objects are labeled using per-instance segmentations to aid in precise object localization. Our dataset contains photos of 91 objects types that would be easily recognizable by a 4 year old. With a total of 2.5 million labeled instances in 328k images, the creation of our dataset drew upon extensive crowd worker involvement via novel user interfaces for category detection, instance spotting and instance segmentation. We present a detailed statistical analysis of the dataset in comparison to PASCAL, ImageNet, and SUN. Finally, we provide baseline performance analysis for bounding box and segmentation detection results using a Deformable Parts Model.
Cited by
- Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding
- Same or Not? Enhancing Visual Perception in Vision-Language Models
- Instruction-Following Evaluation of Large Vision-Language Models
- PurifyGen: A Risk-Discrimination and Semantic-Purification Model for Safe Text-to-Image Generation
- Multi-label Classification with Panoptic Context Aggregation Networks
- Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
- NeXT-IMDL: Build Benchmark for NeXT-Generation Image Manipulation Detection & Localization
- Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization
- Edge-Aware and Content-Adaptive Infrared Gas Leak Detection for Industrial Safety Monitoring
- Anomaly Detection by Effectively Leveraging Synthetic Images
- With Great Context Comes Great Prediction Power: Classifying Objects via Geo-Semantic Scene Graphs
- RealCamo: Boosting Real Camouflage Synthesis with Layout Controls and Textual-Visual Guidance
- CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
- Learning Where to Focus: Density-Driven Guidance for Detecting Dense Tiny Objects
- ReDiF: Reinforced Distillation for Few Step Diffusion
- Parallel Diffusion Solver via Residual Dirichlet Policy Optimization
- Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
- Tiny-YOLOSAM: Fast Hybrid Image Segmentation
- Multimodal Semantic-Probabilistic Objectness for Open World Object Detection
- Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention
- To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion
- Neuromorphic Object Detection: An In-Depth Study and Future Directions
- Geometry Meets Semantics: Fractional Gradient Stabilization for Semantic-Driven Bounding Box Optimization in Visual Detection Tasks
- Enhanced Seam Segmentation for Automated Welding Robot in Construction Through Transfer Learning: Addressing Limitations of Bilateral Segmentation Network
- DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models
- StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting
- What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features
- Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models
- Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs
- DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models
- Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering
- Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors
- Enabling Fully Integer-Only Inference for Lightweight Detection Transformers
- A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions
- Small-Pollinator Detection in Cluttered Field Video
- Controlling Embedding Spaces with Text-Conditioned Transformations
- Advancing All-Weather Building Damage Mapping to the Instance Level: Outcomes and Insights from the 2026 Bright Challenge
- Real-time Reconstruction of Human Visual Perception from fMRI
- Calibration-Free 3D Multi-Camera People Tracking for Indoor Environment
- LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models
- Prolonged reduction in grassland arthropod activity after mowing revealed by AI camera trap monitoring
- Personalize Your Large Vision-language Models With In-context Prompt Tuning
- Evaluation of Winning Solutions of 2025 Low Power Computer Vision Challenge
- ORGAN: Object-Centric Representation Learning Using Cycle Consistent Generative Adversarial Networks
- UP-Fuse: Uncertainty-guided LiDAR-Camera Fusion for 3D Panoptic Segmentation
- CLIP Is Shortsighted: Paying Attention Beyond the First Sentence
- InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation
- Look Closer! An Adversarial Parametric Editing Framework for Hallucination Mitigation in VLMs
- Training-free Conditional Image Embedding Framework Leveraging Large Vision Language Models
- Fast Inference of Visual Autoregressive Model with Adjacency-Adaptive Dynamical Draft Trees
- Few Tokens Matter: Entropy Guided Attacks on Vision-Language Models
- Compliance Rating Scheme: A Data Provenance Framework for Generative AI Datasets
- Pro-Pose: Unpaired Full-Body Portrait Synthesis via Canonical UV Maps
- Contrastive Graph Modeling for Cross-Domain Few-Shot Medical Image Segmentation
- TAMEing Long Contexts in Personalization: Towards Training-Free and State-Aware MLLM Personalized Assistant
- LLM-Free Image Captioning Evaluation in Reference-Flexible Settings
- Vision Transformers are Circulant Attention Learners
- Intelligent recognition of GPR road hidden defect images based on feature fusion and attention mechanism
- Towards Long-window Anchoring in Vision-Language Model Distillation
- Latent Implicit Visual Reasoning
- ORCA: Object Recognition and Comprehension for Archiving Marine Species
- FreeInpaint: Tuning-free Prompt Alignment and Visual Rationality Enhancement in Image Inpainting
- Soft Filtering: Guiding Zero-shot Composed Image Retrieval with Prescriptive and Proscriptive Constraints
- VL4Gaze: Unleashing Vision-Language Models for Gaze Following
- Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
- AlignPose: Generalizable 6D Pose Estimation via Multi-view Feature-metric Alignment
- milliMamba: Specular-Aware Human Pose Estimation via Dual mmWave Radar with Multi-Frame Mamba Fusion
- IndicDLP: A Foundational Dataset for Multi-Lingual and Multi-Domain Document Layout Parsing
- Generative Latent Coding for Ultra-Low Bitrate Image Compression
- TongSIM: A General Platform for Simulating Intelligent Machines
- SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models
- REALM: A Real-to-Sim Validated Benchmark for Generalization in Robotic Manipulation
- D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
- MedNeXt-v2: Scaling 3D ConvNeXts for Large-Scale Supervised Representation Learning in Medical Image Segmentation
- Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?
- Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding
- PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models
- VizDefender: Unmasking Visualization Tampering through Proactive Localization and Intent Inference
- Revealing Perception and Generation Dynamics in LVLMs: Mitigating Hallucinations via Validated Dominance Correction
- Rectification Reimagined: A Unified Mamba Model for Image Correction and Rectangling with Prompts
- Multi-Part Object Representations via Graph Structures and Co-Part Discovery
- YolovN-CBi: A Lightweight and Efficient Architecture for Real-Time Detection of Small UAVs
- Who Can See Through You? Adversarial Shielding Against VLM-Based Attribute Inference Attacks
- Spectral Discrepancy and Cross-modal Semantic Consistency Learning for Object Detection in Hyperspectral Image
- Adversarial Robustness of Vision in Open Foundation Models
- ClothHMR: 3D Mesh Recovery of Humans in Diverse Clothing from Single Image
- Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detection
- MMLANDMARKS: a Cross-View Instance-Level Benchmark for Geo-Spatial Understanding
- EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
- ABE-CLIP: Training-Free Attribute Binding Enhancement for Compositional Image-Text Matching
- Sharing Knowledge without Sharing Data: Stitches can improve ensembles of disjointly trained models
- Do Generalized-Gamma Scale Mixtures of Normals Fit Large Image Datasets?
- Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification
- GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
- FlowDet: Unifying Object Detection and Generative Transport Flows
- TreeNet: A Light Weight Model for Low Bitrate Image Compression
- Towards Reproducibility in Predictive Process Mining: SPICE -- A Deep Learning Library
- N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
- FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
- PixelArena: A benchmark for Pixel-Precision Visual Intelligence
- Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
- Avatar4D: Synthesizing Domain-Specific 4D Humans for Real-World Pose Estimation
- LAPX: Lightweight Hourglass Network with Global Context
- Autoencoder-based Denoising Defense against Adversarial Attacks on Object Detection
- VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression
- Multi-Modal Semantic Communication
- SynthSeg-Agents: Multi-Agent Synthetic Data Generation for Zero-Shot Weakly Supervised Semantic Segmentation
- BLANKET: Anonymizing Faces in Infant Video Recordings
- RUMPL: Ray-Based Transformers for Universal Multi-View 2D to 3D Human Pose Lifting
- ST-DETrack: Identity-Preserving Branch Tracking in Entangled Plant Canopies via Dual Spatiotemporal Evidence
- MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
- Image Complexity-Aware Adaptive Retrieval for Efficient Vision-Language Models
- Null-LoRA: Low-Rank Adaptation on Null Space
- Where is the Watermark? Interpretable Watermark Detection at the Block Level
- PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs
- A Comprehensive Safety Metric to Evaluate Perception in Autonomous Systems
- Enhancing Visual Sentiment Analysis via Semiotic Isotopy-Guided Dataset Construction
- DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning
- Enhancing Interpretability for Vision Models via Shapley Value Optimization
- CIS-BA: Continuous Interaction Space Based Backdoor Attack for Object Detection in the Real-World
- Seeing the Whole Picture: Distribution-Guided Data-Free Distillation for Semantic Segmentation
- OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
- HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering
- SuperCLIP: CLIP with Simple Classification Supervision
- VajraV1 -- The most accurate Real Time Object Detector of the YOLO family
- Dual-R-DETR: Resolving Query Competition with Pairwise Routing in Transformer Decoders
- Coarse-to-Fine Hierarchical Alignment for UAV-based Human Detection using Diffusion Models
- Image Diffusion Preview with Consistency Solver
- CausalCLIP: Causally-Informed Feature Disentanglement and Filtering for Generalizable Detection of Generated Images
- Learning to Generate Cross-Task Unexploitable Examples
- CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
- BézierFlow: Learning Bézier Stochastic Interpolant Schedulers for Few-Step Generation
- JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion
- Calibrating Uncertainty for Zero-Shot Adversarial CLIP
- SCAdapter: Content-Style Disentanglement for Diffusion Style Transfer
- MineTheGap: Automatic Mining of Biases in Text-to-Image Models
- GradID: Adversarial Detection via Intrinsic Dimensionality of Gradients
- Exploring the Design Space of Transition Matching
- Efficient Vision-Language Reasoning via Adaptive Token Pruning
- β-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
- Generative Spatiotemporal Data Augmentation
- WeDetect: Fast Open-Vocabulary Object Detection as Retrieval
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- On the Dangers of Bootstrapping Generation for Continual Learning and Beyond
- Benchmarking the Generality of Vision-Language-Action Models
- From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models
- Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning
- TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection
- Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding
- Take a Peek: Efficient Encoder Adaptation for Few-Shot Semantic Segmentation via LoRA
- Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality
- NordFKB: a fine-grained benchmark dataset for geospatial AI in Norway
- VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models
- Hierarchical Instance Tracking to Balance Privacy Preservation with Accessible Information
- Diffusion Is Your Friend in Show, Suggest and Tell
- FastPose-ViT: A Vision Transformer for Real-Time Spacecraft Pose Estimation
- LiM-YOLO: Less is More with Pyramid Level Shift for Ship Detection in Optical Remote Sensing
- Unconsciously Forget: Mitigating Memorization; Without Knowing What is being Memorized
- Hands-on Evaluation of Visual Transformers for Object Recognition and Detection
- A Distributed Framework for Privacy-Enhanced Vision Transformers on the Edge
- SHARe-KAN: Post-Training Vector Quantization for Cache-Resident KAN Inference
- BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in the Human Brain
- SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing
- Refining Visual Artifacts in Diffusion Models via Explainable AI-based Flaw Activation Maps
- An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
- Beyond Real Weights: Hypercomplex Representations for Stable Quantization
- Age-Inclusive 3D Human Mesh Recovery for Action-Preserving Data Anonymization
- VisKnow: Constructing Visual Knowledge Base for Object Understanding
- Automated Pollen Recognition in Optical and Holographic Microscopy Images
- No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
- GeoDiffMM: Geometry-Guided Conditional Diffusion for Motion Magnification
- HalluShift++: Bridging Language and Vision through Internal Representation Shifts for Hierarchical Hallucinations in MLLMs
- Training-Free Vector Quantization via Gaussian VAEs
- How Far are Modern Trackers from UAV-Anti-UAV? A Million-Scale Benchmark and New Baseline
- Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation
- Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
- START: Spatial and Textual Learning for Chart Understanding
- D3-Predictor: Noise-Free Deterministic Diffusion for Dense Prediction
- UnCageNet: Tracking and Pose Estimation of Caged Animal
- A graph generation pipeline for critical infrastructures based on heuristics, images and depth data
- Pay Less Attention to Function Words for Free Robustness of Vision-Language Models
- SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation
- MSN: Multi-directional Similarity Network for Hand-crafted and Deep-synthesized Copy-Move Forgery Detection
- MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP
- Towards Robust Pseudo-Label Learning in Semantic Segmentation: An Encoding Perspective
- Boosting Unsupervised Video Instance Segmentation with Automatic Quality-Guided Self-Training
- Omni-Referring Image Segmentation
- Task-Model Alignment: A Simple Path to Generalizable AI-Generated Image Detection
- CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks
- Stitch and Tell: A Structured Multimodal Data Augmentation Method for Spatial Understanding
- Personalized Image Descriptions from Attention Sequences
- RunawayEvil: Jailbreaking the Image-to-Video Generative Models
- Neural expressiveness for beyond importance model compression
- RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
- Evaluating Concept Filtering Defenses against Child Sexual Abuse Material Generation by Text-to-Image Models
- LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection
- Self-Supervised AI-Generated Image Detection: A Camera Metadata Perspective
- General and Domain-Specific Zero-shot Detection of Generated Images via Conditional Likelihood
- Light-X: Generative 4D Video Rendering with Camera and Illumination Control
- Performance Evaluation of Deep Learning for Tree Branch Segmentation in Autonomous Forestry Systems
- RevoNAD: Reflective Evolutionary Exploration for Neural Architecture Design
- Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
- Reflection Removal through Efficient Adaptation of Diffusion Transformers
- GeoPE:A Unified Geometric Positional Embedding for Structured Tensors
- Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens
- Parabolic Position Encoding: Vision-Centric, Principled, Extrapolatable, General
- QuaMo: Quaternion Motions for Vision-based 3D Human Kinematics Capture
- Malicious Image Analysis via Vision-Language Segmentation Fusion: Detection, Element, and Location in One-shot
- RoboBPP: Benchmarking Robotic Online Bin Packing with Physics-based Simulation
- Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction
- Out-of-the-box: Black-box Causal Attacks on Object Detectors
- MKSNet: Advanced Small Object Detection in Remote Sensing Imagery with Multi-Kernel and Dual Attention Mechanisms
- V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
- MSG-Loc: Multi-Label Likelihood-based Semantic Graph Matching for Object-Level Global Localization
- ViDiC: Video Difference Captioning
- Technical Report on Text Dataset Distillation
- Culture Affordance Atlas: Reconciling Object Diversity Through Functional Mapping
- Glance: Accelerating Diffusion Models with 1 Sample
- FiMMIA: scaling semantic perturbation-based membership inference across modalities
- ClimaOoD: Improving Anomaly Segmentation via Physically Realistic Synthetic Data
- Unsupervised Structural Scene Decomposition via Foreground-Aware Slot Attention with Pseudo-Mask Guidance
- From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking
- Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield
- Data-Centric Visual Development for Self-Driving Labs
- AirSim360: A Panoramic Simulation Platform within Drone View
- Artemis: Structured Visual Reasoning for Perception Policy Learning
- SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
- Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
- PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models
- CauSight: Learning to Supersense for Visual Causal Discovery
- SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation
- ViT3: Unlocking Test-Time Training in Vision
- InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
- FishDetector-R1: Unified MLLM-Based Framework with Reinforcement Fine-Tuning for Weakly Supervised Fish Detection, Segmentation, and Counting
- Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries
- Controllable 3D Object Generation with Single Image Prompt
- PAGen: Phase-guided Amplitude Generation for Domain-adaptive Object Detection
- BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models
- DEJIMA: A Novel Large-scale Japanese Dataset for Image Captioning and Visual Question Answering
- Concept-Guided Backdoor Attack on Vision Language Models
- Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation
- Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
- Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models
- Object-Centric Data Synthesis for Category-level Object Detection
- GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence
- MANTA: Physics-Informed Generalized Underwater Object Tracking
- DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline
- Optimizing Multimodal Language Models through Attention-based Interpretability
- PowerCLIP: Powerset Alignment for Contrastive Pre-Training
- Guiding Visual Autoregressive Models through Spectrum Weakening
- Hybrid Synthetic Data Generation with Domain Randomization Enables Zero-Shot Vision-Based Part Inspection Under Extreme Class Imbalance
- Robust Image Self-Recovery against Tampering using Watermark Generation with Pixel Shuffling
- Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior
- BTKD++: Beyond Teachers by Critically Distilling Knowledge from Teacher’s Bias
- Advancing Aesthetic Image Generation via Composition Transfer
- SciPostGen: Bridging the Gap between Scientific Papers and Poster Layouts
- Semantic-Aware Caching for Efficient Image Generation in Edge Computing
- Small Object Detection for Birds with Swin Transformer
- SemOD: Semantic Enabled Object Detection Network under Various Weather Conditions
- PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and Fuzz Optimization
- Self-Paced Learning for Images of Antinuclear Antibodies
- DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
- CanKD: Cross-Attention-based Non-local operation for Feature-based Knowledge Distillation
- SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
- uCLIP: Parameter-Efficient Multilingual Extension of Vision-Language Models with Unpaired Data
- Infinite-Story: A Training-Free Consistent Text-to-Image Generation
- SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
- MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
- PG-ControlNet: A Physics-Guided ControlNet for Generative Spatially Varying Image Deblurring
- SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
- OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection
- CaptionQA: Is Your Caption as Useful as the Image Itself?
- Qwen3-VL Technical Report
- Text-Guided Semantic Image Encoder
- Training-Free Diffusion Priors for Text-to-Image Generation via Optimization-based Visual Inversion
- LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight
- Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition
- Latent Diffusion Inversion Requires Understanding the Latent Space
- Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
- AlignBench: Benchmarking Fine-Grained Image-Text Alignment with Synthetic Image-Caption Pairs
- Object-Centric Vision Token Pruning for Vision Language Models
- SKEL-CF: Coarse-to-Fine Biomechanical Skeleton and Surface Mesh Recovery
- Geometry of Decision Making in Language Models
- SelfMOTR: Revisiting MOTR with Self-Generating Detection Priors
- DiCaP: Distribution-Calibrated Pseudo-labeling for Semi-Supervised Multi-Label Learning
- Text-guided Controllable Diffusion for Realistic Camouflage Images Generation
- Restora-Flow: Mask-Guided Image Restoration with Flow Matching
- Exploring State-of-the-art models for Early Detection of Forest Fires
- DinoLizer: Separating VAE and Diffusion Artifacts in Generative Inpainting Localization
- V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs
- Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization
- Diffusion-Based Synthetic Brightfield Microscopy Images for Enhanced Single Cell Detection
- Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
- HybriDLA: Hybrid Generation for Document Layout Analysis
- Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention
- Maritime Small Object Detection from UAVs using Deep Learning with Altitude-Aware Dynamic Tiling
- Medusa: Cross-Modal Transferable Adversarial Attacks on Multimodal Medical Retrieval-Augmented Generation
- Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
- CLASH: A Benchmark for Cross-Modal Contradiction Detection
- SPQR: A Standardized Benchmark for Modern Safety Alignment Methods in Text-to-Image Diffusion Models
- DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection
- HABIT: Human Action Benchmark for Interactive Traffic in CARLA
- Analysis of Deep-Learning Methods in an ISO/TS 15066-Compliant Human-Robot Safety Framework
- BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
- Robust Long-term Test-Time Adaptation for 3D Human Pose Estimation through Motion Discretization
- Understanding Task Transfer in Vision-Language Models
- Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation
- IDEAL-M3D: Instance Diversity-Enriched Active Learning for Monocular 3D Detection
- Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer
- VeCoR -- Velocity Contrastive Regularization for Flow Matching
- Peregrine: One-Shot Fine-Tuning for FHE Inference of General Deep CNNs
- Rethinking Vision Transformer Depth via Structural Reparameterization
- Lightweight Transformer Framework for Weakly Supervised Semantic Segmentation
- Learning Scalable Temporal Representations in Spiking Neural Networks Without Labels
- CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection
- Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression
- NAF: Zero-Shot Feature Upsampling via Neighborhood Attention Filtering
- RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
- ConsistCompose: Unified Multimodal Layout Control for Image Composition
- Angular Gradient Sign Method: Uncovering Vulnerabilities in Hyperbolic Networks
- Concept Regions Matter: Benchmarking CLIP with a New Cluster-Importance Approach
- IE-Critic-R1: Advancing the Explanatory Measurement of Text-Driven Image Editing for Human Perception Alignment
- FAST: Topology-Aware Frequency-Domain Distribution Matching for Coreset Selection
- Tracking and Segmenting Anything in Any Modality
- Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
- Multi-speaker Attention Alignment for Multimodal Social Interaction
- State and Scene Enhanced Prototypes for Weakly Supervised Open-Vocabulary Object Detection
- The Potential and Limitations of Vision-Language Models for Human Motion Understanding: A Case Study in Data-Driven Stroke Rehabilitation
- Understanding Counting Mechanisms in Large Language and Vision-Language Models
- DSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive Architecture
- Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
- Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
- Diversity Has Always Been There in Your Visual Autoregressive Models
- Energy Scaling Laws for Diffusion Models: Quantifying Compute and Carbon Emissions in Image Generation
- OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
- Feature Partitioning and Semantic Equalization for Intrinsic Robustness in Semantic Communication under Packet Loss
- A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback
- SceneDesigner: Controllable Multi-Object Image Generation with 9-DoF Pose Manipulation
- PEPPER: Perception-Guided Perturbation for Robust Backdoor Defense in Text-to-Image Diffusion Models
- SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge
- Integrating Deep Learning and Spatial Statistics in Marine Ecosystem Monitoring
- Beyond Visual Cues: Leveraging General Semantics as Support for Few-Shot Segmentation
- T2I-Based Physical-World Appearance Attack against Traffic Sign Recognition Systems in Autonomous Driving
- Building temporally coherent 3D maps with VGGT for memory-efficient Semantic SLAM
- How Noise Benefits AI-generated Image Detection
- UniDGF: A Unified Detection-to-Generation Framework for Hierarchical Object Visual Recognition
- Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling
- BioBench: A Blueprint to Move Beyond ImageNet for Scientific ML Benchmarks
- Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
- LEGO-SLAM: Language-Embedded Gaussian Optimization SLAM
- WALDO: Where Unseen Model-based 6D Pose Estimation Meets Occlusion
- Multimodal Evaluation of Russian-language Architectures
- Multi-Text Guided Few-Shot Semantic Segmentation
- HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation
- IPTQ-ViT: Post-Training Quantization of Non-linear Functions for Integer-only Vision Transformers
- Taming Generative Synthetic Data for X-ray Prohibited Item Detection
- Fast Post-Hoc Confidence Fusion for 3-Class Open-Set Aerial Object Detection
- What Your Features Reveal: Data-Efficient Black-Box Feature Inversion Attack for Split DNNs
- Quant-Trim in Practice: Improved Cross-Platform Low-Bit Deployment on Edge NPUs
- MMCM: Multimodality-aware Metric using Clustering-based Modes for Probabilistic Human Motion Prediction
- Unbiased Semantic Decoding with Vision Foundation Models for Few-shot Segmentation
- A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
- Computer Vision Modeling of the Development of Geometric and Numerical Concepts in Humans
- DIR-TIR: Dialog-Iterative Refinement for Text-to-Image Retrieval
- O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model
- EBind: a practical approach to space binding
- Online Data Curation for Object Detection via Marginal Contributions to Dataset-level Average Precision
- Free-Form Scene Editor: Enabling Multi-Round Object Manipulation like in a 3D Engine
- CFG-EC: Error Correction Classifier-Free Guidance
- CascadedViT: Cascaded Chunk-FeedForward and Cascaded Group Attention Vision Transformer
- SAE-MCVT: A Real-Time and Scalable Multi-Camera Vehicle Tracking Framework Powered by Edge Computing
- Training-free Detection of AI-generated images via Cropping Robustness
- QUILL: An Algorithm-Architecture Co-Design for Cache-Local Deformable Attention
- VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping
- Language-Guided Invariance Probing of Vision-Language Models
- YOLO Meets Mixture-of-Experts: Adaptive Expert Routing for Robust Object Detection
- Rethinking Saliency Maps: A Cognitive Human Aligned Taxonomy and Evaluation Framework for Explanations
- From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
- Towards Metric-Aware Multi-Person Mesh Recovery by Jointly Optimizing Human Crowd in Camera Space
- Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization
- UniSOT: A Unified Framework for Multi-Modality Single Object Tracking
- Extremal Contours: Gradient-driven contours for compact visual attribution
- FoldPath: End-to-End Object-Centric Motion Generation via Modulated Implicit Paths
- Semantic BIM enrichment for firefighting assets: Fire-ART dataset and panoramic image-based 3D reconstruction
- SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment
- A knowledge-driven approach for automated fire safety compliance checking in operational buildings
- A Novel AI-Driven System for Real-Time Detection of Mirror Absence, Helmet Non-Compliance, and License Plates Using YOLOv8 and OCR
- Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
- MaskAnyNet: Rethinking Masked Image Regions as Valuable Information in Supervised Learning
- SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
- MSLoRA: Multi-Scale Low-Rank Adaptation via Attention Reweighting
- Which Way from B to A: The role of embedding geometry in image interpolation for Stable Diffusion
- Seg-VAR: Image Segmentation with Visual Autoregressive Modeling
- Explainable AI-Generated Image Detection RewardBench
- Suppressing VLM Hallucinations with Spectral Representation Filtering
- Codebook-Centric Deep Hashing: End-to-End Joint Learning of Semantic Hash Centers and Neural Hash Function
- Improved Masked Image Generation with Knowledge-Augmented Token Representations
- LIHE: Linguistic Instance-Split Hyperbolic-Euclidean Framework for Generalized Weakly-Supervised Referring Expression Comprehension
- PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
- SimuFreeMark: A Noise-Simulation-Free Robust Watermarking Against Image Editing
- Draft and Refine with Visual Experts
- ERMoE: Eigen-Reparameterized Mixture-of-Experts for Stable Routing and Interpretable Specialization
- Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods
- Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation
- SP-Guard: Selective Prompt-adaptive Guidance for Safe Text-to-Image Generation
- Fast Data Attribution for Text-to-Image Models
- From 2D to 3D Without Extra Baggage: Data-Efficient Cancer Detection in Digital Breast Tomosynthesis
- Domain Adaptation for Camera-Specific Image Characteristics using Shallow Discriminators
- Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models
- LampQ: Towards Accurate Layer-wise Mixed Precision Quantization for Vision Transformers
- Learning phase diversity for solving ill-posed inverse problems in imaging
- AdaptViG: Adaptive Vision GNN with Exponential Decay Gating
- Scale-Aware Relay and Scale-Adaptive Loss for Tiny Object Detection in Aerial Images
- Thermally Activated Dual-Modal Adversarial Clothing against AI Surveillance Systems
- STORM: Segment, Track, and Object Re-Localization from a Single Image
- RF-DETR: Neural Architecture Search for Real-Time Detection Transformers
- CompressNAS : A Fast and Efficient Technique for Model Compression using Decomposition
- CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?
- Target-Balanced Score Distillation
- Multimodal Large Language Models for Low-Resource Languages: A Case Study for Basque
- Hierarchical Schedule Optimization for Fast and Robust Diffusion Model Sampling
- DKDS: A Benchmark Dataset of Degraded Kuzushiji Documents with Seals for Detection and Binarization
- "It's trained by non-disabled people": Evaluating How Image Quality Affects Product Captioning with VLMs
- Machines Serve Human: A Novel Variable Human-machine Collaborative Compression Framework
- Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation
- Why Should the Server Do It All?: A Scalable, Versatile, and Model-Agnostic Framework for Server-Light DNN Inference over Massively Distributed Clients via Training-Free Intermediate Feature Compression
- Automated sign detection across the Electronic Babylonian Library: A large-scale dataset and end-to-end cuneiform OCR pipeline
- Perturb a Model, Not an Image: Towards Robust Privacy Protection via Anti-Personalized Diffusion Models
- Generalizable Blood Cell Detection via Unified Dataset and Faster R-CNN
- Extreme Model Compression with Structured Sparsity at Low Precision
- NERVE: Neighbourhood & Entropy-guided Random-walk for training free open-Vocabulary sEgmentation
- VLMDiff: Leveraging Vision-Language Models for Multi-Class Anomaly Detection with Diffusion
- Multimodal LLMs Do Not Compose Skills Optimally Across Modalities
- High-Quality Proposal Encoding and Cascade Denoising for Imaginary Supervised Object Detection
- Continual Unlearning for Text-to-Image Diffusion Models: A Regularization Perspective
- Visual Bridge: Universal Visual Perception Representations Generating
- PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier
- From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
- Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling
- Energy Consumption of Dataframe Libraries for End-to-End Deep Learning Pipelines:A Comparative Analysis
- Generating an Image From 1,000 Words: Enhancing Text-to-Image With Structured Captions
- Relative Energy Learning for LiDAR Out-of-Distribution Detection
- HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
- NOVO: Bridging LLaVA and SAM with Visual-only Prompts for Reasoning Segmentation
- Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention Guidance
- Leveraging Text-Driven Semantic Variation for Robust OOD Segmentation
- V-Shuffle: Zero-Shot Style Transfer via Value Shuffle
- Test-Time Iterative Error Correction for Efficient Diffusion Models
- LLM-Driven Completeness and Consistency Evaluation for Cultural Heritage Data Augmentation in Cross-Modal Retrieval
- Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective
- MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition
- Runtime Safety Monitoring of Deep Neural Networks for Perception: A Survey
- CoMA: Complementary Masking and Hierarchical Dynamic Multi-Window Self-Attention in a Unified Pre-training Framework
- Q2: Quantization-Aware Gradient Balancing and Attention Alignment for Low-Bit Quantization
- Training-Free Adaptive Quantization for Variable Rate Image Coding for Machines
- Semantic-Guided Natural Language and Visual Fusion for Cross-Modal Interaction Based on Tiny Object Detection
- S2LM: Towards Semantic Steganography via Large Language Models
- LG-NuSegHop: A Local-to-Global Self-Supervised Pipeline For Nuclei Instance Segmentation
- OregairuChar: A Benchmark Dataset for Character Appearance Frequency Analysis in My Teen Romantic Comedy SNAFU
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- Walk the Lines 2: Contour Tracking for Detailed Segmentation
- Learning Fourier shapes to probe the geometric world of deep neural networks
- Visual Spatial Tuning
- CPO: Condition Preference Optimization for Controllable Image Generation
- Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization
- Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
- PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
- Automatic detection of CMEs using synthetically-trained Mask R-CNN
- AIM: Software and Hardware Co-design for Architecture-level IR-drop Mitigation in High-performance PIM
- Tortoise and Hare Guidance: Accelerating Diffusion Model Inference with Multirate Integration
- NVIDIA Nemotron Nano V2 VL
- Surprisal reveals diversity gaps in image captioning and different scorers change the story
- Which Similarity-Sensitive Entropy?
- Diffusion-Based Image Editing: An Unforeseen Adversary to Robust Invisible Watermarks
- What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes
- Auditing M-LLMs for Privacy Risks: A Synthetic Benchmark and Evaluation Framework
- ISC-Perception: A Hybrid Computer Vision Dataset for Object Detection in Novel Steel Assembly
- TAUE: Training-free Noise Transplant and Cultivation Diffusion Model
- The Urban Vision Hackathon Dataset and Models: Towards Image Annotations and Accurate Vision Models for Indian Traffic
- SigmaCollab: An Application-Driven Dataset for Physically Situated Collaboration
- Object Detection as an Optional Basis: A Graph Matching Network for Cross-View UAV Localization
- The Pervasive Blind Spot: Benchmarking VLM Inference Risks on Everyday Personal Videos
- Differentiable Hierarchical Visual Tokenization
- When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
- Routing-Based Continual Learning for Multimodal Large Language Models
- Wave-Particle (Continuous-Discrete) Dualistic Visual Tokenization for Unified Understanding and Generation
- S2Doc -- Spatial-Semantic Document Format
- Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
- ColMate: Contrastive Late Interaction and Masked Text for Multimodal Document Retrieval
- Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based Attack
- EraseFlow: Learning Concept Erasure Policies via GFlowNet-Driven Alignment
- Benchmarking individual tree segmentation using multispectral airborne laser scanning data: the FGI-EMIT dataset
- MIFO: Learning and Synthesizing Multi-Instance from One Image
- ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
- PreferThinker: Reasoning-based Personalized Image Preference Assessment
- Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
- Parameterized Prompt for Incremental Object Detection
- Rethinking Robust Adversarial Concept Erasure in Diffusion Models
- Object-IR: Leveraging Object Consistency and Mesh Deformation for Self-Supervised Image Retargeting
- ZEBRA: Towards Zero-Shot Cross-Subject Generalization for Universal Brain Visual Decoding
- MLPerf Automotive
- A Retrospect to Multi-prompt Learning across Vision and Language
- LongCat-Flash-Omni Technical Report
- Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
- Merlin L48 Spectrogram Dataset
- Gaussian Combined Distance: A Generic Metric for Object Detection
- MM-OPERA: Benchmarking Open-ended Association Reasoning for Large Vision-Language Models
- Masked Diffusion Captioning for Visual Feature Learning
- STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
- SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Models
- Improving Classification of Occluded Objects through Scene Context
- Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras
- Representation-Level Counterfactual Calibration for Debiased Zero-Shot Recognition
- Distilling Multilingual Vision-Language Models: When Smaller Models Stay Multilingual
- ConceptScope: Characterizing Dataset Bias via Disentangled Visual Concepts
- Dynamic VLM-Guided Negative Prompting for Diffusion Models
- Brain-IT: Image Reconstruction from fMRI via Brain-Interaction Transformer
- Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
- AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models
- Semantic-Aware Temporal Adaptation for UAV Anti-UAV Tracking
- CASIAL: Geometric Distortion Robust Image Watermarking
- Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives
- Weight and Height Estimation from a Single Human Image Captured in the Wild
- RSV-SLAM: Toward Real-Time Semantic Visual SLAM in Indoor Dynamic Environments
- Superposition disentanglement of neural representations reveals hidden alignment
- Real-Time Assessment of Bystander Situation Awareness in Drone-Assisted First Aid
- Morpheme Induction for Emergent Language
- From Keypoints to Predictive Distributions: Post-Hoc Uncertainty for YOLO-Pose Models
- CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering
- Platonic Representations in the Human Brain: Unsupervised Recovery of Universal Geometry
- MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models
- Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes
- Hyper-FEOD: Sparse Hypergraph-Enhanced Frame-Event Object Detection with Fine-Grained MoE
- Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
- Zero-shot World Models Are Developmentally Efficient Learners
- Low-latency Event-based Object Detection with Spatially-Sparse Linear Attention
- VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
- SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense
- Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
- Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions
- DIV-Nav: Open-Vocabulary Spatial Relationships for Multi-Object Navigation
- Generating metamers of human scene understanding
- High-throughput Verticillium wilt detection in cotton: A comparative study of faster R-CNN and YOLOv11
- Universal scale-free representations in human visual cortex
- Cataract-LMM: Large-Scale, Multi-Source, Multi-Task Benchmark for Deep Learning in Surgical Video Analysis
- LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation
- Test-Time Adaptive Object Detection with Foundation Model
- Transformers in Medicine: Improving Vision-Language Alignment for Medical Image Captioning
- DINO-YOLO: Self-Supervised Pre-training for Data-Efficient Object Detection in Civil Engineering Applications
- Region-CAM: Towards Accurate Object Regions in Class Activation Maps for Weakly Supervised Learning Tasks
- Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
- Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
- SafeEditor: Unified MLLM for Efficient Post-hoc T2I Safety Editing
- DiffusionX: Efficient Edge-Cloud Collaborative Image Generation with Multi-Round Prompt Evolution
- Rethinking Visual Intelligence: Insights from Video Pretraining
- What do vision-language models see in the context? Investigating multimodal in-context learning
- Delving into Cascaded Instability: A Lipschitz Continuity View on Image Restoration and Object Detection Synergy
- ETC: training-free diffusion models acceleration with Error-aware Trend Consistency
- MC-SJD : Maximal Coupling Speculative Jacobi Decoding for Autoregressive Visual Generation Acceleration
- DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts
- Enhancing Pre-trained Representation Classifiability can Boost its Interpretability
- Success and Cost Elicit Convention Formation for Efficient Communication
- Diffusion Adaptive Text Embedding for Text-to-Image Diffusion Models
- Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World
- OOS-DSD: Improving Out-of-stock Detection in Retail Images using Auxiliary Tasks
- A geometric and deep learning reproducible pipeline for monitoring floating anthropogenic debris in urban rivers using in situ cameras
- EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
- T-REGS: Minimum Spanning Tree Regularization for Self-Supervised Learning
- FRBNet: Revisiting Low-Light Vision through Frequency-Domain Radial Basis Network
- One-Timestep is Enough: Achieving High-performance ANN-to-SNN Conversion via Scale-and-Fire Neurons
- PlanarTrack: A high-quality and challenging benchmark for large-scale planar object tracking
- DecoDINO: 3D Human-Scene Contact Prediction with Semantic Classification
- DQ3D: Depth-guided Query for Transformer-Based 3D Object Detection in Traffic Scenarios
- Seeing Through the Brain: New Insights from Decoding Visual Stimuli with fMRI
- UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
- M3T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
- Adaptive Stochastic Coefficients for Accelerating Diffusion Sampling
- Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models
- A Critical Study on Tea Leaf Disease Detection using Deep Learning Techniques
- FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
- Approximate Gradient Coding for Distributed Learning with Heterogeneous Stragglers
- A short methodological review on social robot navigation benchmarking
- Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
- WAON: Large-Scale and High-Quality Japanese Image-Text Pair Dataset for Vision-Language Models
- GRAID: Enhancing Spatial Reasoning of VLMs Through High-Fidelity Data Generation
- Discovering Latent Graphs with GFlowNets for Diverse Conditional Image Generation
- Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation
- Identification of 2D colloidal assemblies in images: a threshold processing method versus machine learning
- Unveiling the Spatial-temporal Effective Receptive Fields of Spiking Neural Networks
- MATrack: Efficient Multiscale Adaptive Tracker for Real-Time Nighttime UAV Operations
- Bridging the gap to real-world language-grounded visual concept learning
- Dynamic Semantic-Aware Correlation Modeling for UAV Tracking
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- Modest-Align: Data-Efficient Alignment for Vision-Language Models
- Generative AI in Depth: A Survey of Recent Advances, Model Variants, and Real-World Applications
- ARGenSeg: Image Segmentation with Autoregressive Image Generation Model
- H-SPLID: HSIC-based Saliency Preserving Latent Information Decomposition
- TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
- Synthetic Data for Robust Runway Detection
- AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
- KCM: KAN-Based Collaboration Models Enhance Pretrained Large Models
- Why LVLMs Are More Prone to Hallucinations in Longer Responses: The Role of Context
- Monocular Visual 8D Pose Estimation for Articulated Bicycles and Cyclists
- MCA: Modality Composition Awareness for Robust Composed Multimodal Retrieval
- Attentive Convolution: Unifying the Expressivity of Self-Attention with Convolutional Efficiency
- Blur2seq: Blind Deblurring and Camera Trajectory Estimation from a Single Camera Motion-blurred Image
- GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation Models
- BrainCognizer: Brain Decoding with Human Visual Cognition Simulation for fMRI-to-Image Reconstruction
- A Training-Free Framework for Open-Vocabulary Image Segmentation and Recognition with EfficientNet and CLIP
- Exploring Scale Shift in Crowd Localization under the Context of Domain Generalization
- D2D: Detector-to-Differentiable Critic for Improved Numeracy in Text-to-Image Generation
- Exposing Blindspots: Cultural Bias Evaluation in Generative Image Models
- Hyperbolic Structured Classification for Robust Single Positive Multi-label Learning
- Ninja Codes: Neurally Generated Fiducial Markers for Stealthy 6-DoF Tracking
- ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
- SEAL: Semantic-Aware Hierarchical Learning for Generalized Category Discovery
- CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder
- Latent-Info and Low-Dimensional Learning for Human Mesh Recovery and Parallel Optimization
- Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
- Learning Human-Object Interaction as Groups
- Beyond Single Models: Mitigating Multimodal Hallucinations via Adaptive Token Ensemble Decoding
- MARIS: Marine Open-Vocabulary Instance Segmentation with Geometric Enhancement and Semantic Alignment
- Beyond Frequency: Scoring-Driven Debiasing for Object Detection via Blueprint-Prompted Image Synthesis
- SAM 2++: Tracking Anything at Any Granularity
- Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
- Hyperbolic Space Learning Method Leveraging Temporal Motion Priors for Human Mesh Recovery
- ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters
- UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
- Accelerating Vision Transformers with Adaptive Patch Sizes
- GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver
- CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
- Towards 3D Objectness Learning in an Open World
- DeepDetect: Learning All-in-One Dense Keypoints
- AFRICAPTION: Establishing a New Paradigm for Image Captioning in African Languages
- Token-Level Inference-Time Alignment for Vision-Language Models
- Semantic-E2VID: a Semantic-Enriched Paradigm for Event-to-Video Reconstruction
- A Single Set of Adversarial Clothes Breaks Multiple Defense Methods in the Physical World
- Towards a Generalizable Fusion Architecture for Multimodal Object Detection
- CaMiT: A Time-Aware Car Model Dataset for Classification and Generation
- How Universal Are SAM2 Features?
- Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
- One-step Diffusion Models with Bregman Density Ratio Matching
- An Efficient Semantic Segmentation Decoder for In-Car or Distributed Applications
- Unsupervised Monocular Road Segmentation for Autonomous Driving via Scene Geometry
- Personalized Image Filter: Mastering Your Photographic Style
- Semantic segmentation with coarse annotations
- VAR-SLAM: Visual Adaptive and Robust SLAM for Dynamic Environments
- DPTrack:Directional Kernel-Guided Prompt Learning for Robust Nighttime Aerial Tracking
- NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation
- Neuro-Symbolic Spatial Reasoning in Segmentation
- Train a Unified Multimodal Data Quality Classifier with Synthetic Data
- MOBIUS: Big-to-Mobile Universal Instance Segmentation via Multi-modal Bottleneck Fusion and Calibrated Decoder Pruning
- DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation
- DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models
- CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
- ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention
- ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints
- Cross-Layer Feature Self-Attention Module for Multi-Scale Object Detection
- Geometric Moment Alignment for Domain Adaptation via Siegel Embeddings
- Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
- Talking Points: Describing and Localizing Pixels
- BoardVision: Deployment-ready and Robust Motherboard Defect Detection with YOLO+Faster-RCNN Ensemble
- DOS: Directional Object Separation in Text Embeddings for Multi-Object Image Generation
- Vision-Centric Activation and Coordination for Multimodal Large Language Models
- Watermarking for Factuality: Guiding Vision-Language Models Toward Truth via Tri-layer Contrastive Decoding
- TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
- pi-Flow: Policy-Based Few-Step Generation via Imitation Distillation
- MUSE: Model-based Uncertainty-aware Similarity Estimation for zero-shot 2D Object Detection and Segmentation
- Robotic Classification of Divers' Swimming States using Visual Pose Keypoints as IMUs
- Scaling Vision Transformers for Functional MRI with Flat Maps
- Jacobian-Based Interpretation of Nonlinear Neural Encoding Model
- Language as a Label: Zero-Shot Multimodal Classification of Everyday Postures under Data Scarcity
- DEF-YOLO: Leveraging YOLO for Concealed Weapon Detection in Thermal Imagin
- UniVector: Unified Vector Extraction via Instance-Geometry Interaction
- From Adaptation to Intelligence: A Systematic Review of Data, Strategies, and Impact in Personalized VR
- Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models
- Group-Wise Optimization for Self-Extensible Codebooks in Vector Quantized Models
- The Mechanistic Emergence of Symbol Grounding in Language Models
- Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
- An Analytical Framework to Enhance Autonomous Vehicle Perception for Smart Cities
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
- Accelerated Feature Detectors for Visual SLAM: A Comparative Study of FPGA vs GPU
- DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
- Detect Anything via Next Point Prediction
- On the Use of Hierarchical Vision Foundation Models for Low-Cost Human Mesh Recovery and Pose Estimation
- FedMMKT:Co-Enhancing a Server Text-to-Image Model and Client Task Models in Multi-Modal Federated Learning
- The Impact of Synthetic Data on Object Detection Model Performance: A Comparative Analysis with Real-World Data
- MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
- Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
- Improving Text-to-Image Generation with Input-Side Inference-Time Scaling
- Post-surgical Endometriosis Segmentation in Laparoscopic Videos
- MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
- StealthAttack: Robust 3D Gaussian Splatting Poisoning via Density-Guided Illusions
- FACE: Faithful Automatic Concept Extraction
- Template-Based Text-to-Image Alignment for Language Accessibility: A Study on Visualizing Text Simplifications
- When Does Supervised Training Pay Off? The Hidden Economics of Object Detection in the Era of Vision-Language Models
- Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering
- FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models
- Reliable Cross-modal Alignment via Prototype Iterative Construction
- CoDefend: Cross-Modal Collaborative Defense via Diffusion Purification and Prompt Optimization
- ContextGen: Contextual Layout Anchoring for Identity-Consistent Multi-Instance Generation
- Paving the Way Towards Kinematic Assessment Using Monocular Video: A Preclinical Benchmark of State-of-the-Art Deep-Learning-Based 3D Human Pose Estimators Against Inertial Sensors in Daily Living Activities
- More than A Point: Capturing Uncertainty with Adaptive Affordance Heatmaps for Spatial Grounding in Robotic Tasks
- FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
- Learning Dynamics of VLM Finetuning
- Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey
- A Machine Learning Perspective on Automated Driving Corner Cases
- SpikeGrasp: A Benchmark for 6-DoF Grasp Pose Detection from Stereo Spike Streams
- UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
- Unified Open-World Segmentation with Multi-Modal Prompts
- Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
- Bridging Perspectives: Foundation Model Guided BEV Maps for 3D Object Detection and Tracking
- HccePose(BF): Predicting Front & Back Surfaces to Construct Ultra-Dense 2D-3D Correspondences for Pose Estimation
- SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
- Collaborative Learning of Semantic-Aware Feature Learning and Label Recovery for Multi-Label Image Recognition with Incomplete Labels
- Uncertainty-Aware Post-Detection Framework for Enhanced Fire and Smoke Detection in Compact Deep Learning Models
- Probabilistic Hyper-Graphs using Multiple Randomly Masked Autoencoders for Semi-supervised Multi-modal Multi-task Learning
- Complementary and Contrastive Learning for Audio-Visual Segmentation
- Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
- From pixels to data: automated reconstruction of taxonomic series from whole-drawer images in historical insect collections
- Leveraging Prior Knowledge of Diffusion Model for Person Search
- Asymmetric Flow Models
- PRNet: Original Information Is All You Have
- An uncertainty-aware framework for data-efficient multi-view animal pose estimation
- Holistic Order Prediction in Natural Scenes
- Cell Instance Segmentation: The Devil Is in the Boundaries
- Task-Aware Resolution Optimization for Visual Large Language Models
- Towards Understanding Ambiguity Resolution in Multimodal Inference of Meaning
- FSP-DETR: Few-Shot Prototypical Parasitic Ova Detection
- TC-LoRA: Temporally Modulated Conditional LoRA for Adaptive Diffusion Control
- MRMR: A Realistic and Expert-Level Multidisciplinary Benchmark for Reasoning-Intensive Multimodal Retrieval
- Hybrid-grained Feature Aggregation with Coarse-to-fine Language Guidance for Self-supervised Monocular Depth Estimation
- TARO: Toward Semantically Rich Open-World Object Detection
- Letting Trajectories Spread: Quality-Preserving Control for Diverse Flow Matching
- Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
- Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
- MIRAGE: Runtime Scheduling for Multi-Vector Image Retrieval with Hierarchical Decomposition
- Denoised Diffusion for Object-Focused Image Augmentation
- PHyCLIP: ℓ1-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning
- Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding
- LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition
- Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
- MAT-Agent: Adaptive Multi-Agent Training Optimization
- SilvaScenes: Tree Detection and Species Classification from Under-Canopy Images in Natural Forests
- Vision Language Models: A Survey of 26K Papers
- MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
- SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
- Rectified-CFG++ for Flow Based Models
- Mutual Learning for Hashing: Unlocking Strong Hash Functions from Weak Supervision
- Curriculum Learning with Synthetic Data for Enhanced Pulmonary Nodule Detection in Chest Radiographs
- Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling
- Long-tailed Recognition with Model Rebalancing
- Low-Compute Watermark Removal via Dual-Domain Natural Projection
- DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis
- SpecGuard: Spectral Projection-based Advanced Invisible Watermarking
- On the Convergence of Moral Self-Correction in Large Language Models
- Bridged Clustering: Semi-Supervised Sparse Bridging
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- Concept Retrieval -- What and How?
- MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models
- ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
- Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking
- Extreme Amodal Face Detection
- SDQM: Synthetic Data Quality Metric for Object Detection Dataset Evaluation
- VUGEN: Visual Understanding priors for GENeration
- OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot
- Enhancing Maritime Object Detection in Real-Time with RT-DETR and Data Augmentation
- We Can Hide More Bits: The Unused Watermarking Capacity in Theory and in Practice
- Vi-TacMan: Articulated Object Manipulation via Vision and Touch
- Universal Neural Architecture Space: Covering ConvNets, Transformers and Everything in Between
- OBSR: Open Benchmark for Spatial Representations
- Redefining Generalization in Visual Domains: A Two-Axis Framework for Fake Image Detection with FusionDetect
- Data Factory with Minimal Human Effort Using VLMs
- CalibCLIP: Contextual Calibration of Dominant Semantics for Text-Driven Image Retrieval
- SkinMap: Weighted Full-Body Skin Segmentation for Robust Remote Photoplethysmography
- Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI
- SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
- Model Merging to Maintain Language-Only Performance in Developmentally Plausible Multimodal Models
- Visual Representations inside the Language Model
- From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
- SONA: Learning Conditional, Unconditional, and Mismatching-Aware Discriminator
- Conditional Representation Learning for Customized Tasks
- Activation Quantization of Vision Encoders Needs Prefixing Registers
- TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Sampling
- Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
- Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
- SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
- ObCLIP: Oblivious CLoud-Device Hybrid Image Generation with Privacy Preservation
- Rethinking Consistent Multi-Label Classification Under Inexact Supervision
- Reliable and Scalable Robot Policy Evaluation with Imperfect Simulators
- Cross-View Open-Vocabulary Object Detection in Aerial Imagery
- Mirage: Unveiling Hidden Artifacts in Synthetic Images with Large Vision-Language Models
- Diverse Text-to-Image Generation via Contrastive Noise Optimization
- Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models
- Referring Expression Comprehension for Small Objects
- A Hybrid Co-Finetuning Approach for Visual Bug Detection in Video Games
- FrameOracle: Learning What to See and How Much to See in Videos
- Cross-Modal Content Optimization for Steering Web Agent Preferences
- Efficient Test-Time Scaling for Small Vision-Language Models
- OneFlow: Concurrent Mixed-Modal and Interleaved Generation with Edit Flows
- OTR: Synthesizing Overlay Text Dataset for Text Removal
- Bayesian Test-time Adaptation for Object Recognition and Detection with Vision-language Models
- Deep Generative Continual Learning using Functional LoRA: FunLoRA
- MaskCD: Mitigating LVLM Hallucinations by Image Head Masked Contrastive Decoding
- One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework
- Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
- EditTrack: Detecting and Attributing AI-assisted Image Editing
- ModernVBERT: Towards Smaller Visual Document Retrievers
- In-Situ Tweedie Discrete Diffusion Models
- Datasets for Valence and Arousal Inference: A Survey
- Assessing Foundation Models for Mold Colony Detection with Limited Training Data
- Understanding Sensitivity of Differential Attention through the Lens of Adversarial Robustness
- VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors
- Fast, Secure, and High-Capacity Image Watermarking with Autoencoded Text Vectors
- MetaLogic: Robustness Evaluation of Text-to-Image Models via Logically Equivalent Prompts
- Learn to Guide Your Diffusion Model
- PhraseStereo: The First Open-Vocabulary Stereo Image Segmentation Dataset
- WAInjectBench: Benchmarking Prompt Injection Detections for Web Agents
- From Camera-Based Sensing to Reasoning: A Comprehensive Review Toward Proactive Vulnerable Road User Safety
- F-scheduler: illuminating the free-lunch design space for fast sampling of diffusion models
- Cutting the Skip: Training Residual-Free Transformers
- Looking Beyond the Known: Towards a Data Discovery Guided Open-World Object Detection
- MOLM: Mixture of LoRA Markers
- Stealing AI Model Weights Through Covert Communication Channels
- Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training
- HilbertA: Hilbert Attention for Image Generation with Diffusion Models
- Post-Training Quantization via Residual Truncation and Zero Suppression for Diffusion Models
- SQUARE: Semantic Query-Augmented Fusion and Efficient Batch Reranking for Training-free Zero-Shot Composed Image Retrieval
- Benchmarking Deep Learning Convolutions on Energy-constrained CPUs
- TSalV360: A Method and Dataset for Text-driven Saliency Detection in 360-Degrees Videos
- Beyond Overall Accuracy: Pose- and Occlusion-driven Fairness Analysis in Pedestrian Detection for Autonomous Driving
- MuSLR: Multimodal Symbolic Logical Reasoning
- VELA: An LLM-Hybrid-as-a-Judge Approach for Evaluating Long Image Captions
- LieHMR: Autoregressive Human Mesh Recovery with SO(3) Diffusion
- Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
- OmniDFA: A Unified Framework for Open Set Synthesis Image Detection and Few-Shot Attribution
- Generalized Contrastive Learning for Universal Multimodal Retrieval
- PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
- VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
- AttentionViG: Cross-Attention-Based Dynamic Neighbor Aggregation in Vision GNNs
- Seeing Before Reasoning: A Unified Framework for Generalizable and Explainable Fake Image Detection
- "Where Can I Park?" Understanding Human Perspectives and Scalably Detecting Disability Parking from Aerial Imagery
- FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
- Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
- Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
- Safe Planning in Unknown Environments using Conformalized Semantic Maps
- Score-based Membership Inference on Diffusion Models
- SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation
- Vision Function Layer in Multimodal LLMs
- CMT: Mid-Training for Efficient Learning of Consistency, Mean Flow, and Flow Map Models
- Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models
- Adaptive Source-Channel Coding for Multi-User Semantic and Data Communications
- Personalized Vision via Visual In-Context Learning
- FreeRet: MLLMs as Training-Free Retrievers
- Scalable GANs with Transformers
- GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- Variable Rate Image Compression via N-Gram Context based Swin-transformer
- Does Weak-to-strong Generalization Happen under Spurious Correlations?
- ColLab: A Collaborative Spatial Progressive Data Engine for Referring Expression Comprehension and Generation
- Bridging the Task Gap: Multi-Task Adversarial Transferability in CLIP and Its Derivatives
- A Multi-Camera Vision-Based Approach for Fine-Grained Assembly Quality Control
- GenView++: Unifying Adaptive Generative Augmentation and Quality-Driven Supervision for Contrastive Representation Learning
- UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception
- Transparent Visual Reasoning via Object-Centric Agent Collaboration
- Beyond Greedy Exits: Improved Early Exit Decisions for Risk Control and Reliability
- Open-DeBias: Toward Mitigating Open-Set Bias in Language Models
- Uncovering Grounding IDs: How External Cues Shape Multimodal Binding
- Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
- Modeling the language cortex with form-independent and enriched representations of sentence meaning reveals remarkable semantic abstractness
- Enhanced Fracture Diagnosis Based on Critical Regional and Scale Aware in YOLO
- C3-OWD: A Curriculum Cross-modal Contrastive Learning Framework for Open-World Detection
- Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
- Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
- A Structured Framework for Evaluating and Enhancing Interpretive Capabilities of Multimodal LLMs in Culturally Situated Tasks
- RAISE: A Robot-Assisted Selective Disassembly and Sorting System for End-of-Life Phones
- Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings
- TY-RIST: Tactical YOLO Tricks for Real-time Infrared Small Target Detection
- RefAM: Attention Magnets for Zero-Shot Referral Segmentation
- LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision
- UniMIC: Token-Based Multimodal Interactive Coding for Human-AI Collaboration
- Category Discovery: An Open-World Perspective
- EfficientDepth: A Fast and Detail-Preserving Monocular Depth Estimation Model
- Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation
- Explaining multimodal LLMs via intra-modal token interactions
- GPT-4 for Occlusion Order Recovery
- HierLight-YOLO: A Hierarchical and Lightweight Object Detection Network for UAV Photography
- RAPID3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer
- HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models
- Guidance Watermarking for Diffusion Models
- Multilingual Vision-Language Models, A Survey
- Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors
- FailureAtlas:Mapping the Failure Landscape of T2I Models via Active Exploration
- From Bias to Balance: Exploring and Mitigating Spatial Bias in LVLMs
- Learnable Conformal Prediction with Context-Aware Nonconformity Functions for Robotic Planning and Perception
- PANICL: Mitigating Over-Reliance on Single Prompt in Visual In-Context Learning
- Enhancing Vehicle Detection under Adverse Weather Conditions with Contrastive Learning
- Deepfakes: we need to re-think the concept of "real" images
- Learning What To Hear: Boosting Sound-Source Association For Robust Audiovisual Instance Segmentation
- Fly pollinator foraging in boreal forests is shaped by climate, forest structure and flower resources
- MS-YOLO: Infrared Object Detection for Edge Deployment via MobileNetV4 and SlideLoss
- Towards Multimodal Active Learning: Efficient Learning with Limited Paired Data
- Can AI Perceive Physical Danger and Intervene?
- CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
- SlimDiff: Training-Free, Activation-Guided Hands-free Slimming of Diffusion Models
- SD3.5-Flash: Distribution-Guided Distillation of Generative Flows
- DyME: Dynamic Multi-Concept Erasure in Diffusion Models with Bi-Level Orthogonal LoRA Adaptation
- A Single Neuron Works: Precise Concept Erasure in Text-to-Image Diffusion Models
- Prompt-aware classifier free guidance for diffusion models
- Punching Above Precision: Small Quantized Model Distillation with Learnable Regularizer
- Real-Time Object Detection Meets DINOv3
- Vision Transformers: the threat of realistic adversarial patches
- FerretNet: Efficient Synthetic Image Detection via Local Pixel Dependencies
- Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
- TasselNetV4: A vision foundation model for cross-scene, cross-scale, and cross-species plant counting
- CompressAI-Vision: Open-source software to evaluate compression methods for computer vision tasks
- Data-Efficient Stream-Based Active Distillation for Scalable Edge Model Deployment
- Optical Ocean Recipes: Creating Realistic Datasets to Facilitate Underwater Vision Research
- Improving Generalizability and Undetectability for Targeted Adversarial Attacks on Multimodal Pre-trained Models
- AJAHR: Amputated Joint Aware 3D Human Mesh Recovery
- Adaptive Guidance Semantically Enhanced via Multimodal LLM for Edge-Cloud Object Detection
- High Clockrate Free-space Optical In-Memory Computing
- Look as You Leap: Planning Simultaneous Motion and Perception for High-DOF Robots
- ARD-REFSM: Enhancing Reflection Symmetry Detection with Asymmetric Denoising and Rotation Equivariance
- Unifying Adversarially Robust Model Experts in Vision-Language Models
- DECODE: Tackling Representation and Decision Degradation in Continual AI-Generated Image Detection
- FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference
- AnchorMark: Robust Diffusion Watermarking via Latent-Space Rotation Synchrony
- MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models
- FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval
- Towards Real-Time PixOOD: Efficient Anomaly Segmentation for Autonomous Vehicles
- Gaze Heads: How VLMs Look at What They Describe
- ShapeMark: Robust and Diversity-Preserving Watermarking for Diffusion Models
- Relational Scene Graphs for Object Grounding of Natural Language Commands
- The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation From Recognition to Reasoning
- Learning to Detect Label Errors by Making Them: A Method for Segmentation and Object Detection Datasets
- ISALux: Illumination and Segmentation Aware Transformer Employing Mixture of Experts for Low Light Image Enhancement
- Novel mapping approach for coastal boulders using deep learning
- HitoMi-Cam: A Shape-Agnostic Person Detection Method Using the Spectral Characteristics of Clothing
- From Global to Local: Social Bias Transfer in CLIP
- DroneKey: Drone 3D Pose Estimation in Image Sequences using Gated Key-representation and Pose-adaptive Learning
- Long Story Short: Disentangling Compositionality and Long-Caption Understanding in VLMs
- Advancing Metallic Surface Defect Detection via Anomaly-Guided Pretraining on a Large Industrial Dataset
- FlowCrypt: Flow-Based Lightweight Encryption with Near-Lossless Recovery for Cloud Photo Privacy
- OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation
- SynapFlow: A Modular Framework Towards Large-Scale Analysis of Dendritic Spines
- Generative data augmentation for biliary tract detection on intraoperative images
- Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions
- OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
- Pre-training CLIP against Data Poisoning with Optimal Transport-based Matching and Alignment
- Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
- Visual Detector Compression via Location-Aware Discriminant Analysis
- Visual Instruction Pretraining for Domain-Specific Foundation Models
- Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models
- Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models
- Few-Shot Pattern Detection via Template Matching and Regression
- Align Where the Words Look: Cross-Attention-Guided Patch Alignment with Contrastive and Transport Regularization for Bengali Captioning
- From Benchmarks to Reality: Advancing Visual Anomaly Detection by the VAND 3.0 Challenge
- MLLM-Driven Semantic Identifier Generation for Generative Cross-Modal Retrieval
- MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction
- CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration
- Domain Adaptive Object Detection for Space Applications with Real-Time Constraints
- Depth Edge Alignment Loss: DEALing with Depth in Weakly Supervised Semantic Segmentation
- iMIND: Insightful Multi-subject Invariant Neural Decoding
- Dual-View Alignment Learning with Hierarchical-Prompt for Class-Imbalance Multi-Label Classification
- MVP: Motion Vector Propagation for Zero-Shot Video Object Detection
- Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models
- Towards General Computer Control with Hierarchical Agents and Multi-Level Action Spaces
- LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation
- StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models
- Automated Facility Enumeration for Building Compliance Checking using Door Detection and Large Language Models
- LLM-Assisted Semantic Guidance for Sparsely Annotated Remote Sensing Object Detection
- \mathttM3VIR: A Large-Scale Multi-Modality Multi-View Synthesized Benchmark Dataset for Image Restoration and Content Creation
- Enhanced Detection of Tiny Objects in Aerial Images
- Automatic Classification of Magnetic Chirality of Solar Filaments from H-Alpha Observations
- When Confidence Fails: Revisiting Pseudo-Label Selection in Semi-supervised Semantic Segmentation
- InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
- MCP: A Control-Theoretic Orchestration Framework for Synergistic Efficiency and Interpretability in Multimodal Large Language Models
- mmExpert: Integrating Large Language Models for Comprehensive mmWave Data Synthesis and Understanding
- Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
- ADVEDM:Fine-grained Adversarial Attack against VLM-based Embodied Agents
- RACap: Relation-Aware Prompting for Lightweight Retrieval-Augmented Image Captioning
- SAGE: Semantic-Aware Shared Sampling for Efficient Diffusion
- The Curious Case of Visual Grounding: Different Effects for Speech- and Text-based Language Encoders
- CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models
- Dynamic Classifier-Free Diffusion Guidance via Online Feedback
- Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
- Pointing to a Llama and Call it a Camel: On the Sycophancy of Multimodal Large Language Models
- PolyJuice Makes It Real: Black-Box, Universal Red Teaming for Synthetic Image Detectors
- ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models
- Deep Feedback Models
- Efficient Multimodal Dataset Distillation via Generative Models
- MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
- Synthetic-to-Real Object Detection using YOLOv11 and Domain Randomization Strategies
- [Re] Improving Interpretation Faithfulness for Vision Transformers
- Data Augmentation via Latent Diffusion Models for Detecting Smell-Related Objects in Historical Artworks
- Chain-of-Thought Re-ranking for Image Retrieval Tasks
- UnifiedVisual: A Framework for Constructing Unified Vision-Language Datasets
- MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks
- VisMoDAl: Visual Analytics for Evaluating and Improving Corruption Robustness of Vision-Language Models
- A Framework for Generating Artificial Datasets to Validate Absolute and Relative Position Concepts
- Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
- Data Leakage in Visual Datasets
- MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment
- Noise-Level Diffusion Guidance: Well Begun is Half Done
- SpecDiff: Accelerating Diffusion Model Inference with Self-Speculation
- Improving Generalized Visual Grounding with Instance-aware Joint Learning
- eIQ Neutron: Redefining Edge-AI Inference with Integrated NPU and Compiler Innovations
- Rest2Visual: Predicting Visually Evoked fMRI from Resting-State Scans
- Performance Optimization of YOLO-FEDER FusionNet for Robust Drone Detection in Visually Complex Environments
- MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
- Explain Before You Answer: A Survey on Compositional Visual Reasoning
- Why all roads don't lead to Rome: Representation geometry varies across the human visual cortical hierarchy
- SCORE: A Semantic Evaluation Framework for Generative Document Parsing
- What Makes a Good Generated Image? Investigating Human and Multimodal LLM Image Preference Alignment
- DiffHash: Text-Guided Targeted Attack via Diffusion Models against Deep Hashing Image Retrieval
- SAGA: Selective Adaptive Gating for Efficient and Expressive Linear Attention
- Force-Modulated Visual Policy for Robot-Assisted Dressing with Arm Motions
- Case-Based Decision-Theoretic Decoding with Quality Memories
- Neural Collapse-Inspired Multi-Label Federated Learning under Label-Distribution Skew
- PersPose: 3D Human Pose Estimation with Perspective Encoding and Perspective Rotation
- TFANet: Three-Stage Image-Text Feature Alignment Network for Robust Referring Image Segmentation
- Cumulative Consensus Score: Label-Free and Model-Agnostic Evaluation of Object Detectors in Deployment
- MMMS: Multi-Modal Multi-Surface Interactive Segmentation
- T-SiamTPN: Temporal Siamese Transformer Pyramid Networks for Robust and Efficient UAV Tracking
- End4: End-to-end Denoising Diffusion for Diffusion-Based Inpainting Detection
- Lego-Edit: A General Image Editing Framework with Model-Level Bricks and MLLM Builder
- A Synthetic Data Pipeline for Supporting Manufacturing SMEs in Visual Assembly Control
- Contrastive Learning with Enhanced Abstract Representations using Grouped Loss of Abstract Semantic Supervision
- Adaptive Sampling Scheduler
- 3D Aware Region Prompted Vision Language Model
- Contextualized Representation Learning for Effective Human-Object Interaction Detection
- Road Obstacle Video Segmentation
- FS-SAM2: Adapting Segment Anything Model 2 for Few-Shot Semantic Segmentation via Low-Rank Adaptation
- Lost in Embeddings: Information Loss in Vision-Language Models
- Spec-LLaVA: Accelerating Vision-Language Models with Dynamic Tree-Based Speculative Decoding
- Igniting VLMs toward the Embodied Space
- DRAG: Data Reconstruction Attack using Guided Diffusion
- MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
- Axis-Aligned 3D Stalk Diameter Estimation from RGB-D Imagery
- When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
- CEMTM: Contextual Embedding-based Multimodal Topic Modeling
- From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming
- Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
- Beyond Instance Consistency: Investigating View Diversity in Self-supervised Learning
- A Novel Local Focusing Mechanism for Deepfake Detection Generalization
- StegOT: Trade-offs in Steganography via Optimal Transport
- Policy-Driven Transfer Learning in Resource-Limited Animal Monitoring
- MetaSeal: Defending Against Image Attribution Forgery Through Content-Dependent Cryptographic Watermarks
- MinatoLoader: Accelerating Machine Learning Training Through Efficient Data Preprocessing
- SegSLR: Promptable Video Segmentation for Isolated Sign Language Recognition
- Contrastive Prompt Clustering for Weakly Supervised Semantic Segmentation
- GAMMA: Generalizable Alignment via Multi-task and Manipulation-Augmented Training for AI-Generated Image Detection
- BenchECG and xECG: a benchmark and baseline for ECG foundation models
- Local Information Matters: A Rethink of Crowd Counting
- LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
- Zero-Shot Referring Expression Comprehension via Vison-Language True/False Verification
- LoFT: Parameter-Efficient Fine-Tuning for Long-tailed Semi-Supervised Learning in Open-World Scenarios
- Towards Understanding Visual Grounding in Visual Language Models
- Unified Multimodal Model as Auto-Encoder
- Semantic Concentration for Self-Supervised Dense Representations Learning
- Dark-ISP: Enhancing RAW Image Processing for Low-Light Object Detection
- Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios
- FPI-Det: a face--phone Interaction Dataset for phone-use detection and understanding
- A Lightweight Convolution and Vision Transformer integrated model with Multi-scale Self-attention Mechanism
- VoxelFormer: Parameter-Efficient Multi-Subject Visual Decoding from fMRI
- COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation
- GeneVA: A Dataset of Human Annotations for Generative Text to Video Artifacts
- Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles
- MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models
- Dual-Thresholding Heatmaps to Cluster Proposals for Weakly Supervised Object Detection
- Recurrence Meets Transformers for Universal Multimodal Retrieval
- Feature Space Analysis by Guided Diffusion Model
- Object-level Correlation for Few-Shot Segmentation
- Semantic Watermarking Reinvented: Enhancing Robustness and Generation Quality with Fourier Integrity
- Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation
- Basis Vector Metric: A Method for Robust Open-Ended State Change Detection
- Universal Few-Shot Spatial Control for Diffusion Models
- Tracing and Mitigating Hallucinations in Multimodal LLMs via Dynamic Attention Localization
- Parse Graph-Based Visual-Language Interaction for Human Pose Estimation
- Reconstruction Alignment Improves Unified Multimodal Models
- XBusNet: Text-Guided Breast Ultrasound Segmentation via Multimodal Vision-Language Learning
- Benchmarking EfficientTAM on FMO datasets
- Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
- When Language Model Guides Vision: Grounding DINO for Cattle Muzzle Detection
- Event Spectroscopy: Event-based Multispectral and Depth Sensing using Structured Light
- Back To The Drawing Board: Rethinking Scene-Level Sketch-Based Image Retrieval
- Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding
- CARDIE: clustering algorithm on relevant descriptors for image enhancement
- UNO: Unifying One-stage Video Scene Graph Generation via Object-Centric Visual Representation Learning
- TinyDef-DETR: A Transformer-Based Framework for Defect Detection in Transmission Lines from UAV Imagery
- MV-RAG: Retrieval Augmented Multiview Diffusion
- Closer to Reality: Practical Semi-Supervised Federated Learning for Foundation Model Adaptation
- Effectively obtaining acoustic, visual and textual data from videos
- Hyperbolic Large Language Models
- Tell-Tale Watermarks for Explanatory Reasoning in Synthetic Media Forensics
- Sensitivity-Aware Post-Training Quantization for Deep Neural Networks
- Patch-Level Kernel Alignment for Dense Self-Supervised Learning
- An Analysis of Layer-Freezing Strategies for Enhanced Transfer Learning in YOLO Architectures
- Comp-X: On Defining an Interactive Learned Image Compression Paradigm With Expert-driven LLM Agent
- Semantic-guided LoRA Parameters Generation
- Towards Efficient Pixel Labeling for Industrial Anomaly Detection and Localization
- A biologically inspired separable learning vision model for real-time traffic object perception in Dark
- Quaternion Approximation Networks for Enhanced Image Classification and Oriented Object Detection
- WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning
- Symbolic Graphics Programming with Large Language Models
- An Approach to Grounding AI Model Evaluations in Human-derived Criteria
- OVGrasp: Open-Vocabulary Grasping Assistance via Multimodal Intent Detection
- Differential Morphological Profile Neural Networks for Semantic Segmentation
- Real Time FPGA Based Transformers & VLMs for Vision Tasks: SOTA Designs and Optimizations
- Real Time FPGA Based CNNs for Detection, Classification, and Tracking in Autonomous Systems: State of the Art Designs and Optimizations
- MEPG:Multi-Expert Planning and Generation for Compositionally-Rich Image Generation
- SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
- Focus Through Motion: RGB-Event Collaborative Token Sparsification for Efficient Object Detection
- Measuring How (Not Just Whether) VLMs Build Common Ground
- Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
- DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models
- Sample-efficient Integration of New Modalities into Large Language Models
- AutoDetect: Designing an Autoencoder-based Detection Method for Poisoning Attacks on Object Detection Applications in the Military Domain
- SAMFusion: Sensor-Adaptive Multimodal Fusion for 3D Object Detection in Adverse Weather
- EdgeAttNet: Towards Barb-Aware Filament Segmentation
- Unsupervised Instance Segmentation with Superpixels
- SPENet: Self-guided Prototype Enhancement Network for Few-shot Medical Image Segmentation
- Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
- InstaDA: Augmenting Instance Segmentation Data with Dual-Agent System
- Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
- Joint Training of Image Generator and Detector for Road Defect Detection
- A-FloPS: Accelerating Diffusion Sampling with Adaptive Flow Path Sampler
- Sparse and Dense Retrievers Learn Better Together: Joint Sparse-Dense Optimization for Text-Image Retrieval
- Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection
- Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture
- Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
- Self-Validated Learning for Particle Separation: A Correctness-Based Self-Training Framework Without Human Labels
- A Keyframe-Based Approach for Auditing Bias in YouTube Shorts Recommendations
- Synesthesia of Machines (SoM)-Based Task-Driven MIMO System for Image Transmission
- Improving Long-Tailed Object Detection with Balanced Group Softmax and Metric Learning
- Reinforced Visual Perception with Tools
- FEDEXCHANGE: Bridging the Domain Gap in Federated Object Detection for Free
- Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling
- Kwai Keye-VL 1.5 Technical Report
- Measuring Image-Relation Alignment: Reference-Free Evaluation of VLMs and Synthetic Pre-training for Open-Vocabulary Scene Graph Generation
- FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image Generation
- Expandable Residual Approximation for Knowledge Distillation
- GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
- RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness
- Prompt the Unseen: Evaluating Visual-Language Alignment Beyond Supervision
- No More Sibling Rivalry: Debiasing Human-Object Interaction Detection
- EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions
- Pose as Clinical Prior: Learning Dual Representations for Scoliosis Screening
- Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models
- DGL-RSIS: Decoupling Global Spatial Context and Local Class Semantics for Training-Free Remote Sensing Image Segmentation
- SynDelay: A Synthetic Dataset for Delivery Delay Prediction
- Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety
- CAD2DMD-SET: Synthetic Generation Tool of Digital Measurement Device CAD Model Datasets for fine-tuning Large Vision-Language Models
- OptMark: Robust Multi-bit Diffusion Watermarking via Inference Time Optimization
- Identifying Surgical Instruments in Laparoscopy Using Deep Learning Instance Segmentation
- Webly-Supervised Image Manipulation Localization via Category-Aware Auto-Annotation
- E-ConvNeXt: A Lightweight and Efficient ConvNeXt Variant with Cross-Stage Partial Connections
- "Humor, Art, or Misinformation?": A Multimodal Dataset for Intent-Aware Synthetic Image Detection
- Digital Scale: Open-Source On-Device BMI Estimation from Smartphone Camera Images Trained on a Large-Scale Real-World Dataset
- CaddieSet: A Golf Swing Dataset with Human Joint Features and Ball Information
- Safe-Control: A Safety Patch for Mitigating Unsafe Content in Text-to-Image Generation Models
- More Reliable Pseudo-labels, Better Performance: A Generalized Approach to Single Positive Multi-label Learning
- Improving Alignment in LVLMs with Debiased Self-Judgment
- Disentangling Latent Embeddings with Sparse Linear Concept Subspaces (SLiCS)
- ROBUST-MIPS: A Combined Skeletal Pose and Instance Segmentation Dataset for Laparoscopic Surgical Instruments
- The Role of Teacher Calibration in Knowledge Distillation
- GLSim: Detecting Object Hallucinations in LVLMs via Global-Local Similarity
- Streamlining the Development of Active Learning Methods in Real-World Object Detection
- Self-supervised structured object representation learning
- Image Quality Assessment for Machines: Paradigm, Large-scale Database, and Models
- Context-aware Sparse Spatiotemporal Learning for Event-based Vision
- Quantization Robustness to Input Degradations for Object Detection
- FlowDet: Overcoming Perspective and Scale Challenges in Real-Time End-to-End Traffic Detection
- CSRD2025: A Large-Scale Synthetic Radio Dataset for Spectrum Sensing in Wireless Communications
- Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
- Style4D-Bench: A Benchmark Suite for 4D Stylization
- Autoregressive Universal Video Segmentation Model
- SecureV2X: An Efficient and Privacy-Preserving System for Vehicle-to-Everything (V2X) Applications
- Rethinking Human-Object Interaction Evaluation for both Vision-Language Models and HOI-Specific Methods
- Quantitative Outcome-Oriented Assessment of Microsurgical Anastomosis
- Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models
- Robust and Label-Efficient Deep Waste Detection
- Feature-Space Planes Searcher: A Universal Domain Adaptation Framework for Interpretability and Computational Efficiency
- CARMA: Collocation-Aware Resource Manager
- BRAIN: Bias-Mitigation Continual Learning Approach to Vision-Brain Understanding
- SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
- Annotation-Free Open-Vocabulary Segmentation for Remote-Sensing Images
- Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
- Pretrained Diffusion Models Are Inherently Skipped-Step Samplers
- Scaling Group Inference for Diverse and High-Quality Generation
- Survey of Vision-Language-Action Models for Embodied Manipulation
- Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
- Fusing Monocular RGB Images with AIS Data to Create a 6D Pose Estimation Dataset for Marine Vessels
- GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models
- SMTrack: End-to-End Trained Spiking Neural Networks for Multi-Object Tracking in RGB Videos
- SATURN: Autoregressive Image Generation Guided by Scene Graphs
- Ouroboros: Single-step Diffusion Models for Cycle-consistent Forward and Inverse Rendering
- MUSE: Multi-Subject Unified Synthesis via Explicit Layout Semantic Expansion
- CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
- Inter-Class Relational Loss for Small Object Detection: A Case Study on License Plates
- Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation
- Side Effects of Erasing Concepts from Diffusion Models
- Towards PerSense++: Advancing Training-Free Personalized Instance Segmentation in Dense Images
- Disentanglement in T-space for Faster and Distributed Training of Diffusion Models with Fewer Latent-states
- A Guide for Manual Annotation of Scientific Imagery: How to Prepare for Large Projects
- Seeing Further on the Shoulders of Giants: Knowledge Inheritance for Vision Foundation Models
- OmniSense: Towards Edge-Assisted Online Analytics for 360-Degree Videos
- RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
- OmViD: Omni-supervised active learning for video action detection
- Enhancing Targeted Adversarial Attacks on Large Vision-Language Models via Intermediate Projector
- A Generalized Learning Framework for Self-Supervised Contrastive Learning
- Fracture Detection and Localisation in Wrist and Hand Radiographs using Detection Transformer Variants
- RICO: Two Realistic Benchmarks and an In-Depth Analysis for Incremental Learning in Object Detection
- LENS: Learning to Segment Anything with Unified Reinforced Reasoning
- Sim-to-Real Dynamic Object Manipulation on Conveyor Systems via Optimization Path Shaping
- AIM 2025 Rip Current Segmentation (RipSeg) Challenge Report
- 7Bench: a Comprehensive Benchmark for Layout-guided Text-to-image Models
- CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance
- Learning to Steer: Input-dependent Steering for Multimodal LLMs
- Vehicle detection from GSV imagery: Predicting travel behaviour for cycling and motorcycling using Computer Vision
- Refine-and-Contrast: Adaptive Instance-Aware BEV Representations for Multi-UAV Collaborative Object Detection
- FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
- Federated Action Recognition for Smart Worker Assistance Using FastPose
- ViDA-UGC: Detailed Image Quality Analysis via Visual Distortion Assessment for UGC Images
- RISE: Enhancing VLM Image Annotation with Self-Supervised Reasoning
- Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
- S5: Scalable Semi-Supervised Semantic Segmentation in Remote Sensing
- SafeCtrl: Region-Based Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress
- Automated Model Evaluation for Object Detection via Prediction Consistency and Reliability
- Dataset Creation for Visual Entailment using Generative AI
- RMFAT: Recurrent Multi-scale Feature Atmospheric Turbulence Mitigator
- Multi-State Tracker: Enhancing Efficient Object Tracking via Multi-State Specialization and Interaction
- Hierarchical Graph Feature Enhancement with Adaptive Frequency Modulation for Visual Recognition
- Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
- Index-Aligned Query Distillation for Transformer-based Incremental Object Detection
- Probing the Representational Power of Sparse Autoencoders in Vision Models
- Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception
- EMLIO: Minimizing I/O Latency and Energy Consumption for Large-Scale AI Training
- Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models
- SoK: Data Minimization in Machine Learning
- Beyond conventional vision: RGB-event fusion for robust object detection in dynamic traffic scenarios
- Towards Powerful and Practical Patch Attacks for 2D Object Detection in Autonomous Driving
- SkeySpot: Automating Service Key Detection for Digital Electrical Layout Plans in the Construction Industry
- Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models
- SynBrain: Enhancing Visual-to-fMRI Synthesis via Probabilistic Representation Learning
- MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
- BERT-VQA: Visual Question Answering on Plots
- Deep Learning for Crack Detection: A Review of Learning Paradigms, Generalizability, and Datasets
- Deep Learning Enables Large-Scale Shape and Appearance Modeling in Total-Body DXA Imaging
- Bridging Modality Gaps in e-Commerce Products via Vision-Language Alignment
- Stable Diffusion Models are Secretly Good at Visual In-Context Learning
- Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
- IPG: Incremental Patch Generation for Generalized Adversarial Patch Training
- Poaching Hotspot Identification Using Satellite Imagery
- TRACE: Learning 3D Gaussian Physical Dynamics from Multi-view Videos
- SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs
- COXNet: Cross-Layer Fusion with Adaptive Alignment and Scale Integration for RGBT Tiny Object Detection
- IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding
- Autonomous AI Bird Feeder for Backyard Biodiversity Monitoring
- UniConvNet: Expanding Effective Receptive Field while Maintaining Asymptotically Gaussian Distribution for ConvNets of Any Scale
- DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation
- SHREC 2025: Retrieval of Optimal Objects for Multi-modal Enhanced Language and Spatial Assistance (ROOMELSA)
- Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
- Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization
- Image selective encryption analysis using mutual information in CNN based embedding space
- Designing Object Detection Models for TinyML: Foundations, Comparative Analysis, Challenges, and Emerging Solutions
- Sample-aware RandAugment: Search-free Automatic Data Augmentation for Effective Image Recognition
- Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model
- Pose-RFT: Enhancing MLLMs for 3D Pose Generation via Hybrid Action Reinforcement Fine-Tuning
- Grouped Speculative Decoding for Autoregressive Image Generation
- LaRender: Training-Free Occlusion Control in Image Generation via Latent Rendering
- From Prediction to Explanation: Multimodal, Explainable, and Interactive Deepfake Detection Framework for Non-Expert Users
- Importance-Aware Semantic Communication in MIMO-OFDM Systems Using Vision Transformer
- MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
- Enhancing Small-Scale Dataset Expansion with Triplet-Connection-based Sample Re-Weighting
- DoorDet: Semi-Automated Multi-Class Door Detection Dataset via Object Detection and Large Language Models
- Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation
- Dynamic Pattern Alignment Learning for Pretraining Lightweight Human-Centric Vision Models
- RORPCap: Retrieval-based Objects and Relations Prompt for Image Captioning
- Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
- VOccl3D: A Video Benchmark Dataset for 3D Human Pose and Shape Estimation under real Occlusions
- AGIC: Attention-Guided Image Captioning to Improve Caption Relevance
- Convolutional architectures are cortex-aligned de novo
- CLIPin: A Non-contrastive Plug-in to CLIP for Multimodal Semantic Alignment
- Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation
- Text as Any-Modality for Zero-Shot Classification by Consistent Prompt Tuning
- Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model Deployment
- VISTAR:A User-Centric and Role-Driven Benchmark for Text-to-Image Evaluation
- Text-guided Visual Prompt DINO for Generic Segmentation
- UGD-IML: A Unified Generative Diffusion-based Framework for Constrained and Unconstrained Image Manipulation Localization
- AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
- A Cross-Perspective Annotated Dataset for Dynamic Object-Level Attention Modeling in Cloud Gaming
- Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
- SynSeg: Feature Synergy for Multi-Category Contrastive Learning in End-to-End Open-Vocabulary Semantic Segmentation
- User-Intent-Driven Semantic Communication via Adaptive Deep Understanding
- LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
- WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
- DART: Dual Adaptive Refinement Transfer for Open-Vocabulary Multi-Label Recognition
- Adapting Vision-Language Models Without Labels: A Comprehensive Survey
- Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
- Textual Inversion for Efficient Adaptation of Open-Vocabulary Object Detectors Without Forgetting
- EndoMatcher: Generalizable Endoscopic Image Matcher via Multi-Domain Pre-training for Robot-Assisted Surgery
- Multi-tracklet Tracking for Generic Targets with Adaptive Detection Clustering
- Latent Expression Generation for Referring Image Segmentation and Grounding
- Automatic Image Colorization with Convolutional Neural Networks and Generative Adversarial Networks
- CSRAP: Enhanced Canvas Attention Scheduling for Real-Time Mission Critical Perception
- SPA++: Generalized Graph Spectral Alignment for Versatile Domain Adaptation
- Multimodal RAG Enhanced Visual Description
- Analyzing and Mitigating Object Hallucination: A Training Bias Perspective
- MSC: A Marine Wildlife Video Dataset with Grounded Segmentation and Clip-Level Captioning
- TopKD: Top-scaled Knowledge Distillation
- RAIDX: A Retrieval-Augmented Generation and GRPO Reinforcement Learning Framework for Explainable Deepfake Detection
- FrEVL: Leveraging Frozen Pretrained Embeddings for Efficient Vision-Language Understanding
- Boosting Visual Knowledge-Intensive Training for LVLMs Through Causality-Driven Visual Object Completion
- Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models
- Composed Object Retrieval: Object-level Retrieval via Composed Expressions
- S2M3: Split-and-Share Multi-Modal Models for Distributed Multi-Task Inference on the Edge
- Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting
- What Holds Back Open-Vocabulary Segmentation?
- Learning Using Privileged Information for Litter Detection
- Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
- From Label Error Detection to Correction: A Modular Framework and Benchmark for Object Detection Datasets
- MaLV-OS: Rethinking the Operating System Architecture for Machine Learning in Virtualized Clouds
- IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
- ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools
- BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion Models
- GeoShield: Safeguarding Geolocation Privacy from Vision-Language Models via Adversarial Perturbations
- Open-Vocabulary HOI Detection with Interaction-aware Prompt and Concept Calibration
- AlignCAT: Visual-Linguistic Alignment of Category and Attribute for Weakly Supervised Visual Grounding
- ChartCap: Mitigating Hallucination of Dense Chart Captioning
- Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery
- T2UE: Generating Unlearnable Examples from Text Descriptions
- Seeing It Before It Happens: In-Generation NSFW Detection for Diffusion-Based Text-to-Image Models
- Where and How to Enhance: Discovering Bit-Width Contribution for Mixed Precision Quantization
- Adversarial Attention Perturbations for Large Object Detection Transformers
- Architectural Insights into Knowledge Distillation for Object Detection: A Comprehensive Review
- When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models
- VRSight: An AI-Driven Scene Description System to Improve Virtual Reality Accessibility for Blind People
- Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
- Infrared Object Detection with Ultra Small ConvNets: Is ImageNet Pretraining Still Useful?
- VisuCraft: Enhancing Large Vision-Language Models for Complex Visual-Guided Creative Content Generation via Structured Information Extraction
- Evaluation and Analysis of Deep Neural Transformers and Convolutional Neural Networks on Modern Remote Sensing Datasets
- Hubness Reduction with Dual Bank Sinkhorn Normalization for Cross-Modal Retrieval
- Modality Bias in LVLMs: Analyzing and Mitigating Object Hallucination via Attention Lens
- TRUDI and TITUS: A Multi-Perspective Dataset and A Three-Stage Recognition System for Transportation Unit Identification
- VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions
- AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
- DeflareMamba: Hierarchical Vision Mamba for Contextually Consistent Lens Flare Removal
- Devil is in the Detail: Towards Injecting Fine Details of Image Prompt in Image Generation via Conflict-free Guidance and Stratified Attention
- Fine-Tuning Vision-Language Models for Markdown Conversion of Financial Tables in Malaysian Audited Financial Reports
- Tackling Ill-posedness of Reversible Image Conversion with Well-posed Invertible Network
- Enhancing Object Discovery for Unsupervised Instance Segmentation and Object Detection
- Benchmarking Deep Learning-Based Object Detection Models on Feature Deficient Astrophotography Imagery Dataset
- Single Point, Full Mask: Velocity-Guided Level Set Evolution for End-to-End Amodal Segmentation
- MiraGe: Multimodal Discriminative Representation Learning for Generalizable AI-Generated Image Detection
- Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models
- What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?
- MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing
- Shape Distribution Matters: Shape-specific Mixture-of-Experts for Amodal Segmentation under Diverse Occlusions
- Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models
- SGCap: Decoding Semantic Group for Zero-shot Video Captioning
- ODOV: Towards Open-Domain Open-Vocabulary Object Detection
- Eigen Neural Network: Unlocking Generalizable Vision with Eigenbasis
- StyDeco: Unsupervised Style Transfer with Distilling Priors and Semantic Decoupling
- LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation
- Personalized Safety Alignment for Text-to-Image Diffusion Models
- Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
- ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
- Unraveling Hidden Representations: A Multi-Modal Layer Analysis for Better Synthetic Content Forensics
- Revisiting Adversarial Patch Defenses on Object Detectors: Unified Evaluation, Large-Scale Dataset, and New Insights
- YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
- MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
- Wukong Framework for Not Safe For Work Detection in Text-to-Image systems
- Context-based Motion Retrieval using Open Vocabulary Methods for Autonomous Driving
- Uncertainty-Aware Likelihood Ratio Estimation for Pixel-Wise Out-of-Distribution Detection
- MultiSHAP: A Shapley-Based Framework for Explaining Cross-Modal Interactions in Multimodal AI Models
- HiPrune: Training-Free Visual Token Pruning via Hierarchical Attention in Vision-Language Models
- AutoDebias: Automated Framework for Debiasing Text-to-Image Models
- Reducing the gap between general purpose data and aerial images in concentrated solar power plants
- AniMer+: Unified Pose and Shape Estimation Across Mammalia and Aves via Family-Aware Transformer
- Backdoor Attacks on Deep Learning Face Detection
- UIS-Mamba: Exploring Mamba for Underwater Instance Segmentation via Dynamic Tree Scan and Hidden State Weaken
- CIF: A Constrained Inversion Framework for Reliable Message Extraction in Diffusion-Based Generative Steganography
- Slot Attention with Re-Initialization and Self-Distillation
- DivControl: Knowledge Diversion for Controllable Image Generation
- LED Benchmark: Diagnosing Structural Layout Errors for Document Layout Analysis
- Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
- Adversarial-Guided Diffusion for Multimodal LLM Attacks
- Temporal asymmetry of neural pattern similarity predicts recognition memory decisions
- From Image Captioning to Visual Storytelling
- Learning Semantic-Aware Threshold for Multi-Label Image Recognition with Partial Labels
- The Cow of Rembrandt - Analyzing Artistic Prompt Interpretation in Text-to-Image Models
- Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems
- SAM-PTx: Text-Guided Fine-Tuning of SAM with Parameter-Efficient, Parallel-Text Adapters
- CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
- Modality-Aware Feature Matching: A Comprehensive Review of Single- and Cross-Modality Techniques
- SpectraSentinel: LightWeight Dual-Stream Real-Time Drone Detection, Tracking and Payload Identification
- Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions
- AlphaDent: A dataset for automated tooth pathology detection
- LoReUn: Data Itself Implicitly Provides Cues to Improve Machine Unlearning
- Estimating 2D Camera Motion with Hybrid Motion Basis
- Exploiting Diffusion Prior for Task-driven Image Restoration
- On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations
- Object Recognition Datasets and Challenges: A Review
- SmartCLIP: Modular Vision-language Alignment with Identification Guarantees
- From Waveforms to Pixels: A Survey on Audio-Visual Segmentation
- Trade-offs in Image Generation: How Do Different Dimensions Interact?
- Staining and locking computer vision models without retraining
- CAPE: A CLIP-Aware Pointing Ensemble of Complementary Heatmap Cues for Embodied Reference Understanding
Related