Fine-Grained Visual Classification of Aircraft
2013/06/21 by Subhransu Maji, Esa Rahtu, Maji, Subhransu +8 · 390 citations
Computer Science · Earth and Planetary Sciences · Engineering · #3D Surveying and Cultural Heritage #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image and Object Detection Techniques #Infrared Target Detection Methodologies #cs.CV
paper · pdf · doi:10.48550/arxiv.1306.5151
arxiv created 2013/06/21 · openalex publication_date 2013/06/21 · arxiv updated 2013/06/24 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
This paper introduces FGVC-Aircraft, a new dataset containing 10,000 images of aircraft spanning 100 aircraft models, organised in a three-level hierarchy. At the finer level, differences between models are often subtle but always visually measurable, making visual recognition challenging but possible. A benchmark is obtained by defining corresponding classification tasks and evaluation protocols, and baseline results are presented. The construction of this dataset was made possible by the work of aircraft enthusiasts, a strategy that can extend to the study of number of other object classes. Compared to the domains usually considered in fine-grained visual classification (FGVC), for example animals, aircraft are rigid and hence less deformable. They, however, present other interesting modes of variation, including purpose, size, designation, structure, historical style, and branding.
Cited by
- Same or Not? Enhancing Visual Perception in Vision-Language Models
- Decomposing Task Vectors for Refined Model Editing
- The Quest for Winning Tickets in Low-Rank Adapters
- FunnelAL: Retrieve-then-Rank Active Learning for Single-Class Discovery
- Hierarchy-Aware Fine-Tuning of Vision-Language Models
- Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model
- Retrieval-augmented Prompt Learning for Pre-trained Foundation Models
- SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models
- AmPLe: Supporting Vision-Language Models via Adaptive-Debiased Ensemble Multi-Prompt Learning
- Towards Ancient Plant Seed Classification: A Benchmark Dataset and Baseline Model
- TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models
- SuperCLIP: CLIP with Simple Classification Supervision
- Calibrating Uncertainty for Zero-Shot Adversarial CLIP
- MetaTPT: Meta Test-time Prompt Tuning for Vision-Language Models
- Advancing Cache-Based Few-Shot Classification via Patch-Driven Relational Gated Graph Attention
- Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
- Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective
- Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors
- Training-Free Dual Hyperbolic Adapters for Better Cross-Modal Reasoning
- Decoupling Template Bias in CLIP: Harnessing Empty Prompts for Enhanced Few-Shot Learning
- Dropout Prompt Learning: Towards Robust and Adaptive Vision-Language Models
- ReLKD: Inter-Class Relation Learning with Knowledge Distillation for Generalized Category Discovery
- Neural Coherence : Find higher performance to out-of-distribution tasks from few samples
- Fourier-Attentive Representation Learning: A Fourier-Guided Framework for Few-Shot Generalization in Vision-Language Models
- Basis-Oriented Low-rank Transfer for Few-Shot and Test-Time Adaptation
- Partially Shared Concept Bottleneck Models
- Learning What Helps: Task-Aligned Context Selection for Vision Tasks
- PowerCLIP: Powerset Alignment for Contrastive Pre-Training
- ClearGCD: Mitigating Shortcut Learning For Robust Generalized Category Discovery
- From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts
- VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
- Semi-Supervised Contrastive Learning with Orthonormal Prototypes
- Attention, Please! Revisiting Attentive Probing Through the Lens of Efficiency
- AnchorOPT: Towards Optimizing Dynamic Anchors for Adaptive Prompt Learning
- MetaRank: Task-Aware Metric Selection for Model Transferability Estimation
- CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection
- DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition
- ATAC: Augmentation-Based Test-Time Adversarial Correction for CLIP
- ReBaPL: Repulsive Bayesian Prompt Learning
- Hierarchical Semantic Tree Anchoring for CLIP-Based Class-Incremental Learning
- HiGFA: Hierarchical Guidance for Fine-grained Data Augmentation with Diffusion Models
- BOFA: Bridge-Layer Orthogonal Low-Rank Fusion for CLIP-Based Class-Incremental Learning
- Heterogeneous Complementary Distillation
- Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
- Doubly Debiased Test-Time Prompt Tuning for Vision-Language Models
- SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking
- Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models
- Decoupled Multi-Predictor Optimization for Inference-Efficient Model Tuning
- Generative Hints
- Generalized Category Discovery under Domain Shift: A Frequency Domain Perspective
- Learning an Efficient Optimizer via Hybrid-Policy Sub-Trajectory Balance
- FedMGP: Personalized Federated Learning with Multi-Group Text-Visual Prompts
- Soft Task-Aware Routing of Experts for Equivariant Representation Learning
- A Retrospect to Multi-prompt Learning across Vision and Language
- A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models
- When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs
- Attentive multilayer fusion for vision transformers
- On the Provable Importance of Gradients for Language-Assisted Image Clustering
- Enhancing CLIP Robustness via Cross-Modality Alignment
- Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification
- MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
- Implicit Modeling for Transferability Estimation of Vision Foundation Models
- Self-Calibrated Consistency can Fight Back for Adversarial Robustness in Vision-Language Models
- How Well Do Sparse Imagenet Models Transfer?
- OpenworldAUC: Towards Unified Evaluation and Optimization for Open-world Prompt Tuning
- Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models
- Bi-CoG: Bi-Consistency-Guided Self-Training for Vision-Language Models
- Class-Aware Prototype Learning with Negative Contrast for Test-Time Adaptation of Vision-Language Models
- Theoretical Refinement of CLIP by Utilizing Linear Structure of Optimal Similarity
- FPT-Noise: Dynamic Scene-Aware Counterattack for Test-Time Adversarial Defense in Vision-Language Models
- SEAL: Semantic-Aware Hierarchical Learning for Generalized Category Discovery
- Learning Task-Agnostic Representations through Multi-Teacher Distillation
- Elastic ViTs from Pretrained Models without Retraining
- You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
- Free-Grained Hierarchical Recognition
- Exploring Cross-Modal Flows for Few-Shot Learning
- Salient Concept-Aware Generative Data Augmentation
- Seeing and Knowing in the Wild: Open-domain Visual Entity Recognition with Large-scale Knowledge Graphs via Contrastive Learning
- microCLIP: Unsupervised CLIP Adaptation via Coarse-Fine Token Fusion for Fine-Grained Image Classification
- Cluster-Aware Prompt Ensemble Learning for Few-Shot Vision-Language Model Adaptation
- PHyCLIP: ℓ1-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning
- D-TPT: Dimensional Entropy Maximization for Calibrating Test-Time Prompt Tuning in Vision-Language Models
- Revisiting Pose-Normalization for Fine-Grained Few-Shot Recognition
- How NOT to benchmark your SITE metric: Beyond Static Leaderboards and Towards Realistic Evaluation
- Beyond the Seen: Bounded Distribution Estimation for Open-Vocabulary Learning
- Zero-Shot Fine-Grained Image Classification Using Large Vision-Language Models
- NSGANetV2: Evolutionary Multi-Objective Surrogate-Assisted Neural Architecture Search
- Improving Adversarial Robustness of Zero-Shot CLIP with Confidence-Aware Weighting
- Bayesian Test-time Adaptation for Object Recognition and Detection with Vision-language Models
- On-the-Fly Data Augmentation via Gradient-Guided and Sample-Aware Influence Estimation
- Zero-Shot Decentralized Federated Learning
- SeMoBridge: Semantic Modality Bridge for Efficient Few-Shot Adaptation of CLIP
- GenView++: Unifying Adaptive Generative Augmentation and Quality-Driven Supervision for Contrastive Representation Learning
- Robust Fine-Tuning from Non-Robust Pretrained Models: Mitigating Suboptimal Transfer With Epsilon-Scheduling
- Sparse, Collaborative, or Nonnegative Representation: Which Helps Pattern Classification?
- When Does Self-supervision Improve Few-shot Learning?
- Hierarchical Representation Matching for CLIP-based Class-Incremental Learning
- PartCo: Part-Level Correspondence Priors Enhance Category Discovery
- Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance
- Category Discovery: An Open-World Perspective
- Closing the Oracle Gap: Increment Vector Transformation for Class Incremental Learning
- EnGraf-Net: Multiple Granularity Branch Network with Fine-Coarse Graft Grained for Classification Task
- SiNGER: A Clearer Voice Distills Vision Transformers Further
- Unlocking Noise-Resistant Vision: Key Architectural Secrets for Robust Models
- ICONIC-444: A 3.1-Million-Image Dataset for OOD Detection Research
- Unifying Adversarially Robust Model Experts in Vision-Language Models
- Alternating Training-based Label Smoothing Enhances Prompt Generalization
- Attribute Mix: Semantic Data Augmentation for Fine Grained Recognition
- No Labels Needed: Zero-Shot Image Classification with Collaborative Self-Learning
- Global Prompt Refinement with Non-Interfering Attention Masking for One-Shot Federated Learning
- Learning Attribute-Aware Hash Codes for Fine-Grained Image Retrieval via Query Optimization
- Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models
- Emulating Human-like Adaptive Vision for Efficient and Flexible Machine Visual Perception
- Predicting Training Time Without Training
- Trade-offs in Cross-Domain Generalization of Foundation Model Fine-Tuned for Biometric Applications
- Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models
- Self Identity Mapping
- Vision-Language Models for Vision Tasks: A Survey
- Intriguing Properties of Vision Transformers
- Where to Focus: Deep Attention-based Spatially Recurrent Bilinear Networks for Fine-Grained Visual Recognition
- Re-labeling ImageNet: from Single to Multi-Labels, from Global to Localized Labels
- Attention Convolutional Binary Neural Tree for Fine-Grained Visual Categorization
- Bootstrap your own latent: A new approach to self-supervised Learning
- Fine-Grained Visual Classification via Simultaneously Learning of Multi-regional Multi-grained Features
- Fine-Grained Visual Classification with Efficient End-to-end Localization
- Customizing Student Networks From Heterogeneous Teachers via Adaptive Knowledge Amalgamation
- Logit Mixture Outlier Exposure for Fine-grained Out-of-Distribution Detection
- Rethinking Channel Dimensions for Efficient Model Design
- NAT: Learning to Attack Neurons for Enhanced Adversarial Transferability
- Representation Transfer by Optimal Transport
- Compounding the Performance Improvements of Assembled Techniques in a Convolutional Neural Network
- Intra-Ensemble in Neural Networks
- Hyperbolic Large Language Models
- Rethinking Supervised Pre-training for Better Downstream Transferring
- Towards Open World Detection: A Survey
- Novel Visual Category Discovery with Dual Ranking Statistics and Mutual Knowledge Distillation
- Attn-Adapter: Attention Is All You Need for Online Few-shot Learner of Vision-Language Model
- Causality-guided Prompt Learning for Vision-language Models via Visual Granulation
- Singular Value Few-shot Adaptation of Vision-Language Models
- LogME: Practical Assessment of Pre-trained Models for Transfer Learning
- FedAPT: Federated Adversarial Prompt Tuning for Vision-Language Models
- DIET-CP: Lightweight and Data Efficient Self Supervised Continued Pretraining
- Rethinking FUN: Frequency-Domain Utilization Networks
- Spotlighter: Revisiting Prompt Tuning from a Representative Mining View
- NoiseCutMix: A Novel Data Augmentation Approach by Mixing Estimated Noise in Diffusion Models
- Language-Aware Information Maximization for Transductive Few-Shot CLIP
- Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders
- Representation Learning with Adaptive Superpixel Coding
- Occlusion Robustness of CLIP for Military Vehicle Classification
- Measuring Dataset Granularity
- Local Patch AutoAugment with Multi-Agent Collaboration
- UNIFORM: Unifying Knowledge from Large-scale and Diverse Pre-trained Models
- Backpropagation-Free Test-Time Adaptation via Probabilistic Gaussian Alignment
- Efficient Multi-Source Knowledge Transfer by Model Merging
- Flatness-aware Curriculum Learning via Adversarial Difficulty
- Transfer learning optimization based on evolutionary selective fine tuning
- The Loupe: A Plug-and-Play Attention Module for Amplifying Discriminative Features in Vision Transformers
- Enhancing Targeted Adversarial Attacks on Large Vision-Language Models via Intermediate Projector
- Channel DropBlock: An Improved Regularization Method for Fine-Grained Visual Classification
- Ranking and Tuning Pre-trained Models: A New Paradigm for Exploiting Model Hubs
- Preserve and Sculpt: Manifold-Aligned Fine-tuning of Vision-Language Models for Few-Shot Learning
- Cross-Domain Few-Shot Learning via Multi-View Collaborative Optimization with Vision-Language Models
- Federated Cross-Modal Style-Aware Prompt Generation
- AdaRing: Towards Ultra-Light Vision-Language Adaptation via Cross-Layer Tensor Ring Decomposition
- Noise Matters: Optimizing Matching Noise for Diffusion Classifiers
- Dissecting Generalized Category Discovery: Multiplex Consensus under Self-Deconstruction
- SemPT: Semantic Prompt Tuning for Vision-Language Models
- Compact Approximation for Polynomial of Covariance Feature
- The TCGA Meta-Dataset Clinical Benchmark
- Learn to Explore: Meta NAS via Bayesian Optimization Guided Graph Generation
- Continual Learning in Neural Networks
- AME: Aligned Manifold Entropy for Robust Vision-Language Distillation
- Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
- A Guide to Robust Generalization: The Impact of Architecture, Pre-training, and Optimization Strategy
- Adaptive Cache Enhancement for Test-Time Adaptation of Vision-Language Models
- Separation and Collaboration: Two-Level Routing Grouped Mixture-of-Experts for Multi-Domain Continual Learning
- BadPromptFL: A Novel Backdoor Threat to Prompt-based Federated Learning in Multimodal Models
- LoRA-Loop: Closing the Synthetic Replay Cycle for Continual VLM Learning
- Adapting Vision-Language Models Without Labels: A Comprehensive Survey
- FixyNN: Efficient Hardware for Mobile Computer Vision via Transfer Learning
- ETTA: Efficient Test-Time Adaptation for Vision-Language Models through Dynamic Embedding Updates
- Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise
- UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval
- Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning
- FedPromo: Federated Lightweight Proxy Models at the Edge Bring New Domains to Foundation Models
- Raw Data Matters: Enhancing Prompt Tuning by Internal Augmentation on Vision-Language Models
- EvoVLMA: Evolutionary Vision-Language Model Adaptation
- Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language Models
- Decouple before Align: Visual Disentanglement Enhances Prompt Tuning
- FaceGCD: Generalized Face Discovery via Dynamic Prefix Generation
- Color as the Impetus: Transforming Few-Shot Learner
- MetaLab: Few-Shot Game Changer for Image Recognition
- Fine-Grained Categorization via CNN-Based Automatic Extraction and Integration of Object-Level and Part-Level Features
- MSGCoOp: Multiple Semantic-Guided Context Optimization for Few-Shot Learning
- Adversarial Reconstruction Feedback for Robust Fine-grained Generalization
- One Last Attention for Your Vision-Language Model
- Rethinking Few Shot CLIP Benchmarks: A Critical Analysis in the Inductive Setting
- Beyond Class Tokens: LLM-guided Dominant Property Mining for Few-shot Classification
- TAPS : Frustratingly Simple Test Time Active Learning for VLMs
- EA-ViT: Efficient Adaptation for Elastic Vision Transformer
- DIVA: Dataset Derivative of a Learning Task
- Hierarchical Cross-modal Prompt Learning for Vision-Language Models
- Selecting Relevant Features from a Multi-domain Representation for Few-shot Classification
- Open-Set Recognition: a Good Closed-Set Classifier is All You Need?
- Improving Contrastive Learning by Visualizing Feature Transformation
- A Hidden Stumbling Block in Generalized Category Discovery: Distracted Attention
- FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
- Group Based Deep Shared Feature Learning for Fine-grained Image Classification
- CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation
- GLAD: Generalizable Tuning for Vision-Language Models
- Intrinsic Autoencoders for Joint Neural Rendering and Intrinsic Image Decomposition
- Cross-X Learning for Fine-Grained Visual Categorization
- Deep Attentional Structured Representation Learning for Visual Recognition
- ExchNet: A Unified Hashing Network for Large-Scale Fine-Grained Image Retrieval
- Data-driven Meta-set Based Fine-Grained Visual Classification
- Salvage Reusable Samples from Noisy Data for Robust Learning
- Fuzzy Simplicial Networks: A Topology-Inspired Model to Improve Task Generalization in Few-shot Learning
- Empirical Performance Analysis of Conventional Deep Learning Models for\n Recognition of Objects in 2-D Images
- Bi-tuning of Pre-trained Representations
- Beyond Graph Model: Reliable VLM Fine-Tuning via Random Graph Adapter
- FTCFormer: Fuzzy Token Clustering Transformer for Image Classification
- HMID-Net: An Exploration of Masked Image Modeling and Knowledge Distillation in Hyperbolic Space
- Calibrated and Robust Foundation Models for Vision-Language and Medical Image Tasks Under Distribution Shift
- Revisiting Pool-based Prompt Learning for Few-shot Class-incremental Learning
- AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
- Look-into-Object: Self-supervised Structure Modeling for Object Recognition
- One Representation to Rule Them All: Identifying Out-of-Support Examples in Few-shot Learning with Generic Representations
- Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models
- ViLU: Learning Vision-Language Uncertainties for Failure Prediction
- Divergence-Based Similarity Function for Multi-View Contrastive Learning
- Adaptive Part Learning for Fine-Grained Generalized Category Discovery: A Plug-and-Play Enhancement
- Free on the Fly: Enhancing Flexibility in Test-Time Adaptation with Online EM
- Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
- Improving Robustness of Foundation Models in Domain Adaptation with Soup-Adapters
- Integrated Structural Prompt Learning for Vision-Language Models
- Meta-Learning Transformers to Improve In-Context Generalization
- Consistent Supervised-Unsupervised Alignment for Generalized Category Discovery
- FA: Forced Prompt Learning of Vision-Language Models for Out-of-Distribution Detection
- A Constructive Prediction of the Generalization Error Across Scales
- Dynamic Multimodal Prototype Learning in Vision-Language Models
- Helping CLIP See Both the Forest and the Trees: A Decomposition and Description Approach
- Fine-grained Recognition: Accounting for Subtle Differences between Similar Classes
- Component Adaptive Clustering for Generalized Category Discovery
- Compressive Visual Representations
- AutoAugment: Learning Augmentation Policies from Data
- Unleashing the Potential of All Test Samples: Mean-Shift Guided Test-Time Adaptation
- Few-shot Classification as Multi-instance Verification: Effective Backbone-agnostic Transfer across Domains
- A Closer Look at Conditional Prompt Tuning for Vision-Language Models
- The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models
- Intervening in Black Box: Concept Bottleneck Model for Enhancing Human Neural Network Mutual Understanding
- Prompting without Panic: Attribute-aware, Zero-shot, Test-Time Calibration
- DiMPLe -- Disentangled Multi-Modal Prompt Learning: Enhancing Out-Of-Distribution Alignment with Invariant and Spurious Feature Separation
- Boosting Generative Adversarial Transferability with Self-supervised Vision Transformer Features
- Little by Little: Continual Learning via Incremental Mixture of Rank-1 Associative Memory Experts
- SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
- SABRE-FL: Selective and Accurate Backdoor Rejection for Federated Prompt Learning
- Generalizing vision-language models to novel domains: A comprehensive survey
- CoCoA-Mix: Confusion-and-Confidence-Aware Mixture Model for Context Optimization
- Improving Black-Box Generative Attacks via Generator Semantic Consistency
- With Limited Data for Multimodal Alignment, Let the STRUCTURE Guide You
- Representation Consolidation for Training Expert Students
- Boosting Supervision with Self-Supervision for Few-shot Learning
- Learning Adaptive Classifiers Synthesis for Generalized Few-Shot Learning
- Learning Class Unique Features in Fine-Grained Visual Classification
- Compositional Attribute Imbalance in Vision Datasets
- Rapid Neural Architecture Search by Learning to Generate Graphs from Datasets
- PictSure: Pretraining Embeddings Matters for In-Context Learning Image Classifiers
- SOTA: Self-adaptive Optimal Transport for Zero-Shot Classification with Multiple Foundation Models
- NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
- Interpretable Text-Guided Image Clustering via Iterative Search
- Automatic Dataset Augmentation
- GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers
- Symmetrical Flow Matching: Unified Image Generation, Segmentation, and Classification with Score-Based Generative Models
- Searching for TrioNet: Combining Convolution with Local and Global Self-Attention
- Your "Flamingo" is My "Bird": Fine-Grained, or Not
- Come Together, But Not Right Now: A Progressive Strategy to Boost Low-Rank Adaptation
- Tuning the Right Foundation Models is What you Need for Partial Label Learning
- Interpretable Few-Shot Image Classification via Prototypical Concept-Guided Mixture of LoRA Experts
- TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
- Fine-Grained Image Analysis with Deep Learning: A Survey
- Vocabulary-free few-shot learning for Vision-Language Models
- ABKD: Pursuing a Proper Allocation of the Probability Mass in Knowledge Distillation via α-β-Divergence
- Fine-to-coarse Knowledge Transfer For Low-Res Image Classification
- Unsupervised Part Mining for Fine-grained Image Classification
- Contrastive Learning with Adversarial Examples
- Sequential Random Network for Fine-grained Image Classification
- Spatial-Scale Aligned Network for Fine-Grained Recognition
- Enhancing Target-unspecific Tasks through a Features Matrix
- Robustness in Both Domains: CLIP Needs a Robust Text Encoder
- Generalized Category Discovery via Reciprocal Learning and Class-Wise Distribution Regularization
- Towards Recognizing New Semantic Concepts in New Visual Domains
- Beyond Interpretability: When, Why, and How Sparse Autoencoders Enable Label-Free Visual Steering
- Active Learning via Vision-Language Model Adaptation with Open Data
- PCoreSet: Effective Active Learning through Knowledge Distillation from Vision-Language Models
- Understanding Model Reprogramming for CLIP via Decoupling Visual Prompts
- The iNaturalist Species Classification and Detection Dataset
- The iNaturalist Sounds Dataset
- Conformal Prediction for Zero-Shot Models
- un2CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
- Proxy-FDA: Proxy-based Feature Distribution Alignment for Fine-tuning Vision Foundation Models without Forgetting
- Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning
- CrossTransformers: spatially-aware few-shot transfer
- The Devil is in the Tails: Fine-grained Classification in the Wild
- Provably Improving Generalization of Few-Shot Models with Synthetic Data
- LADA: Scalable Label-Specific CLIP Adapter for Continual Learning
- Towards Privacy-Preserving Fine-Grained Visual Classification via Hierarchical Learning from Label Proportions
- To Trust Or Not To Trust Your Vision-Language Model's Prediction
- SineLoRAΔ: Sine-Activated Delta Compression
- Weakly-Supervised Contrastive Learning for Imprecise Class Labels
- Continual Learning on CLIP via Incremental Prompt Tuning with Intrinsic Textual Anchors
- Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models
- AuroRA: Breaking Low-Rank Bottleneck of LoRA with Nonlinear Mapping
- Gradient Centralization: A New Optimization Technique for Deep Neural Networks
- FDBPL: Faster Distillation-Based Prompt Learning for Region-Aware Vision-Language Models Adaptation
- Improved Bilinear Pooling with CNNs
- VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models
- Shape Adaptor: A Learnable Resizing Module
- Boosting Open Set Recognition Performance through Modulated Representation Learning
- MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models
- Prompt Tuning Vision Language Models with Margin Regularizer for Few-Shot Learning under Distribution Shifts
- Generalized Category Discovery via Token Manifold Capacity Learning
- Exploring Vision Transformers for Fine-grained Classification
- Beginning with You: Perceptual-Initialization Improves Vision-Language Representation and Alignment
- Contrastive Consolidation of Top-Down Modulations Achieves Sparsely Supervised Continual Learning
- Channel Interaction Networks for Fine-Grained Image Categorization
- Multi-branch and Multi-scale Attention Learning for Fine-Grained Visual Categorization
- Semi-Supervised Learning with Taxonomic Labels
- SGD-Mix: Enhancing Domain-Specific Image Classification with Label-Preserving Data Augmentation
- LoFT: LoRA-fused Training Dataset Generation with Few-shot Guidance
- Backbone Can Not be Trained at Once: Rolling Back to Pre-trained Network for Person Re-Identification
- Provably Robust Detection of Out-of-distribution Data (almost) for free
- Generalizable Vision-Language Few-Shot Adaptation with Predictive Prompts and Negative Learning
- MMRL++: Parameter-Efficient and Interaction-Aware Representation Learning for Vision-Language Models
- Does Feasibility Matter? Understanding the Impact of Feasibility on Synthetic Training Data
- FAD: Frequency Adaptation and Diversion for Cross-domain Few-shot Learning
- Deep Layer Aggregation
- Simple yet Effective Semi-supervised Knowledge Distillation from Vision-Language Models via Dual-Head Optimization
- Online Refinement of Low-level Feature Based Activation Map for Weakly Supervised Object Localization
- A Unified Pruning Framework for Vision Transformers
- CacheFL: Privacy-Preserving and Efficient Federated Cache Model Fine-Tuning for Vision-Language Models
- AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference
- Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin
- Topology-Aware CLIP Few-Shot Learning
- An empirical study of pretrained representations for few-shot classification
- Grad-CAM guided channel-spatial attention module for fine-grained visual classification
- Guided Zoom: Questioning Network Evidence for Fine-grained Classification
- AdaFilter: Adaptive Filter Fine-tuning for Deep Transfer Learning
- Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs
- Self-Supervised Learning by Estimating Twin Class Distributions
- SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport
- Parameter-Efficient Fine-Tuning with Circulant and Diagonal Vectors
- Supervised Momentum Contrastive Learning for Few-Shot Classification
- Visual Words Meet BM25: Sparse Auto-Encoder Visual Word Scoring for Image Retrieval
- Frustratingly Easy Transferability Estimation
- Diff-Prompt: Diffusion-Driven Prompt Generator with Mask Supervision
- FedMVP: Federated Multimodal Visual Prompt Tuning for Vision-Language Models
- AREA: Attribute Extraction and Aggregation for CLIP-Based Class-Incremental Learning
- The Devil Is in Gradient Entanglement: Energy-Aware Gradient Coordinator for Robust Generalized Category Discovery
- Benchmarking Transferability: A Framework for Fair and Robust Evaluation
- A Comparison of Dense Region Detectors for Image Search and Fine-Grained Classification
- Facing the Hard Problems in FGVC
- TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering
- AdaBoosting Text Prompts for Vision-Language Models
- Taxonomy-Aware Evaluation of Vision-Language Models
- DP2FL: Dual Prompt Personalized Federated Learning in Foundation Models
- Time Frequency Analysis of EMG Signal for Gesture Recognition using Fine grained Features
- CLIP-Powered Domain Generalization and Domain Adaptation: A Comprehensive Survey
- Bayesian Principles Improve Prompt Learning In Vision-Language Models
- Cross-Hierarchical Bidirectional Consistency Learning for Fine-Grained Visual Classification
- Neural Architecture Transfer
- Efficient Multi-Domain Network Learning by Covariance Normalization
- Post-pre-training for Modality Alignment in Vision-Language Foundation Models
- Sparsity Outperforms Low-Rank Projections in Few-Shot Adaptation
- Logits DeConfusion with CLIP for Few-Shot Learning
- Beyond Words: Augmenting Discriminative Richness via Diffusions in Unsupervised Prompt Learning
- Respect Your Zero-Shot Uncertainty: Conservative Calibration for Test-Time-Adapted Vision-Language Models
- What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective
- R-TPT: Improving Adversarial Robustness of Vision-Language Models through Test-Time Prompt Tuning
- MIEB: Massive Image Embedding Benchmark
- GFT: Gradient Focal Transformer
- FATE: A Prompt-Tuning-Based Semi-Supervised Learning Framework for Extremely Limited Labeled Data
- Proxy-Anchor and EVT-Driven Continual Learning Method for Generalized Category Discovery
- FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations
- ZIP: An Efficient Zeroth-order Prompt Tuning for Black-box Vision-Language Models
- On the Suitability of Reinforcement Fine-Tuning to Visual Tasks
- Memory-Modular Classification: Learning to Generalize with Memory Replacement
- Hyperbolic Category Discovery
- Modular Adaptation for Cross-Domain Few-Shot Learning
- DebGCD: Debiased Learning with Distribution Guidance for Generalized Category Discovery
- Optimizing Specific and Shared Parameters for Efficient Parameter Tuning
Related