Squeeze-and-Excitation Networks
2017/09/05 by Jie Hu, Li Shen, Hu, Jie +7 · 2 voices · 626 citations
Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Neural Networks and Applications #cs.CV
paper · pdf · doi:10.48550/arxiv.1709.01507
journal version of the CVPR 2018 paper, accepted by TPAMI
openalex publication_date 2017/09/05 · arxiv published 2017/09/05 · arxiv created 2019/05/16 · arxiv updated 2019/05/17 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
The central building block of convolutional neural networks (CNNs) is the convolution operator, which enables networks to construct informative features by fusing both spatial and channel-wise information within local receptive fields at each layer. A broad range of prior research has investigated the spatial component of this relationship, seeking to strengthen the representational power of a CNN by enhancing the quality of spatial encodings throughout its feature hierarchy. In this work, we focus instead on the channel relationship and propose a novel architectural unit, which we term the "Squeeze-and-Excitation" (SE) block, that adaptively recalibrates channel-wise feature responses by explicitly modelling interdependencies between channels. We show that these blocks can be stacked together to form SENet architectures that generalise extremely effectively across different datasets. We further demonstrate that SE blocks bring significant improvements in performance for existing state-of-the-art CNNs at slight additional computational cost. Squeeze-and-Excitation Networks formed the foundation of our ILSVRC 2017 classification submission which won first place and reduced the top-5 error to 2.251%, surpassing the winning entry of 2016 by a relative improvement of ~25%. Models and code are available at https://github.com/hujie-frank/SENet.
Cited by
- SC-Net: Robust Correspondence Learning via Spatial and Cross-Channel Context
- Argus: Token Aware Distributed LLM Inference Optimization
- Chessformer: A Unified Architecture for Chess Modeling
- A Neural Network-Based Real-time Casing Collar Recognition System for Downhole Instruments
- Mosaic: A Fleet of User Embedding Specialists for Recommendation at Meta
- Integrating Wide and Deep Neural Networks with Squeeze-and-Excitation Blocks for Multi-Target Property Prediction in Additively Manufactured Fiber Reinforced Composites
- PaperNet: Efficient Temporal Convolutions and Channel Residual Attention for EEG Epilepsy Detection
- A Robust framework for sound event localization and detection on real recordings
- Rethinking Leveraging Pre-Trained Multi-Layer Representations for Speaker Verification
- Mutual Modality Trust with Lightweight Reconstruction Regularization for Fine-grained Tire Pattern Recognition
- DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering
- SE-MLP Model for Predicting Prior Acceleration Features in Penetration Signals
- UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
- Balanced Soft mixture-of-expert model for Glaucoma Detection
- Leak-Free Cross-Validated Stacking with Per-Architecture Calibration for Sand-Boil Segmentation in Earthen Levees
- Post-Operative Glioma Segmentation via Loss Stabilization, Normalization and Subspace Attention
- Real-Time Semantic Segmentation with Optimized RetinaNet Architectures for Embedded Automotive Systems
- SwitchBraidNet: Quantisation-Aware Lightweight Architecture for Hybrid Brain-Computer Interface
- Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinex
- Latent Space Probing for Adult Content Detection in Video Generative Models
- A Lightweight Multi-Scale Attention Framework for Real-Time Spinal Endoscopic Instance Segmentation
- Intelligent recognition of GPR road hidden defect images based on feature fusion and attention mechanism
- Language-Guided Grasp Detection with Coarse-to-Fine Learning for Robotic Manipulation
- WSD-MIL: Window Scale Decay Multiple Instance Learning for Whole Slide Image Classification
- ReasonCD: A Multimodal Reasoning Large Model for Implicit Change-of-Interest Semantic Mining
- BEVCooper: Accurate and Communication-Efficient Bird's-Eye-View Perception in Vehicular Networks
- MCVI-SANet: A lightweight semi-supervised model for LAI and SPAD estimation of winter wheat under vegetation index saturation
- A neural network-based observation operator for weather radar data assimilation
- SG-RIFE: Semantic-Guided Real-Time Intermediate Flow Estimation with Diffusion-Competitive Perceptual Quality
- CPMamba: Selective State Space Models for MIMO Channel Prediction in High-Mobility Environments
- LAPX: Lightweight Hourglass Network with Global Context
- Preserving Marker Specificity with Lightweight Channel-Independent Representation Learning
- SLCFormer: Spectral-Local Context Transformer with Physics-Grounded Flare Synthesis for Nighttime Flare Removal
- Exploring Deep-to-Shallow Transformable Neural Networks for Intelligent Embedded Systems
- Tracking spatial temporal details in ultrasound long video via wavelet analysis and memory bank
- ArcGen: Generalizing Neural Backdoor Detection Across Diverse Architectures
- Cross-modal ultra-scale learning with tri-modalities of renal biopsy images for glomerular multi-disease auxiliary diagnosis
- AMD-HookNet++: Evolution of AMD-HookNet with Hybrid CNN-Transformer Feature Enhancement for Glacier Calving Front Segmentation
- Hybrid Iterative Solvers with Geometry-Aware Neural Preconditioners for Parametric PDEs
- VajraV1 -- The most accurate Real Time Object Detector of the YOLO family
- WAY: Estimation of Vessel Destination in Worldwide AIS Trajectory
- Plug-and-Play Parameter-Efficient Tuning of Embeddings for Federated Recommendation
- Spectral entropy prior-guided deep feature fusion architecture for magnetic core loss
- Assisted Refinement Network Based on Channel Information Interaction for Camouflaged and Salient Object Detection
- Closing the Navigation Compliance Gap in End-to-end Autonomous Driving
- CS3D: An Efficient Facial Expression Recognition via Event Vision
- Gradient-Guided Learning Network for Infrared Small Target Detection
- KD-OCT: Efficient Knowledge Distillation for Clinical-Grade Retinal OCT Classification
- Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment
- Enhanced Chest Disease Classification Using an Improved CheXNet Framework with EfficientNetV2-M and Optimization-Driven Learning
- Integrating Multi-scale and Multi-filtration Topological Features for Medical Image Classification
- R2MF-Net: A Recurrent Residual Multi-Path Fusion Network for Robust Multi-directional Spine X-ray Segmentation
- DAUNet: A Lightweight UNet Variant with Deformable Convolutions and Parameter-Free Attention for Medical Image Segmentation
- Adaptive Normalization Mamba with Multi Scale Trend Decomposition and Patch MoE Encoding
- Latent Nonlinear Denoising Score Matching for Enhanced Learning of Structured Distributions
- Proof of Concept for Mammography Classification with Enhanced Compactness and Separability Modules
- When Gender is Hard to See: Multi-Attribute Support for Long-Range Recognition
- LDLT L-Lipschitz Network: Generalized Deep End-To-End Lipschitz Network Construction
- Smart Timing for Mining: A Deep Learning Framework for Bitcoin Hardware ROI Prediction
- CNN on `Top': In Search of Scalable & Lightweight Image-based Jet Taggers
- Hardware-aware Neural Architecture Search of Early Exiting Networks on Edge Accelerators
- Research on Brain Tumor Classification Method Based on Improved ResNet34 Network
- A Retrieval-Augmented Generation Approach to Extracting Algorithmic Logic from Neural Networks
- EfficientECG: Cross-Attention with Feature Fusion for Efficient Electrocardiogram Classification
- MKSNet: Advanced Small Object Detection in Remote Sensing Imagery with Multi-Kernel and Dual Attention Mechanisms
- A Hybrid Deep Learning Framework with Explainable AI for Lung Cancer Classification with DenseNet169 and SVM
- DisentangleFormer: Spatial-Channel Decoupling for Multi-Channel Vision
- Temporal Dynamics Enhancer for Directly Trained Spiking Object Detectors
- Breast Cell Segmentation Under Extreme Data Constraints: Quantum Enhancement Meets Adaptive Loss Stabilization
- SAGE: Style-Adaptive Generalization for Privacy-Constrained Semantic Segmentation Across Domains
- Learning Visual Affordance from Audio
- Cuffless Blood Pressure Estimation from Six Wearable Sensor Modalities in Multi-Motion-State Scenarios
- Multifractal Recalibration of Neural Networks for Medical Imaging Segmentation
- CausalAffect: Causal Discovery for Facial Affective Understanding
- PhysGen: Physically Grounded 3D Shape Generation for Industrial Design
- Ada-MoGE: Adaptive Mixture of Gaussian Expert Model for Time Series Forecasting
- SDE-Attention: Latent Attention in SDE-RNNs for Irregularly Sampled Time Series with Missing Data
- GeoWorld: Providing Full-frame Geometry Features to Facilitate 3D Scene Generation
- Geodiffussr: Generative Terrain Texturing with Elevation Fidelity
- Hard Spatial Gating for Precision-Driven Brain Metastasis Segmentation: Addressing the Over-Segmentation Paradox in Deep Attention Networks
- INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts
- SemOD: Semantic Enabled Object Detection Network under Various Weather Conditions
- Transformer Driven Visual Servoing for Fabric Texture Matching Using Dual-Arm Manipulator
- Intriguing Properties of Dynamic Sampling Networks
- Cross-Modal Semantic Communication for Heterogeneous Collaborative Perception
- LLM4AMC: Adapting Large Language Models for Adaptive Modulation and Coding
- Dendritic Convolution for Noise Image Recognition
- DE-KAN: A Kolmogorov Arnold Network with Dual Encoder for accurate 2D Teeth Segmentation
- TransLK-Net: Entangling Transformer and Large Kernel for Progressive and Collaborative Feature Encoding and Decoding in Medical Image Segmentation
- Feature Partitioning and Semantic Equalization for Intrinsic Robustness in Semantic Communication under Packet Loss
- Robust Detection of Retinal Neovascularization in Widefield Optical Coherence Tomography
- MRI Super-Resolution with Deep Learning: A Comprehensive Survey
- TFCDiff: Robust ECG Denoising via Time-Frequency Complementary Diffusion
- A Plug-and-Play Spatially-Constrained Representation Enhancement Framework for Local-Life Recommendation
- A Spatial Semantics and Continuity Perception Attention for Remote Sensing Water Body Change Detection
- AIF: Asynchronous Inference Framework for Cost-Effective Pre-Ranking
- Driving in Spikes: An Entropy-Guided Object Detector for Spike Cameras
- Unifying Convolution and Attention via Convolutional Nearest Neighbors
- CascadedViT: Cascaded Chunk-FeedForward and Cascaded Group Attention Vision Transformer
- Contactless Monitoring of Muscle Vibrations During Exercise with a Chaos-Inspired Radar
- Naga: Vedic Encoding for Deep State Space Models
- Inverse Electromagnetic Scattering for Doubly-Connected Cylinders using Convolutional Neural Networks
- FGNet: Leveraging Feature-Guided Attention to Refine SAM2 for 3D EM Neuron Segmentation
- DiffPixelFormer: Differential Pixel-Aware Transformer for RGB-D Indoor Scene Segmentation
- Attention-Enhanced Convolutional Autoencoder and Structured Delay Embeddings for Weather Prediction
- MFI-ResNet: Efficient ResNet Architecture Optimization via MeanFlow Compression and Selective Incubation
- MSLoRA: Multi-Scale Low-Rank Adaptation via Attention Reweighting
- CLAReSNet: When Convolution Meets Latent Attention for Hyperspectral Image Classification
- Evaluation of Attention Mechanisms in U-Net Architectures for Semantic Segmentation of Brazilian Rock Art Petroglyphs
- RobIA: Robust Instance-aware Continual Test-time Adaptation for Deep Stereo
- MPCM-Net: Multi-scale network integrates partial attention convolution with Mamba for ground-based cloud image segmentation
- A Neural-Operator Preconditioned Newton Method for Accelerated Nonlinear Solvers
- REASON: Probability map-guided dual-branch fusion framework for gastric content assessment
- Evaluating Gemini LLM in Food Image-Based Recipe and Nutrition Description with EfficientNet-B4 Visual Backbone
- MirrorMamba: Towards Scalable and Robust Mirror Detection in Videos
- IDMap: A Pseudo-Speaker Generator Framework Based on Speaker Identity Index to Vector Mapping
- A Second-Order Attention Mechanism For Prostate Cancer Segmentation and Detection in Bi-Parametric MRI
- PECL: A Heterogeneous Parallel Multi-Domain Network for Radar-Based Human Activity Recognition
- UHDRes: Ultra-High-Definition Image Restoration via Dual-Domain Decoupled Spectral Modulation
- DARN: Dynamic Adaptive Regularization Networks for Efficient and Robust Foundation Model Adaptation
- Beyond Softmax: Dual-Branch Sigmoid Architecture for Accurate Class Activation Maps
- Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning
- NEF-NET+: Adapting Electrocardio panorama in the wild
- FastBoost: Progressive Attention with Dynamic Scaling for Efficient Deep Learning
- Lightweight ResNet-Based Deep Learning for Photoplethysmography Signal Quality Assessment
- Towards Reliable Pediatric Brain Tumor Segmentation: Task-Specific nnU-Net Enhancements
- MambaNetLK: Enhancing Colonoscopy Point Cloud Registration with Mamba
- MeisenMeister: A Simple Two Stage Pipeline for Breast Cancer Classification on MRI
- ODP-Bench: Benchmarking Out-of-Distribution Performance Prediction
- AFM-Net: Advanced Fusing Hierarchical CNN Visual Priors with Global Sequence Modeling for Remote Sensing Image Scene Classification
- Improving Cross-view Object Geo-localization: A Dual Attention Approach with Cross-view Interaction and Multi-Scale Spatial Features
- A Hybrid Framework Bridging CNN and ViT based on Theory of Evidence for Diabetic Retinopathy Grading
- Comparative Study of UNet-based Architectures for Liver Tumor Segmentation in Multi-Phase Contrast-Enhanced Computed Tomography
- Lightweight Image Classification of Raptor Species for Edge Devices: Rare-Species Dataset Expansion via Video Frame Extraction, Knowledge Distillation, and TensorRT Deployment
- HeteroPROPMT: A Real-time and Privacy-Preserving Heterogeneous Collaborative Perception Framework
- Gated Adaptation for Continual Learning in Human Activity Recognition
- Watch Where You Move: Region-aware Dynamic Aggregation and Excitation for Gait Recognition
- Neighborhood Feature Pooling for Remote Sensing Image Classification
- Super-recognizers sample visual information of superior computational value for facial recognition
- SCALAR: Self-Calibrating Adaptive Latent Attention Representation Learning
- HYDRA: HYbrid knowledge Distillation and spectral Reconstruction Algorithm for high channel hyperspectral camera applications
- Adaptive Dual Prompting: Hierarchical Debiasing for Fairness-aware Graph Neural Networks
- DeepfakeBench-MM: A Comprehensive Benchmark for Multimodal Deepfake Detection
- Dynamically Detect and Fix Hardness for Efficient Approximate Nearest Neighbor Search
- Synthetic-to-Real Transfer Learning for Chromatin-Sensitive PWS Microscopy
- Attention Residual Fusion Network with Contrast for Source-free Domain Adaptation
- MAGIC-Flow: Multiscale Adaptive Conditional Flows for Generation and Interpretable Classification
- AURASeg: Attention Guided Upsampling with Residual Boundary-Assistive Refinement for Drivable-Area Segmentation
- Controllable-LPMoE: Adapting to Challenging Object Segmentation via Dynamic Local Priors from Mixture-of-Experts
- Predicting the 3D microstructure of SOFC anodes from 2D SEM images using stochastic microstructure modeling and CNNs
- DB-FGA-Net: Dual Backbone Frequency Gated Attention Network for Multi-Class Brain Tumor Classification with Grad-CAM Interpretability
- Balanced Multi-Task Attention for Satellite Image Classification: A Systematic Approach to Achieving 97.23% Accuracy on EuroSAT Without Pre-Training
- Attentive Convolution: Unifying the Expressivity of Self-Attention with Convolutional Efficiency
- Real-Time Currency Detection and Voice Feedback for Visually Impaired Individuals
- Towards Single-Source Domain Generalized Object Detection via Causal Visual Prompts
- Exploring "Many in Few" and "Few in Many" Properties in Long-Tailed, Highly-Imbalanced IC Defect Classification
- Enhancing Few-Shot Classification of Benchmark and Disaster Imagery with ABHFA-Net
- OmniNWM: Omniscient Driving Navigation World Models
- Transformer Redesign for Late Fusion of Audio-Text Features on Ultra-Low-Power Edge Hardware
- M2H: Multi-Task Learning with Efficient Window-Based Cross-Task Attention for Monocular Spatial Perception
- Towards a Generalizable Fusion Architecture for Multimodal Object Detection
- Benchmarking Out-of-Distribution Detection for Plankton Recognition: A Systematic Evaluation of Advanced Methods in Marine Ecological Monitoring
- ArmFormer: Lightweight Transformer Architecture for Real-Time Multi-Class Weapon Segmentation and Classification
- WaMaIR: Image Restoration via Multiscale Wavelet Convolutions and Mamba-based Channel Modeling with Texture Enhancement
- Attention-guided few-shot learning for metal surface defect classification
- Real-Time Surgical Instrument Defect Detection via Non-Destructive Testing
- Cross-Layer Feature Self-Attention Module for Multi-Scale Object Detection
- Fusion Meets Diverse Conditions: A High-diversity Benchmark and Baseline for UAV-based Multimodal Object Detection with Condition Cues
- Comparative Analysis of Data Augmentation for Clinical ECG Classification with STAR
- SPORTS: Simultaneous Panoptic Odometry, Rendering, Tracking and Segmentation for Urban Scenes Understanding
- Low-Field Magnetic Resonance Image Quality Enhancement using a Conditional Flow Matching Model
- CurriFlow: Curriculum-Guided Depth Fusion with Optical Flow-Based Temporal Alignment for 3D Semantic Scene Completion
- EEMS: Edge-Prompt Enhanced Medical Image Segmentation Based on Learnable Gating Mechanism
- Generalisation of automatic tumour segmentation in histopathological whole-slide images across multiple cancer types
- A Novel Multi-branch ConvNeXt Architecture for Identifying Subtle Pathological Features in CT Scans
- MAT-Agent: Adaptive Multi-Agent Training Optimization
- Demystifying Deep Learning-based Brain Tumor Segmentation with 3D UNets and Explainable AI (XAI): A Comparative Analysis
- Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling
- HARP-NeXt: High-Speed and Accurate Range-Point Fusion Network for 3D LiDAR Semantic Segmentation
- DPA-Net: A Dual-Path Attention Neural Network for Inferring Glycemic Control Metrics from Self-Monitored Blood Glucose Data
- Lung Infection Severity Prediction Using Transformers with Conditional TransMix Augmentation and Cross-Attention
- Universal Neural Architecture Space: Covering ConvNets, Transformers and Everything in Between
- SSL-SE-EEG: A Framework for Robust Learning from Unlabeled EEG Data with Self-Supervised Learning and Squeeze-Excitation Networks
- Rivaling Transformers: Multi-Scale Structured State-Space Mixtures for Agentic 6G O-RAN
- SFANet: Spatial-Frequency Attention Network for Deepfake Detection
- SPEGNet: Synergistic Perception-Guided Network for Camouflaged Object Detection
- Weakly Supervised Cloud Detection Combining Spectral Features and Multi-Scale Deep Network
- Multi-level Dynamic Style Transfer for NeRFs
- U-DFA: A Unified DINOv2-Unet with Dual Fusion Attention for Multi-Dataset Medical Segmentation
- Forestpest-YOLO: A High-Performance Detection Framework for Small Forestry Pests
- Adaptive Event Stream Slicing for Open-Vocabulary Event-Based Object Detection via Vision-Language Knowledge Distillation
- IR-UWB Radar-Based Contactless Silent Speech Recognition with Attention-Enhanced Temporal Convolutional Networks
- MetaChest: Generalized few-shot learning of pathologies from chest X-rays
- TDHook: A Lightweight Framework for Interpretability
- Robust Multimodal Semantic Segmentation with Balanced Modality Contributions
- Skeleton-based Robust Registration Framework for Corrupted 3D Point Clouds
- PVTAdpNet: Polyp Segmentation using Pyramid vision transformer with a novel Adapter block
- Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
- FracDetNet: Advanced Fracture Detection via Dual-Focus Attention and Multi-scale Calibration in Medical X-ray Imaging
- Enhanced Fracture Diagnosis Based on Critical Regional and Scale Aware in YOLO
- Graph Your Own Prompt
- Explicit modelling of subject dependency in BCI decoding
- UltraUNet: Real-Time Ultrasound Tongue Segmentation for Diverse Linguistic and Imaging Conditions
- Hemorica: A Comprehensive CT Scan Dataset for Automated Brain Hemorrhage Classification, Segmentation, and Detection
- TY-RIST: Tactical YOLO Tricks for Real-time Infrared Small Target Detection
- U-MAN: U-Net with Multi-scale Adaptive KAN Network for Medical Image Segmentation
- Exploring the Early Universe with Deep Learning
- Enhancing Vehicle Detection under Adverse Weather Conditions with Contrastive Learning
- HiPerformer: A High-Performance Global-Local Segmentation Model with Modular Hierarchical Fusion Strategy
- Enabling Multi-Species Bird Classification on Low-Power Bioacoustic Loggers
- Deep Learning for Clouds and Cloud Shadow Segmentation in Methane Satellite and Airborne Imaging Spectroscopy
- Every Character Counts: From Vulnerability to Defense in Phishing Detection
- CoRE-UIR: Prior-guided common and residual experts for efficient all-in-one remote sensing image restoration
- SAFViT: Spatial Attention Fusion Gating for Vision Transformer-Based Nucleus Segmentation and Classification
- Unseen Speaker and Language Adaptation for Lightweight Text-To-Speech with Adapters
- Learning a Sampling-Free Variational DNN Plugin from Tiny Training Sets to Refine OOD Segmentation With Uncertainty Estimation
- Prompt-based Multimodal Semantic Communication for Multi-spectral Image Segmentation
- Apex-Centered Spatio-Temporal Rank Pooling and Gradient Attention for Micro-Expression Recognition
- AI-CNet3D: An Anatomically-Informed Cross-Attention Network with Multi-Task Consistency Fine-tuning for 3D Glaucoma Classification
- Training-Free Multi-Style Fusion Through Reference-Based Adaptive Modulation
- MK-UNet: Multi-kernel Lightweight CNN for Medical Image Segmentation
- MoiréNet: A Compact Dual-Domain Network for Image Demoiréing
- Replay and Synthetic Speech Detection with Res2net Architecture
- MoCrop: Training Free Motion Guided Cropping for Efficient Video Action Recognition
- Degradation-Aware All-in-One Image Restoration via Latent Prior Encoding
- Revisiting Vision Language Foundations for No-Reference Image Quality Assessment
- BlurBall: Joint Ball and Motion Blur Estimation for Table Tennis Ball Tracking
- OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranking System
- MRN: Harnessing 2D Vision Foundation Models for Diagnosing Parkinson's Disease with Limited 3D MR Data
- SFN-YOLO: Towards Free-Range Poultry Detection via Scale-aware Fusion Networks
- Towards Interpretable and Efficient Attention: Compressing All by Contracting a Few
- Enhanced Detection of Tiny Objects in Aerial Images
- Deep Learning Inductive Biases for fMRI Time Series Classification during Resting-state and Movie-watching
- PMRT: A Training Recipe for Fast, 3D High-Resolution Aerodynamic Prediction
- DPSformer: A long-tail-aware model for improving heavy rainfall prediction
- Thermal Imaging-based Real-time Fall Detection using Motion Flow and Attention-enhanced Convolutional Recurrent Architecture
- Saccadic Vision for Fine-Grained Visual Classification
- LLM4MG: Adapting Large Language Model for Multipath Generation via Synesthesia of Machines
- EatGAN: An Edge-Attention Guided Generative Adversarial Network for Single Image Super-Resolution
- SpecGen: Neural Spectral BRDF Generation via Spectral-Spatial Tri-plane Aggregation
- Enhancing Speaker-Independent Dysarthric Speech Severity Classification with DSSCNet and Cross-Corpus Adaptation
- Multi-scale Scanning Network for Machine Anomalous Sound Detection
- Using KL-Divergence to Focus Frequency Information in Low-Light Image Enhancement
- T-SiamTPN: Temporal Siamese Transformer Pyramid Networks for Robust and Efficient UAV Tracking
- Geolocation-Aware Robust Spoken Language Identification
- Radio Propagation Modelling: To Differentiate or To Deep Learn, That Is The Question
- Joint-octamamba:an octa joint segmentation network based on feature enhanced mamba
- MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization
- Neural networks in the search for fast radio bursts with RATAN-600
- GraphDerm: Fusing Imaging, Physical Scale, and Metadata in a Population-Graph Classifier for Dermoscopic Lesions
- Human Activity Recognition Based on Electrocardiogram Data Only
- Group Evidence Matters: Tiling-based Semantic Gating for Dense Object Detection
- Effective Modeling of Critical Contextual Information for TDNN-based Speaker Verification
- Hierarchical MLANet: Multi-level Attention for 3D Face Reconstruction From Single Images
- TUNI: Unifying Pre-training and Fine-tuning with Modality-Aware Mutual Learning and Rectification for RGB-T Semantic Segmentation
- MSDANet: A Multiscale Dual-Channel Spatial Attention Network with Depthwise Separable Convolution for Hyperspectral Image Classification
- Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics
- DiTTO-LLM: Framework for Discovering Topic-based Technology Opportunities via Large Language Model
- Segment Transformer: AI-Generated Music Detection via Music Structural Analysis
- ADHDeepNet From Raw EEG to Diagnosis: Improving ADHD Diagnosis through Temporal-Spatial Processing, Adaptive Attention Mechanisms, and Explainability in Raw EEG Signals
- USEANet: Ultrasound-Specific Edge-Aware Multi-Branch Network for Lightweight Medical Image Segmentation
- SCA-LLM: Spectral-Attentive LLM-Based Wireless World Modeling for Agentic Communications
- Aerial-ground Cross-modal Localization: Dataset, Ground-truth, and Benchmark
- FAIRWELL: Fair Multimodal Self-Supervised Learning for Wellbeing Prediction
- FSG-Net: Frequency-Spatial Synergistic Gated Network for High-Resolution Remote Sensing Change Detection
- Two-Stage Framework for Efficient UAV-Based Wildfire Video Analysis with Adaptive Compression and Fire Source Detection
- Signal-Based Malware Classification Using 1D CNNs
- An Explainable Deep Neural Network with Frequency-Aware Channel and Spatial Refinement for Flood Prediction in Sustainable Cities
- TripOptimizer: Generative 3D Shape Optimization and Drag Prediction using Triplane VAE Networks
- Data Uncertainty Learning in Face Recognition
- Multi-modal Uncertainty Robust Tree Cover Segmentation For High-Resolution Remote Sensing Images
- STA-Net: A Decoupled Shape and Texture Attention Network for Lightweight Plant Disease Classification
- Teacher-Student Model for Detecting and Classifying Mitosis in the MIDOG 2025 Challenge
- EdgeAttNet: Towards Barb-Aware Filament Segmentation
- S2M2ECG: Spatio-temporal bi-directional State Space Model Enabled Multi-branch Mamba for ECG
- Artificial Intelligence-derived Cardiotocography Age as a Digital Biomarker for Predicting Future Adverse Pregnancy Outcomes
- StableSleep: Source-Free Test-Time Adaptation for Sleep Staging with Lightweight Safety Rails
- P2 Net: Augmented Parallel-Pyramid Net for Attention Guided Pose Estimation
- Systematic Integration of Attention Modules into CNNs for Accurate and Generalizable Medical Image Diagnosis
- Synesthesia of Machines (SoM)-Based Task-Driven MIMO System for Image Transmission
- AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
- Multi-AAV-enabled Distributed Beamforming in Low-Altitude Wireless Networking for AoI-Sensitive IoT Data Forwarding
- Self-supervised large-scale kidney abnormality detection in drug safety assessment studies
- E-ConvNeXt: A Lightweight and Efficient ConvNeXt Variant with Cross-Stage Partial Connections
- Disruptive Attacks on Face Swapping via Low-Frequency Perceptual Perturbations
- Digital Scale: Open-Source On-Device BMI Estimation from Smartphone Camera Images Trained on a Large-Scale Real-World Dataset
- CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
- ProMSC-MIS: Prompt-based Multimodal Semantic Communication for Multi-Spectral Image Segmentation
- Image Quality Assessment for Machines: Paradigm, Large-scale Database, and Models
- Fine-Tuning Vision-Language Models for Neutrino Event Analysis in High-Energy Physics Experiments
- EffNetViTLoRA: An Efficient Hybrid Deep Learning Approach for Alzheimer's Disease Diagnosis
- MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
- Identification of Strongly Lensed Gravitational Wave Events Using Squeeze-and-Excitation Multilayer Perceptron Data-efficient Image Transformer
- Exploring Scaling Laws of CTR Model for Online Performance Improvement
- D3FNet: A Differential Attention Fusion Network for Fine-Grained Road Structure Extraction in Remote Perception Systems
- CUPE: Contextless Universal Phoneme Encoder for Language-Agnostic Speech Processing
- On the Effectiveness of Graph Reordering for Accelerating Approximate Nearest Neighbor Search on GPU
- The Loupe: A Plug-and-Play Attention Module for Amplifying Discriminative Features in Vision Transformers
- Understanding Data Influence with Differential Approximation
- MoCHA-former: Moiré-Conditioned Hybrid Adaptive Transformer for Video Demoiréing
- Self-Aware Adaptive Alignment: Enabling Accurate Perception for Intelligent Transportation Systems
- Electromagnetic Signal Modulation Recognition based on Subgraph Embedding Learning
- Genuine multipartite entanglement verification with convolutional neural networks
- A Self-Ensemble Inspired Approach for Effective Training of Binary-Weight Spiking Neural Networks
- Jamming Identification with Differential Transformer for Low-Altitude Wireless Networks
- Federated Cross-Modal Style-Aware Prompt Generation
- Large Kernel Modulation Network for Efficient Image Super-Resolution
- Scale-Disentangled spatiotemporal Modeling for Long-term Traffic Emission Forecasting
- Physiology-informed layered sensing for intelligent human-exoskeleton interaction
- Unified Knowledge Distillation Framework: Fine-Grained Alignment and Geometric Relationship Preservation for Deep Face Recognition
- Borrowing From the Future: Enhancing Early Risk Assessment through Contrastive Learning
- Combinative Matching for Geometric Shape Assembly
- Multi-Contrast Fusion Module: An attention mechanism integrating multi-contrast features for fetal torso plane classification
- Detection of Odor Presence via Deep Neural Networks
- Cross-BCI, A Cross-BCI-Paradigm Classifica-tion Model Towards Universal BCI Applications
- UniSTFormer: Unified Spatio-Temporal Lightweight Transformer for Efficient Skeleton-Based Action Recognition
- ShuffleNet V2: Practical Guidelines for Efficient CNN Architecture Design
- Stationarity Exploration for Multivariate Time Series Forecasting
- VeriPHY: Physical Layer Signal Authentication for Wireless Communication in 5G Environments
- ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
- FaceAnonyMixer: Cancelable Faces via Identity Consistent Latent Space Mixing
- CoCAViT: Compact Vision Transformer with Robust Global Coordination
- RPCANet++: Deep Interpretable Robust PCA for Sparse Object Segmentation
- ERDES: A Benchmark Video Dataset for Retinal Detachment and Macular Status Classification in Ocular Ultrasound
- AttZoom: Attention Zoom for Better Visual Features
- DyCAF-Net: Dynamic Class-Aware Fusion Network
- GRASPing Anatomy to Improve Pathology Segmentation
- A matrix preconditioning framework for physics-informed neural networks based on adjoint method
- AMD-Mamba: A Phenotype-Aware Multi-Modal Framework for Robust AMD Prognosis
- SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
- Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling
- InfoSyncNet: Information Synchronization Temporal Convolutional Network for Visual Speech Recognition
- DMSC: Dynamic Multi-Scale Coordination Framework for Time Series Forecasting
- MHARFedLLM: Multimodal Human Activity Recognition Using Federated Large Language Model
- RMT-PPAD: Real-time Multi-task Learning for Panoptic Perception in Autonomous Driving
- SWAN: Synergistic Wavelet-Attention Network for Infrared Small Target Detection
- Multi-Granularity Adaptive Time-Frequency Attention Framework for Audio Deepfake Detection under Real-World Communication Degradations
- PIF-Net: Ill-Posed Prior Guided Multispectral and Hyperspectral Image Fusion via Invertible Mamba and Fusion-Aware LoRA
- Exploring Fourier Prior and Event Collaboration for Low-Light Image Enhancement
- PriorFusion: Unified Integration of Priors for Robust Road Perception in Autonomous Driving
- CUHK-EE Systems for the vTAD Challenge at NCMMSC 2025
- AugFPN: Improving Multi-scale Feature Learning for Object Detection
- MSQ: Memory-Efficient Bit Sparsification Quantization
- Compress-Align-Detect: onboard change detection from unregistered images
- Staining and locking computer vision models without retraining
- SwinECAT: A Transformer-based fundus disease classification model with Shifted Window Attention and Efficient Channel Attention
- Foundation Models and Transformers for Anomaly Detection: A Survey
- AU-LLM: Micro-Expression Action Unit Detection via Enhanced LLM-Based Feature Fusion
- Categorical Distributions are Effective Neural Network Outputs for Event Prediction
- Dense-depth map guided deep Lidar-Visual Odometry with Sparse Point Clouds and Images
- Collaborative Perceiver: Elevating Vision-based 3D Object Detection via Local Density-Aware Spatial Occupancy
- SCANet: Split Coordinate Attention Network for Building Footprint Extraction
- Conditional Diffusion Models for Global Precipitation Map Inpainting
- Few-Shot Object Detection via Spatial-Channel State Space Model
- Dual-Stream Global-Local Feature Collaborative Representation Network for Scene Classification of Mining Area
- CHADET: Cross-Hierarchical-Attention for Depth-Completion Using Unsupervised Lightweight Transformer
- Radar and Acoustic Sensor Fusion using a Transformer Encoder for Robust Drone Detection and Classification
- WACA-UNet: Weakness-Aware Channel Attention for Static IR Drop Prediction in Integrated Circuit Design
- Probing Multimodal Fusion in the Brain: The Dominance of Audiovisual Streams in Naturalistic Encoding
- DCFFSNet: Deep Connectivity Feature Fusion Separation Network for Medical Image Segmentation
- AFRDA: Attentive Feature Refinement for Domain Adaptive Semantic Segmentation
- Bi-directional Cross-Modality Feature Propagation with Separation-and-Aggregation Gate for RGB-D Semantic Segmentation
- TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
- A deep learning-based framework for segmenting invisible clinical target volumes with estimated uncertainties for post-operative prostate cancer radiotherapy
- D2IP: Deep Dynamic Image Prior for 3D Time-sequence Pulmonary Impedance Imaging
- PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving
- Boosting Ray Search Procedure of Hard-label Attacks with Transfer-based Priors
- Analysis of Plant Nutrient Deficiencies Using Multi-Spectral Imaging and Optimized Segmentation Model
- ParallelTime: Dynamically Weighting the Balance of Short- and Long-Term Temporal Dependencies
- Vec2Face+ for Face Dataset Generation
- SRMambaV2: Biomimetic Attention for Sparse Point Cloud Upsampling in Autonomous Driving
- TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
- Cross-Modal Distillation For Widely Differing Modalities
- StarIO: A Lightweight Inertial Odometry for Nonlinear Motion
- ASC-SW: Atrous strip convolution network with sliding windows
- Multi-Channel Graph Neural Network for Financial Risk Prediction of NEEQ Enterprises
- Learning-Based Interface for Semantic Communication with Bit Importance Awareness
- DiffClean: Diffusion-based Makeup Removal for Accurate Age Estimation
- Feature-Enhanced TResNet for Fine-Grained Food Image Classification
- Unit-Based Histopathology Tissue Segmentation via Multi-Level Feature Representation
- Challenge report: Recognizing Families In the Wild Data Challenge
- Data-Efficient Challenges in Visual Inductive Priors: A Retrospective
- MonoMVSNet: Monocular Priors Guided Multi-View Stereo Network
- Placepedia: Comprehensive Place Understanding with Multi-Faceted Annotations
- Quantum Adaptive Excitation Network with Variational Quantum Circuits for Channel Attention
- SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition
- RMAU-NET: A Residual-Multihead-Attention U-Net Architecture for Landslide Segmentation and Detection from Remote Sensing Images
- Women Sport Actions Dataset for Visual Classification Using Small Scale Training Data
- Multimodal Fusion at Three Tiers: Physics-Driven Data Generation and Vision-Language Guidance for Brain Tumor Segmentation
- Measuring the Impact of Rotation Equivariance on Aerial Object Detection
- Physics-Aware Fluid Field Generation from User Sketches Using Helmholtz-Hodge Decomposition
- AGCD-Net: Attention Guided Context Debiasing Network for Emotion Recognition
- OnlineBEV: Recurrent Temporal Fusion in Bird's Eye View Representations for Multi-Camera 3D Perception
- RawTFNet: A Lightweight CNN Architecture for Speech Anti-spoofing
- Input Conditioned Layer Dropping in Speech Foundation Models
- A statistical physics framework for optimal learning
- A novel attention mechanism for noise-adaptive and robust segmentation of microtubules in microscopy images
- Attend-and-Refine: Interactive keypoint estimation and quantitative cervical vertebrae analysis for bone age assessment
- Semi-supervised learning and integration of multi-sequence MR-images for carotid vessel wall and plaque segmentation
- CL-Polyp: A Contrastive Learning-Enhanced Network for Accurate Polyp Segmentation
- Text-promptable Object Counting via Quantity Awareness Enhancement
- Mask6D: Masked Pose Priors For 6D Object Pose Estimation
- Improving Robustness of Foundation Models in Domain Adaptation with Soup-Adapters
- DFYP: A Dynamic Fusion Framework with Spectral Channel Attention and Adaptive Operator learning for Crop Yield Prediction
- EmissionNet: Air Quality Pollution Forecasting for Agriculture
- YOLO-APD: Enhancing YOLOv8 for Robust Pedestrian Detection on Complex Road Geometries
- A Lightweight Deep Learning Model for Automatic Modulation Classification using Dual Path Deep Residual Shrinkage Network
- ViTaL: A Multimodality Dataset and Benchmark for Multi-pathological Ovarian Tumor Recognition
- Efficient Event-Based Semantic Segmentation via Exploiting Frame-Event Fusion: A Hybrid Neural Network Approach
- SEDR-Seq2P: A Lightweight Dilated Residual Sequence-to-Point Network for Multi-Task Industrial NILM
- DESign: Dynamic Context-Aware Convolution and Efficient Subnet Regularization for Continuous Sign Language Recognition
- MRC-DETR: An Adaptive Multi-Residual Coupled Transformer for Bare Board PCB Defect Detection
- Predicting Steel Fatigue Life from Micrographs Using Physics-Informed Deep Learning
- DADF: A Distribution-Aware Debiasing Framework for Watch-Time Regression in Recommender Systems
- MEGANet-W: A Wavelet-Driven Edge-Guided Attention Framework for Weak Boundary Polyp Detection
- Dynamic Refinement Network for Oriented and Densely Packed Object Detection
- MobileIE: An Extremely Lightweight and Effective ConvNet for Real-Time Image Enhancement on Mobile Devices
- SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement
- SoK: On the Survivability of Backdoor Attacks on Unconstrained Face Recognition Systems
- Classification based deep learning models for lung cancer and disease using medical images
- Frequency Domain-Based Diffusion Model for Unpaired Image Dehazing
- SCAWaveNet: A Spatial-Channel Attention-based Network for Global Significant Wave Height Retrieval
- Few-shot Classification as Multi-instance Verification: Effective Backbone-agnostic Transfer across Domains
- Towards Robustness: A Critique of Current Vector Database Assessments
- PromptForSegCXR: Prompt-Driven Multi-Organ and Multi-Disease Segmentation in Chest X-rays using a Multi-stage Fusion Mechanism
- VR-YOLO: Enhancing PCB Defect Detection with Viewpoint Robustness Based on YOLO
- TASeg: Text-aware RGB-T Semantic Segmentation based on Fine-tuning Vision Foundation Models
- HieraEdgeNet: A Multi-Scale Edge-Enhanced Framework for Automated Pollen Recognition
- CA-I2P: Channel-Adaptive Registration Network with Global Optimal Selection
- YOLO-FDA: Integrating Hierarchical Attention and Detail Enhancement for Surface Defect Detection
- M2SFormer: Multi-Spectral and Multi-Scale Attention with Edge-Aware Difficulty Guidance for Image Forgery Localization
- Personalized Federated Learning via Dual-Prompt Optimization and Cross Fusion
- On the Burstiness of Faces in Set
- SFNet: Fusion of Spatial and Frequency-Domain Features for Remote Sensing Image Forgery Detection
- Airway Skill Assessment with Spatiotemporal Attention Mechanisms Using Human Gaze
- Controllable diffusion-based generation for multi-channel biological data
- A Comparative Study of NAFNet Baselines for Image Restoration
- Multi-Scale Spectral Attention Module-based Hyperspectral Segmentation in Autonomous Driving Scenarios
- Enhancing Image Restoration Transformer via Adaptive Translation Equivariance
- Rethinking Decoder Design: Improving Biomarker Segmentation Using Depth-to-Space Restoration and Residual Linear Attention
- Improving Black-Box Generative Attacks via Generator Semantic Consistency
- Integration of Wavelet Transform Convolution and Channel Attention with LSTM for Stock Price Prediction based Portfolio Allocation
- CSDN: A Context-Gated Self-Adaptive Detection Network for Real-Time Object Detection
- Semi-Supervised Multi-Modal Medical Image Segmentation for Complex Situations
- Cross-modal Offset-guided Dynamic Alignment and Fusion for Weakly Aligned UAV Object Detection
- TD3Net: A temporal densely connected multi-dilated convolutional network for lipreading
- P2MFDS: A Privacy-Preserving Multimodal Fall Detection System for Elderly People in Bathroom Environments
- Adaptive Blind Super-Resolution Network for Spatial-Specific and Spatial-Agnostic Degradations
- Automated MRI Tumor Segmentation using hybrid U-Net with Transformer and Efficient Attention
- Privacy-Preserving Chest X-ray Classification in Latent Space with Homomorphically Encrypted Neural Inference
- Partitioning for Intrinsic Model Inversion Resistance in Collaborative Inference
- A multi-stage augmented multimodal interaction network for fish feeding intensity quantification
- GrFormer: A Novel Transformer on Grassmann Manifold for Infrared and Visible Image Fusion
- Foundation Artificial Intelligence Models for Health Recognition Using Face Photographs (FAHR-Face)
- Manipulated Regions Localization For Partially Deepfake Audio: A Survey
- Finding Optimal Kernel Size and Dimension in Convolutional Neural Networks An Architecture Optimization Approach
- HELENA: High-Efficiency Learning-based channel Estimation using dual Neural Attention
- Sparse Convolutional Recurrent Learning for Efficient Event-based Neuromorphic Object Detection
- SuperPlace: The Renaissance of Classical Feature Aggregation for Visual Place Recognition in the Era of Foundation Models
- RBA-FE: A Robust Brain-Inspired Audio Feature Extractor for Depression Diagnosis
- FOAM: A General Frequency-Optimized Anti-Overlapping Framework for Overlapping Object Perception
- DM3Net: Dual-Camera Super-Resolution via Domain Modulation and Multi-scale Matching
- Mitigating Non-Target Speaker Bias in Guided Speaker Embedding
- Feature Complementation Architecture for Visual Place Recognition
- Efficient Star Distillation Attention Network for Lightweight Image Super-Resolution
- FAD-Net: Frequency-Domain Attention-Guided Diffusion Network for Coronary Artery Segmentation using Invasive Coronary Angiography
- Enhancing Deepfake Detection using SE Block Attention with CNN
- It's Not the Target, It's the Background: Rethinking Infrared Small Target Detection via Deep Patch-Free Low-Rank Representations
- Don't Pay Attention
- PillarMamba: Learning Local-Global Context for Roadside Point Cloud via Hybrid State Space Model
- UniPTMs: The First Unified Multi-type PTM Site Prediction Model via Master-Slave Architecture-Based Multi-Stage Fusion Strategy and Hierarchical Contrastive Loss
- DACN: Dual-Attention Convolutional Network for Hyperspectral Image Super-Resolution
- A Comprehensive Study on Medical Image Segmentation using Deep Neural Networks
- Results of the NeurIPS'21 Challenge on Billion-Scale Approximate Nearest Neighbor Search
- Lightweight RGB-D Salient Object Detection from a Speed-Accuracy Tradeoff Perspective
- MS-YOLO: A Multi-Scale Model for Accurate and Efficient Blood Cell Detection
- PURe: A Plug-and-Play Product-Unit Residual Module for Vision Networks
- EDCFlow: Exploring Temporally Dense Difference Maps for Event-based Optical Flow Estimation
- Automated Action Generation based on Action Field for Robotic Garment Manipulation
- PDSE: A Multiple Lesion Detector for CT Images using PANet and Deformable Squeeze-and-Excitation Block
- RoadFormer : Local-Global Feature Fusion for Road Surface Classification in Autonomous Driving
- A Dynamic Transformer Network for Vehicle Detection
- Geometric Visual Fusion Graph Neural Networks for Multi-Person Human-Object Interaction Recognition in Videos
- OpenCarbon: A Contrastive Learning-based Cross-Modality Neural Approach for High-Resolution Carbon Emission Prediction Using Open Data
- FORLA: Federated Object-centric Representation Learning with Slot Attention
- NTIRE 2025 Challenge on RAW Image Restoration and Super-Resolution
- Quotient Network -- A Network Similar to ResNet but Learning Quotients
- A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
- NeuronSeek: On Stability and Expressivity of Task-driven Neurons
- Efficient 3D Brain Tumor Segmentation with Axial-Coronal-Sagittal Embedding
- Feature Fusion and Knowledge-Distilled Multi-Modal Multi-Target Detection
- DiffVQA: Video Quality Assessment Using Diffusion Feature Extractor
- MGFF-TDNN: A Multi-Granularity Feature Fusion TDNN Model with Depth-Wise Separable Module for Speaker Verification
- 50 Years of Automated Face Recognition
- MaskAdapt: Unsupervised Geometry-Aware Domain Adaptation Using Multimodal Contextual Learning and RGB-Depth Masking
- Parameter-Free Bio-Inspired Channel Attention for Enhanced Cardiac MRI Reconstruction
- HyperPointFormer: Multimodal Fusion in 3D Space with Dual-Branch Cross-Attention Transformers
- DGIQA: Depth-guided Feature Attention and Refinement for Generalizable Image Quality Assessment
- Frequency-Adaptive Discrete Cosine-ViT-ResNet Architecture for Sparse-Data Vision
- What Makes for Text to 360-degree Panorama Generation with Stable Diffusion?
- MAC-Gaze: Motion-Aware Continual Calibration for Mobile Gaze Tracking
- S2AFormer: Strip Self-Attention for Efficient Vision Transformer
- EdgeVidSum: Real-Time Personalized Video Summarization at the Edge
- YOLO-FireAD: Efficient Fire Detection via Attention-Guided Inverted Residual Learning and Dual-Pooling Feature Preservation
- Detecting Informative Channels: ActionFormer
- Efficient Leaf Disease Classification and Segmentation using Midpoint Normalization Technique and Attention Mechanism
- Towards Cross-Domain Multi-Targeted Adversarial Attacks
- YOLO-SPCI: Enhancing Remote Sensing Object Detection via Selective-Perspective-Class Integration
- Depth-Guided Bundle Sampling for Efficient Generalizable Neural Radiance Field Reconstruction
- Improvement Strategies for Few-Shot Learning in OCT Image Classification of Rare Retinal Diseases
- Towards Generalized Proactive Defense against Face Swapping with Contour-Hybrid Watermark
- Co-AttenDWG: Co-Attentive Dimension-Wise Gating and Expert Fusion for Multi-Modal Offensive Content Detection
- Echo Planning for Autonomous Driving: From Current Observations to Future Trajectories and Back
- SETransformer: A Hybrid Attention-Based Architecture for Robust Human Activity Recognition
- Path Aggregation Network for Instance Segmentation
- Generative Data Augmentation for Object Point Cloud Segmentation
- Dual Attention Residual U-Net for Accurate Brain Ultrasound Segmentation in IVH Detection
- State of health prediction of lithium-ion batteries for driving conditions based on full parameter domain sparrow search algorithm and dual-module bidirectional gated recurrent unit
- EVM-Fusion: An Explainable Vision Mamba Architecture with Neural Algorithmic Fusion
- Wavelet Probabilistic Recurrent Convolutional Network for Multivariate Time Series Classification
- Long-Horizon Autonomous Architecture Research with a Language-Model Agent: A Behavioural Case Study
- AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization
- FRN: Fractal-Based Recursive Spectral Reconstruction Network
- Neural Conditional Transport Maps
- CEBSNet: Change-Excited and Background-Suppressed Network with Temporal Dependency Modeling for Bitemporal Change Detection
- Federated prediction for scalable and privacy-preserved knowledge-based planning in radiotherapy
- Domain Adaptation for Multi-label Image Classification: a Discriminator-free Approach
- Selective Structured State Space for Multispectral-fused Small Target Detection
- Use as Many Surrogates as You Want: Selective Ensemble Attack to Unleash Transferability without Sacrificing Resource Efficiency
- Event-Driven Dynamic Scene Depth Completion
- Enhancing Shape Perception and Segmentation Consistency for Industrial Image Inspection
- SEPT: Standard-Definition Map Enhanced Scene Perception and Topology Reasoning for Autonomous Driving
- Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
- DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
- Understanding Nonlinear Implicit Bias via Region Counts in Input Space
- Polynomial Neural Fields for Subband Decomposition and Manipulation
- CSPENet: Contour-Aware and Saliency Priors Embedding Network for Infrared Small Target Detection
- DRRNet: Macro-Micro Feature Fusion and Dual Reverse Refinement for Camouflaged Object Detection
- Learning Informative Attention Weights for Person Re-Identification
- Thermal Detection of People with Mobility Restrictions for Barrier Reduction at Traffic Lights Controlled Intersections
- SAR-GTR: Attributed Scattering Information Guided SAR Graph Transformer Recognition Algorithm
- Polarized Target Nuclear Magnetic Resonance Measurements with Deep Neural Networks
- IKrNet: A Neural Network for Detecting Specific Drug-Induced Patterns in Electrocardiograms Amidst Physiological Variability
- Efficient and Robust Multidimensional Attention in Remote Physiological Sensing through Target Signal Constrained Factorization
- Adapting a Segmentation Foundation Model for Medical Image Classification
- Achieving 3D Attention via Triplet Squeeze and Excitation Block
- Dual-Resolution Attention-Gated Deep Learning with Ordinal Regression for Diabetic Retinopathy Grading: A Quantified Assessment of Cross-Domain Generalization
- CGTrack: Cascade Gating Network with Hierarchical Feature Aggregation for UAV Tracking
- Enhancing Satellite Object Localization with Dilated Convolutions and Attention-aided Spatial Pooling
- Visual Affordance Prediction: Survey and Reproducibility
- Intelligent Diagnosis Using Dual-Branch Attention Network for Rare Thyroid Carcinoma Recognition with Ultrasound Imaging
- CVVNet: A Cross-Vertical-View Network for Gait Recognition
- Low-Complexity Acoustic Scene Classification with Device Information in the DCASE 2025 Challenge
- Toward Onboard AI-Enabled Solutions to Space Object Detection for Space Sustainability
- Parsing-based View-aware Embedding Network for Vehicle Re-Identification
- Brain Foundation Models with Hypergraph Dynamic Adapter for Brain Disease Analysis
- Diverse Semantics-Guided Feature Alignment and Decoupling for Visible-Infrared Person Re-Identification
- Dual-stream spatio-temporal GCN-transformer network for 3D human pose estimation
- Toward Interpretable and Generalizable AI in Regulatory Genomics
- Vision Transformers in Precision Agriculture: A Comprehensive Survey
- Diffusion-based Adversarial Identity Manipulation for Facial Privacy Protection
- Zero-Shot Super-Resolution from Unstructured Data Using a Transformer-Based Neural Operator for Urban Micrometeorology
- Phenotypic dynamics and temporal heritability of tomato architectural traits using an unmanned ground vehicle-based plant phenotyping system
- SNR-aware Semantic Image Transmission with Deep Learning-based Channel Estimation in Fading Channels
- Quality-factor inspired deep neural network solver for solving inverse scattering problems
- Dynamic Contextual Attention Network: Transforming Spatial Representations into Adaptive Insights for Endoscopic Polyp Diagnosis
- Mjölnir: A Deep Learning Parametrization Framework for Global Lightning Flash Density
- Frequency-Guided Fusion For RGB-Thermal Semantic Segmentation
- TimeSAE: Causal Sparse Decoding for Faithful Explanations of Black-Box Time Series Models
- Dual Attention Driven Lumbar Magnetic Resonance Image Feature Enhancement and Automatic Diagnosis of Herniation
- Lightweight Adapter Learning for More Generalized Remote Sensing Change Detection
- MER 2025: When Affective Computing Meets Large Language Models
- MIA-Mind: A Multidimensional Interactive Attention Mechanism Based on MindSpore
- Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness
- Enhancing Pre-Trained Model-Based Class-Incremental Learning through Neural Collapse
- UAV-ReID: A Benchmark on Unmanned Aerial Vehicle Re-identification in Video Imagery
- 3D Deep-learning-based Segmentation of Human Skin Sweat Glands and Their 3D Morphological Response to Temperature Variations
- A Survey on Semantic Communication for Vision: Categories, Frameworks, Enabling Techniques, and Applications
- A Unified Resolution-Conditioned Framework for Orthogonal Line-Scanning Image Fusion
- TS-CAM: Token Semantic Coupled Attention Map for Weakly Supervised Object Localization
- Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching
- Remb: regularized embedding memory book to extend metric learning in fault diagnosis
- CLPSTNet: A Progressive Multi-Scale Convolutional Steganography Model Integrating Curriculum Learning
- Multi-Task Learning With Coarse Priors for Robust Part-Aware Person Re-Identification
- Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval
- SAIP-Net: Enhancing Remote Sensing Image Segmentation via Spectral Adaptive Information Propagation
- Iterative Collaboration Network Guided By Reconstruction Prior for Medical Image Super-Resolution
- Multivariate LSTM-FCNs for time series classification
- On the impact of selected modern deep-learning techniques to the performance and celerity of classification models in an experimental high-energy physics use case
- An Efficient Aerial Image Detection with Variable Receptive Fields
- Acquire and then Adapt: Squeezing out Text-to-Image Model for Image Restoration
- Efficient multiscale feature integration network for lightweight remote sensing images change detection
- Progressive Multi-Source Domain Adaptation for Personalized Facial Expression Recognition
- Enhanced Standard Compatible Image Compression Framework Based on Auxiliary Codec Networks
- MSAD-Net: Multiscale and Spatial Attention-based Dense Network for Lung Cancer Classification
- Segregation and Context Aggregation Network for Real-time Cloud Segmentation
- Rethinking Target Label Conditioning in Adversarial Attacks: A 2D Tensor-Guided Generative Approach
- FocusNet: Transformer-enhanced Polyp Segmentation with Local and Pooling Attention
- Sequential vessel segmentation via deep channel attention network
- A Novel Hybrid Approach for Retinal Vessel Segmentation with Dynamic Long-Range Dependency and Multi-Scale Retinal Edge Fusion Enhancement
- Res2Net: A New Multi-Scale Backbone Architecture
- Circular Image Deturbulence using Quasi-conformal Geometry
- DADU: Dual Attention-based Deep Supervised UNet for Automated Semantic Segmentation of Cardiac Images
- Anomaly Detection-Inspired Few-Shot Medical Image Segmentation Through Self-Supervision With Supervoxels
- Estimating Parameters of the Tree Root in Heterogeneous Soil Environments via Mask-Guided Multi-Polarimetric Integration Neural Network
- Leveraging Functional Encryption and Deep Learning for Privacy-Preserving Traffic Forecasting
- A Multi-task Learning Balanced Attention Convolutional Neural Network Model for Few-shot Underwater Acoustic Target Recognition
- Deep learning at the shallow end: Malware classification for non-domain experts
- AdaptoVision: A Multi-Resolution Image Recognition Model for Robust and Scalable Classification
- Hadamard product in deep learning: Introduction, Advances and Challenges
- Attention-Infused Autoencoder for Massive MIMO CSI Compression
- Beyond Residual Connections: Manifold-Constrained Hyper-Connections for Robust Speaker Representation Learning
- DamageCAT: A Deep Learning Transformer Framework for Typology-Based Post-Disaster Building Damage Categorization
- An Unsupervised Network Architecture Search Method for Solving Partial Differential Equations
- GFT: Gradient Focal Transformer
- Siamese Network with Dual Attention for EEG-Driven Social Learning: Bridging the Human-Robot Gap in Long-Tail Autonomous Driving
- Enhancing Wide-Angle Image Using Narrow-Angle View of the Same Scene
- FractalForensics: Proactive Deepfake Detection and Localization via Fractal Watermarks
- Multi-scale Activation, Refinement, and Aggregation: Exploring Diverse Cues for Fine-Grained Bird Recognition
- Exploring Synergistic Ensemble Learning: Uniting CNNs, MLP-Mixers, and Vision Transformers to Enhance Image Classification
- Wireless Silent Speech Interface Using Multi-Channel Textile EMG Sensors Integrated into Headphones
- Artifact detection and localization in single-channel mobile EEG for sleep research using deep learning and attention mechanisms
- On the Practice of Deep Hierarchical Ensemble Network for Ad Conversion Rate Prediction
- Novel Pooling-based VGG-Lite for Pneumonia and Covid-19 Detection from Imbalanced Chest X-Ray Datasets
- Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition
- DefMamba: Deformable Visual State Space Model
- Nes2Net: A Lightweight Nested Architecture for Foundation Model Driven Speech Anti-spoofing
Discussions
Related