vix.ing · top · new · best · stats · spec

Mixed-Precision Quantization for Deep Vision Models with Integer Quadratic Programming

2023/07/11 by Zihao Deng, Deng, Zihao, Sayeh Sharify +5 · 1 citation
Computer Science · Engineering · #Advanced Image Processing Techniques #Advanced Vision and Imaging #FOS: Computer and information sciences #Neural and Evolutionary Computing (cs.NE) #Sparse and Compressive Sensing Techniques

paper · pdf · doi:10.48550/arxiv.2307.05657

openalex publication_date 2023/07/11 · openalex created_date 2023/07/14 · openalex updated_date 2026/07/28

Abstract

Quantization is a widely used technique to compress neural networks. Assigning uniform bit-widths across all layers can result in significant accuracy degradation at low precision and inefficiency at high precision. Mixed-precision quantization (MPQ) addresses this by assigning varied bit-widths to layers, optimizing the accuracy-efficiency trade-off. Existing sensitivity-based methods for MPQ assume that quantization errors across layers are independent, which leads to suboptimal choices. We introduce CLADO, a practical sensitivity-based MPQ algorithm that captures cross-layer dependency of quantization error. CLADO approximates pairwise cross-layer errors using linear equations on a small data subset. Layerwise bit-widths are assigned by optimizing a new MPQ formulation based on cross-layer quantization errors using an Integer Quadratic Program. Experiments with CNN and vision transformer models on ImageNet demonstrate that CLADO achieves state-of-the-art mixed-precision quantization performance. Code repository available here: https://github.com/JamesTuna/CLADOMPQ

Cited by

Related