vix.ing · top · new · best · stats · spec

Xiao, Guangxuan

  1. Efficient Streaming Language Models with Attention Sinks
    2023/09/29 by Guangxuan Xiao, Yuandong Tian, Xiao, Guangxuan +7 · 5 voices · 395 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Speech Recognition and Synthesis
  2. AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
    2023/06/01 by Ji Lin, Jiaming Tang, Lin, Ji +18 · 1 voice · 306 citations
    Computer Science · Engineering · #Topic Modeling #Ferroelectric and Negative Capacitance Devices #Speech Recognition and Synthesis
  3. SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
    2022/11/18 by Guangxuan Xiao, Ji Lin, Xiao, Guangxuan +10 · 1 voice · 205 citations
    Computer Science · #Machine Learning in Healthcare #Natural Language Processing Techniques #Topic Modeling #cs.AI #cs.CL #cs.LG
  4. DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
    2024/10/14 by Guangxuan Xiao, Xiao, Guangxuan, Jiaming Tang +14 · 1 voice · 59 citations
    Computer Science · #Time Series Analysis and Forecasting #Data Stream Mining Techniques #Neural Networks and Applications
  5. QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
    2024/05/07 by Yujun Lin, Haotian Tang, Lin, Yujun +12 · 1 voice · 45 citations
    Computer Science · Engineering · #Wireless Power Transfer Systems #cs.AI #cs.CL #cs.LG #cs.PF
  6. Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
    2024/06/16 by Jiaming Tang, Yilong Zhao, Tang, Jiaming +9 · 96 citations
    Neuroscience · Computer Science · #Brain Tumor Detection and Classification #Anomaly Detection Techniques and Applications #Time Series Analysis and Forecasting
  7. FastComposer: Tuning-Free Multi-Subject Image Generation with Localized Attention
    2023/05/17 by Guangxuan Xiao, Xiao, Guangxuan, Tianwei Yin +7 · 42 citations
    Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications
  8. StreamingVLM: Real-Time Understanding for Infinite Video Streams
    2025/10/10 by R. Xu, Ruyi Xu, Guangxuan Xiao +14 · 5 voices · 13 citations
    Computer Science · #Multimodal Machine Learning Applications #Generative Adversarial Networks and Image Synthesis #Domain Adaptation and Few-Shot Learning
  9. InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
    2024/02/07 by Chaojun Xiao, Pengle Zhang, Xiao, Chaojun +13 · 44 citations
    Computer Science · #Neural Networks and Applications
  10. Retrieval Head Mechanistically Explains Long-Context Factuality
    2024/04/24 by Wenhao Wu, Yizhong Wang, Wu, Wenhao +7 · 33 citations
    Computer Science · Neuroscience · #Topic Modeling #Memory Processes and Influences
  11. XAttention: Block Sparse Attention with Antidiagonal Scoring
    2025/03/20 by Ruijian Xu, Xu, Ruyi, Guangxuan Xiao +7 · 35 citations
    Computer Science · #Advanced Neural Network Applications #Parallel Computing and Optimization Techniques #Stochastic Gradient Optimization Techniques
  12. Offsite-Tuning: Transfer Learning without Full Model
    2023/02/09 by Xiao, Guangxuan, Lin, Ji, Han, Song · 10 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  13. LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
    2025/02/20 by Yang Shang, J.Z. Li D.B. Guo, Yang, Shang +15 · 12 citations
    Computer Science · Engineering · #Blind Source Separation Techniques #Advanced Algorithms and Applications #Neural Networks and Applications
  14. BitDelta: Your Fine-Tune May Only Be Worth One Bit
    2024/02/15 by Liu, James, Xiao, Guangxuan, Li, Kai +4 · 3 citations
    #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  15. Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
    2025/12/01 by Cook, Jack, Guo, Junxian, Xiao, Guangxuan +2 · 2 citations
    #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  16. Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
    2025/12/01 by Yilong Zhao, Jiaming Tang, Zhao, Yilong +21 · 1 citation
    Computer Science · #Artificial Intelligence (cs.AI) #Big Data and Digital Economy #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques
  17. BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding
    2025/12/12 by Yuan, Jiayi, Shinn, Cameron, Xu, Kai +18 · 1 citation
    #Computation and Language (cs.CL) #FOS: Computer and information sciences
  18. Optimizing Mixture of Block Attention
    2025/11/14 by Guangxuan Xiao, Junxian Guo, Xiao, Guangxuan +5 · 1 citation
    Computer Science · #Network Packet Processing and Optimization #Graph Theory and Algorithms #Caching and Content Delivery