Xiao, Guangxuan
- Efficient Streaming Language Models with Attention Sinks
2023/09/29 by Guangxuan Xiao, Yuandong Tian, Xiao, Guangxuan +7 · 5 voices · 395 citations
Computer Science · #Topic Modeling #Natural Language Processing Techniques #Speech Recognition and Synthesis
- AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
2023/06/01 by Ji Lin, Jiaming Tang, Lin, Ji +18 · 1 voice · 306 citations
Computer Science · Engineering · #Topic Modeling #Ferroelectric and Negative Capacitance Devices #Speech Recognition and Synthesis
- SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
2022/11/18 by Guangxuan Xiao, Ji Lin, Xiao, Guangxuan +10 · 1 voice · 205 citations
Computer Science · #Machine Learning in Healthcare #Natural Language Processing Techniques #Topic Modeling #cs.AI #cs.CL #cs.LG
- DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
2024/10/14 by Guangxuan Xiao, Xiao, Guangxuan, Jiaming Tang +14 · 1 voice · 59 citations
Computer Science · #Time Series Analysis and Forecasting #Data Stream Mining Techniques #Neural Networks and Applications
- QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
2024/05/07 by Yujun Lin, Haotian Tang, Lin, Yujun +12 · 1 voice · 45 citations
Computer Science · Engineering · #Wireless Power Transfer Systems #cs.AI #cs.CL #cs.LG #cs.PF
- Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
2024/06/16 by Jiaming Tang, Yilong Zhao, Tang, Jiaming +9 · 96 citations
Neuroscience · Computer Science · #Brain Tumor Detection and Classification #Anomaly Detection Techniques and Applications #Time Series Analysis and Forecasting
- FastComposer: Tuning-Free Multi-Subject Image Generation with Localized Attention
2023/05/17 by Guangxuan Xiao, Xiao, Guangxuan, Tianwei Yin +7 · 42 citations
Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications
- StreamingVLM: Real-Time Understanding for Infinite Video Streams
2025/10/10 by R. Xu, Ruyi Xu, Guangxuan Xiao +14 · 5 voices · 13 citations
Computer Science · #Multimodal Machine Learning Applications #Generative Adversarial Networks and Image Synthesis #Domain Adaptation and Few-Shot Learning
- InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
2024/02/07 by Chaojun Xiao, Pengle Zhang, Xiao, Chaojun +13 · 44 citations
Computer Science · #Neural Networks and Applications
- Retrieval Head Mechanistically Explains Long-Context Factuality
2024/04/24 by Wenhao Wu, Yizhong Wang, Wu, Wenhao +7 · 33 citations
Computer Science · Neuroscience · #Topic Modeling #Memory Processes and Influences
- XAttention: Block Sparse Attention with Antidiagonal Scoring
2025/03/20 by Ruijian Xu, Xu, Ruyi, Guangxuan Xiao +7 · 35 citations
Computer Science · #Advanced Neural Network Applications #Parallel Computing and Optimization Techniques #Stochastic Gradient Optimization Techniques
- Offsite-Tuning: Transfer Learning without Full Model
2023/02/09 by Xiao, Guangxuan, Lin, Ji, Han, Song · 10 citations
#Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
2025/02/20 by Yang Shang, J.Z. Li D.B. Guo, Yang, Shang +15 · 12 citations
Computer Science · Engineering · #Blind Source Separation Techniques #Advanced Algorithms and Applications #Neural Networks and Applications
- BitDelta: Your Fine-Tune May Only Be Worth One Bit
2024/02/15 by Liu, James, Xiao, Guangxuan, Li, Kai +4 · 3 citations
#Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
2025/12/01 by Cook, Jack, Guo, Junxian, Xiao, Guangxuan +2 · 2 citations
#Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
2025/12/01 by Yilong Zhao, Jiaming Tang, Zhao, Yilong +21 · 1 citation
Computer Science · #Artificial Intelligence (cs.AI) #Big Data and Digital Economy #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques
- BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding
2025/12/12 by Yuan, Jiayi, Shinn, Cameron, Xu, Kai +18 · 1 citation
#Computation and Language (cs.CL) #FOS: Computer and information sciences
- Optimizing Mixture of Block Attention
2025/11/14 by Guangxuan Xiao, Junxian Guo, Xiao, Guangxuan +5 · 1 citation
Computer Science · #Network Packet Processing and Optimization #Graph Theory and Algorithms #Caching and Content Delivery