Guo, Junxian
- DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
2024/10/14 by Guangxuan Xiao, Xiao, Guangxuan, Jiaming Tang +14 · 1 voice · 58 citations
Computer Science · #Time Series Analysis and Forecasting #Data Stream Mining Techniques #Neural Networks and Applications
- SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models
2024/11/07 by Muyang Li, Li, Muyang, Yujun Lin +17 · 1 voice · 41 citations
#cs.CV #cs.LG
- XAttention: Block Sparse Attention with Antidiagonal Scoring
2025/03/20 by Ruijian Xu, Xu, Ruyi, Guangxuan Xiao +7 · 35 citations
Computer Science · #Advanced Neural Network Applications #Parallel Computing and Optimization Techniques #Stochastic Gradient Optimization Techniques
- LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
2025/02/20 by Yang Shang, Yang, Shang, J.Z. Li D.B. Guo +15 · 12 citations
Computer Science · Engineering · #Blind Source Separation Techniques #Advanced Algorithms and Applications #Neural Networks and Applications
- VQ-LLM: High-performance Code Generation for Vector Quantization Augmented LLM Inference
2025/03/04 by Liu, Zihan, Luo, Xinhao, Guo, Junxian +11 · 6 citations
#Distributed #FOS: Computer and information sciences #Parallel #and Cluster Computing (cs.DC)
- SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
2025/10/20 by Khaki, Samir, Guo, Junxian, Tang, Jiaming +6 · 4 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- SparseLoRA: Accelerating LLM Fine-Tuning with Contextual Sparsity
2025/06/19 by Khaki, Samir, Li, Xiuyu, Guo, Junxian +7 · 3 citations
Computer Science · Physics and Astronomy · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Model Reduction and Neural Networks #Numerical Methods and Algorithms #Topic Modeling
- Optimizing Mixture of Block Attention
2025/11/14 by Guangxuan Xiao, Junxian Guo, Xiao, Guangxuan +5 · 1 citation
Computer Science · #Network Packet Processing and Optimization #Graph Theory and Algorithms #Caching and Content Delivery