Shuai Bai
- Qwen2.5-VL Technical Report
2025/02/19 by Shuai Bai, Bai, Shuai, Keqin Chen +48 · 1643 citations
Engineering · #Semiconductor Lasers and Optical Devices
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
2024/09/18 by Peng Wang, Shuai Bai, Wang, Peng +35 · 984 citations
Psychology · #Categorization, perception, and language
- Qwen Technical Report
2023/09/28 by Jinze Bai, Shuai Bai, Bai, Jinze +91 · 622 citations
Computer Science · #Topic Modeling #Natural Language Processing Techniques
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
2023/08/24 by Jinze Bai, Shuai Bai, Bai, Jinze +15 · 524 citations
Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
- An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
2024/03/11 by Liang Chen, Haozhe Zhao, Chen, Liang +11 · 130 citations
Computer Science · Medicine · #Multimodal Machine Learning Applications #COVID-19 diagnosis using AI
- Qwen2.5-Omni Technical Report
2025/03/26 by Jin Xu, Zihan Guo, Xu, Jin +22 · 240 citations
Engineering · #Embedded Systems and FPGA Design
- OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
2022/02/07 by Peng Wang, Yang An, Wang, Peng +17 · 34 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- Qwen3-VL Technical Report
2025/11/26 by Shuai Bai, Bai, Shuai, Yuxuan Cai +120 · 123 citations
Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Generative Adversarial Networks and Image Synthesis
- Qwen3-Omni Technical Report
2025/09/22 by Xu Jin, Zhifang Guo, Xu, Jin +68 · 65 citations
Computer Science · #Speech and Audio Processing #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications
- TouchStone: Evaluating Vision-Language Models by Language Models
2023/08/31 by Shuai Bai, Shusheng Yang, Bai, Shuai +15 · 5 citations
Arts and Humanities · Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Subtitles and Audiovisual Media
- Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
2024/12/16 by Liang Chen, Zekun Wang, Chen, Liang +49 · 5 citations
Computer Science · #Natural Language Processing Techniques #Topic Modeling
- Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
2025/02/27 by Liang Chen, Chen, Liang, Shuai Bai +12 · 3 citations
Computer Science · Arts and Humanities · #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications #Digital Humanities and Scholarship
- Contrastive On-Policy Distillation
2026/07/21 by Jiacheng Ruan, Jun Tang, Wenzhen Yuan +5
#cs.CV