Bailin Li
- DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
2024/02/19 by Xiaoyu Tian, Junru Gu, Tian, Xiaoyu +16 · 97 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- Knowledge-Routed Visual Question Reasoning: Challenges for Deep Representation Embedding
2020/12/14 by Qingxing Cao, Cao, Qingxing, Bailin Li +6 · 1 citation
Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
2025/09/16 by Titong Jiang, Jiang, Titong, X. S. Jiang +16 · 7 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Robotics (cs.RO)
- FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models
2026/07/16 by Wei Li, Peijin Jia, Yuan Ma +9
#cs.CV #cs.AI