Zhenbo Luo
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
2025/03/17 by Ye Wang, Ziheng Wang, Wang, Ye +30 · 49 citations
Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Domain Adaptation and Few-Shot Learning
- MiMo-VL Technical Report
2025/06/04 by Zihao Yue, Core Team, Yue, Zihao +135 · 18 citations
Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Reinforcement Learning in Robotics
- VOC-ReID: Vehicle Re-identification based on Vehicle-Orientation-Camera
2020/04/20 by Xiangyu Zhu, Zhenbo Luo, Zhu, Xiangyu +5 · 1 citation
Computer Science · Engineering · #Video Surveillance and Tracking Methods #Advanced Neural Network Applications #Autonomous Vehicle Technology and Safety
- SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing
2025/07/22 by Jinbo Hu, Yin Cao, Hu, Jinbo +7 · 3 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering