vix.ing · top · new · best · stats · spec

Ren, Shuhuai

  1. Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
    2024/05/31 by Chaoyou Fu, Yuhan Dai, Fu, Chaoyou +35 · 323 citations
    Computer Science · Medicine · #AI in cancer detection #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Radiomics and Machine Learning in Medical Imaging
  2. TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
    2023/12/04 by Shuhuai Ren, Ren, Shuhuai, Linli Yao +7 · 96 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Domain Adaptation and Few-Shot Learning
  3. TempCompass: Do Video LLMs Really Understand Videos?
    2024/03/01 by Liu, Yuanxin, Li, Shicheng, Liu, Yi +6 · 60 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  4. MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
    2025/05/12 by LLM-Core Xiaomi, Xiaomi, LLM-Core, : +118 · 1 voice · 31 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Topic Modeling
  5. DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
    2024/05/31 by Linli Yao, Yao, Linli, Lei Li +11 · 17 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Topic Modeling
  6. FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation
    2023/11/03 by Yuanxin Liu, Lei Li, Liu, Yuanxin +13 · 13 citations
    Computer Science · Social Sciences · #Video Analysis and Summarization #Multimedia Communication and Technology #Multimodal Machine Learning Applications
  7. Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond
    2023/10/03 by Chen, Liang, Zhang, Yichi, Ren, Shuhuai +6 · 8 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Robotics (cs.RO)
  8. Prompt Pre-Training with Twenty-Thousand Classes for Open-Vocabulary Visual Recognition
    2023/04/10 by Shuhuai Ren, Aston Zhang, Ren, Shuhuai +13 · 6 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  9. VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
    2023/11/29 by Shicheng Li, Li, Shicheng, Lei Li +13 · 7 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Human Pose and Action Recognition
  10. M3IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning
    2023/06/07 by Lei Li, Li, Lei, Yuwei Yin +21 · 6 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
  11. MiMo-VL Technical Report
    2025/06/04 by Zihao Yue, Core Team, Yue, Zihao +135 · 18 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Reinforcement Learning in Robotics
  12. TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
    2025/04/24 by Linli Yao, Yicheng Li, Yao, Linli +25 · 15 citations
    Social Sciences · Computer Science · #Multimedia Communication and Technology #Image and Video Quality Assessment #Video Analysis and Summarization
  13. Dynamic Knowledge Distillation for Pre-trained Language Models
    2021/09/23 by Lei Li, Yankai Lin, Li, Lei +9 · 4 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  14. CUGE: A Chinese Language Understanding and Generation Evaluation Benchmark
    2021/12/27 by Yuan Yao, Yao, Yuan, Qingxiu Dong +67 · 4 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
  15. Parallelized Autoregressive Visual Generation
    2024/12/19 by Yuqing Wang, Shuhuai Ren, Wang, Yuqing +15 · 10 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques
  16. CascadeBERT: Accelerating Inference of Pre-trained Language Models via Calibrated Complete Models Cascade
    2020/12/29 by Lei Li, Li, Lei, Yankai Lin +11 · 3 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling
  17. PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
    2024/02/21 by Chen, Liang, Zhang, Yichi, Ren, Shuhuai +7 · 5 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  18. TESTA: Temporal-Spatial Token Aggregation for Long-form Video-Language Understanding
    2023/10/29 by Ren, Shuhuai, Chen, Sishuo, Li, Shicheng +2 · 4 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  19. Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
    2025/03/20 by Wang, Yuqing, Lin, Zhijie, Teng, Yao +4 · 10 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  20. Next Block Prediction: Video Generation via Semi-Autoregressive Modeling
    2025/02/11 by Ren, Shuhuai, Ma, Shuming, Sun, Xu +1 · 7 citations
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  21. LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
    2024/04/16 by Yuchi Wang, Shuhuai Ren, Wang, Yuchi +13 · 4 citations
    Computer Science · #Mathematics, Computing, and Information Processing #Natural Language Processing Techniques #Topic Modeling
  22. Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
    2024/12/16 by Liang Chen, Zekun Wang, Chen, Liang +49 · 6 citations
    Computer Science · #Natural Language Processing Techniques #Topic Modeling
  23. DCA: Diversified Co-Attention towards Informative Live Video Commenting
    2019/11/07 by Zhihan Zhang, Zhiyi Yin, Zhang, Zhihan +7 · 1 citation
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Topic Modeling #Video Analysis and Summarization
  24. MiMo-Embodied: X-Embodied Foundation Model Technical Report
    2025/11/20 by Xiaoshuai Hao, Hao, Xiaoshuai, Lei Zhou +76 · 3 citations
    Engineering · Computer Science · Psychology · #Autonomous Vehicle Technology and Safety #Multimodal Machine Learning Applications #Social Robot Interaction and HRI
  25. UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?
    2025/03/13 by Yuanxin Liu, Rui Zhu, Liu, Yuanxin +11 · 1 citation
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications
  26. TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
    2025/03/21 by Li, Shicheng, Li, Lei, Ouyang, Kun +7 · 1 citation
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences