Shicheng Li
- Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs
2025/03/07 by Ling Team, Binwei Zeng, Zeng, Binwei +144 · 10 voices · 5 citations
#cs.LG #cs.AI #cs.CL
- TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
2023/12/04 by Shuhuai Ren, Ren, Shuhuai, Linli Yao +7 · 90 citations
Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Domain Adaptation and Few-Shot Learning
- MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
2025/05/12 by LLM-Core Xiaomi, Xiaomi, LLM-Core, Bingquan Xia +118 · 1 voice · 29 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Topic Modeling
- FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation
2023/11/03 by Yuanxin Liu, Liu, Yuanxin, Lei Li +13 · 12 citations
Computer Science · Social Sciences · #Video Analysis and Summarization #Multimedia Communication and Technology #Multimodal Machine Learning Applications
- M3IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning
2023/06/07 by Lei Li, Yuwei Yin, Li, Lei +21 · 6 citations
Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
- MiMo-VL Technical Report
2025/06/04 by Core Team, Zihao Yue, Yue, Zihao +135 · 18 citations
Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Reinforcement Learning in Robotics
- VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
2023/11/29 by Shicheng Li, Li, Shicheng, Lei Li +13 · 6 citations
Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Human Pose and Action Recognition
- TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
2025/04/24 by Linli Yao, Yicheng Li, Yao, Linli +25 · 12 citations
Social Sciences · Computer Science · #Multimedia Communication and Technology #Image and Video Quality Assessment #Video Analysis and Summarization
- Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling
2025/07/23 by Xin Yi, Juncheng Yan, Xin, Yi +37 · 21 citations
Computer Science · Engineering · Neuroscience · #Brain Tumor Detection and Classification #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Medical Image Segmentation Techniques #Medical Imaging and Analysis
- Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
2025/02/10 by Dongyang Liu, Liu, Dongyang, Shicheng Li +35 · 4 citations
Computer Science · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image and Video Quality Assessment #Video Coding and Compression Technologies