Xingchen Song
- MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
2025/05/12 by LLM-Core Xiaomi, Xiaomi, LLM-Core, : +118 · 1 voice · 29 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Topic Modeling
- WeNet 2.0: More Productive End-to-End Speech Recognition Toolkit
2022/03/29 by Binbin Zhang, Zhang, Binbin, Di Wu +17 · 8 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
- MiMo-VL Technical Report
2025/06/04 by Zihao Yue, Core Team, Zhenru Lin +135 · 18 citations
Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Reinforcement Learning in Robotics
- Non-Autoregressive Transformer ASR with CTC-Enhanced Decoder Input
2020/10/28 by Xingchen Song, Zhiyong Wu, Song, Xingchen +9 · 3 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
- TrimTail: Low-Latency Streaming ASR with Simple but Effective Spectrogram-Level Length Penalty
2022/11/01 by Xingchen Song, Di Wu, Song, Xingchen +15 · 2 citations
Engineering · Social Sciences · #Advanced Chemical Sensor Technologies #Advanced Computing and Algorithms #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #I.2.7 #Sound (cs.SD) #Underwater Vehicles and Communication Systems #electronic engineering #information engineering
- Fast-U2++: Fast and Accurate End-to-End Speech Recognition in Joint CTC/Attention Frames
2022/11/02 by Chengdong Liang, Liang, Chengdong, Xiao-Lei Zhang +13 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
2024/12/11 by Xingchen Song, Song, Xingchen, Mengtao Xing +20 · 2 citations
Computer Science · Decision Sciences · #Context-Aware Activity Recognition Systems #Personal Information Management and User Behavior
- U2++ MoE: Scaling 4.7x parameters with minimal impact on RTF
2024/04/25 by Xingchen Song, Song, Xingchen, Di Wu +13 · 1 citation
Physics and Astronomy · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #I.2.7 #Nuclear Physics and Applications #Radiation Detection and Scintillator Technologies #electronic engineering #information engineering
- Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer
2026/07/20 by Shengfan Shen, Di Wu, Xingchen Song +5
#cs.SD
- Qwen-Audio-3.0-Gen-Preview Technical Report
2026/07/30 by Junyu Dai, Xiaoyue Duan, Xinyue Fan +14
Engineering · #eess.AS