Ruibin Yuan
- MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
2023/11/27 by Xiang Yue, Yue, Xiang, Yuansheng Ni +41 · 442 citations
Computer Science · #Topic Modeling #Multimodal Machine Learning Applications #Natural Language Processing Techniques
- Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
2025/03/03 by Xinsheng Wang, Wang, Xinsheng, Mingqi Jiang +49 · 2 voices · 59 citations
Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems #cs.AI #cs.SD #eess.AS
- MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training
2023/05/31 by Yizhi Li, Li, Yizhi, Ruibin Yuan +35 · 46 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
2024/02/19 by Jun Zhan, Junqi Dai, Zhan, Jun +29 · 36 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling
- SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines
2025/02/20 by M-A-P Team, Xinrun Du, P Team +179 · 69 citations
Social Sciences · #Artificial Intelligence in Law #Computation and Language (cs.CL) #FOS: Computer and information sciences
- Kimi-Audio Technical Report
2025/04/25 by Ding Ding, KimiTeam, Ding, Ding +70 · 83 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
- RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation
2024/03/31 by Chi-Min Chan, Chunpu Xu, Chan, Chi-Min +11 · 27 citations
Computer Science · #Topic Modeling #Domain Adaptation and Few-Shot Learning #Information Retrieval and Search Behavior
- MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
2025/05/19 by Ziyang Ma, Ma, Ziyang, Yinghao Ma +62 · 49 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Multimodal Machine Learning Applications #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- ChatMusician: Understanding and Generating Music Intrinsically with LLM
2024/02/25 by Ruibin Yuan, Yuan, Ruibin, Y. F. Wang +66 · 16 citations
Computer Science · Decision Sciences · Materials Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Machine Learning in Materials Science #Multimedia (cs.MM) #Scientific Computing and Data Management #Sound (cs.SD) #Topic Modeling #electronic engineering #information engineering
- YuE: Scaling Open Foundation Models for Long-Form Music Generation
2025/03/11 by Ruibin Yuan, Yuan, Ruibin, Lin, Hanfeng +110 · 23 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computer Graphics and Visualization Techniques #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
- MARBLE: Music Audio Representation Benchmark for Universal Evaluation
2023/06/18 by Ruibin Yuan, Yuan, Ruibin, Yinghao Ma +46 · 7 citations
Computer Science · Arts and Humanities · #Music and Audio Processing #Diverse Musicological Studies #Music Technology and Sound Studies
- MuPT: A Generative Symbolic Music Pretrained Transformer
2024/04/09 by Xingwei Qu, Qu, Xingwei, Yuelin Bai +53 · 9 citations
Computer Science · Neuroscience · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Neuroscience and Music Perception #Sound (cs.SD) #electronic engineering #information engineering
- CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages
2025/02/14 by Shangda Wu, Zhancheng Guo, Wu, Shangda +17 · 13 citations
Computer Science · Arts and Humanities · #Music and Audio Processing #Diverse Musicological Studies #Music Technology and Sound Studies
- Foundation Models for Music: A Survey
2024/08/26 by Yinghao Ma, Ma, Yinghao, Anders Øland +81 · 8 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music Technology and Sound Studies #Sound (cs.SD) #electronic engineering #information engineering
- ComposerX: Multi-Agent Symbolic Music Composition with LLMs
2024/04/28 by Qixin Deng, Qikai Yang, Deng, Qixin +35 · 6 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
- CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
2024/01/22 by Ge ZHANG, Zhang, Ge, Xinrun Du +41 · 5 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Semantic Web and Ontologies #Topic Modeling
- LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
2023/06/29 by Le Zhuo, Ruibin Yuan, Zhuo, Le +23 · 4 citations
Arts and Humanities · Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Diverse Musicological Studies #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- AudioX: A Unified Framework for Anything-to-Audio Generation
2025/03/13 by Zhaoyang Liu, Tian, Zeyue, Jin, Yizhu +10 · 11 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Generative Adversarial Networks and Image Synthesis #Machine Learning (cs.LG) #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
- VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
2024/06/06 by Zeyue Tian, Zhaoyang Liu, Tian, Zeyue +15 · 5 citations
Computer Science · Social Sciences · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimedia (cs.MM) #Multimedia Communication and Technology #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD)
- Weakly-Supervised Emotion Transition Learning for Diverse 3D Co-speech Gesture Generation
2023/11/29 by Xingqun Qi, Jiahao Pan, Qi, Xingqun +19 · 4 citations
Computer Science · Psychology · #Hand Gesture Recognition Systems #Speech and dialogue systems #Emotion and Mood Recognition
- MAP-Music2Vec: A Simple and Effective Baseline for Self-Supervised Music Audio Representation Learning
2022/12/05 by Yizhi Li, Ruibin Yuan, Li, Yizhi +25 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning
2024/03/26 by Yuelin Bai, Xinrun Du, Bai, Yuelin +39 · 4 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Educational Technology and Assessment #FOS: Computer and information sciences
- SongEval: A Benchmark Dataset for Song Aesthetics Evaluation
2025/05/16 by Jixun Yao, Yao, Jixun, Guobin Ma +20 · 9 citations
Computer Science · #Artificial Intelligence in Games #Audio and Speech Processing (eess.AS) #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #electronic engineering #information engineering
- CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
2024/10/17 by Shangda Wu, Yashan Wang, Wu, Shangda +27 · 4 citations
Computer Science · Arts and Humanities · #Music and Audio Processing #Diverse Musicological Studies #Natural Language Processing Techniques
- Editing Music with Melody and Text: Using ControlNet for Diffusion Transformer
2024/10/07 by Siyuan Hou, Shansong Liu, Hou, Siyuan +11 · 3 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Neural Networks and Applications #Sound (cs.SD) #electronic engineering #information engineering
- Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
2024/04/05 by Xinrun Du, Zhouliang Yu, Du, Xinrun +25 · 2 citations
Computer Science · #Natural Language Processing Techniques #Topic Modeling
- DeID-VC: Speaker De-identification via Zero-shot Pseudo Voice Conversion
2022/09/09 by Ruibin Yuan, Yuan, Ruibin, Yuxuan Wu +5 · 1 citation
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Hate Speech and Cyberbullying Detection #Multimedia (cs.MM) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- On the Effectiveness of Speech Self-supervised Learning for Music
2023/07/11 by Yinghao Ma, Ma, Yinghao, Ruibin Yuan +27 · 1 citation
Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Music Technology and Sound Studies
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
2025/05/20 by Jiajun Shi, Jian Yang, Shi, Jiajun +53 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Topic Modeling
- MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
2024/07/30 by Xiaowei Chi, Chi, Xiaowei, Yatian Wang +35 · 1 citation
Arts and Humanities · Computer Science · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #Diverse Musicological Studies #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
- SongFormer: Scaling Music Structure Analysis with Heterogeneous Supervision
2025/10/03 by C.X. Hao, Ruibin Yuan, Hao, Chunbo +10 · 2 citations
Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Speech and Audio Processing
- WenetSpeech-Yue: A Large-scale Cantonese Speech Corpus with Multi-dimensional Annotation
2025/09/04 by Longhao Li, Li, Longhao, Zhao Guo +33 · 3 citations
Computer Science · #FOS: Computer and information sciences #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling
- ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships
2026/07/16 by Xinyu Liu, Shihao Li, Weihong Lin +10 · 1 citation
#cs.CV
- Qwen-Music Technical Report
2026/07/27 by Jin Xu, Kangdi Wang, Ruibin Yuan +24
#cs.SD
- Hierarchical Denoising For Multi-Step Visual Reasoning
2026/07/16 by Zezhong Qian, Xiaowei Chi, Chak-Wing Mak +9
#cs.CV