Ju, Zeqian
- NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
2024/03/05 by Zeqian Ju, Yuancheng Wang, Ju, Zeqian +35 · 69 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers
2023/04/18 by Shen, Kai, Ju, Zeqian, Tan, Xu +6 · 42 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Sound (cs.SD) #electronic engineering #information engineering
- Kimi-Audio Technical Report
2025/04/25 by KimiTeam, Ding Ding, Zeqian Ju +70 · 84 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
- AUDIT: Audio Editing by Following Instructions with Latent Diffusion Models
2023/04/03 by Wang, Yuancheng, Ju, Zeqian, Tan, Xu +4 · 23 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Sound (cs.SD) #electronic engineering #information engineering
- MedDialog: Two Large-scale Medical Dialogue Datasets
2020/04/07 by Xuehai He, Shu Chen, He, Xuehai +23 · 14 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning in Healthcare #Speech and dialogue systems #Topic Modeling
- MusicBERT: Symbolic Music Understanding with Large-Scale Pre-Training
2021/06/10 by Mingliang Zeng, Xu Tan, Zeng, Mingliang +9 · 15 citations
Computer Science · Neuroscience · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Information Retrieval (cs.IR) #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Neuroscience and Music Perception #Sound (cs.SD) #electronic engineering #information engineering
- PromptTTS 2: Describing and Generating Voices with Text Prompt
2023/09/05 by Yichong Leng, Zhifang Guo, Leng, Yichong +27 · 7 citations
Computer Science · #Speech Recognition and Synthesis #Topic Modeling #Natural Language Processing Techniques
- MoonCast: High-Quality Zero-Shot Podcast Generation
2025/03/18 by Ju, Zeqian, Yang, Dongchao, Yu, Jianwei +7 · 14 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Sound (cs.SD) #electronic engineering #information engineering
- RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
2024/04/04 by Xin, Detai, Tan, Xu, Shen, Kai +8 · 3 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Sound (cs.SD) #electronic engineering #information engineering
- ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
2025/04/14 by Yang, Dongchao, Liu, Songxiang, Guo, Haohan +9 · 8 citations
#FOS: Computer and information sciences #Sound (cs.SD)
- FlashSpeech: Efficient Zero-Shot Speech Synthesis
2024/04/23 by Zhen Ye, Zeqian Ju, Ye, Zhen +23 · 3 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing
- TeleMelody: Lyric-to-Melody Generation with a Template-Based Two-Stage Method
2021/09/20 by Zeqian Ju, Peiling Lu, Ju, Zeqian +17 · 1 citation
Computer Science · #Music and Audio Processing #Topic Modeling #Natural Language Processing Techniques
- FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
2025/07/11 by Jiang, Yuxuan, Chen, Zehua, Ju, Zeqian +3 · 7 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Sound (cs.SD) #electronic engineering #information engineering
- ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
2025/10/10 by Jiang, Yuxuan, Chen, Zehua, Ju, Zeqian +3 · 2 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering