Songxiang Liu
- Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
2025/03/03 by Xinsheng Wang, Wang, Xinsheng, Mingqi Jiang +49 · 2 voices · 59 citations
Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems #cs.AI #cs.SD #eess.AS
- HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec
2023/05/04 by Dongchao Yang, Songxiang Liu, Yang, Dongchao +9 · 28 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Kimi-Audio Technical Report
2025/04/25 by KimiTeam, Ding Ding, Ding, Ding +70 · 84 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
- InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt
2023/01/31 by Dongchao Yang, Songxiang Liu, Yang, Dongchao +7 · 14 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
- The Singing Voice Conversion Challenge 2023
2023/06/26 by Wen-Chin Huang, Lester Phillip Violeta, Huang, Wen-Chin +7 · 9 citations
Computer Science · Medicine · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #Voice and Speech Disorders #electronic engineering #information engineering
- DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs
2022/01/28 by Songxiang Liu, Liu, Songxiang, Dan Su +3 · 4 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Adversarial Attacks on Spoofing Countermeasures of automatic speaker verification
2019/10/19 by Songxiang Liu, Haibin Wu, Liu, Songxiang +5 · 2 citations
Computer Science · #Adversarial Robustness in Machine Learning #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Network Security and Intrusion Detection #Speech Recognition and Synthesis #electronic engineering #information engineering
- NoreSpeech: Knowledge Distillation based Conditional Diffusion Model for Noise-robust Expressive TTS
2022/11/04 by Dongchao Yang, Songxiang Liu, Yang, Dongchao +9 · 1 citation
Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Speech and Audio Processing
- SnakeGAN: A Universal Vocoder Leveraging DDSP Prior Knowledge and Periodic Inductive Bias
2023/09/14 by Sipan Li, Li, Sipan, Songxiang Liu +13 · 1 citation
Computer Science · #Speech and Audio Processing #Music and Audio Processing #Music Technology and Sound Studies
- Multi-Layer Content Interaction Through Quaternion Product For Visual Question Answering
2020/01/03 by Lei Shi, Shijie Geng, Shi, Lei +11 · 1 citation
Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Human Pose and Action Recognition