Zhixian Zhao
- Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
2025/03/03 by Xinsheng Wang, Mingqi Jiang, Ming Jiang +49 · 2 voices · 59 citations
Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems #cs.AI #cs.SD #eess.AS
- OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia
2025/01/23 by Geng, Xuelong, Wei, Kun, Qijie Shao +34 · 11 citations
Computer Science · #Natural Language Processing Techniques
- Improving Multimodal Emotion Recognition by Leveraging Acoustic Adaptation and Visual Alignment
2024/09/08 by Zhixian Zhao, Zhao, Zhixian, Haifeng Chen +7 · 2 citations
Psychology · #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Human-Computer Interaction (cs.HC) #Sound (cs.SD) #electronic engineering #information engineering