vix.ing · top · new · best · stats · spec

Songxiang Liu

  1. Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
    2025/03/03 by Xinsheng Wang, Wang, Xinsheng, Mingqi Jiang +49 · 2 voices · 59 citations
    Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems #cs.AI #cs.SD #eess.AS
  2. HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec
    2023/05/04 by Dongchao Yang, Songxiang Liu, Yang, Dongchao +9 · 28 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  3. Kimi-Audio Technical Report
    2025/04/25 by KimiTeam, Ding Ding, Ding, Ding +70 · 84 citations
    Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
  4. InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt
    2023/01/31 by Dongchao Yang, Songxiang Liu, Yang, Dongchao +7 · 14 citations
    Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
  5. The Singing Voice Conversion Challenge 2023
    2023/06/26 by Wen-Chin Huang, Lester Phillip Violeta, Huang, Wen-Chin +7 · 9 citations
    Computer Science · Medicine · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #Voice and Speech Disorders #electronic engineering #information engineering
  6. DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs
    2022/01/28 by Songxiang Liu, Liu, Songxiang, Dan Su +3 · 4 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  7. Adversarial Attacks on Spoofing Countermeasures of automatic speaker verification
    2019/10/19 by Songxiang Liu, Haibin Wu, Liu, Songxiang +5 · 2 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Network Security and Intrusion Detection #Speech Recognition and Synthesis #electronic engineering #information engineering
  8. NoreSpeech: Knowledge Distillation based Conditional Diffusion Model for Noise-robust Expressive TTS
    2022/11/04 by Dongchao Yang, Songxiang Liu, Yang, Dongchao +9 · 1 citation
    Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Speech and Audio Processing
  9. SnakeGAN: A Universal Vocoder Leveraging DDSP Prior Knowledge and Periodic Inductive Bias
    2023/09/14 by Sipan Li, Li, Sipan, Songxiang Liu +13 · 1 citation
    Computer Science · #Speech and Audio Processing #Music and Audio Processing #Music Technology and Sound Studies
  10. Multi-Layer Content Interaction Through Quaternion Product For Visual Question Answering
    2020/01/03 by Lei Shi, Shijie Geng, Shi, Lei +11 · 1 citation
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Human Pose and Action Recognition