vix.ing · top · new · best · stats · spec

Jun Zhan

  1. Deep Speech 2: End-to-End Speech Recognition in English and Mandarin
    2015/12/08 by Dario Amodei, Amodei, Dario, Rishita Anubhai +66 · 1 voice · 63 citations
    Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling #cs.CL
  2. SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities
    2023/05/18 by Dong Zhang, Zhang, Dong, Shimin Li +11 · 94 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Speech Recognition and Synthesis
  3. AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
    2024/02/19 by Jun Zhan, Junqi Dai, Zhan, Jun +29 · 39 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling
  4. YuE: Scaling Open Foundation Models for Long-Form Music Generation
    2025/03/11 by Ruibin Yuan, Yuan, Ruibin, Lin, Hanfeng +110 · 23 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computer Graphics and Visualization Techniques #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  5. SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
    2024/01/24 by Dong Zhang, Zhang, Dong, Xin Zhang +9 · 6 citations
    Computer Science · #Speech Recognition and Synthesis #Topic Modeling #Natural Language Processing Techniques
  6. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
    2026/07/26 by Jun Zhan, Chen Yang, Yitian Gong +23
    #cs.SD #cs.CV