vix.ing · top · new · best · stats · spec

Xuankai Chang

  1. AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head
    2023/04/25 by Rongjie Huang, Huang, Rongjie, Mingze Li +23 · 1 voice · 46 citations
    Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Topic Modeling
  2. SUPERB: Speech processing Universal PERformance Benchmark
    2021/05/03 by Shu-Wen Yang, Yang, Shu-wen, Po-Han Chi +37 · 68 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  3. CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings
    2020/04/20 by Shinji Watanabe, Michael Mandel, Watanabe, Shinji +39 · 22 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  4. Towards Robust Speech Representation Learning for Thousands of Languages
    2024/06/30 by William Chen, Wangyou Zhang, Chen, William +17 · 15 citations
    Computer Science · #Speech Recognition and Synthesis #Natural Language Processing Techniques #Speech and dialogue systems
  5. Reproducing Whisper-Style Training Using an Open-Source Toolkit and Publicly Available Data
    2023/09/25 by Yifan Peng, Peng, Yifan, Jinchuan Tian +29 · 8 citations
    Computer Science · #Speech Recognition and Synthesis #Topic Modeling #Natural Language Processing Techniques
  6. Muskits: an End-to-End Music Processing Toolkit for Singing Voice Synthesis
    2022/05/09 by Jiatong Shi, Shuai Guo, Shi, Jiatong +21 · 6 citations
    Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Speech and Audio Processing
  7. End-to-End Multi-speaker Speech Recognition with Transformer
    2020/02/10 by Xuankai Chang, Wangyou Zhang, Chang, Xuankai +7 · 3 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  8. Exploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning
    2023/05/29 by Xuankai Chang, Brian Yan, Chang, Xuankai +7 · 4 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #electronic engineering #information engineering
  9. Reducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute
    2023/06/11 by William Chen, Chen, William, Xuankai Chang +9 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  10. The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
    2024/06/11 by Xuankai Chang, Jiatong Shi, Chang, Xuankai +17 · 5 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  11. Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
    2023/09/29 by Shih-Lun Wu, Xuankai Chang, Wu, Shih-Lun +11 · 3 citations
    Computer Science · Arts and Humanities · #Music and Audio Processing #Subtitles and Audiovisual Media #Speech Recognition and Synthesis
  12. Apple Intelligence Foundation Language Models: Tech Report 2025
    2025/07/17 by Ethan Li, Li, Ethan, Anders Larsen +487 · 14 citations
    Computer Science · #Advanced Malware Detection Techniques #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Big Data and Digital Economy #FOS: Computer and information sciences #Machine Learning (cs.LG)
  13. The 2020 ESPnet update: new features, broadened applications, performance improvements, and future plans
    2020/12/23 by Shinji Watanabe, Florian Boyer, Watanabe, Shinji +27 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  14. Streaming End-to-End ASR based on Blockwise Non-Autoregressive Models
    2021/07/20 by Tianzi Wang, Yuya Fujita, Wang, Tianzi +5 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  15. SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
    2024/12/07 by Pengcheng Guo, Xuankai Chang, Guo, Pengcheng +7 · 3 citations
    Computer Science · #Speech Recognition and Synthesis #Speech and dialogue systems
  16. ESPnet-SLU: Advancing Spoken Language Understanding through ESPnet
    2021/11/29 by Siddhant Arora, Arora, Siddhant, Siddharth Dalmia +23 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech and dialogue systems #Topic Modeling #electronic engineering #information engineering
  17. SUPERB @ SLT 2022: Challenge on Generalization and Efficiency of Self-Supervised Speech Representation Learning
    2022/10/16 by Tzu-hsun Feng, Feng, Tzu-hsun, Annie Dong +25 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  18. Findings of the 2023 ML-SUPERB Challenge: Pre-Training and Evaluation over More Languages and Beyond
    2023/10/09 by Jiatong Shi, Shi, Jiatong, William Chen +23 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering