Xuankai Chang
- AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head
2023/04/25 by Rongjie Huang, Huang, Rongjie, Mingze Li +23 · 1 voice · 46 citations
Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Topic Modeling
- SUPERB: Speech processing Universal PERformance Benchmark
2021/05/03 by Shu-Wen Yang, Yang, Shu-wen, Po-Han Chi +37 · 68 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
- CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings
2020/04/20 by Shinji Watanabe, Michael Mandel, Watanabe, Shinji +39 · 22 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Towards Robust Speech Representation Learning for Thousands of Languages
2024/06/30 by William Chen, Wangyou Zhang, Chen, William +17 · 15 citations
Computer Science · #Speech Recognition and Synthesis #Natural Language Processing Techniques #Speech and dialogue systems
- Reproducing Whisper-Style Training Using an Open-Source Toolkit and Publicly Available Data
2023/09/25 by Yifan Peng, Peng, Yifan, Jinchuan Tian +29 · 8 citations
Computer Science · #Speech Recognition and Synthesis #Topic Modeling #Natural Language Processing Techniques
- Muskits: an End-to-End Music Processing Toolkit for Singing Voice Synthesis
2022/05/09 by Jiatong Shi, Shuai Guo, Shi, Jiatong +21 · 6 citations
Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Speech and Audio Processing
- End-to-End Multi-speaker Speech Recognition with Transformer
2020/02/10 by Xuankai Chang, Wangyou Zhang, Chang, Xuankai +7 · 3 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Exploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning
2023/05/29 by Xuankai Chang, Brian Yan, Chang, Xuankai +7 · 4 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #electronic engineering #information engineering
- Reducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute
2023/06/11 by William Chen, Chen, William, Xuankai Chang +9 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
- The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
2024/06/11 by Xuankai Chang, Jiatong Shi, Chang, Xuankai +17 · 5 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
2023/09/29 by Shih-Lun Wu, Xuankai Chang, Wu, Shih-Lun +11 · 3 citations
Computer Science · Arts and Humanities · #Music and Audio Processing #Subtitles and Audiovisual Media #Speech Recognition and Synthesis
- Apple Intelligence Foundation Language Models: Tech Report 2025
2025/07/17 by Ethan Li, Li, Ethan, Anders Larsen +487 · 14 citations
Computer Science · #Advanced Malware Detection Techniques #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Big Data and Digital Economy #FOS: Computer and information sciences #Machine Learning (cs.LG)
- The 2020 ESPnet update: new features, broadened applications, performance improvements, and future plans
2020/12/23 by Shinji Watanabe, Florian Boyer, Watanabe, Shinji +27 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Streaming End-to-End ASR based on Blockwise Non-Autoregressive Models
2021/07/20 by Tianzi Wang, Yuya Fujita, Wang, Tianzi +5 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
2024/12/07 by Pengcheng Guo, Xuankai Chang, Guo, Pengcheng +7 · 3 citations
Computer Science · #Speech Recognition and Synthesis #Speech and dialogue systems
- ESPnet-SLU: Advancing Spoken Language Understanding through ESPnet
2021/11/29 by Siddhant Arora, Arora, Siddhant, Siddharth Dalmia +23 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech and dialogue systems #Topic Modeling #electronic engineering #information engineering
- SUPERB @ SLT 2022: Challenge on Generalization and Efficiency of Self-Supervised Speech Representation Learning
2022/10/16 by Tzu-hsun Feng, Feng, Tzu-hsun, Annie Dong +25 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- Findings of the 2023 ML-SUPERB Challenge: Pre-Training and Evaluation over More Languages and Beyond
2023/10/09 by Jiatong Shi, Shi, Jiatong, William Chen +23 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering