Tomoki Toda
- ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech
2020/05/20 by Xin Wang, Junichi Yamagishi, Massimiliano Todisco +43 · 46 citations
Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and Audio Processing
- Generalization Ability of MOS Prediction Networks
2021/10/06 by Erica Cooper, Wen-Chin Huang, Cooper, Erica +5 · 17 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Electrical engineering #Speech Recognition and Synthesis #Speech and Audio Processing #Topic Modeling #electronic engineering #information engineering
- ESPnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to-Speech Toolkit
2019/10/24 by Tomoki Hayashi, Hayashi, Tomoki, Ryuichi Yamamoto +15 · 11 citations
Computer Science · #Speech Recognition and Synthesis #Natural Language Processing Techniques #Music and Audio Processing
- Voice Conversion Challenge 2020: Intra-lingual semi-parallel and cross-lingual voice conversion
2020/08/28 by Yi Zhao, Zhao, Yi, Wen-Chin Huang +13 · 7 citations
Computer Science · Medicine · #Speech Recognition and Synthesis #Topic Modeling #Voice and Speech Disorders
- The Singing Voice Conversion Challenge 2023
2023/06/26 by Wen-Chin Huang, Huang, Wen-Chin, Lester Phillip Violeta +7 · 9 citations
Computer Science · Medicine · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #Voice and Speech Disorders #electronic engineering #information engineering
- The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
2024/09/11 by Wen-Chin Huang, Szu‐Wei Fu, Huang, Wen-Chin +13 · 13 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Any-to-One Sequence-to-Sequence Voice Conversion using Self-Supervised Discrete Speech Representations
2020/10/23 by Wen-Chin Huang, Yi-Chiao Wu, Huang, Wen-Chin +5 · 3 citations
Computer Science · #Speech Recognition and Synthesis #Natural Language Processing Techniques #Music and Audio Processing
- Source-Filter HiFi-GAN: Fast and Pitch Controllable High-Fidelity Neural Vocoder
2022/10/27 by Reo Yoneyama, Yoneyama, Reo, Yi-Chiao Wu +3 · 4 citations
Computer Science · Physics and Astronomy · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Model Reduction and Neural Networks #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- Non-Parallel Voice Conversion with Cyclic Variational Autoencoder
2019/07/24 by Patrick Lumban Tobing, Yi-Chiao Wu, Tobing, Patrick Lumban +7 · 4 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Advanced Data Compression Techniques
- Investigating Self-supervised Pretraining Frameworks for Pathological Speech Recognition
2022/03/29 by Lester Phillip Violeta, Wen-Chin Huang, Violeta, Lester Phillip +3 · 2 citations
Computer Science · Medicine · Psychology · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Phonetics and Phonology Research #Sound (cs.SD) #Speech Recognition and Synthesis #Voice and Speech Disorders #electronic engineering #information engineering
- Improvement of Serial Approach to Anomalous Sound Detection by Incorporating Two Binary Cross-Entropies for Outlier Exposure
2022/06/13 by Ibuki Kuroyanagi, Kuroyanagi, Ibuki, Tomoki Hayashi +5 · 2 citations
Computer Science · #Anomaly Detection Techniques and Applications #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
2024/01/24 by Jiajun He, He, Jiajun, Xiaohan Shi +5 · 4 citations
Computer Science · Psychology · #Speech Recognition and Synthesis #Speech and Audio Processing #Emotion and Mood Recognition
- Improving severity preservation of healthy-to-pathological voice conversion with global style tokens
2023/10/04 by Bence Mark Halpern, Wen-Chin Huang, Halpern, Bence Mark +7 · 3 citations
Computer Science · Health Professions · Medicine · #Audio and Speech Processing (eess.AS) #Dysphagia Assessment and Management #FOS: Computer and information sciences #FOS: Electrical engineering #I.2.7 #Sound (cs.SD) #Speech Recognition and Synthesis #Voice and Speech Disorders #electronic engineering #information engineering
- Audio Difference Learning for Audio Captioning
2023/09/15 by Tatsuya Komatsu, Yusuke Fujita, Komatsu, Tatsuya +5 · 2 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
2024/08/28 by You Zhang, Zhang, You, Yongyi Zang +9 · 3 citations
Computer Science · #Music and Audio Processing #Speech and Audio Processing #Speech Recognition and Synthesis
- Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
2024/09/14 by Takuya Fujimura, Ibuki Kuroyanagi, Fujimura, Takuya +3 · 3 citations
Computer Science · #Anomaly Detection Techniques and Applications #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- ed-cec: improving rare word recognition using asr postprocessing based on error detection and context-aware error correction
2023/10/08 by Jiajun He, Zekun Yang, He, Jiajun +3 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems
- Predictions of Subjective Ratings and Spoofing Assessments of Voice Conversion Challenge 2020 Submissions
2020/09/08 by Rohan Kumar Das, Tomi Kinnunen, Das, Rohan Kumar +13 · 1 citation
Computer Science · Medicine · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Voice and Speech Disorders #electronic engineering #information engineering
- Non-autoregressive sequence-to-sequence voice conversion
2021/04/14 by Tomoki Hayashi, Wen-Chin Huang, Hayashi, Tomoki +5 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Noisy-to-Noisy Voice Conversion Framework with Denoising Model
2021/09/22 by Chao Xie, Yi-Chiao Wu, Xie, Chao +7 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- S3PRL-VC: Open-source Voice Conversion Framework with Self-supervised Speech Representations
2021/10/12 by Wen-Chin Huang, Shuwen Yang, Huang, Wen-Chin +9 · 1 citation
Computer Science · #Speech Recognition and Synthesis #Topic Modeling #Natural Language Processing Techniques
- A Comparative Study of Voice Conversion Models with Large-Scale Speech and Singing Data: The T13 Systems for the Singing Voice Conversion Challenge 2023
2023/10/08 by Ryuichi Yamamoto, Yamamoto, Ryuichi, Reo Yoneyama +7 · 2 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- NNSVS: A Neural Network-Based Singing Voice Synthesis Toolkit
2022/10/28 by Ryuichi Yamamoto, Reo Yoneyama, Yamamoto, Ryuichi +3 · 1 citation
Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Music Technology and Sound Studies
- Pretraining Techniques for Sequence-to-Sequence Voice Conversion
2020/08/07 by Wen-Chin Huang, Tomoki Hayashi, Huang, Wen-Chin +7 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
- Evaluating Methods for Ground-Truth-Free Foreign Accent Conversion
2023/09/05 by Wen-Chin Huang, Huang, Wen-Chin, Tomoki Toda +1 · 1 citation
Computer Science · Medicine · #Speech Recognition and Synthesis #Topic Modeling #Voice and Speech Disorders
- SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
2025/05/21 by Wen-Chin Huang, Erica Cooper, Huang, Wen-Chin +3 · 4 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
2024/05/08 by You Zhang, Zhang, You, Yongyi Zang +13 · 1 citation
Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Speech and Audio Processing
- Multi-speaker Text-to-speech Training with Speaker Anonymized Data
2024/05/20 by Wen-Chin Huang, Huang, Wen-Chin, Yi-Chiao Wu +3 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- Quasi-Periodic WaveNet Vocoder: A Pitch Dependent Dilated Convolution Model for Parametric Speech Generation
2019/07/01 by Yi-Chiao Wu, Tomoki Hayashi, Wu, Yi-Chiao +7 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
2024/09/29 by Jinyi Mi, Mi, Jinyi, Xiaohan Shi +9 · 2 citations
Computer Science · #Speech and Audio Processing #Speech Recognition and Synthesis
- Quantifying the effect of speech pathology on automatic and human speaker verification
2024/06/10 by Bence Mark Halpern, Halpern, Bence Mark, Thomas Tienkamp +17 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #I.2.7 #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #electronic engineering #information engineering
- Pseudo-label distillation for discriminative anomalous sound detection
2026/07/18 by Takuya Fujimura, Tomoki Toda
#eess.AS