vix.ing · top · new · best · stats · spec

Tomoki Toda

  1. ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech
    2020/05/20 by Xin Wang, Junichi Yamagishi, Massimiliano Todisco +43 · 46 citations
    Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and Audio Processing
  2. Generalization Ability of MOS Prediction Networks
    2021/10/06 by Erica Cooper, Wen-Chin Huang, Cooper, Erica +5 · 17 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Electrical engineering #Speech Recognition and Synthesis #Speech and Audio Processing #Topic Modeling #electronic engineering #information engineering
  3. ESPnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to-Speech Toolkit
    2019/10/24 by Tomoki Hayashi, Hayashi, Tomoki, Ryuichi Yamamoto +15 · 11 citations
    Computer Science · #Speech Recognition and Synthesis #Natural Language Processing Techniques #Music and Audio Processing
  4. Voice Conversion Challenge 2020: Intra-lingual semi-parallel and cross-lingual voice conversion
    2020/08/28 by Yi Zhao, Zhao, Yi, Wen-Chin Huang +13 · 7 citations
    Computer Science · Medicine · #Speech Recognition and Synthesis #Topic Modeling #Voice and Speech Disorders
  5. The Singing Voice Conversion Challenge 2023
    2023/06/26 by Wen-Chin Huang, Huang, Wen-Chin, Lester Phillip Violeta +7 · 9 citations
    Computer Science · Medicine · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #Voice and Speech Disorders #electronic engineering #information engineering
  6. The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
    2024/09/11 by Wen-Chin Huang, Szu‐Wei Fu, Huang, Wen-Chin +13 · 13 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  7. Any-to-One Sequence-to-Sequence Voice Conversion using Self-Supervised Discrete Speech Representations
    2020/10/23 by Wen-Chin Huang, Yi-Chiao Wu, Huang, Wen-Chin +5 · 3 citations
    Computer Science · #Speech Recognition and Synthesis #Natural Language Processing Techniques #Music and Audio Processing
  8. Source-Filter HiFi-GAN: Fast and Pitch Controllable High-Fidelity Neural Vocoder
    2022/10/27 by Reo Yoneyama, Yoneyama, Reo, Yi-Chiao Wu +3 · 4 citations
    Computer Science · Physics and Astronomy · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Model Reduction and Neural Networks #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  9. Non-Parallel Voice Conversion with Cyclic Variational Autoencoder
    2019/07/24 by Patrick Lumban Tobing, Yi-Chiao Wu, Tobing, Patrick Lumban +7 · 4 citations
    Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Advanced Data Compression Techniques
  10. Investigating Self-supervised Pretraining Frameworks for Pathological Speech Recognition
    2022/03/29 by Lester Phillip Violeta, Wen-Chin Huang, Violeta, Lester Phillip +3 · 2 citations
    Computer Science · Medicine · Psychology · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Phonetics and Phonology Research #Sound (cs.SD) #Speech Recognition and Synthesis #Voice and Speech Disorders #electronic engineering #information engineering
  11. Improvement of Serial Approach to Anomalous Sound Detection by Incorporating Two Binary Cross-Entropies for Outlier Exposure
    2022/06/13 by Ibuki Kuroyanagi, Kuroyanagi, Ibuki, Tomoki Hayashi +5 · 2 citations
    Computer Science · #Anomaly Detection Techniques and Applications #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  12. MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
    2024/01/24 by Jiajun He, He, Jiajun, Xiaohan Shi +5 · 4 citations
    Computer Science · Psychology · #Speech Recognition and Synthesis #Speech and Audio Processing #Emotion and Mood Recognition
  13. Improving severity preservation of healthy-to-pathological voice conversion with global style tokens
    2023/10/04 by Bence Mark Halpern, Wen-Chin Huang, Halpern, Bence Mark +7 · 3 citations
    Computer Science · Health Professions · Medicine · #Audio and Speech Processing (eess.AS) #Dysphagia Assessment and Management #FOS: Computer and information sciences #FOS: Electrical engineering #I.2.7 #Sound (cs.SD) #Speech Recognition and Synthesis #Voice and Speech Disorders #electronic engineering #information engineering
  14. Audio Difference Learning for Audio Captioning
    2023/09/15 by Tatsuya Komatsu, Yusuke Fujita, Komatsu, Tatsuya +5 · 2 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  15. SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
    2024/08/28 by You Zhang, Zhang, You, Yongyi Zang +9 · 3 citations
    Computer Science · #Music and Audio Processing #Speech and Audio Processing #Speech Recognition and Synthesis
  16. Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
    2024/09/14 by Takuya Fujimura, Ibuki Kuroyanagi, Fujimura, Takuya +3 · 3 citations
    Computer Science · #Anomaly Detection Techniques and Applications #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  17. ed-cec: improving rare word recognition using asr postprocessing based on error detection and context-aware error correction
    2023/10/08 by Jiajun He, Zekun Yang, He, Jiajun +3 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems
  18. Predictions of Subjective Ratings and Spoofing Assessments of Voice Conversion Challenge 2020 Submissions
    2020/09/08 by Rohan Kumar Das, Tomi Kinnunen, Das, Rohan Kumar +13 · 1 citation
    Computer Science · Medicine · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Voice and Speech Disorders #electronic engineering #information engineering
  19. Non-autoregressive sequence-to-sequence voice conversion
    2021/04/14 by Tomoki Hayashi, Wen-Chin Huang, Hayashi, Tomoki +5 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  20. Noisy-to-Noisy Voice Conversion Framework with Denoising Model
    2021/09/22 by Chao Xie, Yi-Chiao Wu, Xie, Chao +7 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  21. S3PRL-VC: Open-source Voice Conversion Framework with Self-supervised Speech Representations
    2021/10/12 by Wen-Chin Huang, Shuwen Yang, Huang, Wen-Chin +9 · 1 citation
    Computer Science · #Speech Recognition and Synthesis #Topic Modeling #Natural Language Processing Techniques
  22. A Comparative Study of Voice Conversion Models with Large-Scale Speech and Singing Data: The T13 Systems for the Singing Voice Conversion Challenge 2023
    2023/10/08 by Ryuichi Yamamoto, Yamamoto, Ryuichi, Reo Yoneyama +7 · 2 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  23. NNSVS: A Neural Network-Based Singing Voice Synthesis Toolkit
    2022/10/28 by Ryuichi Yamamoto, Reo Yoneyama, Yamamoto, Ryuichi +3 · 1 citation
    Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Music Technology and Sound Studies
  24. Pretraining Techniques for Sequence-to-Sequence Voice Conversion
    2020/08/07 by Wen-Chin Huang, Tomoki Hayashi, Huang, Wen-Chin +7 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  25. Evaluating Methods for Ground-Truth-Free Foreign Accent Conversion
    2023/09/05 by Wen-Chin Huang, Huang, Wen-Chin, Tomoki Toda +1 · 1 citation
    Computer Science · Medicine · #Speech Recognition and Synthesis #Topic Modeling #Voice and Speech Disorders
  26. SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
    2025/05/21 by Wen-Chin Huang, Erica Cooper, Huang, Wen-Chin +3 · 4 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  27. SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
    2024/05/08 by You Zhang, Zhang, You, Yongyi Zang +13 · 1 citation
    Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Speech and Audio Processing
  28. Multi-speaker Text-to-speech Training with Speaker Anonymized Data
    2024/05/20 by Wen-Chin Huang, Huang, Wen-Chin, Yi-Chiao Wu +3 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  29. Quasi-Periodic WaveNet Vocoder: A Pitch Dependent Dilated Convolution Model for Parametric Speech Generation
    2019/07/01 by Yi-Chiao Wu, Tomoki Hayashi, Wu, Yi-Chiao +7 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  30. Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
    2024/09/29 by Jinyi Mi, Mi, Jinyi, Xiaohan Shi +9 · 2 citations
    Computer Science · #Speech and Audio Processing #Speech Recognition and Synthesis
  31. Quantifying the effect of speech pathology on automatic and human speaker verification
    2024/06/10 by Bence Mark Halpern, Halpern, Bence Mark, Thomas Tienkamp +17 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #I.2.7 #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #electronic engineering #information engineering
  32. Pseudo-label distillation for discriminative anomalous sound detection
    2026/07/18 by Takuya Fujimura, Tomoki Toda
    #eess.AS