Masaya Kawamura
- PromptTTS++: Controlling Speaker Identity in Prompt-Based Text-to-Speech Using Natural Language Descriptions
2023/09/15 by Reo Shimizu, Shimizu, Reo, Ryuichi Yamamoto +11 · 18 citations
Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Topic Modeling
- LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning
2024/06/12 by Masaya Kawamura, Kawamura, Masaya, Ryuichi Yamamoto +7 · 16 citations
Arts and Humanities · Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Natural Language Processing Techniques #Sound (cs.SD) #Subtitles and Audiovisual Media #Translation Studies and Practices #electronic engineering #information engineering
- Lightweight and High-Fidelity End-to-End Text-to-Speech with Multi-Band Generation and Inverse Short-Time Fourier Transform
2022/10/28 by Masaya Kawamura, Yuma Shirahata, Kawamura, Masaya +5 · 6 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Speech and dialogue systems