vix.ing · top · new · best · stats · spec

Komatsu, Tatsuya

  1. Universal Score-based Speech Enhancement with High Content Preservation
    2024/06/18 by Robin Scheibler, Yusuke Fujita, Scheibler, Robin +5 · 9 citations
    Computer Science · Engineering · #Speech and Audio Processing #Advanced Data Compression Techniques #Advanced Adaptive Filtering Techniques
  2. Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions
    2021/04/06 by Nozaki, Jumon, Komatsu, Tatsuya · 4 citations
    #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  3. PromptTTS++: Controlling Speaker Identity in Prompt-Based Text-to-Speech Using Natural Language Descriptions
    2023/09/15 by Reo Shimizu, Ryuichi Yamamoto, Shimizu, Reo +11 · 5 citations
    Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Topic Modeling
  4. A Comparative Study on Non-Autoregressive Modelings for Speech-to-Text Generation
    2021/10/11 by Higuchi, Yosuke, Chen, Nanxin, Fujita, Yuya +6 · 2 citations
    #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  5. Audio Difference Learning for Audio Captioning
    2023/09/15 by Tatsuya Komatsu, Komatsu, Tatsuya, Yusuke Fujita +5 · 2 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  6. Neural Diarization with Non-autoregressive Intermediate Attractors
    2023/03/13 by Fujita, Yusuke, Komatsu, Tatsuya, Scheibler, Robin +2 · 1 citation
    #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  7. Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
    2024/08/06 by Nishimura, Taichi, Nakada, Shota, Munakata, Hokuto +1 · 2 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM)
  8. Keep Decoding Parallel with Effective Knowledge Distillation from Language Models to End-to-end Speech Recognisers
    2024/01/22 by Hentschel, Michael, Nishikawa, Yuta, Komatsu, Tatsuya +1 · 1 citation
    #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  9. DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
    2024/09/18 by Shota Nakada, Taichi Nishimura, Nakada, Shota +7 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering