vix.ing · top · new · best · stats · spec

Nakada, Shota

  1. Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
    2023/12/01 by Taichi Nishimura, Shota Nakada, Nishimura, Taichi +3 · 4 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Image Retrieval and Classification Techniques
  2. On the Audio Hallucinations in Large Audio-Video Language Models
    2024/01/18 by Nishimura, Taichi, Nakada, Shota, Kondo, Masayoshi · 4 citations
    #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Sound (cs.SD) #electronic engineering #information engineering
  3. Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
    2024/08/06 by Nishimura, Taichi, Nakada, Shota, Munakata, Hokuto +1 · 2 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM)
  4. DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
    2024/09/18 by Shota Nakada, Nakada, Shota, Taichi Nishimura +7 · 2 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering