vix.ing · top · new · best · stats · spec

Shimada, Daiki

  1. Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
    2024/03/24 by Tang, Yolo Yunlong, Shimada, Daiki, Bi, Jing +3 · 11 citations
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  2. Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
    2025/04/07 by Yunlong Tang, Tang, Yunlong, Jing Bi +33 · 4 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications #Video Analysis and Summarization
  3. Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
    2025/02/17 by Zhang, Zeliang, Liang, Susan, Shimada, Daiki +1 · 1 citation
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Sound (cs.SD)
  4. Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
    2025/10/06 by Tang, Yolo Y., Bi, Jing, Liu, Pinxin +24 · 6 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  5. Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
    2025/11/21 by Tang, Yolo Y., Shimada, Daiki, Hua, Hang +4 · 1 citation
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences