Shimada, Daiki
- Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
2024/03/24 by Tang, Yolo Yunlong, Shimada, Daiki, Bi, Jing +3 · 11 citations
#Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
2025/04/07 by Yunlong Tang, Tang, Yunlong, Jing Bi +33 · 4 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications #Video Analysis and Summarization
- Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
2025/02/17 by Zhang, Zeliang, Liang, Susan, Shimada, Daiki +1 · 1 citation
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Sound (cs.SD)
- Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
2025/10/06 by Tang, Yolo Y., Bi, Jing, Liu, Pinxin +24 · 6 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
2025/11/21 by Tang, Yolo Y., Shimada, Daiki, Hua, Hang +4 · 1 citation
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences