Luo, Yingmin
- PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM
2024/06/05 by Yang, Tao, Luo, Yingmin, Qi, Zhongang +3 · 9 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
2025/05/19 by Yicheng Xiao, Xiao, Yicheng, Lin Song +17 · 11 citations
Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Natural Language Processing Techniques
- EA-VTR: Event-Aware Video-Text Retrieval
2024/07/10 by Zongyang Ma, Ziqi Zhang, Ma, Zongyang +19 · 2 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Video Analysis and Summarization