vix.ing · top · new · best · stats · spec

Ruipu Luo

  1. Valley: Video Assistant with Large Language model Enhanced abilitY
    2023/06/12 by Ruipu Luo, Ziwang Zhao, Luo, Ruipu +12 · 24 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Human Pose and Action Recognition
  2. VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
    2024/05/27 by Zejun Li, Ruipu Luo, Li, Zejun +7 · 15 citations
    Computer Science · #Semantic Web and Ontologies #Natural Language Processing Techniques #Topic Modeling
  3. GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
    2025/06/01 by Yufei Zhan, Zhan, Yufei, Ziheng Wu +23 · 7 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Semantic Web and Ontologies #Speech and dialogue systems
  4. DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
    2024/04/02 by Mengfei Du, Du, Mengfei, Binhao Wu +13 · 1 citation
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning