vix.ing · top · new · best · stats · spec

Rajabi, Navid

  1. Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
    2023/08/18 by Navid Rajabi, Jana Košecká, Rajabi, Navid +1 · 5 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Natural Language Processing Techniques
  2. GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
    2024/06/19 by Rajabi, Navid, Kosecka, Jana · 6 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  3. Q-GroundCAM: Quantifying Grounding in Vision Language Models via GradCAM
    2024/04/29 by Navid Rajabi, Rajabi, Navid, Jana Košecká +1 · 1 citation
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques
  4. TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation
    2025/02/11 by Rajabi, Navid, Kosecka, Jana · 1 citation
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Robotics (cs.RO)