vix.ing · top · new · best · stats · spec

Xiao, Junbin

  1. NExT-QA:Next Phase of Question-Answering to Explaining Temporal Actions
    2021/05/18 by Junbin Xiao, Xiao, Junbin, Xindi Shang +5 · 123 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Domain Adaptation and Few-Shot Learning
  2. Can I Trust Your Answer? Visually Grounded Video Question Answering
    2023/09/04 by Junbin Xiao, Xiao, Junbin, Angela Yao +5 · 32 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning
  3. Video Question Answering: Datasets, Algorithms and Challenges
    2022/03/02 by Zhong, Yaoyao, Xiao, Junbin, Ji, Wei +3 · 10 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  4. Abductive Ego-View Accident Video Understanding for Safe Driving Perception
    2024/03/01 by Jianwu Fang, Leilei Li, Fang, Jianwu +13 · 11 citations
    Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Autonomous Vehicle Technology and Safety #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Video Surveillance and Tracking Methods
  5. FakeSV: A Multimodal Benchmark with Rich Social Context for Fake News Detection on Short Video Platforms
    2022/11/20 by Peng Qi, Yuyan Bu, Qi, Peng +13 · 8 citations
    Computer Science · Social Sciences · #FOS: Computer and information sciences #Misinformation and Its Impacts #Multimedia (cs.MM) #Spam and Phishing Detection
  6. EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
    2025/02/11 by Sheng Zhou, Zhou, Sheng, Junbin Xiao +15 · 18 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Advanced Image and Video Retrieval Techniques
  7. Video as Conditional Graph Hierarchy for Multi-Granular Question Answering
    2021/12/12 by Junbin Xiao, Angela Yao, Xiao, Junbin +9 · 4 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimedia (cs.MM) #Multimodal Machine Learning Applications
  8. Video Graph Transformer for Video Question Answering
    2022/07/12 by Xiao, Junbin, Zhou, Pan, Chua, Tat-Seng +1 · 4 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  9. Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives
    2024/06/09 by Thông Nguyen, Bin Yi, Nguyen, Thong +15 · 7 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques
  10. Visual Relation Grounding in Videos
    2020/07/17 by Junbin Xiao, Xindi Shang, Xiao, Junbin +7 · 2 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Advanced Image and Video Retrieval Techniques
  11. EgoBlind: Towards Egocentric Visual Assistance for the Blind
    2025/03/11 by Nanxin Huang, Xiao, Junbin, Hao Qiu +12 · 7 citations
    Health Professions · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM) #Older Adults Driving Studies
  12. VideoQA in the Era of LLMs: An Empirical Study
    2024/08/08 by Xiao, Junbin, Nanxin Huang, Huang, Nanxin +18 · 4 citations
    Computer Science · #Digital Rights Management and Security
  13. Contrastive Video Question Answering via Video Graph Transformer
    2023/02/27 by Junbin Xiao, Xiao, Junbin, Pan Zhou +11 · 2 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimedia (cs.MM) #Multimodal Machine Learning Applications
  14. Discovering Spatio-Temporal Rationales for Video Question Answering
    2023/07/22 by Yicong Li, Junbin Xiao, Li, Yicong +7 · 1 citation
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  15. Scene-Text Grounding for Text-Based Video Question Answering
    2024/09/22 by Sheng Zhou, Junbin Xiao, Zhou, Sheng +13 · 2 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Video Analysis and Summarization
  16. Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework
    2024/08/21 by Yunpu Zhao, Rui Zhang, Zhao, Yunpu +10 · 1 citation
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  17. Visual Intention Grounding for Egocentric Assistants
    2025/04/18 by Sun, Pengzhan, Xiao, Junbin, Tse, Tze Ho Elden +3 · 2 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  18. On the Consistency of Video Large Language Models in Temporal Comprehension
    2024/11/20 by Minjoon Jung, Junbin Xiao, Jung, Minjoon +5 · 2 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Topic Modeling
  19. MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
    2025/06/22 by Dang, Jisheng, Song, Huilin, Xiao, Junbin +6 · 2 citations
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  20. EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
    2025/10/30 by Jung, Minjoon, Xiao, Junbin, Kim, Junghyun +2 · 2 citations
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences