vix.ing · top · new · best · stats · spec

Xun Yang

  1. EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
    2025/02/11 by Sheng Zhou, Junbin Xiao, Zhou, Sheng +15 · 18 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Advanced Image and Video Retrieval Techniques
  2. Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding
    2024/03/21 by Jingjing Hu, Hu, Jingjing, Dan Guo +11 · 9 citations
    Computer Science · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Video Analysis and Summarization
  3. NTU4DRadLM: 4D Radar-centric Multi-Modal Dataset for Localization and Mapping
    2023/09/02 by Jun Zhang, Huayang Zhuge, Zhang, Jun +27 · 6 citations
    Computer Science · Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Robotic Path Planning Algorithms #Robotics (cs.RO) #Robotics and Sensor-Based Localization #UAV Applications and Optimization
  4. Enhancing One-Shot Federated Learning Through Data and Ensemble Co-Boosting
    2024/02/23 by Rong Dai, Dai, Rong, Yonggang Zhang +9 · 5 citations
    Computer Science · Neuroscience · #Brain Tumor Detection and Classification #FOS: Computer and information sciences #Machine Learning (cs.LG) #Privacy-Preserving Technologies in Data #Stochastic Gradient Optimization Techniques
  5. GRPose: Learning Graph Relations for Human Image Generation with Pose Priors
    2024/08/29 by Xiangchen Yin, Donglin Di, Yin, Xiangchen +15 · 6 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  6. EgoBlind: Towards Egocentric Visual Assistance for the Blind
    2025/03/11 by Xiao, Junbin, Nanxin Huang, Huang, Nanxin +12 · 8 citations
    Health Professions · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM) #Older Adults Driving Studies
  7. Visual Relation Grounding in Videos
    2020/07/17 by Junbin Xiao, Xindi Shang, Xiao, Junbin +7 · 2 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Advanced Image and Video Retrieval Techniques
  8. Towards Complex-query Referring Image Segmentation: A Novel Benchmark
    2023/09/29 by Wei Ji, Li Li, Ji, Wei +10 · 3 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning
  9. Joint transmit and reflective beamforming for IRS-assisted integrated sensing and communication
    2021/11/26 by Xianxin Song, Ding Zhao, Song, Xianxin +9 · 2 citations
    Engineering · #Advanced Wireless Communication Technologies #FOS: Electrical engineering #Satellite Communication Systems #Signal Processing (eess.SP) #Underwater Vehicles and Communication Systems #electronic engineering #information engineering
  10. Omni-Perception: Omnidirectional Collision Avoidance for Legged Locomotion in Dynamic Environments
    2025/05/25 by Zifan Wang, Teli Ma, Wang, Zifan +12 · 9 citations
    Computer Science · Engineering · #Evacuation and Crowd Dynamics #FOS: Computer and information sciences #Human Motion and Animation #Robotic Path Planning Algorithms #Robotics (cs.RO)
  11. Deep Conversational Recommender in Travel
    2019/06/25 by Lizi Liao, Ryuichi Takanobu, Liao, Lizi +9 · 4 citations
    Computer Science · #Topic Modeling #Speech and dialogue systems #Natural Language Processing Techniques
  12. TrAME: Trajectory-Anchored Multi-View Editing for Text-Guided 3D Gaussian Splatting Manipulation
    2024/07/02 by Chaofan Luo, Luo, Chaofan, Donglin Di +11 · 3 citations
    Computer Science · Engineering · #Image Processing and 3D Reconstruction #Additive Manufacturing and 3D Printing Technologies
  13. Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning
    2025/08/14 by Chongyuan Dai, Jinpeng Hu, Dai, Chongyuan +10 · 7 citations
    #cs.CL
  14. Repetitive Action Counting with Hybrid Temporal Relation Modeling
    2024/12/10 by Kun Li, Xinge Peng, Li, Kun +7 · 4 citations
    Computer Science · Engineering · #Human Pose and Action Recognition #Anomaly Detection Techniques and Applications #Human Motion and Animation
  15. Person Re-identification with Metric Learning using Privileged Information
    2019/04/10 by Xun Yang, Yang, Xun, Meng Wang +3 · 1 citation
    Computer Science · Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Gait Recognition and Analysis #Human Pose and Action Recognition #Video Surveillance and Tracking Methods
  16. AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
    2025/01/16 by Xinyi Wang, Na Zhao, Wang, Xinyi +7 · 3 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Advanced Image and Video Retrieval Techniques
  17. Efficient Cross-Modal Video Retrieval with Meta-Optimized Frames
    2022/10/16 by Ning Han, Xun Yang, Han, Ning +7 · 1 citation
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Video Analysis and Summarization
  18. Scene-Text Grounding for Text-Based Video Question Answering
    2024/09/22 by Sheng Zhou, Zhou, Sheng, Junbin Xiao +13 · 2 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Video Analysis and Summarization
  19. Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
    2025/09/01 by Long Zhang, Zhang, Long, Peipei Song +7 · 2 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Video Analysis and Summarization
  20. AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
    2025/11/13 by Xinyi Wang, Wang, Xinyi, Xun Yang +9 · 1 citation
    Computer Science · Engineering · #Multimodal Machine Learning Applications #Robot Manipulation and Learning #Human Motion and Animation
  21. MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos
    2026/07/30 by Jinpeng Hu, Erqiang Wang, Shan Wang +4
    Computer Science · #cs.AI #cs.CV
  22. MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving
    2026/07/26 by Zhijing Cheng, Xuancheng Zhang, Donglin Di +4
    #cs.CV