vix.ing · top · new · best · stats · spec

Yuhang Zang

  1. InternLM2 Technical Report
    2024/03/26 by Zheng Cai, Cai, Zheng, Maosong Cao +199 · 2 voices · 77 citations
    Medicine · Computer Science · #Artificial Intelligence in Healthcare and Education #Topic Modeling #Machine Learning in Healthcare
  2. Are We on the Right Way for Evaluating Large Vision-Language Models?
    2024/03/29 by Lin Chen, Jinsong Li, Chen, Lin +19 · 1 voice · 256 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #cs.CV
  3. VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models
    2024/07/16 by Haodong Duan, Duan, Haodong, Xinyu Fang +73 · 163 citations
    Computer Science · #Natural Language Processing Techniques
  4. ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
    2024/06/06 by Lin Chen, Xilin Wei, Chen, Lin +27 · 115 citations
    Arts and Humanities · Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Subtitles and Audiovisual Media #Video Analysis and Summarization
  5. Long-CLIP: Unlocking the Long-Text Capability of CLIP
    2024/03/22 by Beichen Zhang, Pan Zhang, Zhang, Beichen +7 · 93 citations
    Computer Science · #Natural Language Processing Techniques
  6. Alpha-CLIP: A CLIP Model Focusing on Wherever You Want
    2023/12/06 by Zeyi Sun, Ye Fang, Sun, Zeyi +16 · 1 voice · 38 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Handwritten Text Recognition Techniques #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #cs.AI #cs.CL #cs.CV #cs.LG
  7. InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD
    2024/04/09 by Xiaoyi Dong, Dong, Xiaoyi, Pan Zhang +45 · 1 voice · 22 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #cs.CL #cs.CV
  8. PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
    2024/10/22 by Long Xing, Xing, Long, Qidong Huang +19 · 79 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Multimodal Machine Learning Applications
  9. Streaming Long Video Understanding with Large Language Models
    2024/05/25 by Rui Qian, Qian, Rui, Xiaoyi Dong +11 · 47 citations
    Computer Science · Medicine · #COVID-19 diagnosis using AI #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning in Healthcare #Multimodal Machine Learning Applications
  10. MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
    2024/07/01 by Yubo Ma, Yuhang Zang, Ma, Yubo +29 · 47 citations
    Computer Science · #Natural Language Processing Techniques #Topic Modeling #Semantic Web and Ontologies
  11. InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model
    2024/01/29 by Xiaoyi Dong, Pan Zhang, Dong, Xiaoyi +43 · 40 citations
    Arts and Humanities · Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Digital Humanities and Scholarship #FOS: Computer and information sciences #Handwritten Text Recognition Techniques #Image Retrieval and Classification Techniques
  12. InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output
    2024/07/03 by Pan Zhang, Zhang, Pan, Xiaoyi Dong +51 · 35 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques
  13. Contextual Object Detection with Multimodal Large Language Models
    2023/05/29 by Yuhang Zang, Zang, Yuhang, Wei Li +7 · 21 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  14. MVSGaussian: Fast Generalizable Gaussian Splatting Reconstruction from Multi-View Stereo
    2024/05/20 by Tianqi Liu, Guangcong Wang, Liu, Tianqi +15 · 30 citations
    Computer Science · Engineering · #Advanced Vision and Imaging #CCD and CMOS Imaging Sensors #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Infrared Target Detection Methodologies
  15. Unified Vision and Language Prompt Learning
    2022/10/13 by Yuhang Zang, Zang, Yuhang, Wei Li +7 · 16 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Text and Document Classification Technologies
  16. OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
    2025/01/09 by Yifei Li, Li, Yifei, Junbo Niu +26 · 24 citations
    Computer Science · #Video Analysis and Summarization
  17. Contextual Object Detection with Multimodal Large Language Models
    2024/08/20 by Yuhang Zang, Wei Li, Jun Han +2 · 20 citations
    Computer Science · #Domain Adaptation and Few-Shot Learning #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  18. MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
    2024/06/17 by Ziyu Liu, Tao Chu, Liu, Ziyu +19 · 18 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques
  19. Seesaw Loss for Long-Tailed Instance Segmentation
    2020/08/23 by Jiaqi Wang, Wang, Jiaqi, Wenwei Zhang +17 · 7 citations
    Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning and Data Classification
  20. Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
    2025/01/06 by Rui Qian, Qian, Rui, Shuangrui Ding +13 · 22 citations
    Computer Science · Social Sciences · #Computer Vision and Pattern Recognition (cs.CV) #Data Stream Mining Techniques #FOS: Computer and information sciences #Multimedia Communication and Technology #Video Analysis and Summarization
  21. Efficient and Accurate Arbitrary-Shaped Text Detection with Pixel Aggregation Network
    2019/08/16 by Wenhai Wang, Wang, Wenhai, Enze Xie +13 · 6 citations
    Computer Science · Engineering · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Handwritten Text Recognition Techniques #Vehicle License Plate Recognition
  22. VideoRoPE: What Makes for Good Video Rotary Position Embedding?
    2025/02/07 by Xilin Wei, Wei, Xilin, Xiaoran Liu +21 · 27 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Hand Gesture Recognition Systems #Image and Video Stabilization #Video Analysis and Summarization
  23. Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
    2025/05/20 by Jiaer Xia, Yuhang Zang, Xia, Jiaer +7 · 36 citations
    Computer Science · Neuroscience · #Computer Vision and Pattern Recognition (cs.CV) #EEG and Brain-Computer Interfaces #FOS: Computer and information sciences #Neural and Behavioral Psychology Studies #Reinforcement Learning in Robotics
  24. Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
    2025/05/06 by Yibin Wang, Wang, Yibin, Zhimin Li +11 · 30 citations
    Decision Sciences · Neuroscience · Psychology · #Computer Vision and Pattern Recognition (cs.CV) #EEG and Brain-Computer Interfaces #FOS: Computer and information sciences #Innovation Diffusion and Forecasting #Mental Health Research Topics
  25. InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
    2024/12/12 by Pan Zhang, Xiaoyi Dong, Zhang, Pan +53 · 17 citations
    Computer Science · Social Sciences · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia Communication and Technology #Speech and dialogue systems #Video Analysis and Summarization
  26. InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
    2025/01/21 by Yuhang Zang, Xiaoyi Dong, Zang, Yuhang +22 · 18 citations
    Business, Management and Accounting · #Business Process Modeling and Analysis
  27. SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
    2025/02/18 by Zihan Liu, Shuangrui Ding, Liu, Zihan +14 · 15 citations
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Music and Audio Processing #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis
  28. Visual Agentic Reinforcement Fine-Tuning
    2025/05/20 by Ziyu Liu, Yuhang Zang, Liu, Ziyu +11 · 15 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computational Geometry and Mesh Generation #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Visual Attention and Saliency Detection
  29. Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization
    2024/01/29 by Yuhang Zang, Zang, Yuhang, Hanlin Goh +5 · 5 citations
    Computer Science · #Semantic Web and Ontologies
  30. MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
    2024/10/23 by Ziyu Liu, Yuhang Zang, Liu, Ziyu +17 · 8 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Constraint Satisfaction and Optimization #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  31. Bootstrap3D: Improving Multi-view Diffusion Model with Synthetic Data
    2024/05/31 by Zeyi Sun, Sun, Zeyi, Tong Wu +13 · 5 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Human Motion and Animation #Image Processing and 3D Reconstruction #Machine Learning (cs.LG) #Multimedia (cs.MM)
  32. X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
    2024/12/02 by Zeyi Sun, Sun, Zeyi, Pan Zhang +14 · 7 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques
  33. MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
    2025/09/26 by Junbo Niu, Niu, Junbo, Zheng Liu +119 · 1 voice · 15 citations
    #cs.CV #cs.CL
  34. Unified Scene Representation and Reconstruction for 3D Large Language Models
    2024/04/19 by Tao Chu, Pan Zhang, Chu, Tao +9 · 3 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  35. ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
    2025/06/24 by Long Xing, Xing, Long, Qidong Huang +23 · 8 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Video Analysis and Summarization
  36. SIM-CoT: Supervised Implicit Chain-of-Thought
    2025/09/24 by Xilin Wei, Xiaoran Liu, Wei, Xilin +12 · 6 citations
    Physics and Astronomy · #Complex Network Analysis Techniques #Opinion Dynamics and Social Influence
  37. Advancing Complex Video Object Segmentation via Progressive Concept Construction
    2025/07/21 by Zhixiong Zhang, Shuangrui Ding, Zhang, Zhixiong +14 · 10 citations
    Computer Science · #Visual Attention and Saliency Detection #Advanced Neural Network Applications #Multimodal Machine Learning Applications
  38. Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings
    2025/06/05 by Yubo Ma, Jinsong Li, Ma, Yubo +19 · 4 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #FOS: Computer and information sciences #Handwritten Text Recognition Techniques #Information Retrieval (cs.IR) #Information Retrieval and Search Behavior
  39. Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
    2025/10/31 by Yuhong Liu, Beichen Zhang, Liu, Yuhong +15 · 3 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Neural Network Applications
  40. ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
    2024/10/08 by Jiazi Bu, Pengyang Ling, Bu, Jiazi +15 · 2 citations
    Computer Science · #Video Analysis and Summarization
  41. Generative Photographic Control for Scene-Consistent Video Cinematic Editing
    2025/11/17 by Huiqiang Sun, Liao Shen, Sun, Huiqiang +20 · 1 citation
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Video Analysis and Summarization #Visual Attention and Saliency Detection