vix.ing · top · new · best · stats · spec

Xiaoyi Dong

  1. InternLM2 Technical Report
    2024/03/26 by Zheng Cai, Cai, Zheng, Maosong Cao +199 · 2 voices · 60 citations
    Medicine · Computer Science · #Artificial Intelligence in Healthcare and Education #Topic Modeling #Machine Learning in Healthcare
  2. Are We on the Right Way for Evaluating Large Vision-Language Models?
    2024/03/29 by Lin Chen, Chen, Lin, Jinsong Li +19 · 1 voice · 204 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #cs.CV
  3. ShareGPT4V: Improving Large Multi-Modal Models with Better Captions
    2023/11/21 by Lin Chen, Jisong Li, Chen, Lin +14 · 1 voice · 135 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning #Multimodal Machine Learning Applications #cs.CV
  4. How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
    2024/04/25 by Zhe Chen, Chen, Zhe, Weiyun Wang +59 · 177 citations
    Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Reservoir Engineering and Simulation Methods
  5. VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models
    2024/07/16 by Haodong Duan, Duan, Haodong, Xinyu Fang +73 · 131 citations
    Computer Science · #Natural Language Processing Techniques
  6. OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation
    2023/11/29 by Qidong Huang, Huang, Qidong, Xiaoyi Dong +15 · 90 citations
    Computer Science · #Advanced Graph Neural Networks #Big Data and Digital Economy #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning in Healthcare
  7. Long-CLIP: Unlocking the Long-Text Capability of CLIP
    2024/03/22 by Beichen Zhang, Pan Zhang, Zhang, Beichen +7 · 82 citations
    Computer Science · #Natural Language Processing Techniques
  8. ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
    2024/06/06 by Lin Chen, Xilin Wei, Chen, Lin +27 · 90 citations
    Arts and Humanities · Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Subtitles and Audiovisual Media #Video Analysis and Summarization
  9. CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows
    2021/07/01 by Xiaoyi Dong, Jianmin Bao, Dong, Xiaoyi +13 · 38 citations
    Computer Science · Engineering · #Advanced Memory and Neural Computing #Advanced Neural Network Applications #CCD and CMOS Imaging Sensors #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  10. PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
    2024/10/22 by Long Xing, Qidong Huang, Xing, Long +19 · 70 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Multimodal Machine Learning Applications
  11. InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD
    2024/04/09 by Xiaoyi Dong, Dong, Xiaoyi, Pan Zhang +45 · 1 voice · 18 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #cs.CL #cs.CV
  12. Open-Sora Plan: Open-Source Large Video Generation Model
    2024/11/28 by Bin Lin, Yunyang Ge, Lin, Bin +44 · 68 citations
    Mathematics · Computer Science · #Mathematical Biology Tumor Growth #Distributed and Parallel Computing Systems #Video Analysis and Summarization
  13. Streaming Long Video Understanding with Large Language Models
    2024/05/25 by Rui Qian, Xiaoyi Dong, Qian, Rui +11 · 39 citations
    Computer Science · Medicine · #COVID-19 diagnosis using AI #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning in Healthcare #Multimodal Machine Learning Applications
  14. CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows
    2022/06/01 by Xiaoyi Dong, Jianmin Bao, Dongdong Chen +5 · 26 citations
    Engineering · #Advanced Memory and Neural Computing #CCD and CMOS Imaging Sensors #Infrared Target Detection Methodologies
  15. Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization
    2023/11/28 by Zhiyuan Zhao, Bin Wang, Zhao, Zhiyuan +9 · 31 citations
    Computer Science · #Advanced Text Analysis Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Sentiment Analysis and Opinion Mining #Topic Modeling
  16. MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
    2024/07/01 by Yubo Ma, Ma, Yubo, Yuhang Zang +29 · 36 citations
    Computer Science · #Natural Language Processing Techniques #Topic Modeling #Semantic Web and Ontologies
  17. MaskCLIP: Masked Self-Distillation Advances Contrastive Language-Image Pretraining
    2022/08/25 by Xiaoyi Dong, Jianmin Bao, Dong, Xiaoyi +21 · 21 citations
    Computer Science · Medicine · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #COVID-19 diagnosis using AI
  18. InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output
    2024/07/03 by Pan Zhang, Xiaoyi Dong, Zhang, Pan +51 · 27 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques
  19. PeCo: Perceptual Codebook for BERT Pre-training of Vision Transformers
    2021/11/24 by Xiaoyi Dong, Jianmin Bao, Dong, Xiaoyi +16 · 11 citations
    Computer Science · #Advanced Neural Network Applications #Visual Attention and Saliency Detection #Domain Adaptation and Few-Shot Learning
  20. OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
    2025/01/09 by Yifei Li, Li, Yifei, Junbo Niu +26 · 21 citations
    Computer Science · #Video Analysis and Summarization
  21. Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
    2025/01/06 by Rui Qian, Qian, Rui, Shuangrui Ding +13 · 19 citations
    Computer Science · Social Sciences · #Computer Vision and Pattern Recognition (cs.CV) #Data Stream Mining Techniques #FOS: Computer and information sciences #Multimedia Communication and Technology #Video Analysis and Summarization
  22. Protecting Celebrities from DeepFake with Identity Consistency Transformer
    2022/03/02 by Xiaoyi Dong, Jianmin Bao, Dong, Xiaoyi +15 · 7 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Digital Media Forensic Detection #FOS: Computer and information sciences #Face recognition and analysis #Generative Adversarial Networks and Image Synthesis
  23. MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
    2024/06/17 by Ziyu Liu, Liu, Ziyu, Tao Chu +19 · 13 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques
  24. VideoRoPE: What Makes for Good Video Rotary Position Embedding?
    2025/02/07 by Xilin Wei, Xiaoran Liu, Wei, Xilin +21 · 20 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Hand Gesture Recognition Systems #Image and Video Stabilization #Video Analysis and Summarization
  25. Shape-invariant 3D Adversarial Point Clouds
    2022/03/08 by Qidong Huang, Xiaoyi Dong, Huang, Qidong +9 · 6 citations
    Computer Science · Engineering · Materials Science · #Adversarial Robustness in Machine Learning #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #High-Velocity Impact and Material Behavior #Integrated Circuits and Semiconductor Failure Analysis
  26. InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
    2025/01/21 by Yuhang Zang, Xiaoyi Dong, Zang, Yuhang +22 · 16 citations
    Business, Management and Accounting · #Business Process Modeling and Analysis
  27. InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
    2024/12/12 by Pan Zhang, Xiaoyi Dong, Zhang, Pan +53 · 14 citations
    Computer Science · Social Sciences · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia Communication and Technology #Speech and dialogue systems #Video Analysis and Summarization
  28. SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
    2025/02/18 by Zihan Liu, Liu, Zihan, Shuangrui Ding +14 · 13 citations
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Music and Audio Processing #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis
  29. LG-GAN: Label Guided Adversarial Network for Flexible Targeted Attack of Point Cloud-based Deep Networks
    2020/11/01 by Hang Zhou, Dongdong Chen, Zhou, Hang +15 · 3 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences
  30. Visual Agentic Reinforcement Fine-Tuning
    2025/05/20 by Ziyu Liu, Liu, Ziyu, Yuhang Zang +11 · 15 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computational Geometry and Mesh Generation #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Visual Attention and Saliency Detection
  31. Diversity-Aware Meta Visual Prompting
    2023/03/14 by Qidong Huang, Xiaoyi Dong, Huang, Qidong +11 · 4 citations
    Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  32. SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition
    2024/02/27 by Shuangrui Ding, Ding, Shuangrui, Zihan Liu +14 · 5 citations
    Computer Science · #Music and Audio Processing
  33. HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
    2025/04/08 by Jiazi Bu, Peng Ling, Bu, Jiazi +16 · 9 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · Physics and Astronomy · #Cell Image Analysis Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Model Reduction and Neural Networks
  34. Bootstrap3D: Improving Multi-view Diffusion Model with Synthetic Data
    2024/05/31 by Zeyi Sun, Tong Wu, Sun, Zeyi +13 · 5 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Human Motion and Animation #Image Processing and 3D Reconstruction #Machine Learning (cs.LG) #Multimedia (cs.MM)
  35. MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
    2025/09/26 by Junbo Niu, Zheng Liu, Niu, Junbo +119 · 1 voice · 15 citations
    #cs.CV #cs.CL
  36. X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
    2024/12/02 by Zeyi Sun, Sun, Zeyi, Chu, Ziyang +14 · 5 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques
  37. MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
    2024/10/23 by Ziyu Liu, Liu, Ziyu, Yuhang Zang +17 · 4 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Constraint Satisfaction and Optimization #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  38. Maximum Entropy Reinforcement Learning with Diffusion Policy
    2025/02/17 by Xiaoyi Dong, Jian Cheng, Dong, Xiaoyi +3 · 4 citations
    Computer Science · #Adaptive Dynamic Programming Control #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  39. Unified Scene Representation and Reconstruction for 3D Large Language Models
    2024/04/19 by Tao Chu, Chu, Tao, Pan Zhang +9 · 2 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  40. ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
    2025/06/24 by Long Xing, Qidong Huang, Xing, Long +23 · 8 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Video Analysis and Summarization
  41. SIM-CoT: Supervised Implicit Chain-of-Thought
    2025/09/24 by Xilin Wei, Xiaoran Liu, Wei, Xilin +12 · 6 citations
    Physics and Astronomy · #Complex Network Analysis Techniques #Opinion Dynamics and Social Influence
  42. Advancing Complex Video Object Segmentation via Progressive Concept Construction
    2025/07/21 by Zhixiong Zhang, Zhang, Zhixiong, Shuangrui Ding +14 · 10 citations
    Computer Science · #Visual Attention and Saliency Detection #Advanced Neural Network Applications #Multimodal Machine Learning Applications
  43. PointCAT: Contrastive Adversarial Training for Robust Point Cloud Recognition
    2022/09/16 by Qidong Huang, Xiaoyi Dong, Huang, Qidong +13 · 1 citation
    Computer Science · Earth and Planetary Sciences · Materials Science · #3D Surveying and Cultural Heritage #Adversarial Robustness in Machine Learning #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #High-Velocity Impact and Material Behavior
  44. Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings
    2025/06/05 by Yubo Ma, Ma, Yubo, Jinsong Li +19 · 4 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #FOS: Computer and information sciences #Handwritten Text Recognition Techniques #Information Retrieval (cs.IR) #Information Retrieval and Search Behavior
  45. Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
    2025/10/31 by Yuhong Liu, Liu, Yuhong, Beichen Zhang +15 · 3 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Neural Network Applications
  46. PersonMAE: Person Re-Identification Pre-Training with Masked AutoEncoders
    2023/11/08 by Hezhen Hu, Hu, Hezhen, Xiaoyi Dong +11 · 1 citation
    Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Video Surveillance and Tracking Methods
  47. ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
    2024/10/08 by Jiazi Bu, Pengyang Ling, Bu, Jiazi +15 · 1 citation
    Computer Science · #Video Analysis and Summarization
  48. HydroAgent: Formalizing Forecaster Expertise into Skill-Orchestrated Flood Forecasting Workflows
    2026/07/27 by Qingyi Yang, Siqian Qiu, Bing Li +20
    #physics.geo-ph #cs.LG