vix.ing · top · new · best · stats · spec

Renrui Zhang

  1. LLaVA-OneVision: Easy Visual Task Transfer
    2024/08/06 by Bo Li, Yuanhan Zhang, Li, Bo +18 · 595 citations
    Computer Science · Engineering · #Gaze Tracking and Assistive Technology #Teleoperation and Haptic Systems
  2. Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
    2024/05/31 by Chaoyou Fu, Yuhan Dai, Fu, Chaoyou +35 · 316 citations
    Computer Science · Medicine · #AI in cancer detection #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Radiomics and Machine Learning in Medical Imaging
  3. CLIP-Adapter: Better Vision-Language Models with Feature Adapters
    2021/10/09 by Peng Gao, Gao, Peng, Shijie Geng +13 · 129 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Image and Video Retrieval Techniques
  4. CLIP-Adapter: Better Vision-Language Models with Feature Adapters
    2023/09/15 by Peng Gao, Shijie Geng, Renrui Zhang +5 · 107 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning #Multimodal Machine Learning Applications
  5. LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
    2024/07/10 by Feng Li, Li, Feng, Renrui Zhang +13 · 120 citations
    Computer Science · Engineering · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Motion and Animation #Machine Learning (cs.LG) #Simulation and Modeling Applications #Video Analysis and Summarization
  6. LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
    2023/03/28 by Renrui Zhang, Zhang, Renrui, Jiaming Han +16 · 66 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimedia (cs.MM) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  7. Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling
    2021/11/06 by Renrui Zhang, Zhang, Renrui, Rongyao Fang +13 · 50 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Neural Network Applications
  8. Tip-Adapter: Training-free Adaption of CLIP for Few-shot Classification
    2022/07/19 by Renrui Zhang, Zhang, Renrui, Wěi Zhāng +13 · 45 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  9. ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation
    2023/12/24 by Xiaoqi Li, Mingxu Zhang, Li, Xiaoqi +15 · 44 citations
    Engineering · Computer Science · #Robot Manipulation and Learning #Multimodal Machine Learning Applications #Human Pose and Action Recognition
  10. Point-M2AE: Multi-scale Masked Autoencoders for Hierarchical Point Cloud Pre-training
    2022/05/28 by Renrui Zhang, Zhang, Renrui, Rongyao Fang +12 · 28 citations
    Computer Science · #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Human Pose and Action Recognition
  11. MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
    2024/04/24 by Kaining Ying, Ying, Kaining, Fanqing Meng +40 · 45 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Multimodal Machine Learning Applications
  12. RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
    2024/06/06 by Jiaming Liu, Mengzhen Liu, Liu, Jiaming +16 · 43 citations
    Computer Science · Engineering · #AI-based Problem Solving and Planning #Robot Manipulation and Learning #Robotics and Automated Systems
  13. Personalize Segment Anything Model with One Shot
    2023/05/04 by Renrui Zhang, Zhengkai Jiang, Zhang, Renrui +13 · 27 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimedia (cs.MM) #Visual Attention and Saliency Detection
  14. JourneyDB: A Benchmark for Generative Image Understanding
    2023/07/03 by Keqiang Sun, Sun, Keqiang, Junting Pan +24 · 28 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Image Retrieval and Classification Techniques
  15. SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models
    2023/11/13 by Ziyi Lin, Lin, Ziyi, Chris Liu +29 · 25 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Human Pose and Action Recognition #Machine Learning (cs.LG) #Multimodal Machine Learning Applications
  16. RenderOcc: Vision-Centric 3D Occupancy Prediction with 2D Rendering Supervision
    2023/09/18 by Mingjie Pan, Pan, Mingjie, Jiaming Liu +11 · 21 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  17. MonoDETR: Depth-guided Transformer for Monocular 3D Object Detection
    2022/03/24 by Renrui Zhang, Han Qiu, Zhang, Renrui +14 · 15 citations
    Computer Science · #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #FOS: Electrical engineering #Human Pose and Action Recognition #Image and Video Processing (eess.IV) #electronic engineering #information engineering
  18. Training-free Regional Prompting for Diffusion Transformers
    2024/11/04 by Anthony Chen, Chen, Anthony, Jianjin Xu +13 · 2 voices · 13 citations
    #cs.CV
  19. Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
    2025/01/23 by Renrui Zhang, Guo, Ziyu, Zhang, Renrui +12 · 42 citations
    Computer Science · #AI in cancer detection #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Medical Image Segmentation Techniques
  20. MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
    2024/07/11 by Renrui Zhang, Xinyu Wei, Zhang, Renrui +22 · 26 citations
    Social Sciences · #Mathematics Education and Teaching Techniques
  21. Learning 3D Representations from 2D Pre-trained Models via Image-to-Point Masked Autoencoders
    2022/12/13 by Renrui Zhang, Zhang, Renrui, Liuhui Wang +7 · 15 citations
    Computer Science · Earth and Planetary Sciences · Engineering · #3D Shape Modeling and Analysis #3D Surveying and Cultural Heritage #Advanced Vision and Imaging #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  22. MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
    2025/02/13 by Dongzhi Jiang, Jiang, Dongzhi, Renrui Zhang +22 · 39 citations
    Computer Science · #Advanced Text Analysis Techniques #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Semantic Web and Ontologies
  23. From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning
    2025/04/22 by Le Zhuo, Liangbing Zhao, Zhuo, Le +15 · 1 voice · 18 citations
    #cs.CV
  24. Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation
    2023/05/25 by Shilin Yan, Renrui Zhang, Yan, Shilin +15 · 13 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM) #Multimodal Machine Learning Applications #Video Analysis and Summarization
  25. CALIP: Zero-Shot Enhancement of CLIP with Parameter-free Attention
    2022/09/28 by Guo, Ziyu, Renrui Zhang, Zhang, Renrui +10 · 11 citations
    Computer Science · Biochemistry, Genetics and Molecular Biology · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Cancer-related molecular mechanisms research
  26. Frozen CLIP Models are Efficient Video Learners
    2022/08/06 by Ziyi Lin, Shijie Geng, Lin, Ziyi +15 · 10 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Image and Video Retrieval Techniques
  27. Not All Features Matter: Enhancing Few-shot CLIP with Adaptive Prior Refinement
    2023/04/03 by Xiangyang Zhu, Renrui Zhang, Zhu, Xiangyang +11 · 11 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · #Artificial Intelligence (cs.AI) #Cancer-related molecular mechanisms research #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimedia (cs.MM) #Multimodal Machine Learning Applications
  28. Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
    2024/11/27 by Yueru Jia, Jia, Yueru, Jiaming Liu +19 · 1 voice · 15 citations
    Engineering · #Robot Manipulation and Learning #Manufacturing Process and Optimization #Robotic Mechanisms and Dynamics
  29. MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
    2024/09/19 by Dongzhi Jiang, Jiang, Dongzhi, Renrui Zhang +23 · 19 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Information Retrieval (cs.IR) #Semantic Web and Ontologies #Web Data Mining and Analysis
  30. Prompt, Generate, then Cache: Cascade of Foundation Models makes Strong Few-shot Learners
    2023/03/03 by Renrui Zhang, Xiangfei Hu, Zhang, Renrui +13 · 10 citations
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques
  31. iQuery: Instruments as Queries for Audio-Visual Sound Separation
    2022/12/07 by Jiaben Chen, Chen, Jiaben, Renrui Zhang +9 · 9 citations
    Computer Science · Neuroscience · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Hearing Loss and Rehabilitation #Multimedia (cs.MM) #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  32. OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient Tuning
    2024/03/14 by Lingyi Hong, Hong, Lingyi, Shilin Yan +19 · 12 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Video Surveillance and Tracking Methods #Visual Attention and Saliency Detection
  33. SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models
    2024/02/08 by Liu, Dongyang, Renrui Zhang, Longtian Qiu +34 · 11 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
  34. PiMAE: Point Cloud and Image Interactive Masked Autoencoders for 3D Object Detection
    2023/03/14 by Anthony Chen, Chen, Anthony, Kevin Zhang +11 · 8 citations
    Computer Science · Earth and Planetary Sciences · Engineering · #3D Shape Modeling and Analysis #3D Surveying and Cultural Heritage #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  35. MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
    2025/06/05 by Xinyan Chen, Chen, Xinyan, Renrui Zhang +11 · 21 citations
    Computer Science · #Advanced Graph Neural Networks #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Topic Modeling
  36. Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models
    2023/06/15 by Junting Pan, Pan, Junting, Ziyi Lin +13 · 5 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  37. Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
    2025/05/22 by Chengzhuo Tong, Ziyu Guo, Tong, Chengzhuo +13 · 16 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics
  38. VT-CLIP: Enhancing Vision-Language Models with Visual-guided Texts
    2021/12/04 by Longtian Qiu, Renrui Zhang, Qiu, Longtian +7 · 3 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  39. No Time to Train: Empowering Non-Parametric Networks for Few-shot 3D Scene Segmentation
    2024/04/05 by Xiangyang Zhu, Renrui Zhang, Zhu, Xiangyang +14 · 5 citations
    Computer Science · Engineering · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Industrial Vision Systems and Defect Detection #Robotics and Sensor-Based Localization
  40. Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling
    2025/07/23 by Xin Yi, Juncheng Yan, Xin, Yi +37 · 21 citations
    Computer Science · Engineering · Neuroscience · #Brain Tumor Detection and Classification #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Medical Image Segmentation Techniques #Medical Imaging and Analysis
  41. Improving Compositional Text-to-image Generation with Large Vision-Language Models
    2023/10/10 by Guian Fang, Wen, Song, Renrui Zhang +8 · 3 citations
    Computer Science · #Image Retrieval and Classification Techniques
  42. 3DAxiesPrompts: Unleashing the 3D Spatial Task Capabilities of GPT-4V
    2023/12/15 by Dingning Liu, Liu, Dingning, Xiaomeng Dong +13 · 3 citations
    Computer Science · Engineering · #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Image Processing Techniques and Applications #Robotics and Sensor-Based Localization
  43. Adaptive Classifier-Free Guidance via Dynamic Low-Confidence Masking
    2025/05/26 by Pengxiang Li, Shilin Yan, Li, Pengxiang +10 · 9 citations
    Engineering · Computer Science · #Guidance and Control Systems #Target Tracking and Data Fusion in Sensor Networks #Inertial Sensor and Navigation
  44. MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
    2025/05/27 by Jiakang Yuan, Tianshuo Peng, Yuan, Jiakang +17 · 9 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multi-Agent Systems and Negotiation #Natural Language Processing Techniques #Semantic Web and Ontologies
  45. Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
    2025/03/17 by Ruichuan An, An, Ruichuan, Kai Zeng +13 · 5 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning
  46. Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models
    2026/01/27 by Jialong Wu, Xiaoying Zhang, Hongyi Yuan +7 · 3 voices
    #cs.AI
  47. DSPoint: Dual-scale Point Cloud Recognition with High-frequency Fusion
    2021/11/19 by Renrui Zhang, Zhang, Renrui, Ziyao Zeng +9 · 1 citation
    Engineering · Earth and Planetary Sciences · Environmental Science · #3D Shape Modeling and Analysis #3D Surveying and Cultural Heritage #Remote Sensing and LiDAR Applications
  48. TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving
    2025/04/22 by Daocheng Fu, Fu, Daocheng, Renqiu Xia +26 · 4 citations
    Computer Science · Social Sciences · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Constraint Satisfaction and Optimization #FOS: Computer and information sciences #Mathematics Education and Teaching Techniques #Multimodal Machine Learning Applications
  49. Generative Universal Verifier as Multimodal Meta-Reasoner
    2025/10/15 by Xinchen Zhang, Zhang, Xinchen, Xiaoying Zhang +13 · 4 citations
    Computer Science · #Natural Language Processing Techniques #Semantic Web and Ontologies #Speech and dialogue systems
  50. TerDiT: Ternary Diffusion Models with Transformers
    2024/05/23 by Xudong Lu, Lu, Xudong, Aojun Zhou +16 · 1 citation
    Physics and Astronomy · #Theoretical and Computational Physics
  51. CoPESD: A Multi-Level Surgical Motion Dataset for Training Large Vision-Language Models to Co-Pilot Endoscopic Submucosal Dissection
    2024/10/10 by Guankun Wang, Wang, Guankun, Han Xiao +15 · 1 citation
    Medicine · #Gastric Cancer Management and Outcomes
  52. Point Cloud Understanding via Attention-Driven Contrastive Learning
    2024/11/22 by Yi Wang, Jiaze Wang, Wang, Yi +13 · 1 citation
    Earth and Planetary Sciences · Engineering · Environmental Science · #3D Surveying and Cultural Heritage #3D Shape Modeling and Analysis #Remote Sensing and LiDAR Applications