vix.ing · top · new · best · stats · spec

Huang, Haifeng

  1. Improving Retrieval Augmented Language Model with Self-Reasoning
    2024/07/29 by Yuan Xia, Xia, Yuan, Jingbo Zhou +7 · 2 voices · 10 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques
  2. Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
    2023/12/13 by Haifeng Huang, Huang, Haifeng, Chen, Yilun +15 · 44 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  3. Grounded 3D-LLM with Referent Tokens
    2024/05/16 by Yilun Chen, Chen, Yilun, Shuai Yang +13 · 30 citations
    Computer Science · Engineering · #Image Processing and 3D Reconstruction #Tunneling and Rock Mechanics #Natural Language Processing Techniques
  4. Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes
    2023/08/17 by Zehan Wang, Haifeng Huang, Wang, Zehan +7 · 22 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Hand Gesture Recognition Systems
  5. Connecting Multi-modal Contrastive Representations
    2023/05/22 by Wang, Zehan, Zhao, Yang, Cheng, Xize +8 · 10 citations
    #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Sound (cs.SD) #electronic engineering #information engineering
  6. Extending Multi-modal Contrastive Representations
    2023/10/13 by Zehan Wang, Wang, Zehan, Ziang Zhang +11 · 10 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  7. MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
    2024/06/13 by Ruiyuan Lyu, Jingli Lin, Lyu, Ruiyuan +19 · 10 citations
    Computer Science · Earth and Planetary Sciences · Engineering · #3D Surveying and Cultural Heritage #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Processing and 3D Reconstruction #Robotics (cs.RO) #Robotics and Sensor-Based Localization
  8. RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
    2025/04/30 by Haifeng Huang, Xinyi Chen, Huang, Haifeng +15 · 18 citations
    Computer Science · Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics #Robot Manipulation and Learning #Robotics (cs.RO)
  9. Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine
    2024/12/12 by Huang, Xiaoshuang, Shen, Lingdong, Liu, Jia +4 · 11 citations
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  10. 3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding
    2023/07/25 by Zehan Wang, Haifeng Huang, Wang, Zehan +13 · 5 citations
    Computer Science · Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Robotics and Sensor-Based Localization
  11. FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
    2024/05/08 by Zehan Wang, Wang, Zehan, Ziang Zhang +19 · 6 citations
    Computer Science · Chemistry · Materials Science · #Semantic Web and Ontologies #History and advancements in chemistry #Diatoms and Algae Research
  12. Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding
    2023/07/18 by Zehan Wang, Wang, Zehan, Haifeng Huang +13 · 4 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  13. Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
    2024/09/30 by Kang, Weitai, Huang, Haifeng, Shang, Yuzhang +2 · 6 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  14. A Refer-and-Ground Multimodal Large Language Model for Biomedicine
    2024/06/26 by Huang, Xiaoshuang, Huang, Haifeng, Shen, Lingdong +4 · 3 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  15. SynFundus-1M: A High-quality Million-scale Synthetic fundus images Dataset with Fifteen Types of Annotation
    2023/12/01 by Fangxin Shang, Shang, Fangxin, Jie Fu +6 · 2 citations
    Medicine · Computer Science · #Retinal Imaging and Analysis #Digital Imaging for Blood Diseases #Retinal and Optic Conditions
  16. GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation
    2025/06/12 by Ning Gao, Yilun Chen, Gao, Ning +17 · 5 citations
    Computer Science · Engineering · #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics #Robot Manipulation and Learning #Robotics (cs.RO)