vix.ing · top · new · best · stats · spec

Jun-Yan He

  1. Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
    2024/06/17 by Zebang Cheng, Zhi-Qi Cheng, Cheng, Zebang +15 · 38 citations
    Psychology · #Artificial Intelligence (cs.AI) #Emotion and Mood Recognition #FOS: Computer and information sciences #Multimedia (cs.MM)
  2. AnyText: Multilingual Visual Text Generation And Editing
    2023/11/06 by Yuxiang Tuo, Tuo, Yuxiang, Wangmeng Xiang +7 · 22 citations
    Computer Science · #Computer Graphics and Visualization Techniques #Generative Adversarial Networks and Image Synthesis
  3. Human-Aware Vision-and-Language Navigation: Bridging Simulation to Reality with Dynamic Human Interactions
    2024/06/27 by Minghan Li, Li, Heng, Zhi-Qi Cheng +14 · 11 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Robotics (cs.RO) #Speech and dialogue systems
  4. Tracking with Human-Intent Reasoning
    2023/12/29 by Jiawen Zhu, Zhu, Jiawen, Zhi-Qi Cheng +13 · 8 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Gaze Tracking and Assistive Technology #Multimodal Machine Learning Applications #Visual Attention and Saliency Detection
  5. Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
    2024/03/05 by Junwen He, Yifan Wang, He, Junwen +13 · 6 citations
    Computer Science · Engineering · #Advanced Image and Video Retrieval Techniques #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Processing Techniques and Applications
  6. ProContEXT: Exploring Progressive Context Transformer for Tracking
    2022/10/27 by Jin-Peng Lan, Zhi-Qi Cheng, Lan, Jin-Peng +15 · 2 citations
    Computer Science · Environmental Science · #Advanced Technologies in Various Fields #Air Quality Monitoring and Forecasting #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM) #Video Surveillance and Tracking Methods
  7. MetaDesigner: Advancing Artistic Typography Through AI-Driven, User-Centric, and Multilingual WordArt Synthesis
    2024/06/28 by Jun-Yan He, Zhi-Qi Cheng, He, Jun-Yan +25 · 3 citations
    Computer Science · Engineering · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Handwritten Text Recognition Techniques #Human Motion and Animation #Human-Computer Interaction (cs.HC) #Multimedia (cs.MM)
  8. UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
    2024/04/29 by Zhi-Qi Cheng, Cheng, Zhi-Qi, Xiang Li +9 · 2 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Multimedia (cs.MM) #Speech and dialogue systems
  9. PoSynDA: Multi-Hypothesis Pose Synthesis Domain Adaptation for Robust 3D Human Pose Estimation
    2023/08/18 by Hanbing Liu, Liu, Hanbing, Jun-Yan He +19 · 1 citation
    Computer Science · #Anomaly Detection Techniques and Applications #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Hand Gesture Recognition Systems #Human Pose and Action Recognition #Multimedia (cs.MM) #Robotics (cs.RO)
  10. DyRoNet: Dynamic Routing and Low-Rank Adapters for Autonomous Driving Streaming Perception
    2024/03/08 by Xiang Huang, Zhi-Qi Cheng, Huang, Xiang +9 · 1 citation
    Computer Science · Neuroscience · #Artificial Intelligence (cs.AI) #Brain Tumor Detection and Classification #Computer Vision and Pattern Recognition (cs.CV) #Energy Efficient Wireless Sensor Networks #FOS: Computer and information sciences #Multimedia (cs.MM) #Video Surveillance and Tracking Methods
  11. WordArt Designer API: User-Driven Artistic Typography Synthesis with Large Language Models on ModelScope
    2024/01/03 by Jun-Yan He, He, Jun-Yan, Zhi-Qi Cheng +23 · 1 citation
    Arts and Humanities · Social Sciences · #Digital Humanities and Scholarship #Multimedia Communication and Technology #Subtitles and Audiovisual Media
  12. GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts
    2024/11/18 by Junwen He, He, Junwen, Lijun Wang +16 · 1 citation
    Arts and Humanities · Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Digital Humanities and Scholarship #FOS: Computer and information sciences #Handwritten Text Recognition Techniques #Image Processing and 3D Reconstruction
  13. UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
    2024/12/14 by Haoyu Jiang, Zhi-Qi Cheng, Jiang, Haoyu +14 · 1 citation
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Information Retrieval (cs.IR) #Multimedia (cs.MM) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling