Zunnan Xu
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
2024/12/03 by Weijie Kong, Kong, Weijie, Qi Tian +106 · 1 voice · 383 citations
Computer Science · #Generative Adversarial Networks and Image Synthesis #Human Pose and Action Recognition #Video Analysis and Summarization #cs.CV
- MambaTalk: Efficient Holistic Gesture Synthesis with Selective State Space Models
2024/03/14 by Zunnan Xu, Xu, Zunnan, Yukang Lin +11 · 8 citations
Computer Science · Neuroscience · Psychology · #Hand Gesture Recognition Systems #Tactile and Sensory Interactions #Hearing Impairment and Communication
- Bridging Vision and Language Encoders: Parameter-Efficient Tuning for Referring Image Segmentation
2023/07/21 by Zunnan Xu, Xu, Zunnan, Zhihong Chen +9 · 6 citations
Computer Science · Medicine · #COVID-19 diagnosis using AI #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Topic Modeling
- Consistent123: One Image to Highly Consistent 3D Asset Using Case-Aware Diffusion Priors
2023/09/29 by Yukang Lin, Lin, Yukang, Haonan Han +9 · 4 citations
Computer Science · #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Generative Adversarial Networks and Image Synthesis
- Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation
2025/01/15 by Jiaqi Huang, Zunnan Xu, Huang, Jiaqi +11 · 7 citations
Computer Science · Neuroscience · #Advanced Image and Video Retrieval Techniques #Brain Tumor Detection and Classification #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Medical Image Segmentation Techniques
- BATON: Aligning Text-to-Audio Model with Human Preference Feedback
2024/02/01 by Huan Liao, Liao, Huan, Haonan Han +17 · 3 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Freetalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness
2024/01/07 by Sicheng Yang, Zunnan Xu, Yang, Sicheng +11 · 3 citations
Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Face recognition and analysis #Human Motion and Animation #Human-Computer Interaction (cs.HC) #Multimedia (cs.MM) #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning
2025/05/28 by Jiaqi Huang, Zunnan Xu, Huang, Jiaqi +15 · 5 citations
Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
2024/09/20 by Ting Liu, Zunnan Xu, Liu, Ting +9 · 1 citation
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems