Xu, Zunnan
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
2024/12/03 by Weijie Kong, Kong, Weijie, Qi Tian +106 · 1 voice · 380 citations
Computer Science · #Generative Adversarial Networks and Image Synthesis #Human Pose and Action Recognition #Video Analysis and Summarization #cs.CV
- REPARO: Compositional 3D Assets Generation with Differentiable 3D Layout Alignment
2024/05/28 by Han, Haonan, Yang, Rui, Liao, Huan +6 · 14 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- MambaTalk: Efficient Holistic Gesture Synthesis with Selective State Space Models
2024/03/14 by Zunnan Xu, Yukang Lin, Xu, Zunnan +11 · 8 citations
Computer Science · Neuroscience · Psychology · #Hand Gesture Recognition Systems #Tactile and Sensory Interactions #Hearing Impairment and Communication
- Bridging Vision and Language Encoders: Parameter-Efficient Tuning for Referring Image Segmentation
2023/07/21 by Zunnan Xu, Xu, Zunnan, Zhihong Chen +9 · 6 citations
Computer Science · Medicine · #COVID-19 diagnosis using AI #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Topic Modeling
- HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation
2025/03/24 by Xu, Zunnan, Yu, Zhentao, Zhou, Zixiang +10 · 14 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model
2025/03/25 by Zhou, Jun, Li, Jiahao, Xu, Zunnan +6 · 11 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- Consistent123: One Image to Highly Consistent 3D Asset Using Case-Aware Diffusion Priors
2023/09/29 by Yukang Lin, Lin, Yukang, Haonan Han +9 · 4 citations
Computer Science · #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Generative Adversarial Networks and Image Synthesis
- Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation
2025/01/15 by Jiaqi Huang, Zunnan Xu, Huang, Jiaqi +11 · 7 citations
Computer Science · Neuroscience · #Advanced Image and Video Retrieval Techniques #Brain Tumor Detection and Classification #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Medical Image Segmentation Techniques
- Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
2024/05/23 by Liu, Ting, Liu, Xuyang, Shi, Liangtao +6 · 4 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- BATON: Aligning Text-to-Audio Model with Human Preference Feedback
2024/02/01 by Huan Liao, Haonan Han, Liao, Huan +17 · 3 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Freetalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness
2024/01/07 by Sicheng Yang, Yang, Sicheng, Zunnan Xu +11 · 3 citations
Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Face recognition and analysis #Human Motion and Animation #Human-Computer Interaction (cs.HC) #Multimedia (cs.MM) #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward
2024/11/27 by Han, Haonan, Wu, Xiangzuo, Liao, Huan +5 · 3 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
2025/06/03 by Xiao, Yicheng, Song, Lin, Yang, Rui +6 · 5 citations
#Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning
2025/05/28 by Jiaqi Huang, Zunnan Xu, Huang, Jiaqi +15 · 5 citations
Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- Separate to Collaborate: Dual-Stream Diffusion Model for Coordinated Piano Hand Motion Synthesis
2025/04/14 by Liu, Zihao, Ou, Mingwen, Xu, Zunnan +4 · 2 citations
#Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- Alignment is All You Need: A Training-free Augmentation Strategy for Pose-guided Video Generation
2024/08/29 by Jin, Xiaoyu, Xu, Zunnan, Ou, Mingwen +1 · 2 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- Chain of Generation: Multi-Modal Gesture Synthesis via Cascaded Conditional Control
2023/12/26 by Xu, Zunnan, Zhang, Yachao, Yang, Sicheng +2 · 1 citation
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
2024/09/20 by Ting Liu, Liu, Ting, Zunnan Xu +9 · 1 citation
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems
- Zero-shot 3D-Aware Trajectory-Guided image-to-video generation via Test-Time Training
2025/09/08 by Zhang, Ruicheng, Zhou, Jun, Xu, Zunnan +5 · 4 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation
2025/04/03 by Hong, Fa-Ting, Xu, Zunnan, Zhou, Zixiang +5 · 1 citation
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences