Enxin Song
- Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
2024/10/10 by Jinbin Bai, Ye Tian, Bai, Jinbin +14 · 2 voices · 20 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Generative Adversarial Networks and Image Synthesis #Image Retrieval and Classification Techniques #cs.CV
- MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
2023/07/31 by Enxin Song, Song, Enxin, Wenhao Chai +21 · 92 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
- VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models
2024/07/16 by Haodong Duan, Duan, Haodong, Xinyu Fang +73 · 123 citations
Computer Science · #Natural Language Processing Techniques
- AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
2024/10/04 by Wenhao Chai, Enxin Song, Chai, Wenhao +15 · 32 citations
Computer Science · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Video Analysis and Summarization
- MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
2024/04/26 by Enxin Song, Wenhao Chai, Song, Enxin +9 · 15 citations
Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning