Le Zhuo
- Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
2024/08/05 by Dongyang Liu, Shitian Zhao, Liu, Dongyang +12 · 40 citations
Engineering · Computer Science · Health Professions · #Human Motion and Animation #Multimodal Machine Learning Applications #Digital Storytelling and Education
- Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
2024/06/05 by Le Zhuo, Zhuo, Le, Ruoyi Du +41 · 35 citations
Computer Science · Physics and Astronomy · #Generative Adversarial Networks and Image Synthesis #Music Technology and Sound Studies #Model Reduction and Neural Networks
- From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning
2025/04/22 by Le Zhuo, Zhuo, Le, Liangbing Zhao +15 · 1 voice · 21 citations
#cs.CV
- VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
2024/11/22 by Songhao Han, Han, Songhao, Wei Huang +16 · 26 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
- MARBLE: Music Audio Representation Benchmark for Universal Evaluation
2023/06/18 by Ruibin Yuan, Yuan, Ruibin, Yinghao Ma +46 · 8 citations
Computer Science · Arts and Humanities · #Music and Audio Processing #Diverse Musicological Studies #Music Technology and Sound Studies
- LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
2024/08/28 by Fangxun Shu, Yue Liao, Shu, Fangxun +30 · 9 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Semantic Web and Ontologies
- Video Background Music Generation: Dataset, Method and Evaluation
2022/11/21 by Le Zhuo, Zhuo, Le, Zhaokai Wang +14 · 4 citations
Computer Science · Engineering · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Human Motion and Animation #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
- PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
2024/09/23 by Weifeng Lin, Lin, Weifeng, Xinyu Wei +18 · 7 citations
Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
2023/06/29 by Le Zhuo, Zhuo, Le, Ruibin Yuan +23 · 4 citations
Arts and Humanities · Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Diverse Musicological Studies #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling
2025/07/23 by Xin Yi, Juncheng Yan, Xin, Yi +37 · 21 citations
Computer Science · Engineering · Neuroscience · #Brain Tumor Detection and Classification #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Medical Image Segmentation Techniques #Medical Imaging and Analysis
- OmniCaptioner: One Captioner to Rule Them All
2025/04/09 by Yiting Lu, Jiakang Yuan, Lu, Yiting +36 · 7 citations
Computer Science · #Multimodal Machine Learning Applications #Generative Adversarial Networks and Image Synthesis #Data Visualization and Analytics
- Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
2025/10/07 by Xin Yi, Qi Qin, Xin, Yi +58 · 19 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Topic Modeling
- ProtLLM: An Interleaved Protein-Language LLM with Protein-as-Word Pre-Training
2024/02/28 by Le Zhuo, Zewen Chi, Zhuo, Le +13 · 2 citations
Biochemistry, Genetics and Molecular Biology · Computer Science · #Artificial Intelligence (cs.AI) #Biomedical Text Mining and Ontologies #Biomolecules (q-bio.BM) #Computation and Language (cs.CL) #FOS: Biological sciences #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
- Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
2024/12/12 by Baisen Wang, Wang, Baisen, Le Zhuo +17 · 3 citations
Computer Science · Engineering · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Human Motion and Animation #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
- Resurrect Mask AutoRegressive Modeling for Efficient and Scalable Image Generation
2025/07/17 by Xin Yi, Le Zhuo, Xin, Yi +19 · 8 citations
Computer Science · Engineering · #Advanced Image and Video Retrieval Techniques #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Industrial Vision Systems and Defect Detection