vix.ing · top · new · best · stats · spec

Le Zhuo

  1. Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
    2024/08/05 by Dongyang Liu, Shitian Zhao, Liu, Dongyang +12 · 40 citations
    Engineering · Computer Science · Health Professions · #Human Motion and Animation #Multimodal Machine Learning Applications #Digital Storytelling and Education
  2. Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
    2024/06/05 by Le Zhuo, Zhuo, Le, Ruoyi Du +41 · 35 citations
    Computer Science · Physics and Astronomy · #Generative Adversarial Networks and Image Synthesis #Music Technology and Sound Studies #Model Reduction and Neural Networks
  3. From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning
    2025/04/22 by Le Zhuo, Zhuo, Le, Liangbing Zhao +15 · 1 voice · 21 citations
    #cs.CV
  4. VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
    2024/11/22 by Songhao Han, Han, Songhao, Wei Huang +16 · 26 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  5. MARBLE: Music Audio Representation Benchmark for Universal Evaluation
    2023/06/18 by Ruibin Yuan, Yuan, Ruibin, Yinghao Ma +46 · 8 citations
    Computer Science · Arts and Humanities · #Music and Audio Processing #Diverse Musicological Studies #Music Technology and Sound Studies
  6. LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
    2024/08/28 by Fangxun Shu, Yue Liao, Shu, Fangxun +30 · 9 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Semantic Web and Ontologies
  7. Video Background Music Generation: Dataset, Method and Evaluation
    2022/11/21 by Le Zhuo, Zhuo, Le, Zhaokai Wang +14 · 4 citations
    Computer Science · Engineering · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Human Motion and Animation #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  8. PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
    2024/09/23 by Weifeng Lin, Lin, Weifeng, Xinyu Wei +18 · 7 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
  9. LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
    2023/06/29 by Le Zhuo, Zhuo, Le, Ruibin Yuan +23 · 4 citations
    Arts and Humanities · Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Diverse Musicological Studies #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  10. Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling
    2025/07/23 by Xin Yi, Juncheng Yan, Xin, Yi +37 · 21 citations
    Computer Science · Engineering · Neuroscience · #Brain Tumor Detection and Classification #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Medical Image Segmentation Techniques #Medical Imaging and Analysis
  11. OmniCaptioner: One Captioner to Rule Them All
    2025/04/09 by Yiting Lu, Jiakang Yuan, Lu, Yiting +36 · 7 citations
    Computer Science · #Multimodal Machine Learning Applications #Generative Adversarial Networks and Image Synthesis #Data Visualization and Analytics
  12. Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
    2025/10/07 by Xin Yi, Qi Qin, Xin, Yi +58 · 19 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Natural Language Processing Techniques #Topic Modeling
  13. ProtLLM: An Interleaved Protein-Language LLM with Protein-as-Word Pre-Training
    2024/02/28 by Le Zhuo, Zewen Chi, Zhuo, Le +13 · 2 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · #Artificial Intelligence (cs.AI) #Biomedical Text Mining and Ontologies #Biomolecules (q-bio.BM) #Computation and Language (cs.CL) #FOS: Biological sciences #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
  14. Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
    2024/12/12 by Baisen Wang, Wang, Baisen, Le Zhuo +17 · 3 citations
    Computer Science · Engineering · #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Human Motion and Animation #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  15. Resurrect Mask AutoRegressive Modeling for Efficient and Scalable Image Generation
    2025/07/17 by Xin Yi, Le Zhuo, Xin, Yi +19 · 8 citations
    Computer Science · Engineering · #Advanced Image and Video Retrieval Techniques #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Industrial Vision Systems and Defect Detection