vix.ing · top · new · best · stats · spec

Qu, Leigang

  1. NExT-GPT: Any-to-Any Multimodal LLM
    2023/09/11 by Shengqiong Wu, Wu, Shengqiong, Fei, Hao +6 · 85 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  2. LayoutLLM-T2I: Eliciting Layout Guidance from LLM for Text-to-Image Generation
    2023/08/09 by Leigang Qu, Qu, Leigang, Shengqiong Wu +6 · 10 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Handwritten Text Recognition Techniques #Multimodal Machine Learning Applications
  3. Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives
    2024/06/09 by Thông Nguyen, Bin Yi, Nguyen, Thong +15 · 7 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques
  4. Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
    2024/02/16 by Yongqi Li, Wenjie Wang, Li, Yongqi +9 · 5 citations
    Computer Science · #Multimodal Machine Learning Applications
  5. Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
    2022/11/14 by Chen, Yiyang, Zheng, Zhedong, Ji, Wei +2 · 3 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  6. SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
    2024/12/08 by Qu, Leigang, Li, Haochuan, Wang, Wenjie +4 · 5 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimedia (cs.MM)
  7. TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
    2024/06/09 by Leigang Qu, Qu, Leigang, Haochuan Li +11 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Retrieval and Classification Techniques #Machine Learning (cs.LG) #Multimedia (cs.MM)
  8. Discriminative Probing and Tuning for Text-to-Image Generation
    2024/03/07 by Qu, Leigang, Wang, Wenjie, Li, Yongqi +3 · 2 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM)
  9. Enhanced Structured Lasso Pruning with Class-wise Information
    2025/02/13 by Liu, Xiang, Li, Mingchen, Li, Xia +7 · 1 citation
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  10. Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
    2024/07/24 by Li, Yongqi, Cai, Hongru, Wang, Wenjie +5 · 1 citation
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM)
  11. VINCIE: Unlocking In-context Image Editing from Video
    2025/06/12 by Leigang Qu, Feng Cheng, Qu, Leigang +17 · 3 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications #Video Analysis and Summarization