vix.ing · top · new · best · stats · spec

Wu, Jianzong

  1. Towards Open Vocabulary Learning: A Survey
    2023/06/28 by Wu, Jianzong, Li, Xiangtai, Xu, Shilin +9 · 26 citations
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  2. DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
    2024/12/10 by Jianzong Wu, Jianhua Wu, Wu, Jianzong +10 · 1 voice · 8 citations
    Arts and Humanities · Computer Science · #Digital Humanities and Scholarship #Handwritten Text Recognition Techniques #cs.CV
  3. MotionBooth: Motion-Aware Customized Text-to-Video Generation
    2024/06/25 by Wu, Jianzong, Li, Xiangtai, Zeng, Yanhong +5 · 19 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  4. Towards Language-Driven Video Inpainting via Multimodal Large Language Models
    2024/01/18 by Jianzong Wu, Xiangtai Li, Wu, Jianzong +19 · 1 voice · 6 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Multimodal Machine Learning Applications #Video Analysis and Summarization #cs.CV
  5. Towards Robust Referring Image Segmentation
    2022/09/20 by Wu, Jianzong, Li, Xiangtai, Li, Xia +3 · 7 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  6. Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
    2025/05/29 by Shi, Qingyu, Bai, Jinbin, Zhao, Zhuoran +8 · 19 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  7. An Empirical Study of GPT-4o Image Generation Capabilities
    2025/04/08 by Sixiang Chen, Jinbin Bai, Chen, Sixiang +31 · 9 citations
    Computer Science · Arts and Humanities · #Generative Adversarial Networks and Image Synthesis #Digital Humanities and Scholarship #Music Technology and Sound Studies
  8. DreamRelation: Bridging Customization and Relation Generation
    2024/10/30 by Lu Qi, Shi, Qingyu, Jianzong Wu +9 · 6 citations
    Computer Science · Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Motion and Animation #Multimodal Machine Learning Applications #Robotic Path Planning Algorithms
  9. VMoBA: Mixture-of-Block Attention for Video Diffusion Models
    2025/06/30 by Jianhua Wu, Liang Hou, Wu, Jianzong +12 · 9 citations
    Computer Science · #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Visual Attention and Saliency Detection
  10. Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
    2025/03/21 by Shi, Qingyu, Wu, Jianzong, Bai, Jinbin +4 · 4 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  11. Betrayed by Captions: Joint Caption Grounding and Generation for Open Vocabulary Instance Segmentation
    2023/01/02 by Jianzong Wu, Wu, Jianzong, Xiangtai Li +11 · 1 citation
    Computer Science · #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling