vix.ing · top · new · best · stats · spec

Chen, Xinyuan

  1. VBench: Comprehensive Benchmark Suite for Video Generative Models
    2023/11/29 by Ziqi Huang, Huang, Ziqi, Yinan He +29 · 349 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Visual Attention and Saliency Detection #Human Pose and Action Recognition
  2. InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
    2023/07/13 by Yi Wang, Wang, Yi, Yinan He +26 · 84 citations
    Computer Science · #Multimodal Machine Learning Applications #Human Pose and Action Recognition #Video Analysis and Summarization
  3. Latte: Latent Diffusion Transformer for Video Generation
    2024/01/05 by Xin Ma, Yaohui Wang, Ma, Xin +13 · 78 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
  4. SinSR: Diffusion-Based Image Super-Resolution in a Single Step
    2023/11/23 by Yufei Wang, Wenhan Yang, Wang, Yufei +17 · 42 citations
    Computer Science · Engineering · Medicine · #Advanced Image Processing Techniques #Advanced Neuroimaging Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Sparse and Compressive Sensing Techniques
  5. LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models
    2023/09/26 by Yaohui Wang, Wang, Yaohui, Xinyuan Chen +37 · 41 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Advanced Vision and Imaging
  6. SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction
    2023/10/31 by Xinyuan Chen, Chen, Xinyuan, Yaohui Wang +17 · 36 citations
    Computer Science · Economics, Econometrics and Finance · #Generative Adversarial Networks and Image Synthesis #Cinema and Media Studies
  7. 4Diffusion: Multi-view Video Diffusion Model for 4D Generation
    2024/05/31 by Haiyu Zhang, Xinyuan Chen, Zhang, Haiyu +9 · 33 citations
    Social Sciences · #Multimedia Communication and Technology
  8. Vlogger: Make Your Dream A Vlog
    2024/01/17 by Shaobin Zhuang, Kunchang Li, Zhuang, Shaobin +11 · 1 voice · 15 citations
    Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Video Analysis and Summarization #cs.AI #cs.CV #cs.LG #cs.MM
  9. EpiDiff: Enhancing Multi-View Synthesis via Localized Epipolar-Constrained Diffusion
    2023/12/11 by Huang, Zehuan, Wen, Hao, Dong, Junting +8 · 13 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  10. Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models
    2025/01/14 by Fan, Weichen, Chenyang Si, Si, Chenyang +31 · 19 citations
    Computer Science · #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image and Signal Denoising Methods #Machine Learning (cs.LG)
  11. DG-Font: Deformable Generative Networks for Unsupervised Font Generation
    2021/04/07 by Yangchen Xie, Xie, Yangchen, Xinyuan Chen +5 · 4 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Video Analysis and Summarization #Computer Graphics and Visualization Techniques
  12. Diff-Font: Diffusion Model for Robust One-Shot Font Generation
    2022/12/12 by Haibin He, Xinyuan Chen, He, Haibin +11 · 5 citations
    Computer Science · Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Handwritten Text Recognition Techniques #Human Motion and Animation #Video Analysis and Summarization
  13. Ouroboros3D: Image-to-3D Generation via 3D-aware Recursive Diffusion
    2024/06/05 by Wen, Hao, Huang, Zehuan, Wang, Yaohui +2 · 7 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  14. LEO: Generative Latent Image Animator for Human Video Synthesis
    2023/05/06 by Wang, Yaohui, Ma, Xin, Chen, Xinyuan +4 · 5 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  15. Brush Your Text: Synthesize Any Scene Text on Images via Diffusion Model
    2023/12/19 by Zhang, Lingjun, Chen, Xinyuan, Wang, Yaohui +2 · 4 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  16. Hierarchical Diffusion Autoencoders and Disentangled Image Manipulation
    2023/04/24 by Zeyu Lu, Lu, Zeyu, Chengyue Wu +11 · 3 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Advanced Image Processing Techniques #Digital Media Forensic Detection
  17. AccVideo: Accelerating Video Diffusion Model with Synthetic Dataset
    2025/03/25 by Haiyu Zhang, Zhang, Haiyu, Xinyuan Chen +9 · 1 voice · 3 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #cs.CV
  18. Cross Attention Based Style Distribution for Controllable Person Image Synthesis
    2022/08/01 by Zhou, Xinyue, Yin, Mingyu, Chen, Xinyuan +3 · 2 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  19. VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models
    2024/11/20 by Ziqi Huang, Fan Zhang, Huang, Ziqi +31 · 4 citations
    Computer Science · Engineering · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Human Motion and Animation
  20. CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models
    2025/08/15 by Xiaoxue Wu, Bin Gao, Wu, Xiaoxue +7 · 7 citations
    Computer Science · #Video Analysis and Summarization #Generative Adversarial Networks and Image Synthesis #Human Pose and Action Recognition
  21. Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model
    2024/12/30 by Yifei Huang, Huang, Yifei, Jilan Xu +33 · 4 citations
    Engineering · #Robotics and Automated Systems
  22. The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation
    2025/04/16 by Bin Gao, Gao, Bingjie, Xinyu Gao +13 · 5 citations
    Computer Science · Engineering · Social Sciences · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Motion and Animation #Multimedia Communication and Technology #Video Analysis and Summarization
  23. Long-Term Rhythmic Video Soundtracker
    2023/05/02 by Yu, Jiashuo, Wang, Yaohui, Chen, Xinyuan +2 · 1 citation
    #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Sound (cs.SD) #electronic engineering #information engineering
  24. An Egocentric Vision-Language Model based Portable Real-time Smart Assistant
    2025/03/06 by Yifei Huang, Huang, Yifei, Jilan Xu +35 · 2 citations
    Computer Science · Psychology · #Multimodal Machine Learning Applications #Social Robot Interaction and HRI #Advanced Neural Network Applications
  25. LIA-X: Interpretable Latent Portrait Animator
    2025/08/13 by Wang, Yaohui, Yang, Di, Chen, Xinyuan +3 · 3 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  26. TimeStep Master: Asymmetrical Mixture of Timestep LoRA Experts for Versatile and Efficient Diffusion Models in Vision
    2025/03/10 by Zhuang, Shaobin, Guo, Yiwei, Ding, Yanbo +7 · 1 citation
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  27. ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
    2025/12/11 by Wu, Xiaoxue, Chen, Xinyuan, Wang, Yaohui +1 · 1 citation
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  28. Self-Improvement for Audio Large Language Model using Unlabeled Speech
    2025/07/27 by Wang, Shaowen, Chen, Xinyuan, Xu, Yao · 4 citations
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #H.5.5 #I.2.7 #Sound (cs.SD) #electronic engineering #information engineering