vix.ing · top · new · best · stats · spec

Zhengcong Fei

  1. SkyReels-V2: Infinite-length Film Generative Model
    2025/04/17 by Guibin Chen, Dixuan Lin, Chen, Guibin +46 · 66 citations
    Computer Science · Engineering · #Generative Adversarial Networks and Image Synthesis #Video Analysis and Summarization #Human Motion and Animation
  2. Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models
    2024/04/06 by Zhengcong Fei, Mingyuan Fan, Fei, Zhengcong +7 · 1 voice · 6 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #cs.CV
  3. FLUX that Plays Music
    2024/09/01 by Zhengcong Fei, Mingyuan Fan, Fei, Zhengcong +5 · 1 voice · 6 citations
    Computer Science · Engineering · #Artificial Intelligence in Games #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #cs.CV #cs.SD #eess.AS #electronic engineering #information engineering
  4. Scaling Diffusion Transformers to 16 Billion Parameters
    2024/07/16 by Zhengcong Fei, Mingyuan Fan, Fei, Zhengcong +7 · 12 citations
    Physics and Astronomy · Earth and Planetary Sciences · #Nuclear physics research studies #Cold Fusion and Nuclear Reactions #Cold Atom Physics and Bose-Einstein Condensates
  5. SkyReels-A2: Compose Anything in Video Diffusion Transformers
    2025/04/03 by Zhengcong Fei, Debang Li, Fei, Zhengcong +18 · 23 citations
    Computer Science · Engineering · #Advanced Optical Imaging Technologies #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  6. SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers
    2025/02/15 by Di Qiu, Zhengcong Fei, Qiu, Di +13 · 14 citations
    Earth and Planetary Sciences · #3D Surveying and Cultural Heritage
  7. Dimba: Transformer-Mamba Diffusion Models
    2024/06/03 by Zhengcong Fei, Fei, Zhengcong, Mingyuan Fan +9 · 5 citations
    Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Vibration and Dynamic Analysis
  8. Towards Expressive Communication with Internet Memes: A New Multimodal Conversation Dataset and Benchmark
    2021/09/04 by Zhengcong Fei, Fei, Zhengcong, Zekang Li +7 · 2 citations
    Computer Science · Psychology · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #Digital Communication and Language #FOS: Computer and information sciences #Humor Studies and Applications #Sentiment Analysis and Opinion Mining
  9. Video Diffusion Transformers are In-Context Learners
    2024/12/14 by Zhengcong Fei, Di Qiu, Fei, Zhengcong +7 · 4 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Neural Networks and Applications
  10. Scalable Diffusion Models with State Space Backbone
    2024/02/08 by Zhengcong Fei, Fei, Zhengcong, Mingyuan Fan +5 · 3 citations
    Engineering · #Advanced Control Systems Optimization #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM)
  11. Gradient-Free Textual Inversion
    2023/04/12 by Zhengcong Fei, Fei, Zhengcong, Mingyuan Fan +3 · 2 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
  12. Prefix-diffusion: A Lightweight Diffusion Model for Diverse Image Captioning
    2023/09/10 by Guisheng Liu, Liu, Guisheng, Yi Li +9 · 2 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  13. SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
    2025/06/01 by Zhengcong Fei, Fei, Zhengcong, Hao Jiang +19 · 6 citations
    Arts and Humanities · Social Sciences · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia Communication and Technology #Radio, Podcasts, and Digital Media #Subtitles and Audiovisual Media
  14. Music Consistency Models
    2024/04/20 by Zhengcong Fei, Mingyuan Fan, Fei, Zhengcong +3 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Sound (cs.SD) #electronic engineering #information engineering
  15. Ingredients: Blending Custom Photos with Video Diffusion Transformers
    2025/01/03 by Zhengcong Fei, Fei, Zhengcong, Debang Li +7 · 3 citations
    Earth and Planetary Sciences · #3D Surveying and Cultural Heritage
  16. Uncertainty-Aware Image Captioning
    2022/11/30 by Zhengcong Fei, Fei, Zhengcong, Mingyuan Fan +9 · 1 citation
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Video Analysis and Summarization
  17. Fast Image Caption Generation with Position Alignment
    2019/12/13 by Zhengcong Fei, Fei, Zheng-cong · 1 citation
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Video Analysis and Summarization