Rao, Anyi
- Adding Conditional Control to Text-to-Image Diffusion Models
2023/02/10 by Lvmin Zhang, Zhang, Lvmin, Rao, Anyi +1 · 733 citations
Medicine · #Advanced Neuroimaging Techniques and Applications
- AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
2023/07/10 by Yuwei Guo, Ceyuan Yang, Guo, Yuwei +13 · 211 citations
Computer Science · Engineering · #Image Retrieval and Classification Techniques #Human Motion and Animation #Music and Audio Processing
- MovieNet: A Holistic Dataset for Movie Understanding
2020/07/21 by Huang, Qingqiu, Xiong, Yu, Rao, Anyi +2 · 16 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- A Molecular Multimodal Foundation Model Associating Molecule Graphs with Natural Language
2022/09/12 by Su, Bing, Du, Dazhao, Yang, Zhao +6 · 18 citations
#Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models
2023/11/28 by Yuwei Guo, Ceyuan Yang, Guo, Yuwei +9 · 23 citations
Computer Science · Engineering · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Motion and Animation #Video Analysis and Summarization
- BungeeNeRF: Progressive Neural Radiance Field for Extreme Multi-scale Scene Rendering
2021/12/10 by Yuanbo Xiangli, Linning Xu, Xiangli, Yuanbo +13 · 14 citations
Computer Science · Engineering · #3D Shape Modeling and Analysis #Advanced Vision and Imaging #Artificial Intelligence (cs.AI) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- A Unified Framework for Shot Type Classification Based on Subject Centric Lens
2020/08/08 by Anyi Rao, Rao, Anyi, Jiaze Wang +11 · 5 citations
Computer Science · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Human Pose and Action Recognition #Image and Video Processing (eess.IV) #Machine Learning (cs.LG) #Multimedia (cs.MM) #Video Analysis and Summarization #electronic engineering #information engineering
- A Local-to-Global Approach to Multi-modal Movie Scene Segmentation
2020/04/06 by Anyi Rao, Rao, Anyi, Linning Xu +11 · 5 citations
Computer Science · #Human Pose and Action Recognition #Video Analysis and Summarization #Multimodal Machine Learning Applications
- Light-A-Video: Training-free Video Relighting via Progressive Light Fusion
2025/02/12 by Zhou, Yujie, Bu, Jiazi, Ling, Pengyang +10 · 14 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
2023/05/27 by Shi, Dachuan, Tao, Chaofan, Rao, Anyi +3 · 5 citations
#Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- Dynamic Storyboard Generation in an Engine-based Virtual Environment for Video Production
2023/01/30 by Rao, Anyi, Jiang, Xuekun, Guo, Yuwei +5 · 4 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Graphics (cs.GR) #Human-Computer Interaction (cs.HC) #Image and Video Processing (eess.IV) #Multimedia (cs.MM) #electronic engineering #information engineering
- Generative AI for Film Creation: A Survey of Recent Advances
2025/04/11 by Ruihan Zhang, Zhang, Ruihan, Borou Yu +45 · 9 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis
- Simulating the Real World: A Unified Survey of Multimodal Generative Models
2025/03/06 by Hu, Yuqi, Wang, Longguang, Liu, Xian +7 · 5 citations
#Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- CinePreGen: Camera Controllable Video Previsualization via Engine-powered Diffusion
2024/08/30 by Yiran Chen, Anyi Rao, Chen, Yiran +13 · 2 citations
Computer Science · #Video Surveillance and Tracking Methods #Generative Adversarial Networks and Image Synthesis #Advanced Vision and Imaging
- Temporal and Contextual Transformer for Multi-Camera Editing of TV Shows
2022/10/17 by Anyi Rao, Xuekun Jiang, Rao, Anyi +17 · 1 citation
Computer Science · Economics, Econometrics and Finance · #Video Analysis and Summarization #Video Coding and Compression Technologies #Cinema and Media Studies
- ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images
2025/05/10 by Xianghao Kong, Kong, Xianghao, Qiaosong Qi +11 · 3 citations
Computer Science · Engineering · #Generative Adversarial Networks and Image Synthesis #Human Motion and Animation #3D Shape Modeling and Analysis
- Cinematic Behavior Transfer via NeRF-based Differentiable Filming
2023/11/29 by Jiang, Xuekun, Rao, Anyi, Wang, Jingbo +2 · 1 citation
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Human-Computer Interaction (cs.HC) #Multimedia (cs.MM)
- ScriptViz: A Visualization Tool to Aid Scriptwriting based on a Large Movie Database
2024/10/04 by Rao, Anyi, Chou, Jean-Peïc, Agrawala, Maneesh · 2 citations
#Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Human-Computer Interaction (cs.HC)
- Mindalogue: LLM-Powered Nonlinear Interaction for Effective Learning and Task Exploration
2024/10/14 by Zhang, Rui, Zhang, Ziyao, Zhu, Fengliang +2 · 1 citation
#68T20(Secondary) #68U35(Primary) #FOS: Computer and information sciences #FOS: Electrical engineering #H.5.2 #Human-Computer Interaction (cs.HC) #Systems and Control (eess.SY) #electronic engineering #information engineering
- Dense Semantic Matching with VGGT Prior
2025/09/25 by Songlin Yang, Yang, Songlin, Yushi Lan +8 · 1 citation
Computer Science · #Topic Modeling #Natural Language Processing Techniques