Ross, David A.
- Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
2023/10/09 by Lijun Yu, José Lezama, Yu, Lijun +28 · 111 citations
Computer Science · Medicine · #Multimodal Machine Learning Applications #Topic Modeling #Artificial Intelligence in Healthcare and Education
- AI Choreographer: Music Conditioned 3D Dance Generation with AIST++
2021/01/21 by Li, Ruilong, Yang, Shan, Ross, David A. +1 · 52 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Multimedia (cs.MM)
- AVA: A Video Dataset of Spatio-temporally Localized Atomic Visual Actions
2017/05/23 by Chunhui Gu, Gu, Chunhui, Chen Sun +21 · 39 citations
Computer Science · Medicine · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Stroke Rehabilitation and Recovery
- VideoPoet: A Large Language Model for Zero-Shot Video Generation
2023/12/21 by Dan Kondratyuk, Kondratyuk, Dan, Lijun Yu +59 · 66 citations
Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Human Motion and Animation #Multimodal Machine Learning Applications
- REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi-Source Multimodal Knowledge Memory
2022/12/10 by Ziniu Hu, Ahmet İşcen, Hu, Ziniu +15 · 25 citations
Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning
- SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code
2024/03/02 by Ziniu Hu, Ahmet İşcen, Hu, Ziniu +13 · 23 citations
Computer Science · Engineering · #3D Shape Modeling and Analysis #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Processing and 3D Reconstruction #Machine Learning (cs.LG)
- VideoPrism: A Foundational Visual Encoder for Video Understanding
2024/02/20 by Zhao, Long, Gundavarapu, Nitesh B., Yuan, Liangzhe +16 · 20 citations
#Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- Rethinking the Faster R-CNN Architecture for Temporal Action Localization
2018/04/20 by Yu-Wei Chao, Sudheendra Vijayanarasimhan, Chao, Yu-Wei +9 · 2 citations
Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Anomaly Detection Techniques and Applications
- The AVA-Kinetics Localized Human Actions Video Dataset
2020/05/01 by Ang Li, Li, Ang, Meghana Thotakuri +9 · 3 citations
Computer Science · Engineering · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Gait Recognition and Analysis #Human Pose and Action Recognition #Image and Video Processing (eess.IV) #Machine Learning (cs.LG) #electronic engineering #information engineering
- D3D: Distilled 3D Networks for Video Action Recognition
2018/12/19 by Stroud, Jonathan C., Ross, David A., Sun, Chen +2 · 2 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
- Language-Guided Image Tokenization for Generation
2024/12/08 by Kaiwen Zha, Zha, Kaiwen, Lijun Yu +11 · 7 citations
Computer Science · Biochemistry, Genetics and Molecular Biology · #Advanced Image and Video Retrieval Techniques #Video Analysis and Summarization #Cell Image Analysis Techniques
- IC3: Image Captioning by Committee Consensus
2023/02/02 by Chan, David M., Myers, Austin, Vijayanarasimhan, Sudheendra +2 · 3 citations
#Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- SPAE: Semantic Pyramid AutoEncoder for Multimodal Generation with Frozen LLMs
2023/06/30 by Lijun Yu, Yu, Lijun, Yong Cheng +23 · 2 citations
Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Image and Video Retrieval Techniques
- What's in a Caption? Dataset-Specific Linguistic Diversity and Its Effect on Visual Description Models and Metrics
2022/05/12 by Chan, David M., Myers, Austin, Vijayanarasimhan, Sudheendra +3 · 1 citation
#Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences