vix.ing · top · new · best · stats · spec

David A. Ross

  1. Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
    2023/10/09 by Lijun Yu, Yu, Lijun, José Lezama +28 · 155 citations
    Computer Science · Medicine · #Multimodal Machine Learning Applications #Topic Modeling #Artificial Intelligence in Healthcare and Education
  2. AI Choreographer: Music Conditioned 3D Dance Generation with AIST++
    2021/01/21 by Ruilong Li, Shan Yang, Li, Ruilong +5 · 71 citations
    Computer Science · Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Human Motion and Animation #Human Pose and Action Recognition #Multimedia (cs.MM) #Video Analysis and Summarization
  3. AVA: A Video Dataset of Spatio-temporally Localized Atomic Visual Actions
    2017/05/23 by Chunhui Gu, Chen Sun, Gu, Chunhui +21 · 49 citations
    Computer Science · Medicine · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Stroke Rehabilitation and Recovery
  4. VideoPoet: A Large Language Model for Zero-Shot Video Generation
    2023/12/21 by Dan Kondratyuk, Lijun Yu, Kondratyuk, Dan +59 · 94 citations
    Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Human Motion and Animation #Multimodal Machine Learning Applications
  5. VideoPrism: A Foundational Visual Encoder for Video Understanding
    2024/02/20 by Long Zhao, Zhao, Long, Nitesh B. Gundavarapu +35 · 2 voices · 28 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #cs.AI #cs.CV
  6. REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi-Source Multimodal Knowledge Memory
    2022/12/10 by Ziniu Hu, Ahmet İşcen, Hu, Ziniu +15 · 31 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning
  7. SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code
    2024/03/02 by Ziniu Hu, Hu, Ziniu, Ahmet İşcen +13 · 32 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Processing and 3D Reconstruction #Machine Learning (cs.LG)
  8. UnLoc: A Unified Framework for Video Localization Tasks
    2023/08/21 by Yan Shen, Xuehan Xiong, Yan, Shen +13 · 16 citations
    Computer Science · #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Machine Learning (cs.LG) #Multimodal Machine Learning Applications
  9. Rethinking the Faster R-CNN Architecture for Temporal Action Localization
    2018/04/20 by Yu-Wei Chao, Sudheendra Vijayanarasimhan, Chao, Yu-Wei +9 · 6 citations
    Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Anomaly Detection Techniques and Applications
  10. The AVA-Kinetics Localized Human Actions Video Dataset
    2020/05/01 by Ang Li, Li, Ang, Meghana Thotakuri +9 · 7 citations
    Computer Science · Engineering · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Gait Recognition and Analysis #Human Pose and Action Recognition #Image and Video Processing (eess.IV) #Machine Learning (cs.LG) #electronic engineering #information engineering
  11. SPAE: Semantic Pyramid AutoEncoder for Multimodal Generation with Frozen LLMs
    2023/06/30 by Lijun Yu, Yong Cheng, Yu, Lijun +23 · 7 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Image and Video Retrieval Techniques
  12. Language-Guided Image Tokenization for Generation
    2024/12/08 by Kaiwen Zha, Zha, Kaiwen, Lijun Yu +11 · 12 citations
    Computer Science · Biochemistry, Genetics and Molecular Biology · #Advanced Image and Video Retrieval Techniques #Video Analysis and Summarization #Cell Image Analysis Techniques
  13. MALT Diffusion: Memory-Augmented Latent Transformers for Any-Length Video Generation
    2025/02/18 by Sihyun Yu, Yu, Sihyun, Meera Hahn +15 · 6 citations
    Computer Science · #Advanced Vision and Imaging #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Machine Learning (cs.LG)
  14. What We’ve Got Here Is Failure to Communicate: Improving Interventional Psychiatry With Closed-Loop Stimulation
    2018/09/24 by Katherine W. Scangos, David A. Ross · 5 citations
    Medicine · Neuroscience · #Neurological disorders and treatments #EEG and Brain-Computer Interfaces #Neuroscience and Neural Engineering
  15. What's in a Caption? Dataset-Specific Linguistic Diversity and Its Effect on Visual Description Models and Metrics
    2022/05/12 by David M. Chan, Chan, David M., Austin Myers +9 · 1 citation
    Arts and Humanities · Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Subtitles and Audiovisual Media #Video Analysis and Summarization
  16. Video Foundation Models for Animal Behavior Analysis
    2024/07/31 by Jennifer J. Sun, Hao Zhou, Long Zhao +8 · 1 voice · 2 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · Psychology · #Domain Adaptation and Few-Shot Learning #Primate Behavior and Ecology #Zebrafish Biomedical Research Applications