vix.ing · top · new · best · stats · spec

Ross, David A.

  1. Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
    2023/10/09 by Lijun Yu, José Lezama, Yu, Lijun +28 · 111 citations
    Computer Science · Medicine · #Multimodal Machine Learning Applications #Topic Modeling #Artificial Intelligence in Healthcare and Education
  2. AI Choreographer: Music Conditioned 3D Dance Generation with AIST++
    2021/01/21 by Li, Ruilong, Yang, Shan, Ross, David A. +1 · 52 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Graphics (cs.GR) #Multimedia (cs.MM)
  3. AVA: A Video Dataset of Spatio-temporally Localized Atomic Visual Actions
    2017/05/23 by Chunhui Gu, Gu, Chunhui, Chen Sun +21 · 39 citations
    Computer Science · Medicine · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Stroke Rehabilitation and Recovery
  4. VideoPoet: A Large Language Model for Zero-Shot Video Generation
    2023/12/21 by Dan Kondratyuk, Kondratyuk, Dan, Lijun Yu +59 · 66 citations
    Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Generative Adversarial Networks and Image Synthesis #Human Motion and Animation #Multimodal Machine Learning Applications
  5. REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi-Source Multimodal Knowledge Memory
    2022/12/10 by Ziniu Hu, Ahmet İşcen, Hu, Ziniu +15 · 25 citations
    Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Domain Adaptation and Few-Shot Learning
  6. SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code
    2024/03/02 by Ziniu Hu, Ahmet İşcen, Hu, Ziniu +13 · 23 citations
    Computer Science · Engineering · #3D Shape Modeling and Analysis #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Graphics and Visualization Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Processing and 3D Reconstruction #Machine Learning (cs.LG)
  7. VideoPrism: A Foundational Visual Encoder for Video Understanding
    2024/02/20 by Zhao, Long, Gundavarapu, Nitesh B., Yuan, Liangzhe +16 · 20 citations
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  8. Rethinking the Faster R-CNN Architecture for Temporal Action Localization
    2018/04/20 by Yu-Wei Chao, Sudheendra Vijayanarasimhan, Chao, Yu-Wei +9 · 2 citations
    Computer Science · #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Anomaly Detection Techniques and Applications
  9. The AVA-Kinetics Localized Human Actions Video Dataset
    2020/05/01 by Ang Li, Li, Ang, Meghana Thotakuri +9 · 3 citations
    Computer Science · Engineering · #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Gait Recognition and Analysis #Human Pose and Action Recognition #Image and Video Processing (eess.IV) #Machine Learning (cs.LG) #electronic engineering #information engineering
  10. D3D: Distilled 3D Networks for Video Action Recognition
    2018/12/19 by Stroud, Jonathan C., Ross, David A., Sun, Chen +2 · 2 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
  11. Language-Guided Image Tokenization for Generation
    2024/12/08 by Kaiwen Zha, Zha, Kaiwen, Lijun Yu +11 · 7 citations
    Computer Science · Biochemistry, Genetics and Molecular Biology · #Advanced Image and Video Retrieval Techniques #Video Analysis and Summarization #Cell Image Analysis Techniques
  12. IC3: Image Captioning by Committee Consensus
    2023/02/02 by Chan, David M., Myers, Austin, Vijayanarasimhan, Sudheendra +2 · 3 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  13. SPAE: Semantic Pyramid AutoEncoder for Multimodal Generation with Frozen LLMs
    2023/06/30 by Lijun Yu, Yu, Lijun, Yong Cheng +23 · 2 citations
    Computer Science · #Multimodal Machine Learning Applications #Domain Adaptation and Few-Shot Learning #Advanced Image and Video Retrieval Techniques
  14. What's in a Caption? Dataset-Specific Linguistic Diversity and Its Effect on Visual Description Models and Metrics
    2022/05/12 by Chan, David M., Myers, Austin, Vijayanarasimhan, Sudheendra +3 · 1 citation
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences