Xinxin Zhu
- VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset
2023/05/29 by Sihan Chen, Handong Li, Chen, Sihan +11 · 43 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Handwritten Text Recognition Techniques #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #electronic engineering #information engineering
- VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
2023/04/17 by Jing Liu, Sihan Chen, Liu, Jing +11 · 25 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling #electronic engineering #information engineering
- ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst
2023/05/25 by Zijia Zhao, Zhao, Zijia, Longteng Guo +13 · 5 citations
Computer Science · #Topic Modeling #Multimodal Machine Learning Applications #Natural Language Processing Techniques
- CPTR: Full Transformer Network for Image Captioning
2021/01/26 by Wei Liu, Sihan Chen, Liu, Wei +7 · 7 citations
Computer Science · #Multimodal Machine Learning Applications #Advanced Image and Video Retrieval Techniques #Human Pose and Action Recognition
- MM-LDM: Multi-Modal Latent Diffusion Model for Sounding Video Generation
2024/10/02 by Mingzhen Sun, Weining Wang, Sun, Mingzhen +12 · 5 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing
- The developmental trajectory of behavioral school engagement and its reciprocal relations with subjective well-being in school among Chinese elementary school students
2019/04/01 by Xinxin Zhu, Lili Tian, Jianhua Zhou +1 · 1 citation
- OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation
2021/07/01 by Jing Liu, Liu, Jing, Xinxin Zhu +19 · 1 citation
Computer Science · #Advanced Image and Video Retrieval Techniques #Advanced Neural Network Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications
- Enhancing and Accelerating Large Language Models via Instruction-Aware Contextual Compression
2024/08/28 by Haowen Hou, Hou, Haowen, Fei Ma +7 · 2 citations
Computer Science · #Topic Modeling #Natural Language Processing Techniques #Speech Recognition and Synthesis
- MOSO: Decomposing MOtion, Scene and Object for Video Prediction
2023/03/07 by Mingzhen Sun, Sun, Mingzhen, Ning Wang +5 · 1 citation
Computer Science · #Advanced Image Processing Techniques #Advanced Vision and Imaging #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition
- Deep Optimal Timing Strategies for Time Series
2023/10/09 by Pan Chen, Fan Zhou, Pan, Chen +15 · 1 citation
Computer Science · #Data Stream Mining Techniques #Time Series Analysis and Forecasting
- Joint Text-Audio Alignment for EEG-to-Text Decoding in Chinese Speech Production and Perception
2026/07/28 by Tian Zheng, Xurong Xie, Xinxin Zhu +2
#cs.AI