vix.ing · top · new · best · stats · spec

Changli Tang

  1. SALMONN: Towards Generic Hearing Abilities for Large Language Models
    2023/10/20 by Changli Tang, Tang, Changli, Wenyi Yu +15 · 110 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  2. video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
    2024/06/22 by Guangzhi Sun, Sun, Guangzhi, Wenyi Yu +17 · 25 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing #Speech and Audio Processing
  3. Connecting Speech Encoder and Large Language Model for ASR
    2023/09/25 by Wenyi Yu, Changli Tang, Yu, Wenyi +15 · 13 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  4. Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
    2024/09/25 by Siyin Wang, Wang, Siyin, Wenyi Yu +20 · 9 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  5. Can Large Language Models Understand Spatial Audio?
    2024/06/12 by Changli Tang, Tang, Changli, Wenyi Yu +19 · 6 citations
    Computer Science · Social Sciences · #Audio and Speech Processing (eess.AS) #Computational and Text Analysis Methods #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  6. Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models
    2023/10/09 by Guangzhi Sun, Wenyi Yu, Sun, Guangzhi +14 · 3 citations
    Computer Science · #Music and Audio Processing #Multimodal Machine Learning Applications #Speech and Audio Processing
  7. video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
    2025/02/17 by Guangzhi Sun, Sun, Guangzhi, Yudong Yang +11 · 6 citations
    Computer Science · #Multimodal Machine Learning Applications #Music and Audio Processing #Natural Language Processing Techniques
  8. WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
    2025/09/26 by Changli Tang, Tang, Changli, Qiyan Xiao +9 · 2 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Sound (cs.SD) #Topic Modeling
  9. Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization
    2024/10/09 by Changli Tang, Tang, Changli, Yixuan Li +11 · 1 citation
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Image and Video Processing (eess.IV) #Multimodal Machine Learning Applications #Video Analysis and Summarization #electronic engineering #information engineering
  10. SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations
    2026/07/19 by Xiaoyu Yang, Xuenan Xu, Wenyi Yu +10
    #eess.AS