vix.ing · top · new · best · stats · spec

Wenyi Yu

  1. SALMONN: Towards Generic Hearing Abilities for Large Language Models
    2023/10/20 by Changli Tang, Tang, Changli, Wenyi Yu +15 · 121 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  2. video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
    2024/06/22 by Guangzhi Sun, Wenyi Yu, Sun, Guangzhi +17 · 27 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing #Speech and Audio Processing
  3. Connecting Speech Encoder and Large Language Model for ASR
    2023/09/25 by Wenyi Yu, Changli Tang, Yu, Wenyi +15 · 13 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  4. Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
    2024/09/25 by Siyin Wang, Wang, Siyin, Wenyi Yu +20 · 10 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  5. Can Large Language Models Understand Spatial Audio?
    2024/06/12 by Changli Tang, Tang, Changli, Wenyi Yu +19 · 8 citations
    Computer Science · Social Sciences · #Audio and Speech Processing (eess.AS) #Computational and Text Analysis Methods #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  6. Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models
    2023/10/09 by Guangzhi Sun, Wenyi Yu, Sun, Guangzhi +14 · 3 citations
    Computer Science · #Music and Audio Processing #Multimodal Machine Learning Applications #Speech and Audio Processing
  7. QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
    2025/03/26 by Siyin Wang, Wenyi Yu, Wang, Siyin +16 · 6 citations
    Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis
  8. M3AV: A Multimodal, Multigenre, and Multipurpose Audio-Visual Academic Lecture Dataset
    2024/03/21 by Zhe Chen, Heyang Liu, Chen, Zhe +15 · 2 citations
    Arts and Humanities · Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Music and Audio Processing #Subtitles and Audiovisual Media #Video Analysis and Summarization
  9. Towards General Auditory Intelligence: Large Multimodal Models for Machine Listening and Speaking
    2025/11/03 by Siyin Wang, Wang, Siyin, Zengrui Jin +55 · 1 voice
    Computer Science · Engineering · Psychology · #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Electrical engineering #Multimodal Machine Learning Applications #Music and Audio Processing #eess.AS #electronic engineering #information engineering
  10. SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations
    2026/07/19 by Xiaoyu Yang, Xuenan Xu, Wenyi Yu +10
    #eess.AS