Wenyi Yu
- SALMONN: Towards Generic Hearing Abilities for Large Language Models
2023/10/20 by Changli Tang, Tang, Changli, Wenyi Yu +15 · 121 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
2024/06/22 by Guangzhi Sun, Wenyi Yu, Sun, Guangzhi +17 · 27 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing #Speech and Audio Processing
- Connecting Speech Encoder and Large Language Model for ASR
2023/09/25 by Wenyi Yu, Changli Tang, Yu, Wenyi +15 · 13 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
- Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
2024/09/25 by Siyin Wang, Wang, Siyin, Wenyi Yu +20 · 10 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- Can Large Language Models Understand Spatial Audio?
2024/06/12 by Changli Tang, Tang, Changli, Wenyi Yu +19 · 8 citations
Computer Science · Social Sciences · #Audio and Speech Processing (eess.AS) #Computational and Text Analysis Methods #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
- Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models
2023/10/09 by Guangzhi Sun, Wenyi Yu, Sun, Guangzhi +14 · 3 citations
Computer Science · #Music and Audio Processing #Multimodal Machine Learning Applications #Speech and Audio Processing
- QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
2025/03/26 by Siyin Wang, Wenyi Yu, Wang, Siyin +16 · 6 citations
Computer Science · #Natural Language Processing Techniques #Speech Recognition and Synthesis
- M3AV: A Multimodal, Multigenre, and Multipurpose Audio-Visual Academic Lecture Dataset
2024/03/21 by Zhe Chen, Heyang Liu, Chen, Zhe +15 · 2 citations
Arts and Humanities · Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Music and Audio Processing #Subtitles and Audiovisual Media #Video Analysis and Summarization
- Towards General Auditory Intelligence: Large Multimodal Models for Machine Listening and Speaking
2025/11/03 by Siyin Wang, Wang, Siyin, Zengrui Jin +55 · 1 voice
Computer Science · Engineering · Psychology · #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Electrical engineering #Multimodal Machine Learning Applications #Music and Audio Processing #eess.AS #electronic engineering #information engineering
- SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations
2026/07/19 by Xiaoyu Yang, Xuenan Xu, Wenyi Yu +10
#eess.AS