Sun, Haoqin
- MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
2025/01/18 by Cheng Liu, Hui Wang, Liu, Cheng +15 · 14 citations
Arts and Humanities · Computer Science · #Audio and Speech Processing (eess.AS) #Diverse Musicological Studies #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
- Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs
2024/07/12 by Aobo Kong, Shiwan Zhao, Kong, Aobo +15 · 5 citations
Business, Management and Accounting · Computer Science · #Business Process Modeling and Analysis #Computation and Language (cs.CL) #FOS: Computer and information sciences #Model-Driven Software Engineering Techniques #Multi-Agent Systems and Negotiation
- FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
2025/02/16 by Wang, Hui, Liu, Shujie, Meng, Lingwei +9 · 9 citations
#Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- Fine-grained Disentangled Representation Learning for Multimodal Emotion Recognition
2023/12/21 by Sun, Haoqin, Zhao, Shiwan, Wang, Xuechen +3 · 2 citations
#Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Sound (cs.SD) #electronic engineering #information engineering
- ChildMandarin: A Comprehensive Mandarin Speech Dataset for Young Children Aged 3-5
2024/09/27 by Jiaming Zhou, Zhou, Jiaming, Shiyao Wang +19 · 3 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- Uncertainty-Aware Mean Opinion Score Prediction
2024/08/23 by Hui Wang, Shiwan Zhao, Wang, Hui +11 · 4 citations
Computer Science · Physics and Astronomy · #Sentiment Analysis and Opinion Mining #Opinion Dynamics and Social Influence #Advanced Text Analysis Techniques
- M2R-Whisper: Multi-stage and Multi-scale Retrieval Augmentation for Enhancing Whisper
2024/09/18 by Jiaming Zhou, Shiwan Zhao, Zhou, Jiaming +12 · 3 citations
Computer Science · #Sentiment Analysis and Opinion Mining
- Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
2024/06/06 by Zhou, Jiaming, Zhao, Shiwan, Wang, Hui +4 · 2 citations
#Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations
2025/05/29 by Sun, Haoqin, Wang, Xuechen, Zhao, Jinghua +9 · 3 citations
#FOS: Computer and information sciences #Multimedia (cs.MM)
- Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
2024/07/12 by Haoqin Sun, Shiwan Zhao, Sun, Haoqin +17 · 2 citations
Computer Science · Psychology · #Anomaly Detection Techniques and Applications #Emotion and Mood Recognition
- Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
2024/12/30 by Xuechen Wang, Wang, Xuechen, Shiwan Zhao +9 · 2 citations
Psychology · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
2025/02/26 by Zhou, Jiaming, Guo, Yujie, Zhao, Shiwan +9 · 2 citations
#Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- DIFFA: Large Language Diffusion Models Can Listen and Understand
2025/07/24 by Zhou, Jiaming, Chen, Hongjie, Zhao, Shiwan +9 · 4 citations
#Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- Multi-Level Knowledge Distillation for Speech Emotion Recognition in Noisy Conditions
2023/12/21 by Yang Liu, Liu, Yang, Haoqin Sun +11 · 1 citation
Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
2025/06/14 by Hui Wang, Wang, Hui, Shujie Liu +16 · 4 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
- AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
2025/10/16 by Wang, Hui, Zhao, Jinghua, Liu, Cheng +4 · 1 citation
#Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- WildElder: A Chinese Elderly Speech Dataset from the Wild with Fine-Grained Manual Annotations
2025/10/10 by Hui Wang, Jiaming Zhou, Wang, Hui +7 · 1 citation
#cs.SD #eess.AS
- RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
2025/05/26 by Jingguang Tian, Sun, Haoqin, Tian, Jingguang +18 · 2 citations
Computer Science · #Music and Audio Processing #Speech and Audio Processing #Speech Recognition and Synthesis