vix.ing · top · new · best · stats · spec

Sun, Haoqin

  1. MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
    2025/01/18 by Cheng Liu, Hui Wang, Liu, Cheng +15 · 14 citations
    Arts and Humanities · Computer Science · #Audio and Speech Processing (eess.AS) #Diverse Musicological Studies #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  2. Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs
    2024/07/12 by Aobo Kong, Shiwan Zhao, Kong, Aobo +15 · 5 citations
    Business, Management and Accounting · Computer Science · #Business Process Modeling and Analysis #Computation and Language (cs.CL) #FOS: Computer and information sciences #Model-Driven Software Engineering Techniques #Multi-Agent Systems and Negotiation
  3. FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
    2025/02/16 by Wang, Hui, Liu, Shujie, Meng, Lingwei +9 · 9 citations
    #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  4. Fine-grained Disentangled Representation Learning for Multimodal Emotion Recognition
    2023/12/21 by Sun, Haoqin, Zhao, Shiwan, Wang, Xuechen +3 · 2 citations
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Sound (cs.SD) #electronic engineering #information engineering
  5. ChildMandarin: A Comprehensive Mandarin Speech Dataset for Young Children Aged 3-5
    2024/09/27 by Jiaming Zhou, Zhou, Jiaming, Shiyao Wang +19 · 3 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  6. Uncertainty-Aware Mean Opinion Score Prediction
    2024/08/23 by Hui Wang, Shiwan Zhao, Wang, Hui +11 · 4 citations
    Computer Science · Physics and Astronomy · #Sentiment Analysis and Opinion Mining #Opinion Dynamics and Social Influence #Advanced Text Analysis Techniques
  7. M2R-Whisper: Multi-stage and Multi-scale Retrieval Augmentation for Enhancing Whisper
    2024/09/18 by Jiaming Zhou, Shiwan Zhao, Zhou, Jiaming +12 · 3 citations
    Computer Science · #Sentiment Analysis and Opinion Mining
  8. Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
    2024/06/06 by Zhou, Jiaming, Zhao, Shiwan, Wang, Hui +4 · 2 citations
    #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  9. EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations
    2025/05/29 by Sun, Haoqin, Wang, Xuechen, Zhao, Jinghua +9 · 3 citations
    #FOS: Computer and information sciences #Multimedia (cs.MM)
  10. Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
    2024/07/12 by Haoqin Sun, Shiwan Zhao, Sun, Haoqin +17 · 2 citations
    Computer Science · Psychology · #Anomaly Detection Techniques and Applications #Emotion and Mood Recognition
  11. Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
    2024/12/30 by Xuechen Wang, Wang, Xuechen, Shiwan Zhao +9 · 2 citations
    Psychology · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  12. CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
    2025/02/26 by Zhou, Jiaming, Guo, Yujie, Zhao, Shiwan +9 · 2 citations
    #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  13. DIFFA: Large Language Diffusion Models Can Listen and Understand
    2025/07/24 by Zhou, Jiaming, Chen, Hongjie, Zhao, Shiwan +9 · 4 citations
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  14. Multi-Level Knowledge Distillation for Speech Emotion Recognition in Noisy Conditions
    2023/12/21 by Yang Liu, Liu, Yang, Haoqin Sun +11 · 1 citation
    Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  15. StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
    2025/06/14 by Hui Wang, Wang, Hui, Shujie Liu +16 · 4 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  16. AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
    2025/10/16 by Wang, Hui, Zhao, Jinghua, Liu, Cheng +4 · 1 citation
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  17. WildElder: A Chinese Elderly Speech Dataset from the Wild with Fine-Grained Manual Annotations
    2025/10/10 by Hui Wang, Jiaming Zhou, Wang, Hui +7 · 1 citation
    #cs.SD #eess.AS
  18. RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
    2025/05/26 by Jingguang Tian, Sun, Haoqin, Tian, Jingguang +18 · 2 citations
    Computer Science · #Music and Audio Processing #Speech and Audio Processing #Speech Recognition and Synthesis