vix.ing · top · new · best · stats · spec

Jianhua Tao

  1. ADD 2022: the First Audio Deep Synthesis Detection Challenge
    2022/02/17 by Jiangyan Yi, Ruibo Fu, Yi, Jiangyan +36 · 23 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  2. ADD 2023: the Second Audio Deepfake Detection Challenge
    2023/05/23 by Jiangyan Yi, Jianhua Tao, Yi, Jiangyan +33 · 25 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Generative Adversarial Networks and Image Synthesis #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  3. GCNet: Graph Completion Network for Incomplete Multimodal Learning in Conversation
    2022/03/04 by Zheng Lian, Lian, Zheng, Lan Chen +7 · 14 citations
    Computer Science · #Advanced Graph Neural Networks #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Sentiment Analysis and Opinion Mining #Topic Modeling
  4. CFAD: A Chinese Dataset for Fake Audio Detection
    2022/07/12 by Haoxin Ma, Jiangyan Yi, Ma, Haoxin +13 · 9 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  5. MER 2023: Multi-label Learning, Modality Robustness, and Semi-Supervised Learning
    2023/04/18 by Zheng Lian, Lian, Zheng, Haiyang Sun +27 · 10 citations
    Psychology · Computer Science · #Emotion and Mood Recognition #Sentiment Analysis and Opinion Mining #Text and Document Classification Technologies
  6. Half-Truth: A Partially Fake Audio Detection Dataset
    2021/04/08 by Jiangyan Yi, Ye Bai, Yi, Jiangyan +12 · 6 citations
    Computer Science · #Music and Audio Processing #Speech and Audio Processing #Speech Recognition and Synthesis
  7. The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
    2024/05/08 by Yuankun Xie, Yi Lu, Xie, Yuankun +21 · 12 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  8. AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models
    2025/01/27 by Zheng Lian, Haoyu Chen, Lian, Zheng +21 · 14 citations
    Computer Science · #Sentiment Analysis and Opinion Mining
  9. MERBench: A Unified Evaluation Benchmark for Multimodal Emotion Recognition
    2024/01/07 by Zheng Lian, Lian, Zheng, Licai Sun +13 · 7 citations
    Psychology · Computer Science · #Emotion and Mood Recognition #Sentiment Analysis and Opinion Mining #Text and Document Classification Technologies
  10. Fewer-token Neural Speech Codec with Time-invariant Codes
    2023/09/15 by Yong Ren, Tao Wang, Ren, Yong +11 · 6 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  11. MER 2024: Semi-Supervised Learning, Noise Robustness, and Open-Vocabulary Multimodal Emotion Recognition
    2024/04/26 by Zheng Lian, Lian, Zheng, Haiyang Sun +33 · 7 citations
    Psychology · #Emotion and Mood Recognition #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Machine Learning (cs.LG)
  12. What to Remember: Self-Adaptive Continual Learning for Audio Deepfake Detection
    2023/12/15 by Xiaohui Zhang, Jiangyan Yi, Zhang, Xiaohui +9 · 5 citations
    Computer Science · #Speech and Audio Processing #Digital Media Forensic Detection #Music and Audio Processing
  13. Detection of Cross-Dataset Fake Audio Based on Prosodic and Pronunciation Features
    2023/05/23 by Chenglong Wang, Jiangyan Yi, Wang, Chenglong +9 · 4 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  14. Fast End-to-End Speech Recognition via Non-Autoregressive Models and Cross-Modal Knowledge Transferring from BERT
    2021/02/15 by Ye Bai, Jiangyan Yi, Bai, Ye +9 · 2 citations
    Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Natural Language Processing Techniques
  15. FSR: Accelerating the Inference Process of Transducer-Based Models by Applying Fast-Skip Regularization
    2021/04/07 by Zhengkun Tian, Tian, Zhengkun, Jiangyan Yi +9 · 2 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  16. Spike-Triggered Non-Autoregressive Transformer for End-to-End Speech Recognition
    2020/05/16 by Zhengkun Tian, Tian, Zhengkun, Jiangyan Yi +9 · 3 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  17. OV-MER: Towards Open-Vocabulary Multimodal Emotion Recognition
    2024/10/02 by Zheng Lian, Lian, Zheng, Haiyang Sun +29 · 6 citations
    Psychology · #Emotion and Mood Recognition #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC)
  18. Fully Automated End-to-End Fake Audio Detection
    2022/08/20 by Chenglong Wang, Jiangyan Yi, Wang, Chenglong +15 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  19. Audio Deepfake Attribution: An Initial Dataset and Investigation
    2022/08/21 by Xinrui Yan, Yan, Xinrui, Jiangyan Yi +4 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  20. Listen Attentively, and Spell Once: Whole Sentence Generation via a Non-Autoregressive Architecture for Low-Latency Speech Recognition
    2020/05/11 by Ye Bai, Bai, Ye, Jiangyan Yi +9 · 2 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  21. Pandora's Box or Aladdin's Lamp: A Comprehensive Analysis Revealing the Role of RAG Noise in Large Language Models
    2024/08/24 by Jinyang Wu, Shuai Zhang, Wu, Jinyang +9 · 3 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Topic Modeling
  22. TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
    2025/05/21 by Jinyang Wu, Wu, Jinyang, Chan-Yu Liao +13 · 9 citations
    Decision Sciences · #Complex Systems and Decision Making #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  23. Region-Based Optimization in Continual Learning for Audio Deepfake Detection
    2024/12/16 by Yujie Chen, Chen, Yujie, Jiangyan Yi +23 · 4 citations
    Computer Science · #Anomaly Detection Techniques and Applications #Digital Media Forensic Detection #Speech and Audio Processing
  24. Do You Remember? Overcoming Catastrophic Forgetting for Fake Audio Detection
    2023/08/07 by Xiaohui Zhang, Jiangyan Yi, Zhang, Xiaohui +7 · 2 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Generative Adversarial Networks and Image Synthesis #Machine Learning (cs.LG) #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  25. AStar: Boosting Multimodal Reasoning with Automated Structured Thinking
    2025/02/04 by Jinyang Wu, Wu, Jinyang, Mingkuan Feng +14 · 4 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Semantic Web and Ontologies #Speech and dialogue systems
  26. VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing
    2024/08/11 by Chunyu Qiang, Qiang, Chunyu, Geng Wang +26 · 5 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #electronic engineering #information engineering
  27. Learn Spelling from Teachers: Transferring Knowledge from Language Models to Sequence-to-Sequence Speech Recognition
    2019/07/13 by Ye Bai, Bai, Ye, Jiangyan Yi +7 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Natural Language Processing Techniques #Speech Recognition and Synthesis #electronic engineering #information engineering
  28. Integrating Knowledge into End-to-End Speech Recognition from External Text-Only Data
    2019/12/04 by Ye Bai, Jiangyan Yi, Bai, Ye +9 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  29. DARNet: Dual Attention Refinement Network with Spatiotemporal Construction for Auditory Attention Detection
    2024/10/15 by Sheng Yan, Cunhang Fan, Yan, Sheng +9 · 3 citations
    Neuroscience · Engineering · #EEG and Brain-Computer Interfaces #Analog and Mixed-Signal Circuit Design
  30. Generalized Source Tracing: Detecting Novel Audio Deepfake Algorithm with Real Emphasis and Fake Dispersion Strategy
    2024/06/05 by Yuankun Xie, Ruibo Fu, Xie, Yuankun +13 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  31. Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio
    2024/06/12 by Yi Lu, Yuankun Xie, Lu, Yi +21 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  32. Reducing language context confusion for end-to-end code-switching automatic speech recognition
    2022/01/28 by Shuai Zhang, Zhang, Shuai, Jiangyan Yi +9 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Text Readability and Simplification #electronic engineering #information engineering
  33. Exploring the Role of Audio in Multimodal Misinformation Detection
    2024/08/22 by Yukun Liu, Liu, Moyang, Liu, Yukun +10 · 2 citations
    Social Sciences · #Misinformation and Its Impacts
  34. MDPE: A Multimodal Deception Dataset with Personality and Emotional Characteristics
    2024/07/17 by Cong Cai, Cai, Cong, Shan Liang +25 · 2 citations
    Computer Science · Psychology · Social Sciences · #Cybercrime and Law Enforcement Studies #Deception detection and forensic psychology #Crime Patterns and Interventions
  35. Manipulated Regions Localization For Partially Deepfake Audio: A Survey
    2025/06/17 by Jiayi He, Jiangyan Yi, He, Jiayi +7 · 3 citations
    Computer Science · #Speech and Audio Processing #Music and Audio Processing #Digital Media Forensic Detection
  36. DGSD: Dynamical Graph Self-Distillation for EEG-Based Auditory Spatial Attention Detection
    2023/09/07 by Cunhang Fan, Fan, Cunhang, Hongyu Zhang +13 · 1 citation
    Computer Science · Neuroscience · #Audio and Speech Processing (eess.AS) #Blind Source Separation Techniques #EEG and Brain-Computer Interfaces #FOS: Computer and information sciences #FOS: Electrical engineering #Human-Computer Interaction (cs.HC) #Machine Learning (cs.LG) #Multimedia (cs.MM) #Signal Processing (eess.SP) #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  37. Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
    2023/09/13 by Chu Yuan Zhang, Zhang, Chu Yuan, Jiangyan Yi +7 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  38. BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
    2024/12/26 by Cunhang Fan, Fan, Cunhang, Andong Li +12 · 2 citations
    Computer Science · Health Professions · #Speech and Audio Processing #Speech Recognition and Synthesis #Infant Health and Development
  39. ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
    2025/05/16 by Hao Gu, Jiangyan Yi, Gu, Hao +15 · 3 citations
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Speech Recognition and Synthesis #Music and Audio Processing
  40. DReSS: Data-driven Regularized Structured Streamlining for Large Language Models
    2025/01/29 by Mingkuan Feng, Jinyang Wu, Feng, Mingkuan +13 · 1 citation
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
  41. ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
    2024/07/07 by Ruibo Fu, Xin Qi, Fu, Ruibo +23 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  42. Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
    2024/08/20 by Yuankun Xie, Chenxu Xiong, Xie, Yuankun +21 · 1 citation
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Digital Media Forensic Detection #FOS: Computer and information sciences #FOS: Electrical engineering #Image and Signal Denoising Methods #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  43. Decoupling Pronunciation and Language for End-to-end Code-switching Automatic Speech Recognition
    2020/10/28 by Shuai Zhang, Zhang, Shuai, Jiangyan Yi +9 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  44. Reject Threshold Adaptation for Open-Set Model Attribution of Deepfake Audio
    2024/12/02 by Jiangyan Yi, Yan, Xinrui, Yi, Jiangyan +13 · 1 citation
    Computer Science · #Speech and Audio Processing #Image and Signal Denoising Methods #Music and Audio Processing
  45. RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
    2025/06/04 by Ruihan Jin, Pengpeng Shao, Jin, Ruihan +11 · 3 citations
    Computer Science · Physics and Astronomy · #Natural Language Processing Techniques #Complex Network Analysis Techniques #Advanced Graph Neural Networks
  46. SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
    2026/07/16 by Jinyang Wu, Shuo Yang, Zhengxi Lu +8 · 1 voice
    #cs.CL
  47. Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution
    2026/07/29 by Mingkuan Feng, Zhengqi Wen, Jianhua Tao
    Computer Science · #cs.AI #cs.CV