vix.ing · top · new · best · stats · spec
  1. A Data-Centric Approach to Generalizable Speech Deepfake Detection
    2025/12/20 by Huang, Wen, Mao, Yuchen, Qian, Yanmin · 1 citation
    #FOS: Computer and information sciences #FOS: Electrical engineering #Signal Processing (eess.SP) #Sound (cs.SD) #electronic engineering #information engineering
  2. VABench: A Comprehensive Benchmark for Audio-Video Generation
    2025/12/10 by Hua, Daili, Wang, Xizhi, Zeng, Bohan +6 · 2 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Sound (cs.SD)
  3. UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
    2025/12/10 by Xuangeng Chu, Chu, Xuangeng, Ruicong Liu +9 · 1 citation
    Computer Science · Psychology · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Face recognition and analysis #Social Robot Interaction and HRI #Sound (cs.SD) #Speech and Audio Processing
  4. Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition
    2025/12/07 by Wang, Zihao, Yuan, Ruibin, Geng, Ziqi +7 · 1 citation
    #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Sound (cs.SD)
  5. YingMusic-Singer: Zero-shot Singing Voice Synthesis and Editing with Annotation-free Melody Guidance
    2025/12/04 by Junjie Zheng, Zheng, Junjie, Guobin Ma +11 · 1 citation
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis
  6. AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
    2025/11/14 by Jiang, Zhonghua, Chen, Kui, Li, Kunxi +5 · 1 citation
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM) #Sound (cs.SD)
  7. CLARITY: Contextual Linguistic Adaptation and Accent Retrieval for Dual-Bias Mitigation in Text-to-Speech Generation
    2025/11/14 by Poon, Crystal Min Hui, Ng, Pai Chet, Miao, Xiaoxiao +4 · 1 citation
    #Computation and Language (cs.CL) #FOS: Computer and information sciences #Sound (cs.SD)
  8. StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
    2025/11/12 by Li, Hongyi, Zhou, Chengxuan, Wang, Chu +5 · 1 citation
    #FOS: Computer and information sciences #Sound (cs.SD)
  9. SyMuPe: Affective and Controllable Symbolic Music Performance
    2025/11/05 by Borovik, Ilya, Gavrilev, Dmitrii, Viro, Vladimir · 1 citation
    #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimedia (cs.MM) #Sound (cs.SD)
  10. FOA Tokenizer: Low-bitrate Neural Codec for First Order Ambisonics with Spatial Consistency Loss
    2025/10/25 by Sudarsanam, Parthasaarathy, Braun, Sebastian, Gamper, Hannes · 1 citation
    #FOS: Computer and information sciences #Sound (cs.SD)
  11. AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
    2025/10/16 by Wang, Hui, Zhao, Jinghua, Liu, Cheng +4 · 1 citation
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  12. Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
    2025/10/14 by Ma, Ziyang, Xu, Ruiyang, Xing, Zhenghao +9 · 2 citations
    #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM) #Sound (cs.SD)
  13. Not in Sync: Unveiling Temporal Bias in Audio Chat Models
    2025/10/14 by Jiayu Yao, Shenghua Liu, Yao, Jiayu +12 · 1 citation
    Arts and Humanities · Computer Science · Psychology · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Language, Metaphor, and Cognition #Sound (cs.SD) #Speech and dialogue systems #Subtitles and Audiovisual Media
  14. Automatic Speech Recognition in the Modern Era: Architectures, Training, and Evaluation
    2025/10/11 by Nayeem, Md., Tabrej, Md Shamse, Deb, Kabbojit Jit +2 · 2 citations
    #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  15. DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment
    2025/10/10 by Du, Zongcai, Deng, Guilin, Guo, Xiaofeng +8 · 2 citations
    #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  16. ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
    2025/10/10 by Jiang, Yuxuan, Chen, Zehua, Ju, Zeqian +3 · 2 citations
    #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  17. Moises-Light: Resource-efficient Band-split U-Net For Music Source Separation
    2025/10/08 by Yun-Ning, Hung, Pereira, Igor +1 · 1 citation
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  18. UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
    2025/09/29 by Xu, Xuenan, Mei, Jiahao, Zheng, Zihao +9 · 3 citations
    #FOS: Computer and information sciences #Sound (cs.SD)
  19. Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
    2025/09/28 by Huang, Pu, Wang, Shouguang, Yao, Siya +1 · 1 citation
    #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Sound (cs.SD)
  20. Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
    2025/09/28 by Li, Kai, Gao, Kejun, Hu, Xiaolin · 1 citation
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Sound (cs.SD)
  21. Object-AVEdit: An Object-level Audio-Visual Editing Model
    2025/09/27 by Fu, Youquan, Si, Ruiyang, Wang, Hongfa +6 · 7 citations
    #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Sound (cs.SD) #electronic engineering #information engineering
  22. VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing
    2025/09/26 by Wang, Ke, Ren, Houxing, Lu, Zimu +2 · 2 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Sound (cs.SD)
  23. WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
    2025/09/26 by Changli Tang, Tang, Changli, Qiyan Xiao +9 · 2 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Sound (cs.SD) #Topic Modeling
  24. WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
    2025/09/22 by Dai, Yuhang, Zhang, Ziyu, Wang, Shuai +13 · 3 citations
    #Computation and Language (cs.CL) #FOS: Computer and information sciences #Sound (cs.SD)
  25. SongPrep: A Preprocessing Framework and End-to-end Model for Full-song Structure Parsing and Lyrics Transcription
    2025/09/22 by Tan, Wei, Lei, Shun, Zhang, Huaicheng +6 · 2 citations
    #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  26. Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
    2025/09/20 by Raja, Vishnu, Ganesan, Adithya V, Syamkumar, Anand +2 · 1 citation
    #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  27. Etude: Piano Cover Generation with a Three-Stage Approach - Extract, strucTUralize, and DEcode
    2025/09/20 by Chen, Tse-Yang, Joung, Yuh-Jzer · 1 citation
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Sound (cs.SD) #electronic engineering #information engineering
  28. The MSP-Podcast Corpus
    2025/09/11 by Busso, Carlos, Lotfian, Reza, Sridhar, Kusha +9 · 5 citations
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  29. Bona fide Cross Testing Reveals Weak Spot in Audio Deepfake Detection Systems
    2025/09/11 by Kwok, Chin Yuen, Yip, Jia Qi, Qiu, Zhen +2 · 4 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Sound (cs.SD)
  30. MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
    2025/09/11 by Pan, Zihan, Bhupendra, Sailor Hardik, Wu, Jinyang · 2 citations
    #FOS: Computer and information sciences #Multimedia (cs.MM) #Sound (cs.SD)

more