- A Data-Centric Approach to Generalizable Speech Deepfake Detection
2025/12/20 by Huang, Wen, Mao, Yuchen, Qian, Yanmin · 1 citation
#FOS: Computer and information sciences #FOS: Electrical engineering #Signal Processing (eess.SP) #Sound (cs.SD) #electronic engineering #information engineering
- VABench: A Comprehensive Benchmark for Audio-Video Generation
2025/12/10 by Hua, Daili, Wang, Xizhi, Zeng, Bohan +6 · 2 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Sound (cs.SD)
- UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
2025/12/10 by Xuangeng Chu, Chu, Xuangeng, Ruicong Liu +9 · 1 citation
Computer Science · Psychology · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Face recognition and analysis #Social Robot Interaction and HRI #Sound (cs.SD) #Speech and Audio Processing
- Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition
2025/12/07 by Wang, Zihao, Yuan, Ruibin, Geng, Ziqi +7 · 1 citation
#Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Sound (cs.SD)
- YingMusic-Singer: Zero-shot Singing Voice Synthesis and Editing with Annotation-free Melody Guidance
2025/12/04 by Junjie Zheng, Zheng, Junjie, Guobin Ma +11 · 1 citation
Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis
- AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
2025/11/14 by Jiang, Zhonghua, Chen, Kui, Li, Kunxi +5 · 1 citation
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM) #Sound (cs.SD)
- CLARITY: Contextual Linguistic Adaptation and Accent Retrieval for Dual-Bias Mitigation in Text-to-Speech Generation
2025/11/14 by Poon, Crystal Min Hui, Ng, Pai Chet, Miao, Xiaoxiao +4 · 1 citation
#Computation and Language (cs.CL) #FOS: Computer and information sciences #Sound (cs.SD)
- StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
2025/11/12 by Li, Hongyi, Zhou, Chengxuan, Wang, Chu +5 · 1 citation
#FOS: Computer and information sciences #Sound (cs.SD)
- SyMuPe: Affective and Controllable Symbolic Music Performance
2025/11/05 by Borovik, Ilya, Gavrilev, Dmitrii, Viro, Vladimir · 1 citation
#FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimedia (cs.MM) #Sound (cs.SD)
- FOA Tokenizer: Low-bitrate Neural Codec for First Order Ambisonics with Spatial Consistency Loss
2025/10/25 by Sudarsanam, Parthasaarathy, Braun, Sebastian, Gamper, Hannes · 1 citation
#FOS: Computer and information sciences #Sound (cs.SD)
- AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
2025/10/16 by Wang, Hui, Zhao, Jinghua, Liu, Cheng +4 · 1 citation
#Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
2025/10/14 by Ma, Ziyang, Xu, Ruiyang, Xing, Zhenghao +9 · 2 citations
#Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimedia (cs.MM) #Sound (cs.SD)
- Not in Sync: Unveiling Temporal Bias in Audio Chat Models
2025/10/14 by Jiayu Yao, Shenghua Liu, Yao, Jiayu +12 · 1 citation
Arts and Humanities · Computer Science · Psychology · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Language, Metaphor, and Cognition #Sound (cs.SD) #Speech and dialogue systems #Subtitles and Audiovisual Media
- Automatic Speech Recognition in the Modern Era: Architectures, Training, and Evaluation
2025/10/11 by Nayeem, Md., Tabrej, Md Shamse, Deb, Kabbojit Jit +2 · 2 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment
2025/10/10 by Du, Zongcai, Deng, Guilin, Guo, Xiaofeng +8 · 2 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
2025/10/10 by Jiang, Yuxuan, Chen, Zehua, Ju, Zeqian +3 · 2 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- Moises-Light: Resource-efficient Band-split U-Net For Music Source Separation
2025/10/08 by Yun-Ning, Hung, Pereira, Igor +1 · 1 citation
#Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
2025/09/29 by Xu, Xuenan, Mei, Jiahao, Zheng, Zihao +9 · 3 citations
#FOS: Computer and information sciences #Sound (cs.SD)
- Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
2025/09/28 by Huang, Pu, Wang, Shouguang, Yao, Siya +1 · 1 citation
#Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Sound (cs.SD)
- Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
2025/09/28 by Li, Kai, Gao, Kejun, Hu, Xiaolin · 1 citation
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Sound (cs.SD)
- Object-AVEdit: An Object-level Audio-Visual Editing Model
2025/09/27 by Fu, Youquan, Si, Ruiyang, Wang, Hongfa +6 · 7 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Multimedia (cs.MM) #Sound (cs.SD) #electronic engineering #information engineering
- VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing
2025/09/26 by Wang, Ke, Ren, Houxing, Lu, Zimu +2 · 2 citations
#Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Sound (cs.SD)
- WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
2025/09/26 by Changli Tang, Tang, Changli, Qiyan Xiao +9 · 2 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Sound (cs.SD) #Topic Modeling
- WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
2025/09/22 by Dai, Yuhang, Zhang, Ziyu, Wang, Shuai +13 · 3 citations
#Computation and Language (cs.CL) #FOS: Computer and information sciences #Sound (cs.SD)
- SongPrep: A Preprocessing Framework and End-to-end Model for Full-song Structure Parsing and Lyrics Transcription
2025/09/22 by Tan, Wei, Lei, Shun, Zhang, Huaicheng +6 · 2 citations
#Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
2025/09/20 by Raja, Vishnu, Ganesan, Adithya V, Syamkumar, Anand +2 · 1 citation
#Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- Etude: Piano Cover Generation with a Three-Stage Approach - Extract, strucTUralize, and DEcode
2025/09/20 by Chen, Tse-Yang, Joung, Yuh-Jzer · 1 citation
#Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Sound (cs.SD) #electronic engineering #information engineering
- The MSP-Podcast Corpus
2025/09/11 by Busso, Carlos, Lotfian, Reza, Sridhar, Kusha +9 · 5 citations
#Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- Bona fide Cross Testing Reveals Weak Spot in Audio Deepfake Detection Systems
2025/09/11 by Kwok, Chin Yuen, Yip, Jia Qi, Qiu, Zhen +2 · 4 citations
#Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Sound (cs.SD)
- MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
2025/09/11 by Pan, Zihan, Bhupendra, Sailor Hardik, Wu, Jinyang · 2 citations
#FOS: Computer and information sciences #Multimedia (cs.MM) #Sound (cs.SD)
more