Singh, Rita
- Pengi: An Audio Language Model for Audio Tasks
2023/05/19 by Soham Deshmukh, Deshmukh, Soham, Benjamin Elizalde +5 · 1 voice · 33 citations
Computer Science · Engineering · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #cs.SD #eess.AS #electronic engineering #information engineering
- ControlVAR: Exploring Controllable Visual Autoregressive Modeling
2024/06/14 by Xiang Li, Li, Xiang, Kai Qiu +10 · 17 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Data Visualization and Analytics #FOS: Computer and information sciences
- PAM: Prompting Audio-Language Models for Audio Quality Assessment
2024/02/01 by Soham Deshmukh, Deshmukh, Soham, Dareen Alharthi +13 · 13 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- SphereFace2: Binary Classification is All You Need for Deep Face Recognition
2021/08/03 by Wen, Yandong, Liu, Weiyang, Weller, Adrian +2 · 5 citations
#Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
2024/07/25 by Soham Deshmukh, Shuo Han, Deshmukh, Soham +11 · 10 citations
Arts and Humanities · #Subtitles and Audiovisual Media
- SphereFace Revived: Unifying Hyperspherical Face Recognition
2021/09/12 by Weiyang Liu, Yandong Wen, Liu, Weiyang +7 · 4 citations
Computer Science · #Artificial Intelligence (cs.AI) #Biometric Identification and Security #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Face and Expression Recognition #Face recognition and analysis #Machine Learning (cs.LG)
- QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
2023/09/29 by Xiang Li, Li, Xiang, Jinglu Wang +11 · 5 citations
Computer Science · #Music and Audio Processing #Speech and Audio Processing #Image and Signal Denoising Methods
- Mellow: a small audio language model for reasoning
2025/03/11 by Soham Deshmukh, Deshmukh, Soham, Satvik Dixit +5 · 13 citations
Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis
- Disjoint Mapping Network for Cross-modal Matching of Voices and Faces
2018/07/12 by Yandong Wen, Wen, Yandong, Mahmoud Al Ismail +7 · 3 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Face recognition and analysis #Speech Recognition and Synthesis #Speech and Audio Processing
- Hierarchical Routing Mixture of Experts
2019/03/18 by Zhao, Wenbo, Gao, Yang, Memon, Shahan Ali +2 · 2 citations
#FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML)
- GPT-Sentinel: Distinguishing Human and ChatGPT Generated Content
2023/05/13 by Chen, Yutian, Kang, Hao, Zhai, Vivian +3 · 3 citations
#Computation and Language (cs.CL) #FOS: Computer and information sciences
- Generalized Spoofing Detection Inspired from Audio Generation Artifacts
2021/04/08 by Yang Gao, Tyler Vuong, Gao, Yang +7 · 2 citations
Computer Science · #Music and Audio Processing #Speech and Audio Processing #Digital Media Forensic Detection
- LoFT: Local Proxy Fine-tuning For Improving Transferability Of Adversarial Attacks Against Large Language Model
2023/10/02 by Muhammad A. Shah, Shah, Muhammad Ahmed, Roshan Lal Sharma +22 · 3 citations
Computer Science · Medicine · #Artificial Intelligence (cs.AI) #Artificial Intelligence in Healthcare and Education #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
- Describing emotions with acoustic property prompts for speech emotion recognition
2022/11/14 by Hira Dhamyal, Benjamin Elizalde, Dhamyal, Hira +9 · 2 citations
Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
2025/02/18 by Hanin Atwany, Abdül Waheed, Atwany, Hanin +7 · 5 citations
Biochemistry, Genetics and Molecular Biology · Neuroscience · #Cognitive Science and Education Research #Computation and Language (cs.CL) #FOS: Computer and information sciences #Fractal and DNA sequence analysis
- What Do Speech Foundation Models Not Learn About Speech?
2024/10/16 by Abdül Waheed, Hanin Atwany, Waheed, Abdul +5 · 4 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- Imprecise Label Learning: A Unified Framework for Learning with Various Imprecise Label Configurations
2023/05/22 by Hao Chen, Chen, Hao, Ankit Shah +15 · 2 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Text and Document Classification Technologies
- SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
2024/07/22 by Hazim Bukhari, Soham Deshmukh, Bukhari, Hazim +7 · 3 citations
Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Prompting Audios Using Acoustic Properties For Emotion Representation
2023/10/03 by Hira Dhamyal, Benjamin Elizalde, Dhamyal, Hira +9 · 2 citations
Computer Science · Psychology · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- Speaker identification from the sound of the human breath
2017/12/01 by Zhao, Wenbo, Gao, Yang, Singh, Rita · 1 citation
#Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (stat.ML) #Sound (cs.SD) #electronic engineering #information engineering
- Voice Impersonation using Generative Adversarial Networks
2018/02/19 by Gao, Yang, Singh, Rita, Raj, Bhiksha · 1 citation
#Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
- Evaluating Speech Synthesis by Training Recognizers on Synthetic Speech
2023/10/01 by Dareen Alharthi, Alharthi, Dareen, Roshan Sharma +9 · 2 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #Topic Modeling #electronic engineering #information engineering
- Hide and Speak: Towards Deep Neural Networks for Speech Steganography
2019/02/07 by Kreuk, Felix, Adi, Yossi, Raj, Bhiksha +2 · 1 citation
#Audio and Speech Processing (eess.AS) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Sound (cs.SD) #electronic engineering #information engineering
- ADIFF: Explaining audio difference using natural language
2025/02/06 by Soham Deshmukh, Deshmukh, Soham, Shuo Han +5 · 4 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- A General Framework for Learning from Weak Supervision
2024/02/02 by Hao Chen, Jindong Wang, Chen, Hao +15 · 2 citations
Psychology · #Counseling, Therapy, and Family Dynamics #Counseling Practices and Supervision #Psychology, Coaching, and Therapy
- Training Audio Captioning Models without Audio
2023/09/14 by Soham Deshmukh, Benjamin Elizalde, Deshmukh, Soham +9 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Domain Adaptation for Contrastive Audio-Language Models
2024/02/14 by Soham Deshmukh, Rita Singh, Deshmukh, Soham +3 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
- On the Robust Approximation of ASR Metrics
2025/02/18 by Waheed, Abdul, Atwany, Hanin, Singh, Rita +1 · 1 citation
#Computation and Language (cs.CL) #FOS: Computer and information sciences
- R2-Bench: Benchmarking the Robustness of Referring Perception Models under Perturbations
2024/03/07 by Xiang Li, Kai Qiu, Li, Xiang +15 · 1 citation
Computer Science · #Topic Modeling #Semantic Web and Ontologies #Neural Networks and Applications