vix.ing · top · new · best · stats · spec

Singh, Rita

  1. Pengi: An Audio Language Model for Audio Tasks
    2023/05/19 by Soham Deshmukh, Deshmukh, Soham, Benjamin Elizalde +5 · 1 voice · 33 citations
    Computer Science · Engineering · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #cs.SD #eess.AS #electronic engineering #information engineering
  2. ControlVAR: Exploring Controllable Visual Autoregressive Modeling
    2024/06/14 by Xiang Li, Li, Xiang, Kai Qiu +10 · 17 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Data Visualization and Analytics #FOS: Computer and information sciences
  3. PAM: Prompting Audio-Language Models for Audio Quality Assessment
    2024/02/01 by Soham Deshmukh, Deshmukh, Soham, Dareen Alharthi +13 · 13 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  4. SphereFace2: Binary Classification is All You Need for Deep Face Recognition
    2021/08/03 by Wen, Yandong, Liu, Weiyang, Weller, Adrian +2 · 5 citations
    #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  5. Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
    2024/07/25 by Soham Deshmukh, Shuo Han, Deshmukh, Soham +11 · 10 citations
    Arts and Humanities · #Subtitles and Audiovisual Media
  6. SphereFace Revived: Unifying Hyperspherical Face Recognition
    2021/09/12 by Weiyang Liu, Yandong Wen, Liu, Weiyang +7 · 4 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Biometric Identification and Security #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Face and Expression Recognition #Face recognition and analysis #Machine Learning (cs.LG)
  7. QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition
    2023/09/29 by Xiang Li, Li, Xiang, Jinglu Wang +11 · 5 citations
    Computer Science · #Music and Audio Processing #Speech and Audio Processing #Image and Signal Denoising Methods
  8. Mellow: a small audio language model for reasoning
    2025/03/11 by Soham Deshmukh, Deshmukh, Soham, Satvik Dixit +5 · 13 citations
    Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis
  9. Disjoint Mapping Network for Cross-modal Matching of Voices and Faces
    2018/07/12 by Yandong Wen, Wen, Yandong, Mahmoud Al Ismail +7 · 3 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Face recognition and analysis #Speech Recognition and Synthesis #Speech and Audio Processing
  10. Hierarchical Routing Mixture of Experts
    2019/03/18 by Zhao, Wenbo, Gao, Yang, Memon, Shahan Ali +2 · 2 citations
    #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML)
  11. GPT-Sentinel: Distinguishing Human and ChatGPT Generated Content
    2023/05/13 by Chen, Yutian, Kang, Hao, Zhai, Vivian +3 · 3 citations
    #Computation and Language (cs.CL) #FOS: Computer and information sciences
  12. Generalized Spoofing Detection Inspired from Audio Generation Artifacts
    2021/04/08 by Yang Gao, Tyler Vuong, Gao, Yang +7 · 2 citations
    Computer Science · #Music and Audio Processing #Speech and Audio Processing #Digital Media Forensic Detection
  13. LoFT: Local Proxy Fine-tuning For Improving Transferability Of Adversarial Attacks Against Large Language Model
    2023/10/02 by Muhammad A. Shah, Shah, Muhammad Ahmed, Roshan Lal Sharma +22 · 3 citations
    Computer Science · Medicine · #Artificial Intelligence (cs.AI) #Artificial Intelligence in Healthcare and Education #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
  14. Describing emotions with acoustic property prompts for speech emotion recognition
    2022/11/14 by Hira Dhamyal, Benjamin Elizalde, Dhamyal, Hira +9 · 2 citations
    Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  15. Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
    2025/02/18 by Hanin Atwany, Abdül Waheed, Atwany, Hanin +7 · 5 citations
    Biochemistry, Genetics and Molecular Biology · Neuroscience · #Cognitive Science and Education Research #Computation and Language (cs.CL) #FOS: Computer and information sciences #Fractal and DNA sequence analysis
  16. What Do Speech Foundation Models Not Learn About Speech?
    2024/10/16 by Abdül Waheed, Hanin Atwany, Waheed, Abdul +5 · 4 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  17. Imprecise Label Learning: A Unified Framework for Learning with Various Imprecise Label Configurations
    2023/05/22 by Hao Chen, Chen, Hao, Ankit Shah +15 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Text and Document Classification Technologies
  18. SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
    2024/07/22 by Hazim Bukhari, Soham Deshmukh, Bukhari, Hazim +7 · 3 citations
    Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  19. Prompting Audios Using Acoustic Properties For Emotion Representation
    2023/10/03 by Hira Dhamyal, Benjamin Elizalde, Dhamyal, Hira +9 · 2 citations
    Computer Science · Psychology · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Emotion and Mood Recognition #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  20. Speaker identification from the sound of the human breath
    2017/12/01 by Zhao, Wenbo, Gao, Yang, Singh, Rita · 1 citation
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (stat.ML) #Sound (cs.SD) #electronic engineering #information engineering
  21. Voice Impersonation using Generative Adversarial Networks
    2018/02/19 by Gao, Yang, Singh, Rita, Raj, Bhiksha · 1 citation
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  22. Evaluating Speech Synthesis by Training Recognizers on Synthetic Speech
    2023/10/01 by Dareen Alharthi, Alharthi, Dareen, Roshan Sharma +9 · 2 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #Topic Modeling #electronic engineering #information engineering
  23. Hide and Speak: Towards Deep Neural Networks for Speech Steganography
    2019/02/07 by Kreuk, Felix, Adi, Yossi, Raj, Bhiksha +2 · 1 citation
    #Audio and Speech Processing (eess.AS) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Sound (cs.SD) #electronic engineering #information engineering
  24. ADIFF: Explaining audio difference using natural language
    2025/02/06 by Soham Deshmukh, Deshmukh, Soham, Shuo Han +5 · 4 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
  25. A General Framework for Learning from Weak Supervision
    2024/02/02 by Hao Chen, Jindong Wang, Chen, Hao +15 · 2 citations
    Psychology · #Counseling, Therapy, and Family Dynamics #Counseling Practices and Supervision #Psychology, Coaching, and Therapy
  26. Training Audio Captioning Models without Audio
    2023/09/14 by Soham Deshmukh, Benjamin Elizalde, Deshmukh, Soham +9 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  27. Domain Adaptation for Contrastive Audio-Language Models
    2024/02/14 by Soham Deshmukh, Rita Singh, Deshmukh, Soham +3 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #electronic engineering #information engineering
  28. On the Robust Approximation of ASR Metrics
    2025/02/18 by Waheed, Abdul, Atwany, Hanin, Singh, Rita +1 · 1 citation
    #Computation and Language (cs.CL) #FOS: Computer and information sciences
  29. R2-Bench: Benchmarking the Robustness of Referring Perception Models under Perturbations
    2024/03/07 by Xiang Li, Kai Qiu, Li, Xiang +15 · 1 citation
    Computer Science · #Topic Modeling #Semantic Web and Ontologies #Neural Networks and Applications