vix.ing · top · new · best · stats · spec

Ma, Bin

  1. The similarity metric
    2001/11/20 by Ming Li, Li, Ming, Xin Chen +7 · 9 citations
    Biochemistry, Genetics and Molecular Biology · Computer Science · #Algorithms and Data Compression #Combinatorics (math.CO) #Computability, Logic, AI Algorithms #Computational Complexity (cs.CC) #Computational Engineering #Computer Vision and Pattern Recognition (cs.CV) #Data Analysis #E.4 #FOS: Biological sciences #FOS: Computer and information sciences #FOS: Mathematics #FOS: Physical sciences #Finance #Fractal and DNA sequence analysis #Genomics (q-bio.GN) #J.3 #Metric Geometry (math.MG) #Statistical Mechanics (cond-mat.stat-mech) #Statistics Theory (math.ST) #Statistics and Probability (physics.data-an) #and Science (cs.CE)
  2. M2MeT: The ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge
    2021/10/14 by Fan Yu, Yu, Fan, Shiliang Zhang +21 · 17 citations
    Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Topic Modeling
  3. FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs
    2024/07/04 by An, Keyu, Chen, Qian, Deng, Chong +30 · 30 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #Speech and dialogue systems #electronic engineering #information engineering
  4. FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
    2022/06/15 by Shengkui Zhao, Bin Ma, Zhao, Shengkui +5 · 13 citations
    Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Phonetics and Phonology Research #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  5. MinMo: A Multimodal Large Language Model for Seamless Voice Interaction
    2025/01/10 by Chen, Qian, Chen, Yafeng, Chen, Yanni +33 · 25 citations
    #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Human-Computer Interaction (cs.HC) #Sound (cs.SD) #electronic engineering #information engineering
  6. MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
    2023/12/19 by Shengkui Zhao, Yukun Ma, Zhao, Shengkui +17 · 12 citations
    Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Phonetics and Phonology Research #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  7. MossFormer: Pushing the Performance Limit of Monaural Speech Separation using Gated Single-Head Transformer with Convolution-Augmented Joint Self-Attentions
    2023/02/23 by Shengkui Zhao, Zhao, Shengkui, Bin Ma +1 · 8 citations
    Computer Science · Engineering · #Speech and Audio Processing #Speech Recognition and Synthesis #Ultrasonics and Acoustic Wave Propagation
  8. Robust Identity Perceptual Watermark Against Deepfake Face Swapping
    2023/11/02 by Tianyi Wang, Wang, Tianyi, Mengxiao Huang +7 · 6 citations
    Computer Science · #Digital Media Forensic Detection #Advanced Steganography and Watermarking Techniques #Face recognition and analysis
  9. Summary On The ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Grand Challenge
    2022/02/08 by Fan Yu, Shiliang Zhang, Yu, Fan +29 · 4 citations
    Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Speech and Audio Processing
  10. On The Closest String and Substring Problems
    2000/02/17 by Ming Li, Li, Ming, Bin Ma +3 · 1 citation
    Biochemistry, Genetics and Molecular Biology · Computer Science · #Algorithms and Data Compression #Computational Complexity (cs.CC) #Computational Engineering #DNA and Biological Computing #F.2 #FOS: Computer and information sciences #Finance #J.3 #Machine Learning and Algorithms #and Science (cs.CE) #cs.CC #cs.CE
  11. InspireMusic: Integrating Super Resolution and Large Language Model for High-Fidelity Long-Form Music Generation
    2025/02/28 by Zhang, Chong, Ma, Yukun, Chen, Qian +12 · 6 citations
    #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  12. Adaptive Knowledge Distillation between Text and Speech Pre-trained Models
    2023/03/07 by Jinjie Ni, Ni, Jinjie, Yukun Ma +17 · 2 citations
    Computer Science · #Speech Recognition and Synthesis #Topic Modeling #Natural Language Processing Techniques
  13. I2CR: Improving Noise Robustness on Keyword Spotting Using Inter-Intra Contrastive Regularization
    2022/09/14 by Dianwen Ng, Jia Qi Yip, Ng, Dianwen +15 · 2 citations
    Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
  14. deHuBERT: Disentangling Noise in a Self-supervised Model for Robust Speech Recognition
    2023/02/28 by Ng, Dianwen, Zhang, Ruixi, Yip, Jia Qi +7 · 2 citations
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  15. Towards Audio Codec-based Speech Separation
    2024/06/18 by Yip, Jia Qi, Zhao, Shengkui, Ng, Dianwen +2 · 3 citations
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Sound (cs.SD) #electronic engineering #information engineering
  16. Towards Natural and Controllable Cross-Lingual Voice Conversion Based on Neural TTS Model and Phonetic Posteriorgram
    2021/02/03 by Shengkui Zhao, Zhao, Shengkui, Hao Wang +5 · 1 citation
    Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Natural Language Processing Techniques
  17. Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses
    2021/02/03 by Zhao, Shengkui, Nguyen, Trung Hieu, Ma, Bin · 1 citation
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Sound (cs.SD) #electronic engineering #information engineering
  18. ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment
    2025/06/24 by Shengkui Zhao, Zhao, Shengkui, Bin Ma +2 · 4 citations
    Computer Science · #Speech and dialogue systems
  19. Speech Separation using Neural Audio Codecs with Embedding Loss
    2024/11/27 by Jia Qi Yip, Yip, Jia Qi, Chin Yuen Kwok +5 · 2 citations
    Computer Science · #Advanced Data Compression Techniques #Audio and Speech Processing (eess.AS) #FOS: Electrical engineering #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  20. HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
    2025/01/17 by Zhao, Shengkui, Zhou, Kun, Pan, Zexu +3 · 2 citations
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  21. Multi-band Frequency Reconstruction for Neural Psychoacoustic Coding
    2025/05/12 by Ng, Dianwen, Zhou, Kun, Chao, Yi-Wen +3 · 3 citations
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  22. SPGM: Prioritizing Local Features for enhanced speech separation performance
    2023/09/22 by Yip, Jia Qi, Zhao, Shengkui, Ma, Yukun +8 · 1 citation
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  23. FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems
    2025/07/25 by Y Peng, Peng, Yizhou, Yi Chao +11 · 4 citations
    Computer Science · Decision Sciences · #Speech and dialogue systems #Personal Information Management and User Behavior #Topic Modeling
  24. ZenFlow: Enabling Stall-Free Offloading Training via Asynchronous Updates
    2025/05/18 by Lan, Tingfeng, Wu, Yusen, Ma, Bin +7 · 3 citations
    #C.1.4 #D.4.7 #Distributed #FOS: Computer and information sciences #Machine Learning (cs.LG) #Parallel #and Cluster Computing (cs.DC)
  25. Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding
    2024/09/12 by Hongyu Li, Tianrui Hui, Li, Hongyu +13 · 1 citation
    Arts and Humanities · Computer Science · #Artificial Intelligence in Games #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Narrative Theory and Analysis #Topic Modeling
  26. Independent language modeling architecture for end-to-end ASR
    2019/11/25 by Van Tung Pham, Pham, Van Tung, Haihua Xu +13 · 1 citation
    Computer Science · #Speech Recognition and Synthesis #Natural Language Processing Techniques #Music and Audio Processing
  27. Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
    2025/01/17 by Zhao, Shengkui, Pan, Zexu, Zhou, Kun +3 · 1 citation
    #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Sound (cs.SD) #electronic engineering #information engineering
  28. Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation
    2025/12/29 by Shaocong Xu, Xu, Shaocong, Songlin Wei +27 · 1 citation
    Computer Science · #Generative Adversarial Networks and Image Synthesis #Advanced Vision and Imaging #Image Enhancement Techniques