vix.ing · top · new · best · stats · spec

Dan Su

  1. Survey of Hallucination in Natural Language Generation
    2022/11/17 by Ziwei Ji, Nayeon Lee, Rita Frieske +7 · 355 citations
    Computer Science · #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  2. A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity
    2023/02/08 by Yejin Bang, Samuel Cahyawijaya, Bang, Yejin +23 · 2 voices · 43 citations
    Computer Science · #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling #cs.AI #cs.CL
  3. Llama-Nemotron: Efficient Reasoning Models
    2025/05/02 by Akhiad Bercovich, Bercovich, Akhiad, Itay Levy +224 · 1 voice · 29 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Topic Modeling
  4. MM-LLMs: Recent Advances in MultiModal Large Language Models
    2024/01/24 by Duzhen Zhang, Yahan Yu, Zhang, Duzhen +11 · 49 citations
    Computer Science · #Natural Language Processing Techniques #Topic Modeling #Text Readability and Simplification
  5. Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset
    2024/12/03 by Dan Su, Su, Dan, Kezhi Kong +15 · 50 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Image Processing and 3D Reconstruction #Natural Language Processing Techniques #Semantic Web and Ontologies
  6. Nemotron-4 15B Technical Report
    2024/02/26 by Jupinder Parmar, Shrimai Prabhumoye, Parmar, Jupinder +51 · 1 voice · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #cs.AI #cs.CL #cs.LG
  7. SpeechMoE: Scaling to Large Acoustic Models with Dynamic Routing Mixture of Experts
    2021/05/07 by Zhao You, Shulin Feng, You, Zhao +5 · 6 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  8. Deep Extractor Network for Target Speaker Recovery From Single Channel Speech Mixtures
    2018/07/24 by Jun Wang, Jie Chen, Wang, Jun +11 · 5 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  9. Plausible May Not Be Faithful: Probing Object Hallucination in Vision-Language Pre-training
    2022/10/14 by Wenliang Dai, Zihan Liu, Dai, Wenliang +7 · 5 citations
    Computer Science · Medicine · #Multimodal Machine Learning Applications #COVID-19 diagnosis using AI
  10. Sandglasset: A Light Multi-Granularity Self-attentive Network For Time-Domain Speech Separation
    2021/03/01 by Max W. Y. Lam, Jun Wang, Lam, Max W. Y. +5 · 4 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  11. Prompt-guided Precise Audio Editing with Diffusion Models
    2024/05/11 by Manjie Xu, Xu, Manjie, Chenxing Li +9 · 7 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  12. DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs
    2022/01/28 by Songxiang Liu, Liu, Songxiang, Dan Su +3 · 4 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  13. Replay and Synthetic Speech Detection with Res2net Architecture
    2020/10/28 by Xu Li, Li, Xu, Na Li +11 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  14. Non-Autoregressive Transformer ASR with CTC-Enhanced Decoder Input
    2020/10/28 by Xingchen Song, Song, Xingchen, Zhiyong Wu +9 · 3 citations
    Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
  15. Enhancing Speaking Styles in Conversational Text-to-Speech Synthesis with Graph-based Multi-modal Context Modeling
    2021/06/11 by Jingbei Li, Li, Jingbei, Meng Yi +11 · 3 citations
    Computer Science · #Speech and dialogue systems #Topic Modeling #Speech Recognition and Synthesis
  16. Maximize Your Data's Potential: Enhancing LLM Accuracy with Two-Phase Pretraining
    2024/12/18 by Shrimai Prabhumoye, Feng, Steven, Prabhumoye, Shrimai +10 · 9 citations
    Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Fault Detection and Control Systems #Machine Learning (cs.LG) #Machine Learning and Data Classification #Neural Networks and Applications
  17. NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model
    2025/08/20 by NVIDIA, Aarti Basant, : +305 · 24 citations
    Computer Science · #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Big Data and Digital Economy #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Parallel Computing and Optimization Techniques
  18. Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
    2024/06/03 by Yongxin Zhu, Dan Su, Zhu, Yongxin +7 · 4 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
  19. UniSyn: An End-to-End Unified Model for Text-to-Speech and Singing Voice Synthesis
    2022/12/03 by Yi Lei, Shan Yang, Lei, Yi +11 · 2 citations
    Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Speech and Audio Processing
  20. NusaCrowd: Open Source Initiative for Indonesian NLP Resources
    2022/12/19 by Samuel Cahyawijaya, Cahyawijaya, Samuel, Holy Lovenia +91 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems
  21. Speaker Independent and Multilingual/Mixlingual Speech-Driven Talking Head Generation Using Phonetic Posteriorgrams
    2020/06/20 by Huirong Huang, Huang, Huirong, Zhiyong Wu +21 · 1 citation
    Computer Science · #Speech and Audio Processing #Speech Recognition and Synthesis #Face recognition and analysis
  22. Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
    2025/12/23 by NVIDIA, :, Aaron Blakeman +623 · 1 voice · 2 citations
    #cs.CL #cs.AI #cs.LG
  23. Light regulates tomato fruit metabolome via SlDML2‐mediated global DNA demethylation
    2025/10/23 by Zixin Zhang, Jing Zhang, Yi Wang +13 · 1 voice · 2 citations
    Agricultural and Biological Sciences · Biochemistry, Genetics and Molecular Biology · #Light effects on plants #Photosynthetic Processes and Mechanisms #Plant Molecular Biology Research
  24. TeCANet: Temporal-Contextual Attention Network for Environment-Aware Speech Dereverberation
    2021/03/31 by Helin Wang, Wang, Helin, Bo Wu +17 · 1 citation
    Computer Science · Neuroscience · #Speech and Audio Processing #Hearing Loss and Rehabilitation #Music and Audio Processing