Dan Su
- Survey of Hallucination in Natural Language Generation
2022/11/17 by Ziwei Ji, Nayeon Lee, Rita Frieske +7 · 355 citations
Computer Science · #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
- A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity
2023/02/08 by Yejin Bang, Samuel Cahyawijaya, Bang, Yejin +23 · 2 voices · 43 citations
Computer Science · #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling #cs.AI #cs.CL
- Llama-Nemotron: Efficient Reasoning Models
2025/05/02 by Akhiad Bercovich, Bercovich, Akhiad, Itay Levy +224 · 1 voice · 29 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Topic Modeling
- MM-LLMs: Recent Advances in MultiModal Large Language Models
2024/01/24 by Duzhen Zhang, Yahan Yu, Zhang, Duzhen +11 · 49 citations
Computer Science · #Natural Language Processing Techniques #Topic Modeling #Text Readability and Simplification
- Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset
2024/12/03 by Dan Su, Su, Dan, Kezhi Kong +15 · 50 citations
Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Image Processing and 3D Reconstruction #Natural Language Processing Techniques #Semantic Web and Ontologies
- Nemotron-4 15B Technical Report
2024/02/26 by Jupinder Parmar, Shrimai Prabhumoye, Parmar, Jupinder +51 · 1 voice · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #cs.AI #cs.CL #cs.LG
- SpeechMoE: Scaling to Large Acoustic Models with Dynamic Routing Mixture of Experts
2021/05/07 by Zhao You, Shulin Feng, You, Zhao +5 · 6 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Deep Extractor Network for Target Speaker Recovery From Single Channel Speech Mixtures
2018/07/24 by Jun Wang, Jie Chen, Wang, Jun +11 · 5 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Plausible May Not Be Faithful: Probing Object Hallucination in Vision-Language Pre-training
2022/10/14 by Wenliang Dai, Zihan Liu, Dai, Wenliang +7 · 5 citations
Computer Science · Medicine · #Multimodal Machine Learning Applications #COVID-19 diagnosis using AI
- Sandglasset: A Light Multi-Granularity Self-attentive Network For Time-Domain Speech Separation
2021/03/01 by Max W. Y. Lam, Jun Wang, Lam, Max W. Y. +5 · 4 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Prompt-guided Precise Audio Editing with Diffusion Models
2024/05/11 by Manjie Xu, Xu, Manjie, Chenxing Li +9 · 7 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs
2022/01/28 by Songxiang Liu, Liu, Songxiang, Dan Su +3 · 4 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Replay and Synthetic Speech Detection with Res2net Architecture
2020/10/28 by Xu Li, Li, Xu, Na Li +11 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Non-Autoregressive Transformer ASR with CTC-Enhanced Decoder Input
2020/10/28 by Xingchen Song, Song, Xingchen, Zhiyong Wu +9 · 3 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
- Enhancing Speaking Styles in Conversational Text-to-Speech Synthesis with Graph-based Multi-modal Context Modeling
2021/06/11 by Jingbei Li, Li, Jingbei, Meng Yi +11 · 3 citations
Computer Science · #Speech and dialogue systems #Topic Modeling #Speech Recognition and Synthesis
- Maximize Your Data's Potential: Enhancing LLM Accuracy with Two-Phase Pretraining
2024/12/18 by Shrimai Prabhumoye, Feng, Steven, Prabhumoye, Shrimai +10 · 9 citations
Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Fault Detection and Control Systems #Machine Learning (cs.LG) #Machine Learning and Data Classification #Neural Networks and Applications
- NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model
2025/08/20 by NVIDIA, Aarti Basant, : +305 · 24 citations
Computer Science · #Advanced Neural Network Applications #Artificial Intelligence (cs.AI) #Big Data and Digital Economy #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Parallel Computing and Optimization Techniques
- Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
2024/06/03 by Yongxin Zhu, Dan Su, Zhu, Yongxin +7 · 4 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #Topic Modeling #electronic engineering #information engineering
- UniSyn: An End-to-End Unified Model for Text-to-Speech and Singing Voice Synthesis
2022/12/03 by Yi Lei, Shan Yang, Lei, Yi +11 · 2 citations
Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Speech and Audio Processing
- NusaCrowd: Open Source Initiative for Indonesian NLP Resources
2022/12/19 by Samuel Cahyawijaya, Cahyawijaya, Samuel, Holy Lovenia +91 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Speech Recognition and Synthesis #Speech and dialogue systems
- Speaker Independent and Multilingual/Mixlingual Speech-Driven Talking Head Generation Using Phonetic Posteriorgrams
2020/06/20 by Huirong Huang, Huang, Huirong, Zhiyong Wu +21 · 1 citation
Computer Science · #Speech and Audio Processing #Speech Recognition and Synthesis #Face recognition and analysis
- Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
2025/12/23 by NVIDIA, :, Aaron Blakeman +623 · 1 voice · 2 citations
#cs.CL #cs.AI #cs.LG
- Light regulates tomato fruit metabolome via SlDML2‐mediated global DNA demethylation
2025/10/23 by Zixin Zhang, Jing Zhang, Yi Wang +13 · 1 voice · 2 citations
Agricultural and Biological Sciences · Biochemistry, Genetics and Molecular Biology · #Light effects on plants #Photosynthetic Processes and Mechanisms #Plant Molecular Biology Research
- TeCANet: Temporal-Contextual Attention Network for Environment-Aware Speech Dereverberation
2021/03/31 by Helin Wang, Wang, Helin, Bo Wu +17 · 1 citation
Computer Science · Neuroscience · #Speech and Audio Processing #Hearing Loss and Rehabilitation #Music and Audio Processing