Rongjie Huang
- AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head
2023/04/25 by Rongjie Huang, Mingze Li, Huang, Rongjie +23 · 1 voice · 47 citations
Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Topic Modeling
- Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
2023/12/13 by Haifeng Huang, Huang, Haifeng, Zehan Wang +15 · 39 citations
Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
- HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec
2023/05/04 by Dongchao Yang, Yang, Dongchao, Songxiang Liu +9 · 28 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
2024/08/29 by Shengpeng Ji, Ziyue Karen Jiang, Ji, Shengpeng +30 · 41 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
2024/06/05 by Le Zhuo, Ruoyi Du, Zhuo, Le +41 · 31 citations
Computer Science · Physics and Astronomy · #Generative Adversarial Networks and Image Synthesis #Music Technology and Sound Studies #Model Reduction and Neural Networks
- Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation
2023/05/29 by Jiawei Huang, Huang, Jiawei, Yi Ren +17 · 19 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
- Multi-Singer: Fast Multi-Singer Singing Voice Vocoder With A Large-Scale Corpus
2021/12/20 by Rongjie Huang, Huang, Rongjie, Feiyang Chen +9 · 13 citations
Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Speech and Audio Processing
- InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt
2023/01/31 by Dongchao Yang, Songxiang Liu, Yang, Dongchao +7 · 14 citations
Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
- ProDiff: Progressive Fast Diffusion Model For High-Quality Text-to-Speech
2022/07/13 by Rongjie Huang, Zhou Zhao, Huang, Rongjie +9 · 10 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation
2023/05/01 by Zhenhui Ye, Jinzheng He, Ye, Zhenhui +17 · 8 citations
Computer Science · #Face recognition and analysis #Generative Adversarial Networks and Image Synthesis #Speech and Audio Processing
- RMSSinger: Realistic-Music-Score based Singing Voice Synthesis
2023/05/18 by Jinzheng He, Jinglin Liu, He, Jinzheng +11 · 7 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias
2023/06/06 by Ziyue Karen Jiang, Yi Ren, Jiang, Ziyue +21 · 7 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
2024/06/14 by Dongchao Yang, Haohan Guo, Yang, Dongchao +13 · 10 citations
Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Speech and Audio Processing
- OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
2024/07/16 by Z.Y. Wang, Ziang Zhang, Wang, Zehan +13 · 9 citations
Computer Science · #Web Data Mining and Analysis #Video Analysis and Summarization #Speech and dialogue systems
- Robust Singing Voice Transcription Serves Synthesis
2024/05/16 by Ruiqi Li, Li, Ruiqi, Yu Zhang +9 · 7 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion Models
2023/05/23 by Ziyue Karen Jiang, Qian Yang, Jiang, Ziyue +11 · 5 citations
Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Phonetics and Phonology Research #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- 3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization
2024/03/29 by Yafeng Chen, Chen, Yafeng, Siqi Zheng +17 · 7 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Electrical engineering #Signal Processing (eess.SP) #Speech Recognition and Synthesis #electronic engineering #information engineering
- Make-A-Voice: Unified Voice Synthesis With Discrete Representation
2023/05/30 by Rongjie Huang, Chunlei Zhang, Huang, Rongjie +17 · 5 citations
Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Topic Modeling
- CLAPSpeech: Learning Prosody from Text Context with Contrastive Language-Audio Pre-training
2023/05/18 by Zhenhui Ye, Rongjie Huang, Ye, Zhenhui +13 · 4 citations
Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Phonetics and Phonology Research #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #electronic engineering #information engineering
- FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
2024/05/08 by Zehan Wang, Wang, Zehan, Ziang Zhang +19 · 5 citations
Computer Science · Chemistry · Materials Science · #Semantic Web and Ontologies #History and advancements in chemistry #Diatoms and Algae Research
- OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
2025/01/02 by Xize Cheng, Cheng, Xize, Dongjie Fu +25 · 6 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Human-Computer Interaction (cs.HC) #Multi-Agent Systems and Negotiation #Sound (cs.SD) #Speech and dialogue systems #Topic Modeling #electronic engineering #information engineering
- VarietySound: Timbre-Controllable Video to Sound Generation via Unsupervised Information Disentanglement
2022/11/19 by Chenye Cui, Cui, Chenye, Yi Ren +7 · 2 citations
Computer Science · #Music and Audio Processing #Music Technology and Sound Studies #Speech and Audio Processing
- FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
2024/10/16 by Huadai Liu, Liu, Huadai, Jialei Wang +11 · 4 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Video Analysis and Summarization #electronic engineering #information engineering
- Accompanied Singing Voice Synthesis with Fully Text-controlled Melody
2024/07/02 by Ruiqi Li, Zhiqing Hong, Li, Ruiqi +11 · 3 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset
2025/06/27 by Vasu Agrawal, Agrawal, Vasu, Akinniyi Akinyemi +165 · 1 voice · 4 citations
#cs.CV #cs.AI
- Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
2023/09/14 by Yongqi Wang, Wang, Yongqi, Jionghao Bai +9 · 2 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Text-to-Song: Towards Controllable Music Generation Incorporating Vocals and Accompaniment
2024/04/14 by Zhiqing Hong, Hong, Zhiqing, Rongjie Huang +13 · 2 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #electronic engineering #information engineering
- MEDIC: Zero-shot Music Editing with Disentangled Inversion Control
2024/07/18 by Huadai Liu, Liu, Huadai, Jialei Wang +13 · 2 citations
Computer Science · #Music and Audio Processing #Music Technology and Sound Studies #Advanced Data Storage Technologies
- TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
2023/12/23 by Xize Cheng, Rongjie Huang, Cheng, Xize +17 · 1 citation
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Versatile Framework for Song Generation with Prompt-based Control
2025/04/27 by Yu Zhang, Wenxiang Guo, Zhang, Yu +19 · 1 citation
Computer Science · #Artificial Intelligence in Games #Music Technology and Sound Studies #Music and Audio Processing