vix.ing · top · new · best · stats · spec

Rongjie Huang

  1. AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head
    2023/04/25 by Rongjie Huang, Mingze Li, Huang, Rongjie +23 · 1 voice · 47 citations
    Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Topic Modeling
  2. Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
    2023/12/13 by Haifeng Huang, Huang, Haifeng, Zehan Wang +15 · 39 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  3. HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec
    2023/05/04 by Dongchao Yang, Yang, Dongchao, Songxiang Liu +9 · 28 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  4. WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
    2024/08/29 by Shengpeng Ji, Ziyue Karen Jiang, Ji, Shengpeng +30 · 41 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  5. Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
    2024/06/05 by Le Zhuo, Ruoyi Du, Zhuo, Le +41 · 31 citations
    Computer Science · Physics and Astronomy · #Generative Adversarial Networks and Image Synthesis #Music Technology and Sound Studies #Model Reduction and Neural Networks
  6. Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation
    2023/05/29 by Jiawei Huang, Huang, Jiawei, Yi Ren +17 · 19 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  7. Multi-Singer: Fast Multi-Singer Singing Voice Vocoder With A Large-Scale Corpus
    2021/12/20 by Rongjie Huang, Huang, Rongjie, Feiyang Chen +9 · 13 citations
    Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Speech and Audio Processing
  8. InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt
    2023/01/31 by Dongchao Yang, Songxiang Liu, Yang, Dongchao +7 · 14 citations
    Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Music and Audio Processing
  9. ProDiff: Progressive Fast Diffusion Model For High-Quality Text-to-Speech
    2022/07/13 by Rongjie Huang, Zhou Zhao, Huang, Rongjie +9 · 10 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  10. GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation
    2023/05/01 by Zhenhui Ye, Jinzheng He, Ye, Zhenhui +17 · 8 citations
    Computer Science · #Face recognition and analysis #Generative Adversarial Networks and Image Synthesis #Speech and Audio Processing
  11. RMSSinger: Realistic-Music-Score based Singing Voice Synthesis
    2023/05/18 by Jinzheng He, Jinglin Liu, He, Jinzheng +11 · 7 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  12. Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias
    2023/06/06 by Ziyue Karen Jiang, Yi Ren, Jiang, Ziyue +21 · 7 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  13. UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
    2024/06/14 by Dongchao Yang, Haohan Guo, Yang, Dongchao +13 · 10 citations
    Computer Science · #Music and Audio Processing #Speech Recognition and Synthesis #Speech and Audio Processing
  14. OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
    2024/07/16 by Z.Y. Wang, Ziang Zhang, Wang, Zehan +13 · 9 citations
    Computer Science · #Web Data Mining and Analysis #Video Analysis and Summarization #Speech and dialogue systems
  15. Robust Singing Voice Transcription Serves Synthesis
    2024/05/16 by Ruiqi Li, Li, Ruiqi, Yu Zhang +9 · 7 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  16. FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion Models
    2023/05/23 by Ziyue Karen Jiang, Qian Yang, Jiang, Ziyue +11 · 5 citations
    Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Phonetics and Phonology Research #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  17. 3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization
    2024/03/29 by Yafeng Chen, Chen, Yafeng, Siqi Zheng +17 · 7 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Electrical engineering #Signal Processing (eess.SP) #Speech Recognition and Synthesis #electronic engineering #information engineering
  18. Make-A-Voice: Unified Voice Synthesis With Discrete Representation
    2023/05/30 by Rongjie Huang, Chunlei Zhang, Huang, Rongjie +17 · 5 citations
    Computer Science · #Speech Recognition and Synthesis #Music and Audio Processing #Topic Modeling
  19. CLAPSpeech: Learning Prosody from Text Context with Contrastive Language-Audio Pre-training
    2023/05/18 by Zhenhui Ye, Rongjie Huang, Ye, Zhenhui +13 · 4 citations
    Computer Science · Psychology · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Phonetics and Phonology Research #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and dialogue systems #electronic engineering #information engineering
  20. FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
    2024/05/08 by Zehan Wang, Wang, Zehan, Ziang Zhang +19 · 5 citations
    Computer Science · Chemistry · Materials Science · #Semantic Web and Ontologies #History and advancements in chemistry #Diatoms and Algae Research
  21. OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
    2025/01/02 by Xize Cheng, Cheng, Xize, Dongjie Fu +25 · 6 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Human-Computer Interaction (cs.HC) #Multi-Agent Systems and Negotiation #Sound (cs.SD) #Speech and dialogue systems #Topic Modeling #electronic engineering #information engineering
  22. VarietySound: Timbre-Controllable Video to Sound Generation via Unsupervised Information Disentanglement
    2022/11/19 by Chenye Cui, Cui, Chenye, Yi Ren +7 · 2 citations
    Computer Science · #Music and Audio Processing #Music Technology and Sound Studies #Speech and Audio Processing
  23. FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
    2024/10/16 by Huadai Liu, Liu, Huadai, Jialei Wang +11 · 4 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Video Analysis and Summarization #electronic engineering #information engineering
  24. Accompanied Singing Voice Synthesis with Fully Text-controlled Melody
    2024/07/02 by Ruiqi Li, Zhiqing Hong, Li, Ruiqi +11 · 3 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  25. Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset
    2025/06/27 by Vasu Agrawal, Agrawal, Vasu, Akinniyi Akinyemi +165 · 1 voice · 4 citations
    #cs.CV #cs.AI
  26. Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
    2023/09/14 by Yongqi Wang, Wang, Yongqi, Jionghao Bai +9 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  27. Text-to-Song: Towards Controllable Music Generation Incorporating Vocals and Accompaniment
    2024/04/14 by Zhiqing Hong, Hong, Zhiqing, Rongjie Huang +13 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #electronic engineering #information engineering
  28. MEDIC: Zero-shot Music Editing with Disentangled Inversion Control
    2024/07/18 by Huadai Liu, Liu, Huadai, Jialei Wang +13 · 2 citations
    Computer Science · #Music and Audio Processing #Music Technology and Sound Studies #Advanced Data Storage Technologies
  29. TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
    2023/12/23 by Xize Cheng, Rongjie Huang, Cheng, Xize +17 · 1 citation
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  30. Versatile Framework for Song Generation with Prompt-based Control
    2025/04/27 by Yu Zhang, Wenxiang Guo, Zhang, Yu +19 · 1 citation
    Computer Science · #Artificial Intelligence in Games #Music Technology and Sound Studies #Music and Audio Processing