vix.ing · top · new · best · stats · spec

Xize Cheng

  1. WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
    2024/08/29 by Shengpeng Ji, Ziyue Karen Jiang, Ziyue Jiang +33 · 1 voice · 48 citations
    Computer Science · Engineering · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multimedia (cs.MM) #Music and Audio Processing #Signal Processing (eess.SP) #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #cs.LG #cs.MM #cs.SD #eess.AS #eess.SP #electronic engineering #information engineering
  2. Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
    2023/12/13 by Haifeng Huang, Huang, Haifeng, Chen, Yilun +15 · 50 citations
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  3. WavChat: A Survey of Spoken Dialogue Models
    2024/11/15 by Shengpeng Ji, Yifu Chen, Ji, Shengpeng +35 · 28 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multi-Agent Systems and Negotiation #Multimedia (cs.MM) #Natural Language Processing Techniques #Sound (cs.SD) #Speech and dialogue systems #electronic engineering #information engineering
  4. Connecting Multi-modal Contrastive Representations
    2023/05/22 by Zehan Wang, Wang, Zehan, Yang Zhao +19 · 10 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #Computer Vision and Pattern Recognition (cs.CV) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #FOS: Electrical engineering #Human Pose and Action Recognition #Machine Learning (cs.LG) #Multimedia (cs.MM) #Multimodal Machine Learning Applications #Sound (cs.SD) #electronic engineering #information engineering
  5. OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
    2024/07/16 by Z.Y. Wang, Ziang Zhang, Wang, Zehan +13 · 11 citations
    Computer Science · #Web Data Mining and Analysis #Video Analysis and Summarization #Speech and dialogue systems
  6. ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
    2024/06/03 by Shengpeng Ji, Ji, Shengpeng, Qian Chen +18 · 8 citations
    Computer Science · #Speech Recognition and Synthesis #Natural Language Processing Techniques #Topic Modeling
  7. Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding
    2023/07/18 by Zehan Wang, Haifeng Huang, Wang, Zehan +13 · 5 citations
    Computer Science · #Advanced Image and Video Retrieval Techniques #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications
  8. 3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding
    2023/07/25 by Zehan Wang, Wang, Zehan, Haifeng Huang +13 · 5 citations
    Computer Science · Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Human Pose and Action Recognition #Multimodal Machine Learning Applications #Robotics and Sensor-Based Localization
  9. FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
    2024/05/08 by Zehan Wang, Ziang Zhang, Wang, Zehan +19 · 6 citations
    Computer Science · Chemistry · Materials Science · #Semantic Web and Ontologies #History and advancements in chemistry #Diatoms and Algae Research
  10. AudioLCM: Text-to-Audio Generation with Latent Consistency Models
    2024/06/01 by Huadai Liu, Rongjie Huang, Liu, Huadai +13 · 5 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Natural Language Processing Techniques #Sound (cs.SD) #Speech Recognition and Synthesis #electronic engineering #information engineering
  11. OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
    2025/01/02 by Xize Cheng, Dongjie Fu, Cheng, Xize +25 · 6 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Human-Computer Interaction (cs.HC) #Multi-Agent Systems and Negotiation #Sound (cs.SD) #Speech and dialogue systems #Topic Modeling #electronic engineering #information engineering
  12. Text-to-Song: Towards Controllable Music Generation Incorporating Vocals and Accompaniment
    2024/04/14 by Zhiqing Hong, Rongjie Huang, Hong, Zhiqing +13 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Music Technology and Sound Studies #Music and Audio Processing #electronic engineering #information engineering
  13. TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
    2023/12/23 by Xize Cheng, Rongjie Huang, Cheng, Xize +17 · 2 citations
    Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #FOS: Electrical engineering #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
  14. Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
    2025/02/08 by Jialong Zuo, Shengpeng Ji, Zuo, Jialong +19 · 4 citations
    Computer Science · #Speech Recognition and Synthesis #Speech and Audio Processing #Speech and dialogue systems
  15. WavReward: Spoken Dialogue Models With Generalist Reward Evaluators
    2025/05/14 by Shengpeng Ji, Ji, Shengpeng, Yangzhuo Li +22 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Multi-Agent Systems and Negotiation #Multimedia (cs.MM) #Sound (cs.SD) #Speech and dialogue systems #Topic Modeling #electronic engineering #information engineering
  16. OpenSR: Open-Modality Speech Recognition via Maintaining Multi-Modality Alignment
    2023/06/10 by Xize Cheng, Cheng, Xize, Tao Jin +9 · 1 citation
    Computer Science · #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Music and Audio Processing #Speech Recognition and Synthesis #Speech and Audio Processing
  17. SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
    2024/09/05 by Lingyu Xiong, Xize Cheng, Xiong, Lingyu +17 · 1 citation
    Computer Science · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Face recognition and analysis #Multimedia (cs.MM)
  18. A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
    2024/12/12 by Zirun Guo, Guo, Zirun, Xize Cheng +5 · 1 citation
    Computer Science · #Text and Document Classification Technologies #Speech and Audio Processing #Domain Adaptation and Few-Shot Learning
  19. Qwen-Music Technical Report
    2026/07/27 by Jin Xu, Kangdi Wang, Ruibin Yuan +24
    #cs.SD
  20. X3-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
    2026/07/23 by Dongjie Fu, Di Cao, Xize Cheng +6
    #cs.LG