Siddharth Gururani
- Cosmos World Foundation Model Platform for Physical AI
2025/01/07 by NVIDIA, Niket Agarwal, : +151 · 180 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #Distributed and Parallel Computing Systems #FOS: Computer and information sciences #Machine Learning (cs.LG) #Robotics (cs.RO)
- Symbolic Music Generation with Non-Differentiable Rule Guided Diffusion
2024/02/22 by Yujia Huang, Huang, Yujia, Adishree Ghatare +15 · 9 citations
Computer Science · #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music Technology and Sound Studies #Music and Audio Processing #Sound (cs.SD) #Speech and Audio Processing #electronic engineering #information engineering
- SPACE: Speech-driven Portrait Animation with Controllable Expression
2022/11/17 by Siddharth Gururani, Gururani, Siddharth, Arun Mallya +7 · 6 citations
Computer Science · Engineering · #Face recognition and analysis #Generative Adversarial Networks and Image Synthesis #Human Motion and Animation
- Prosody Transfer in Neural Text to Speech Using Global Pitch and Loudness Features
2019/11/21 by Siddharth Gururani, Gururani, Siddharth, Kilol Gupta +6 · 3 citations
Computer Science · #Audio and Speech Processing (eess.AS) #Computation and Language (cs.CL) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Music and Audio Processing #Sound (cs.SD) #Speech Recognition and Synthesis #Speech and Audio Processing #electronic engineering #information engineering
- Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models
2024/11/11 by Nvidia Nvidia, NVIDIA, Yuval Atzmon +56 · 6 citations
Computer Science · Engineering · #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Image Processing Techniques and Applications #Image Retrieval and Classification Techniques #Machine Learning (cs.LG) #Medical Image Segmentation Techniques
- World Simulation with Video Foundation Models for Physical AI
2025/10/28 by Nvidia Nvidia, NVIDIA, : +170 · 14 citations
Computer Science · #Multimodal Machine Learning Applications #Generative Adversarial Networks and Image Synthesis #Reinforcement Learning in Robotics
- Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
2026/07/17 by Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19
#eess.AS #cs.CV