vix.ing · top · new · best · stats · spec

Aviral Kumar

  1. Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
    2025/07/07 by Gheorghe Comanici, Comanici, Gheorghe, Eric Bieber +6844 · 8 voices · 1375 citations
    #cs.CL #cs.AI
  2. Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
    2024/03/08 by Gemini Robotics Team, Gemini Team, Petko Georgiev +2277 · 4 voices · 559 citations
    Computer Science · #Semantic Web and Ontologies
  3. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
    2024/08/06 by Charlie Snell, Snell, Charlie, Jaehoon Lee +5 · 9 voices · 390 citations
    #cs.LG #cs.CL
  4. Training Language Models to Self-Correct via Reinforcement Learning
    2024/09/19 by Aviral Kumar, Vincent Zhuang, Kumar, Aviral +36 · 2 voices · 76 citations
    Computer Science · #Speech and dialogue systems #Topic Modeling #Natural Language Processing Techniques
  5. Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
    2024/12/18 by Yinlam Chow, Guy Tennenholtz, Chow, Yinlam +18 · 7 voices · 26 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques
  6. Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems
    2020/05/04 by Sergey Levine, Aviral Kumar, Levine, Sergey +5 · 206 citations
    Computer Science · Engineering · #Reinforcement Learning in Robotics #Evolutionary Algorithms and Applications #Scheduling and Optimization Algorithms
  7. D4RL: Datasets for Deep Data-Driven Reinforcement Learning
    2020/04/15 by Justin Fu, Fu, Justin, Aviral Kumar +7 · 157 citations
    Computer Science · Engineering · #Reinforcement Learning in Robotics #Data Stream Mining Techniques #Autonomous Vehicle Technology and Safety
  8. Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning
    2019/10/01 by Xue Bin Peng, Aviral Kumar, Peng, Xue Bin +5 · 76 citations
    Computer Science · Engineering · #Adaptive Dynamic Programming Control #Advanced Control Systems Optimization #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
  9. Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction
    2019/06/03 by Aviral Kumar, Justin Fu, Kumar, Aviral +5 · 62 citations
    Computer Science · Engineering · #Reinforcement Learning in Robotics #Adaptive Dynamic Programming Control #Smart Grid Energy Management
  10. Recursive Introspection: Teaching Language Model Agents How to Self-Improve
    2024/07/25 by Yuxiao Qu, Qu, Yuxiao, Tianjun Zhang +5 · 1 voice · 30 citations
    #cs.LG #cs.AI #cs.CL
  11. Value-Based Deep RL Scales Predictably
    2025/02/06 by Oleh Rybkin, Michal Nauman, Rybkin, Oleh +11 · 9 voices · 6 citations
    #cs.LG
  12. Generative Verifiers: Reward Modeling as Next-Token Prediction
    2024/08/27 by Lunjun Zhang, Zhang, Lunjun, Arian Hosseini +9 · 103 citations
    Computer Science · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Semantic Web and Ontologies #Topic Modeling
  13. Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models
    2023/10/16 by Kevin Black, Black, Kevin, Mitsuhiko Nakamoto +11 · 68 citations
    Computer Science · #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics #Robotics (cs.RO)
  14. Stop Regressing: Training Value Functions via Classification for Scalable Deep RL
    2024/03/06 by Jesse Farebrother, Farebrother, Jesse, Jordi Orbay +21 · 3 voices · 33 citations
    Computer Science · Mathematics · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #cs.AI #cs.LG #stat.ML
  15. Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
    2024/10/10 by Amrith Setlur, Chirag Nagpal, Setlur, Amrith +15 · 71 citations
    Business, Management and Accounting · Computer Science · #Business Process Modeling and Analysis #Semantic Web and Ontologies #Service-Oriented Architecture and Web Services
  16. Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
    2023/03/09 by Mitsuhiko Nakamoto, Yuexiang Zhai, Nakamoto, Mitsuhiko +13 · 33 citations
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Mobile Crowdsensing and Crowdsourcing #Reinforcement Learning in Robotics #Software Engineering Research
  17. ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
    2024/02/29 by Yifei Zhou, Zhou, Yifei, Andrea Zanette +7 · 37 citations
    Computer Science · #Natural Language Processing Techniques #Topic Modeling
  18. COMBO: Conservative Offline Model-Based Policy Optimization
    2021/02/16 by Tianhe Yu, Yu, Tianhe, Aviral Kumar +9 · 25 citations
    Computer Science · Decision Sciences · #Reinforcement Learning in Robotics #Adversarial Robustness in Machine Learning #Advanced Bandit Algorithms Research
  19. Implicit Under-Parameterization Inhibits Data-Efficient Deep\n Reinforcement Learning
    2020/10/27 by Aviral Kumar, Kumar, Aviral, Rishabh Agarwal +5 · 14 citations
    Computer Science · Engineering · #FOS: Computer and information sciences #Ferroelectric and Negative Capacitance Devices #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #Stochastic Gradient Optimization Techniques
  20. Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
    2024/04/22 by Fahim Tajwar, Anikait Singh, Tajwar, Fahim +15 · 26 citations
    Decision Sciences · Economics, Econometrics and Finance · #Efficiency Analysis Using DEA #Healthcare Policy and Management #Auction Theory and Applications
  21. Why Generalization in RL is Difficult: Epistemic POMDPs and Implicit Partial Observability
    2021/07/13 by Dibya Ghosh, Jad Rahme, Ghosh, Dibya +9 · 13 citations
    Computer Science · #Reinforcement Learning in Robotics #Machine Learning and Algorithms #Adversarial Robustness in Machine Learning
  22. Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance
    2024/10/17 by Mitsuhiko Nakamoto, Oier Mees, Nakamoto, Mitsuhiko +5 · 26 citations
    Computer Science · Decision Sciences · #Semantic Web and Ontologies #Simulation Techniques and Applications #Model-Driven Software Engineering Techniques
  23. RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
    2024/06/20 by Amrith Setlur, Setlur, Amrith, Saurabh K. Garg† +9 · 21 citations
    Computer Science · #Educational Technology and Assessment
  24. Offline Q-Learning on Diverse Multi-Task Data Both Scales And Generalizes
    2022/11/28 by Aviral Kumar, Rishabh Agarwal, Kumar, Aviral +7 · 13 citations
    Computer Science · #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning and Data Classification #Reinforcement Learning in Robotics
  25. OPAL: Offline Primitive Discovery for Accelerating Offline Reinforcement Learning
    2020/10/26 by Anurag Ajay, Ajay, Anurag, Aviral Kumar +7 · 9 citations
    Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Mobile Crowdsensing and Crowdsourcing #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics
  26. Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
    2024/12/09 by Max Sobol Mark, Tian Gao, Mark, Max Sobol +11 · 1 voice · 20 citations
    #cs.LG #cs.AI
  27. Gemini: A Family of Highly Capable Multimodal Models
    2023/12/19 by Gemini Robotics Team, Gemini Team, Rohan Anil +2692 · 9 voices
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #cs.AI #cs.CL #cs.CV
  28. Is Value Learning Really the Main Bottleneck in Offline RL?
    2024/06/13 by Seohong Park, Kevin Frans, Park, Seohong +5 · 17 citations
    Business, Management and Accounting · #Artificial Intelligence (cs.AI) #ERP Systems Implementation and Impact #FOS: Computer and information sciences #Machine Learning (cs.LG)
  29. Conservative Safety Critics for Exploration
    2020/10/27 by Homanga Bharadhwaj, Bharadhwaj, Homanga, Aviral Kumar +9 · 7 citations
    Computer Science · Engineering · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #Robot Manipulation and Learning #Robotics (cs.RO)
  30. Scaling Test-Time Compute Without Verification or RL is Suboptimal
    2025/02/17 by Amrith Setlur, Nived Rajaraman, Setlur, Amrith +5 · 22 citations
    Computer Science · #Embedded Systems Design Techniques #Parallel Computing and Optimization Techniques #Software Testing and Debugging Techniques
  31. When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?
    2022/04/12 by Aviral Kumar, Kumar, Aviral, Joey Hong +5 · 7 citations
    Computer Science · #Evolutionary Algorithms and Applications #FOS: Computer and information sciences #Machine Learning (cs.LG) #Neural Networks and Reservoir Computing #Reinforcement Learning in Robotics
  32. Graph Normalizing Flows
    2019/05/30 by Jenny Liu, Aviral Kumar, Liu, Jenny +7 · 7 citations
    Computer Science · #Advanced Graph Neural Networks #FOS: Computer and information sciences #Graph Theory and Algorithms #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Topic Modeling
  33. Diagnosing Bottlenecks in Deep Q-learning Algorithms
    2019/02/26 by Justin Fu, Aviral Kumar, Fu, Justin +5 · 8 citations
    Computer Science · Engineering · #Advancements in Semiconductor Devices and Circuit Design #Adversarial Robustness in Machine Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
  34. Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data
    2024/12/10 by Zhiyuan Zhou, Zhou, Zhiyuan, Qiyang Li +6 · 14 citations
    Business, Management and Accounting · #Digital Platforms and Economics
  35. Conservative Data Sharing for Multi-Task Offline Reinforcement Learning
    2021/09/16 by Tianhe Yu, Yu, Tianhe, Aviral Kumar +9 · 5 citations
    Computer Science · Engineering · #Artificial Intelligence (cs.AI) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Robot Manipulation and Learning #Robotics (cs.RO)
  36. Conservative Objective Models for Effective Offline Model-Based Optimization
    2021/07/14 by Brandon Trabucco, Aviral Kumar, Trabucco, Brandon +5 · 6 citations
    Decision Sciences · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Simulation Techniques and Applications
  37. DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization
    2021/12/09 by Aviral Kumar, Kumar, Aviral, Rishabh Agarwal +9 · 5 citations
    Computer Science · #Reinforcement Learning in Robotics #Domain Adaptation and Few-Shot Learning #Machine Learning and ELM
  38. Efficient Deep Reinforcement Learning Requires Regulating Overfitting
    2023/04/20 by Qiyang Li, Li, Qiyang, Aviral Kumar +5 · 5 citations
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
  39. How to Leverage Unlabeled Data in Offline Reinforcement Learning
    2022/02/03 by Tianhe Yu, Aviral Kumar, Yu, Tianhe +9 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Robotics (cs.RO)
  40. Action-Quantized Offline Reinforcement Learning for Robotic Skill Learning
    2023/10/18 by Jianlan Luo, Perry Dong, Luo, Jianlan +9 · 4 citations
    Computer Science · Neuroscience · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Neuroscience and Neural Engineering #Reinforcement Learning in Robotics
  41. A Workflow for Offline Model-Free Robotic Reinforcement Learning
    2021/09/22 by Aviral Kumar, Kumar, Aviral, Anikait Singh +7 · 3 citations
    Computer Science · Decision Sciences · #Reinforcement Learning in Robotics #Machine Learning and Algorithms #Advanced Bandit Algorithms Research
  42. Vision-Language Models Provide Promptable Representations for Reinforcement Learning
    2024/02/05 by William Chen, Oier Mees, Chen, William +5 · 4 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics
  43. Data-Driven Offline Optimization For Architecting Hardware Accelerators
    2021/10/20 by Aviral Kumar, Kumar, Aviral, Amir Yazdanbakhsh +7 · 2 citations
    Computer Science · Decision Sciences · #Advanced Data Storage Technologies #FOS: Computer and information sciences #Hardware Architecture (cs.AR) #Machine Learning (cs.LG) #Parallel Computing and Optimization Techniques #Simulation Techniques and Applications
  44. COG: Connecting New Skills to Past Experience with Offline Reinforcement Learning
    2020/10/27 by Avi Singh, Singh, Avi, Albert S. Yu +9 · 7 citations
    Engineering · Computer Science · #Robot Manipulation and Learning #Reinforcement Learning in Robotics #Machine Learning and Algorithms
  45. Horizon Reduction Makes RL Scalable
    2025/06/04 by Seohong Park, Park, Seohong, Kevin Frans +8 · 11 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Stochastic Gradient Optimization Techniques
  46. What Do Learning Dynamics Reveal About Generalization in LLM Reasoning?
    2024/11/12 by Katie Kang, Amrith Setlur, Kang, Katie +11 · 4 citations
    Computer Science · #AI-based Problem Solving and Planning #FOS: Computer and information sciences #Intelligent Tutoring Systems and Adaptive Learning #Machine Learning (cs.LG) #Natural Language Processing Techniques
  47. Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners
    2025/05/29 by Michal Nauman, Nauman, Michal, Marek Cygan +7 · 7 citations
    Computer Science · #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics
  48. Reasoning as an Adaptive Defense for Safety
    2025/07/01 by Taeyoun Kim, Fahim Tajwar, Kim, Taeyoun +5 · 9 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Security and Verification in Computing #Software Testing and Debugging Techniques
  49. RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
    2025/10/02 by Yuzhong Qu, Qu, Yuxiao, Anikait Singh +11 · 4 citations
    Social Sciences · Computer Science · #Artificial Intelligence in Law #Software Engineering Research #Natural Language Processing Techniques
  50. Confidence-Conditioned Value Functions for Offline Reinforcement Learning
    2022/12/08 by Joey Hong, Aviral Kumar, Hong, Joey +3 · 1 citation
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning and Data Classification #Reinforcement Learning in Robotics
  51. D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning
    2024/08/15 by Rafael Rafailov, Rafailov, Rafael, Kyle Hatch +21 · 2 citations
    Computer Science · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Robotics (cs.RO)
  52. Latent Conservative Objective Models for Data-Driven Crystal Structure Prediction
    2023/10/16 by Qi Han, Qi, Han, Xinyang Geng +9 · 1 citation
    Biochemistry, Genetics and Molecular Biology · Computer Science · Materials Science · #Computational Drug Discovery Methods #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning in Materials Science #Protein Structure and Dynamics
  53. RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction
    2025/09/09 by Zheyuan Hu, Hu, Zheyuan, Ruilian Wu +11 · 5 citations
    Computer Science · Engineering · Psychology · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Robot Manipulation and Learning #Robotics (cs.RO) #Social Robot Interaction and HRI
  54. MIRROR: Learning from the Other View for Multi-Modal Reasoning
    2026/07/23 by Wen Ye, Yuxiao Qu, Aviral Kumar +1 · 1 voice
    #cs.AI #cs.LG