Yash Chandak
- Supervised Pretraining Can Learn In-Context Reinforcement Learning
2023/06/26 by Jonathan Lee, Lee, Jonathan N., Annie Xie +11 · 15 citations
Decision Sciences · Computer Science · #Advanced Bandit Algorithms Research #Data Stream Mining Techniques #Machine Learning and Data Classification
- Command A: An Enterprise-Ready Large Language Model
2025/04/01 by Team Cohere, Cohere, Team, : +316 · 10 citations
Business, Management and Accounting · Computer Science · #Business Process Modeling and Analysis #Software System Performance and Reliability #Advanced Software Engineering Methodologies
- Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion
2024/06/27 by Yannis Flet-Berliac, Nathan Grinsztajn, Flet-Berliac, Yannis +18 · 5 citations
Decision Sciences · #Educational Assessment and Improvement
- Optimizing for the Future in Non-Stationary MDPs
2020/05/17 by Yash Chandak, Chandak, Yash, Georgios Theocharous +9 · 1 citation
Decision Sciences · Computer Science · #Advanced Bandit Algorithms Research #Reinforcement Learning in Robotics #Advanced Multi-Objective Optimization Algorithms