vix.ing · top · new · best · stats · spec

Yash Chandak

  1. Supervised Pretraining Can Learn In-Context Reinforcement Learning
    2023/06/26 by Jonathan Lee, Lee, Jonathan N., Annie Xie +11 · 15 citations
    Decision Sciences · Computer Science · #Advanced Bandit Algorithms Research #Data Stream Mining Techniques #Machine Learning and Data Classification
  2. Command A: An Enterprise-Ready Large Language Model
    2025/04/01 by Team Cohere, Cohere, Team, : +316 · 10 citations
    Business, Management and Accounting · Computer Science · #Business Process Modeling and Analysis #Software System Performance and Reliability #Advanced Software Engineering Methodologies
  3. Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion
    2024/06/27 by Yannis Flet-Berliac, Nathan Grinsztajn, Flet-Berliac, Yannis +18 · 5 citations
    Decision Sciences · #Educational Assessment and Improvement
  4. Optimizing for the Future in Non-Stationary MDPs
    2020/05/17 by Yash Chandak, Chandak, Yash, Georgios Theocharous +9 · 1 citation
    Decision Sciences · Computer Science · #Advanced Bandit Algorithms Research #Reinforcement Learning in Robotics #Advanced Multi-Objective Optimization Algorithms