vix.ing · top · new · best · stats · spec

Chang, Jonathan D.

  1. Critique-out-Loud Reward Models
    2024/08/21 by Zachary Ankner, Mansheej Paul, Ankner, Zachary +7 · 20 citations
    Decision Sciences · Economics, Econometrics and Finance · #Simulation Techniques and Applications #Diverse Scientific and Economic Studies
  2. REBEL: Reinforcement Learning via Regressing Relative Rewards
    2024/04/25 by Zhaolin Gao, Jonathan Chang, Gao, Zhaolin +17 · 8 citations
    Computer Science · #Reinforcement Learning in Robotics
  3. Dataset Reset Policy Optimization for RLHF
    2024/04/12 by Chang, Jonathan D., Zhan, Wenhao, Oertell, Owen +4 · 3 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  4. Policy-Gradient Training of Language Models for Ranking
    2023/10/06 by Ge Gao, Jonathan Chang, Gao, Ge +7 · 2 citations
    Computer Science · #Topic Modeling #Expert finding and Q&A systems #Multimodal Machine Learning Applications
  5. Learning to Generate Better Than Your LLM
    2023/06/20 by Jonathan Chang, Kianté Brantley, Chang, Jonathan D. +7 · 2 citations
    Computer Science · Medicine · #Artificial Intelligence (cs.AI) #Artificial Intelligence in Healthcare and Education #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
  6. Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF
    2024/10/06 by Zhaolin Gao, Wenhao Zhan, Gao, Zhaolin +11 · 3 citations
    Engineering · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reliability and Maintenance Optimization
  7. RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
    2024/03/25 by Owen Oertell, Jonathan Chang, Oertell, Owen +7 · 2 citations
    Computer Science · #Multimodal Machine Learning Applications #Topic Modeling #Generative Adversarial Networks and Image Synthesis
  8. Mitigating Covariate Shift in Imitation Learning via Offline Data Without Great Coverage
    2021/06/06 by Jonathan Chang, Masatoshi Uehara, Chang, Jonathan D. +7 · 3 citations
    Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics
  9. Adversarial Imitation Learning via Boosting
    2024/04/12 by Chang, Jonathan D., Sreenivas, Dhruv, Huang, Yingbing +2 · 1 citation
    #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG)