vix.ing · top · new · best · stats · spec

Harrison Lee

  1. RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
    2023/09/01 by Harrison Lee, Samrat Phatale, Hassan Mansoor +8 · 3 voices · 20 citations
    Computer Science · #cs.CL #cs.AI #cs.LG
  2. RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs
    2024/09/06 by Jiaxing Wu, Ning Lin, Wu, Jiaxing +17 · 1 citation
    Computer Science · Decision Sciences · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Data Mining Algorithms and Applications #Data Quality and Management #FOS: Computer and information sciences #Machine Learning (cs.LG) #Recommender Systems and Techniques