Harrison Lee
- RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
2023/09/01 by Harrison Lee, Samrat Phatale, Hassan Mansoor +8 · 3 voices · 20 citations
Computer Science · #cs.CL #cs.AI #cs.LG
- RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMs
2024/09/06 by Jiaxing Wu, Ning Lin, Wu, Jiaxing +17 · 1 citation
Computer Science · Decision Sciences · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Data Mining Algorithms and Applications #Data Quality and Management #FOS: Computer and information sciences #Machine Learning (cs.LG) #Recommender Systems and Techniques