vix.ing · top · new · best · stats · spec

Manith Adikari

  1. LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
    2026/07/31 by Manith Adikari, Bei Peng, Samuele Vinanzi +1
    Computer Science · #cs.AI #cs.RO