vix.ing · top · new · best · stats · spec

Evan Assmus

  1. SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling
    2026/08/03 by Evan Assmus, Qining Zhang, Lei Ying
    Computer Science · #cs.LG #cs.AI