vix.ing
·
top
·
new
·
best
·
stats
·
spec
Evan Assmus
SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling
2026/08/03 by
Evan Assmus
,
Qining Zhang
,
Lei Ying
Computer Science
·
#cs.LG
#cs.AI