vix.ing
·
top
·
new
·
best
·
stats
·
spec
Jianze Wang
SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
2026/07/29 by
Jianze Wang
,
Kunwang Zheng
,
Ying Liu
+5
Computer Science
·
#cs.CL