Feng-Lin Li
- Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
2025/02/20 by Huimin Xu, Xu, Huimin, Xin Mao +11 · 4 citations
Computer Science · #Computation and Language (cs.CL) #Constraint Satisfaction and Optimization #Data Management and Algorithms #FOS: Computer and information sciences #Fuzzy Logic and Control Systems