Xiong, Ruibin
- From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning
2024/11/06 by Zhirui Deng, Zhicheng Dou, Deng, Zhirui +11 · 5 citations
Computer Science · #Multi-Agent Systems and Negotiation
- Beyond Outlining: Heterogeneous Recursive Planning for Adaptive Long-form Writing with Language Models
2025/03/11 by Xiong, Ruibin, Chen, Yimeng, Khizbullin, Dmitrii +2 · 5 citations
#Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences
- ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
2025/07/07 by Chenchen Zhang, Yuhang Li, Zhang, Chenchen +36 · 8 citations
Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Software Engineering (cs.SE)
- Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward
2025/10/03 by Huang, Guanhua, Xu, Tingqiang, Wang, Mingze +7 · 3 citations
#Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)