Zijun Xie
- Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning
2026/07/24 by Guanqun Zhao, Zijun Xie, Binbin Zheng +5 · 1 citation
#cs.AI
- ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate
2026/07/30 by Zijun Xie, Yuyang You, Yongzhi Li +8
Computer Science · #cs.LG #cs.AI
- Group-Reflective Self-Distillation for Agentic Reinforcement Learning
2026/07/30 by Binbin Zheng, Zijun Xie, Guanqun Zhao +4
Computer Science · #cs.AI #cs.LG