Tao, Nigel
- The Optimal Reward Baseline for Gradient-Based Reinforcement Learning
2013/01/10 by Lex Weaver, Weaver, Lex, Nigel Tao +1 · 37 citations
Computer Science · Decision Sciences · Mathematics · #Adaptive Dynamic Programming Control #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #cs.AI #cs.LG #stat.ML