vix.ing · top · new · best · stats · spec

Nigel Tao

  1. The Optimal Reward Baseline for Gradient-Based Reinforcement Learning
    2013/01/10 by Lex Weaver, Weaver, Lex, Nigel Tao +1 · 37 citations
    Computer Science · Decision Sciences · #Adaptive Dynamic Programming Control #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics