vix.ing · top · new · best · stats · spec

Yanzhen Deng

  1. A Batch, Off-Policy, Actor-Critic Algorithm for Optimizing the Average Reward
    2016/07/18 by Susan A. Murphy, Yanzhen Deng, Murphy, S. A. +9 · 2 citations
    Decision Sciences · Engineering · Medicine · #Advanced Bandit Algorithms Research #Diabetes Management and Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Smart Grid Energy Management