vix.ing · top · new · best · stats · spec

META-Learning Eligibility Traces for More Sample Efficient Temporal Difference Learning

2020/01/01 by Mingde Zhao, Zhao, Mingde
Computer Science · Engineering · #Adaptive Dynamic Programming Control #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #Smart Grid Energy Management

paper · pdf · doi:10.48550/arxiv.2006.08906

openalex publication_date 2020/01/01 · openalex created_date 2025/10/10 · openalex updated_date 2026/08/02

Abstract

L'apprentissage par différence temporelle (TD) est une approche d'apprentissage par renforcement standard et très réussie, au cœur des deux algorithmes qui apprennent la valeur d'une politique donnée, ainsi que des algorithmes qui apprennent à améliorer les politiques. L'apprentissage TD avec des traces d'éligibilité fournit un moyen de faire une attribution de crédit temporelle, c'est-à-dire décide quelle portion d'une récompense doit être affectée aux états prédécesseurs qui se sont produits à différents moments précédents, contrôlé par un paramètre λ. Cependant, le réglage de ce paramètre peut prendre du temps et ne pas le régler peut conduire à un apprentissage inefficace. Pour améliorer l'efficacité de l'échantillon d'apprentissage TD, nous proposons une méthode de méta-apprentissage pour ajuster le paramètre de trace d'éligibilité, d'une manière dépendante de l'état. L'adaptation est réalisée avec l'aide d'apprenants auxiliaires qui apprennent en ligne les informations de distribution sur les cibles de mise à jour, entraînant à peu près la même complexité de calcul par étape que l'apprenant de valeur habituelle. Notre approche peut être utilisée à la fois dans l'apprentissage sur les politiques et hors politique. Nous prouvons que, sous certaines hypothèses, la méthode proposée améliore la qualité globale des cibles de mise à jour, en minimisant l'erreur cible globale. Cette méthode peut être considérée comme un plugin qui peut également être utilisé pour aider à la prédiction avec l'approximation des fonctions par la fonction de méta-apprentissage (observation) basée sur λ en ligne, ou même dans le cas de contrôle pour aider à l'amélioration des politiques. Notre évaluation empirique démontre des améliorations significatives des performances, ainsi qu'une meilleure robustesse de l'algorithme proposé à la variation du taux d'apprentissage

Citations

Related