Key points are not available for this paper at this time.
Dans l'apprentissage par renforcement (RL), les erreurs d'approximation de fonction sont connues pour conduire facilement à des surestimations de la valeur Q, réduisant ainsi considérablement la performance de la politique. Cet article présente un algorithme d'acteur-critique doux distributionnel (DSAC), qui est une méthode RL hors politique pour le cadre de contrôle continu, visant à améliorer la performance de la politique en atténuant les surestimations de la valeur Q. Nous découvrons d'abord en théorie que l'apprentissage d'une fonction de distribution des retours état-action peut effectivement atténuer les surestimations de la valeur Q car il est capable d'ajuster de manière adaptative la taille de l'étape de mise à jour de la fonction de valeur Q. Ensuite, un cadre d'itération de politique douce distributionnelle (DSPI) est développé en intégrant la fonction de distribution des retours dans l'apprentissage par renforcement à entropie maximale. Enfin, nous présentons une variante d'acteur-critique hors politique profonde du DSPI, appelée DSAC, qui apprend directement une distribution continue des retours en maintenant la variance des retours état-action dans une plage raisonnable pour traiter les problèmes de gradients explosifs et de gradients disparaissants. Nous évaluons DSAC sur l'ensemble des tâches de contrôle continu de MuJoCo, atteignant des performances à la pointe de la technologie.
Duan et al. (Mercredi,) ont étudié cette question.
Synapse has enriched 2 closely related papers on similar clinical questions. Consider them for comparative context: