Diese Arbeit schlägt ein hybrides multi-objektives Verstärkungslernen-Framework vor, um autonome Pokémon-Kampfagentenstrategien zu optimieren, indem der nicht-dominierte Sortier-Genetische Algorithmus II (NSGA-II) mit Deep Q-Learning (DQN) kombiniert wird. Der Ansatz adressiert die Herausforderung, mehrere widersprüchliche Ziele auszubalancieren, einschließlich der Maximierung der Gewinnwahrscheinlichkeit, der Minimierung erhaltener Schäden und der Verbesserung der allgemeinen Kampfeffizienz. NSGA-II wird verwendet, um Pareto-optimale Strategienparameter zu entwickeln und auszuwählen, was eine effektive Erkundung des multi-objektiven Suchraums ermöglicht, während Deep Q-Learning Aktionsrichtlinien durch Interaktion mit der Kampfumgebung verfeinert. Experimentelle Bewertungen zeigen, dass das vorgeschlagene NSGA-II–DQN-Framework traditionelle ein-objektive und Basis-Verstärkungslernen-Methoden hinsichtlich Anpassungsfähigkeit, strategischer Vielfalt und multi-kriterialer Leistung übertrifft. Die Ergebnisse heben die Effektivität der Integration von evolutionärer multi-objektiver Optimierung mit tiefem Verstärkungslernen für komplexe sequenzielle Entscheidungsprobleme hervor. Dieses Framework ist über spielbasierte Umgebungen hinaus erweiterbar und kann auf breitere Bereiche angewendet werden, die effiziente Abwägungen zwischen konkurrierenden Zielen erfordern.
Mohan Manoj Kumar Bonthu (Dienstag) untersuchte diese Frage.