ゼロサムゲームのための割引安定適応批評設計とその応用検証
ディスカウント価値反復に基づく適応的批評設計のゼロサムゲームへの応用と検証 研究背景 制御分野において、最適制御(Optimal Control)は重要な研究テーマであり、システムの性能を最適化するための制御システムの設計と分析を目的としています。システムの複雑さが増すにつれて、伝統的なハミルトン-ヤコビ-ベルマン方程式(Hamilton-Jacobi-Bellman, HJB)に基づく最適制御手法は「次元の呪い」(Curse of Dimensionality)という課題に直面しています。この課題に対処するため、研究者たちは適応的動的計画法(Adaptive Dynamic Programming, ADP)を提案し、強化学習(Reinforcement Learning)や関数近似(Fu...