Gymで強化学習⑨動的計画法:理論編
前回の記事では有限マルコフ決定過程において最適なポリシーを見つけるための代表的な手法をざっと見渡しました。この記事ではその中で最初に取り上げられた動的計画法の理論を詳細に解説します。そして次回の記事では実際にコードを交えて動的計画法をGymの環境を使って解説します。
この記事が気に入ったらチップで応援してみませんか?
前回の記事では有限マルコフ決定過程において最適なポリシーを見つけるための代表的な手法をざっと見渡しました。この記事ではその中で最初に取り上げられた動的計画法の理論を詳細に解説します。そして次回の記事では実際にコードを交えて動的計画法をGymの環境を使って解説します。
この記事が気に入ったらチップで応援してみませんか?