見出し画像

Gymで強化学習⑨動的計画法：理論編

澁谷直樹 @ キカベン

2023年3月12日 20:58

前回の記事では有限マルコフ決定過程において最適なポリシーを見つけるための代表的な手法をざっと見渡しました。この記事ではその中で最初に取り上げられた動的計画法の理論を詳細に解説します。そして次回の記事では実際にコードを交えて動的計画法をGymの環境を使って解説します。

ここから先は

11,605字

キカベン・読み放題

¥1,000 / 月

初月無料

アルゴリズム、機械学習、深層学習、強化学習、量子技術をわかりやすく

すべての記事とマガジンが読み放題
メンバー限定の会員証が発行されます
活動期間に応じたバッジを表示
メンバー限定掲示板を閲覧できます
メンバー特典記事を閲覧できます
メンバー特典マガジンを閲覧できます

このメンバーシップの詳細

この記事が気に入ったらチップで応援してみませんか？