Gymで強化学習⑨動的計画法:理論編 1 澁谷直樹 2023年3月12日 20:58 前回の記事では有限マルコフ決定過程において最適なポリシーを見つけるための代表的な手法をざっと見渡しました。この記事ではその中で最初に取り上げられた動的計画法の理論を詳細に解説します。そして次回の記事では実際にコードを交えて動的計画法をGymの環境を使って解説します。 ダウンロード copy ここから先は 11,605字 キカベン・読み放題 ¥1,000 / 月 初月無料 アルゴリズム、機械学習、深層学習、強化学習、量子技術をわかりやすく すべての記事とマガジンが読み放題 メンバー限定の会員証が発行されます 活動期間に応じたバッジを表示 メンバー限定掲示板を閲覧できます メンバー特典記事を閲覧できます メンバー特典マガジンを閲覧できます このメンバーシップの詳細 1人が高評価 ログイン #動的計画法 #行動価値関数 #状態価値関数 #ポリシー反復法 #価値反復法 1 この記事が気に入ったらサポートをしてみませんか? サポート