見出し画像

Gymで強化学習⑦グリッド・ワールド

澁谷直樹 @ キカベン

2023年2月26日 22:49

前回の記事で強化学習の目的を「環境における最適なポリシー」を見つけること定義しました。ただし、数式が多く登場したので話が抽象的になりました。そこで今回は単純なグリッド・ワールドを使って具体例と共に数式を見て行きます。

グリッド・ワールドを使う最大の利点はその分かり易さにあります。すべて状態が観測可能であり個別な（連続ではない）値なので状態遷移などを例を使って考えやすくなります。

もし前回の記事でイメージが湧きにくいと感じた方は今回の記事を読まれるとより数式の意味が伝わるはずです。また、最後には最適なポリシーを探す一般的な考え方について解説します。

では、さっそく始めましょう。

ここから先は

8,539字 / 16画像

キカベン・読み放題

¥1,000 / 月

アルゴリズム、機械学習、深層学習、強化学習、量子技術をわかりやすく

すべての記事とマガジンが読み放題
メンバー限定の会員証が発行されます
活動期間に応じたバッジを表示
メンバー限定掲示板を閲覧できます
メンバー特典記事を閲覧できます
メンバー特典マガジンを閲覧できます

このメンバーシップの詳細

この記事が気に入ったらチップで応援してみませんか？