Gymで強化学習⑤マルコフ決定過程 1 澁谷直樹 2023年2月16日 22:29 前回の記事では手動で宇宙船を動かすエージェントを取り扱いました。実際に試してみると、初めの頃に取った行動が最終的に着陸できるかどうかに大きく影響するのがわかります。上空での操作によっては地上に近づいた頃にはもう手遅れでどのようなコントロールを行なっても取り返しがつかなくなります。とはいうものの過去の失敗を悔やまずに、現在の状態から未来に向けて最善な行動を行い続けるしかありません。そんなわけで手動ではほぼ着陸できないのですが、強化学習でこのような問題をどう捉えるのかを今回の記事では解説します。 ダウンロード copy ここから先は 4,552字 / 4画像 キカベン・読み放題 ¥1,000 / 月 初月無料 人工知能、機械学習、ディープラーニング、量子コンピュータ関連の用語の解説、研究論文の概要、プログラミングの具体例などの読み応えのある新しい記事が月に4−5本ほど追加されます。また、気になるAIニュースや日常の雑観などは随時公開しています。 メンバー限定の会員証が発行されます 活動期間に応じたバッジを表示 メンバー限定掲示板を閲覧できます メンバー特典記事を閲覧できます メンバー特典マガジンを閲覧できます このメンバーシップの詳細 ログイン #ポリシー #強化学習 #マルコフ連鎖 #ベルマン方程式 #マルコフ性 1 この記事が気に入ったらサポートをしてみませんか? サポート