PythonとPyTorchで強化学習の基本からDQNを実装する

PythonとPyTorchで強化学習の基本からDQNを実装する|Tetsuya T

行動と報酬から学ぶ仕組みを理解し、バンディット問題、価値計算、DQNまでコードで試す。

ε-greedy法、マルコフ決定過程、Gymnasium、ベルマン方程式を扱う。方策反復・価値反復、TD学習、SARSA、Q学習を経て、DQNの実装を段階的に進める。

原題:【Hands Onで学ぶ】データサイエンスのための強化学習入門

学習・行動と報酬:バンディット問題、状態・行動価値、エピソードと継続タスクを整理する。/確認 2026-09-15/https://www.udemy.com/course/rl-python/

学習・価値を計算:ベルマン方程式と方策反復・価値反復を学ぶ。/確認 2026-09-15/https://www.udemy.com/course/rl-python/

学習・モデルを実装:SARSA・Q学習からDQNへ進み、PyTorchで実装する。/確認 2026-09-15/https://www.udemy.com/course/rl-python/

対象:PythonとPyTorchのプログラミング経験があり、強化学習を実装して学びたい人。形式:オンデマンド動画講座(公開シラバスを確認)。言語:日本語。利用条件:一部講義にプレビューの案内あり。全講座の受講条件・現在価格はUdemyで確認。

確認事項(編集部):公開要件はPythonとPyTorchの使用経験。完全なプログラミング初心者向けとは説明しない。公開シラバスは5章・34講義で、実際のロボットや業務システムに接続する演習は確認していない。取得した公開ページは2か月前のキャッシュ。

出典:Tetsuya T / Udemy「【Hands Onで学ぶ】データサイエンスのための強化学習入門 — 講師公開の講座概要・シラバス」/公開・更新日:ページで特定せず/確認日:2026-09-15/https://www.udemy.com/course/rl-python/

関連ページ


株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp