RLHF:人の評価を用いたモデル調整

RLHF:人の評価を用いたモデル調整|StatQuest with Josh Starmer

2:25から事前学習、5:06から教師あり微調整、7:35からRLHFを説明。

10:07から報酬モデルの学習、15:02からその利用を扱う。

公開日:2025-05-05。長さ:1082秒。確認範囲:概要・章立て。視聴前の目安(編集部):LLMの学習と強化学習の基本

原題:Reinforcement Learning with Human Feedback (RLHF), Clearly Explained!!!

学習内容・前半のテーマ:2:25から事前学習、5:06から教師あり微調整、7:35からRLHFを説明。/確認 2026-09-15/https://www.youtube.com/watch?v=qPN_XZcJf_s

学習内容・後半のテーマ:10:07から報酬モデルの学習、15:02からその利用を扱う。/確認 2026-09-15/https://www.youtube.com/watch?v=qPN_XZcJf_s

確認事項・制作者の訂正・内容の範囲:InstructGPTの元論文を説明の基礎とする。すべての現行モデルが同一の学習工程を使うという意味ではない。/確認 2026-09-15/https://www.youtube.com/watch?v=qPN_XZcJf_s

対象:AIのモデルと実装を体系的に学びたい人。形式:YouTube動画(個別教材)。言語:英語。日本語の要点は本資料庫で作成。日本語字幕・吹き替えの有無は視聴時に確認。。利用条件:YouTube公開動画。外部の書籍・会員サービス・実行環境は別条件。

確認事項(編集部):InstructGPTの元論文を説明の基礎とする。すべての現行モデルが同一の学習工程を使うという意味ではない。 必要な前提知識を確認し、概要だけで理解が済んだとせず元の説明と計算例を参照する。

出典:StatQuest with Josh Starmer「Reinforcement Learning with Human Feedback (RLHF), Clearly Explained!!!」/公開・更新情報:2025-05-05/確認日:2026-09-15/https://www.youtube.com/watch?v=qPN_XZcJf_s

関連ページ


株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp