GPT3.5を用いてマルチターン日本語会話データセット(16K)を作りました|shi3z
日本語 Wikipedia をもとに、GPT-3.5 で教師と生徒の会話データを作成した著者の記事。約 1.6 万件の公開時点の成果と、テキストを読み込み JSON の会話へ変換するコードを紹介する。
記事の一部をモデルへ渡し、質問と回答の組を生成して JSON として読み取る処理を掲載。失敗を捕捉しながらデータを増やし、公開した Hugging Face のデータセットへ案内している。
学習・作成方法:Wikipedia から教師・生徒の会話を合成/確認 2026-09-14/https://note.com/shi3zblog/n/nfc07c53d61a8
学習・公開資料:生成スクリプトとデータセットへのリンク/確認 2026-09-14/https://note.com/shi3zblog/n/nfc07c53d61a8
対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開記事(本文をログインなしで確認)
確認事項(編集部):本文で触れる JSON モードの設定は掲載コードではコメントアウトされている。合成会話の事実性、元データと生成物の利用条件は別途確認が必要。
出典:shi3z「GPT3.5を用いてマルチターン日本語会話データセット(16K)を作りました」/公開・更新情報:2023-11-10/確認日:2026-09-14/https://note.com/shi3zblog/n/nfc07c53d61a8
株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp