社長(AI)に頼んで今度こそ商用利用可能な日本語マルチターン会話データセットを作ってもらった|shi3z
LLaMA-Pro 8BとvLLMで、日本語Wikipediaから複数往復の会話データを生成した著者の公開記録。生成コードと約3千件のデータセットへのリンクがある。
複数GPUで並行推論し、文章から4組以上の質問回答を作る指示を使用。JSONの読み込み、雛形が残る出力の除外、例外処理を実装し、速度と会話品質の差やスクリーニングの必要性も説明する。
学習・生成工程:Wikipediaから質問回答を作りJSONとして保存/確認 2026-09-14/https://note.com/shi3zblog/n/n290e437cb61c
学習・公開物:生成スクリプトと会話データセット/確認 2026-09-14/https://note.com/shi3zblog/n/n290e437cb61c
対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開記事(本文をログインなしで確認)
確認事項(編集部):著者の商用利用に関する見解を権利確認済みとは扱わない。元文章、モデル、生成物それぞれの条件とデータ品質の確認が必要。
出典:shi3z「社長(AI)に頼んで今度こそ商用利用可能な日本語マルチターン会話データセットを作ってもらった」/公開・更新情報:2024-01-09/確認日:2026-09-14/https://note.com/shi3zblog/n/n290e437cb61c
株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp