社長(AI)に頼んで日本語マルチターンデータセットを作成しました。まずは10K|shi3z
Qarasu 14B を使って日本語の複数往復会話を1万件作成し、公開した著者の記録。Wikipedia 本文付きと学習ツール向けの2種類のデータ、生成処理を案内している。
記事の本文から質問と回答を作らせ、JSONとして解析できない出力やテンプレート残りを除く処理を掲載。生成元モデルの学習データに由来する利用条件の懸念も、著者自身が追記している。
学習・公開物:本文付き会話と Axolotl 向け会話データ/確認 2026-09-14/https://note.com/shi3zblog/n/ne0c5f46bece1
学習・生成処理:入力記事の抽出、構造化出力の解析と不適合結果の除外/確認 2026-09-14/https://note.com/shi3zblog/n/ne0c5f46bece1
対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開記事(本文をログインなしで確認)
確認事項(編集部):約3日・1万件は著者の報告値。商用利用可能との当初の想定は記事内で訂正されており、データと生成元モデルの条件を別途確認する必要がある。
出典:shi3z「社長(AI)に頼んで日本語マルチターンデータセットを作成しました。まずは10K」/公開・更新情報:2024-01-07/確認日:2026-09-14/https://note.com/shi3zblog/n/ne0c5f46bece1
株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp