Nexdata 多方向の読唇映像

Nexdata 多方向の読唇映像|Datatang株式会社(Nexdata)

多方向の読唇映像を収録し、映像と音声を組み合わせた発話認識に利用するAI学習用データセット。

データ仕様・収録内容:中国語を話す202人のインドネシア人を対象に、正面・左右・上下など13方向の映像と音声を収録。室内の自然光・蛍光灯環境を含む。/確認 2026-09-15/https://nexdata.jp/datasets/speechrecog/1298

データ仕様・形式・注釈:MP4動画、音声、文字情報を用意。映像は1,920×1,080、音声は16kHz・16bit以上と案内。/確認 2026-09-15/https://nexdata.jp/datasets/speechrecog/1298

対象:映像と音声を組み合わせた発話認識に取り組むAI開発・データ調達担当。形式:AI学習用データセット。言語:日本語の公式商品説明を確認。収録言語・注釈言語は商品仕様による。。利用条件:公式商品ページから仕様・サンプル・見積もりを相談。納品範囲と利用許諾は個別条件を確認。

確認事項(編集部):各方向の映像は同一人物・同一発話を含むため、方向ごとに独立した商品として数えない。話者・収録セッションを分けて学習と評価を設計する。

出典:Nexdata「読唇動画データセット|202人・13アングル」/公開・更新日:ページで特定せず/確認日:2026-09-15/https://nexdata.jp/datasets/speechrecog/1298

関連ページ


株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp