DGX Spark で Parakeet TDT-CTC 0.6B JA を試す|npaka
DGX Spark で Parakeet TDT-CTC の日本語モデルを試した記事。音声ファイルの文字起こしに続き、マイクの発話区間を分けて標準出力へ書き出すコードを作成している。
NeMo のモデルを読み込む最小例と、Codex に作成を依頼したリアルタイム入力用の Python コードを公開。音量に基づく区間検出を使い、挨拶の認識結果を実行ログに残している。
学習・試した入力:WAV ファイルとマイク音声をそれぞれ文字起こし。/確認 2026-09-15/https://note.com/npaka/n/nd9a5ebcc5531
学習・区間の検出:RMS としきい値を使った軽量 VAD を実装。/確認 2026-09-15/https://note.com/npaka/n/nd9a5ebcc5531
対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開記事(本文をログインなしで確認)
確認事項(編集部):少数の音声での動作確認。冒頭のランキングは第三者情報であり、著者自身による大規模な精度比較ではない。雑音による区間判定の変化に注意する。
出典:npaka「DGX Spark で Parakeet TDT-CTC 0.6B JA を試す」/公開・更新情報:2026-04-08/確認日:2026-09-15/https://note.com/npaka/n/nd9a5ebcc5531
株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp