DeepSeek v4.1 Flashを動かしたくてFP4に対応していないA100を、33tok/sから673 tok/sまで持っていって気がつくと公式APIより速くなっていた話

DeepSeek v4.1 Flashを動かしたくてFP4に対応していないA100を、33tok/sから673 tok/sまで持っていって気がつくと公式APIより速くなっていた話|shi3z

DeepSeek のローカル推論を A100 向けに調整した著者の開発記録。公開部分では、重みの転送、CPU 上の処理、GPU カーネルの起動回数を調べ、速度の制約を切り分けている。

FP4 の保存形式と演算形式を分ける考え方を使い、PCIe 転送と CPU 計算の所要時間を比較。重みの配置を変える工夫と、多数の小さな GPU 処理が起動コストを生む状況を説明する。

学習・計測対象:重み転送、CPU 演算、GPU カーネルの起動コスト/確認 2026-09-15/https://note.com/shi3zblog/n/nd5fc5341b342

学習・改善の方向:データ配置と演算形式を見直す開発過程/確認 2026-09-15/https://note.com/shi3zblog/n/nd5fc5341b342

対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開の紹介部分を確認。全文の閲覧条件は元記事で確認。

確認事項(編集部):公開部分で確認できる工程に限定。冒頭の最大速度は単独・並列の条件が異なり、外部 API との同条件比較や最終性能の追試はしていない。

出典:shi3z「DeepSeek v4.1 Flashを動かしたくてFP4に対応していないA100を、33tok/sから673 tok/sまで持っていって気がつくと公式APIより速くなっていた話」/公開・更新情報:2026-09-12/確認日:2026-09-15/https://note.com/shi3zblog/n/nd5fc5341b342

関連ページ


株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp