vllmで70Bモデルを動かすためのメモ

vllmで70Bモデルを動かすためのメモ|shi3z

Swallow 70B を vLLM で起動する際に必要だった GPU とメモリ設定を残した著者のメモ。ハッカソンで複数の参加者が同時に使った経験も報告している。

A100 80GB を 4 台に分割しても起動できず、PyTorch のメモリ割当設定を追加した手順を掲載。16 人の利用に対応した経験と、別サービス側で発生した同一 IP のアクセス制限を記している。

学習・起動設定:4 GPU のテンソル並列とメモリ割当の調整/確認 2026-09-15/https://note.com/shi3zblog/n/n0dff40ea3e96

学習・利用経験:ハッカソンでの複数人同時アクセス/確認 2026-09-15/https://note.com/shi3zblog/n/n0dff40ea3e96

対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開記事(本文をログインなしで確認)

確認事項(編集部):著者環境での対処であり、設定の普遍性や 16 人分の負荷性能を計測したものではない。モデル比較は主観的な利用感として読む。

出典:shi3z「vllmで70Bモデルを動かすためのメモ」/公開・更新情報:2024-10-13/確認日:2026-09-15/https://note.com/shi3zblog/n/n0dff40ea3e96

関連ページ


株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp