ローカルLLMを回すVPS
「7Bモデルを動かしたい」と言われても、量子化の有無で必要メモリは3倍変わります。まず現実的な数字から。
当サイトは各VPS事業者のアフィリエイトプログラムに参加しており、リンク経由でのお申し込みにより報酬を受け取る場合があります。ただし掲載順位・評価・実測データは編集方針と計測結果のみに基づいており、報酬額による優遇は一切行いません。日本リージョンが無い事業者や、報酬が発生しない事業者も同じ基準で掲載しています。
必要メモリの現実
「7Bモデル」という表現だけでは必要スペックは決まりません。量子化の有無で3倍変わります。
| モデル | 4bit量子化 | 8bit量子化 | FP16(量子化なし) |
|---|---|---|---|
| 3B | 約2.5GB | 約4GB | 約7GB |
| 7B / 8B | 約5.5GB | 約9GB | 約15GB |
| 13B | 約9GB | 約15GB | 約26GB |
| 32B | 約20GB | 約35GB | 約64GB |
| 70B | 約42GB | 約75GB | 約140GB |
これに OS・コンテキストウィンドウ・その他プロセスで2〜4GB を足したものが、必要なRAMです。
CPU推論は実用になるか
なります。ただし用途を選びます。
GPUなしのVPSで7B/4bit量子化を動かした場合、生成速度はおおむね毎秒3〜10トークン程度です。vCPU数とメモリ帯域に依存します。
| 用途 | CPU推論で実用か |
|---|---|
| バッチでの要約・分類 | ◎ 十分実用的 |
| 非同期のテキスト処理 | ◎ 問題なし |
| RAGの埋め込み生成 | ○ 遅いが待てる |
| 対話・チャット | △ 待ち時間が苦痛 |
| コード補完 | ✕ 遅すぎる |
「待てる処理」なら CPU推論で十分というのが結論です。裏でキューを回す用途なら、GPUに金を払う必要はありません。
選択肢
大容量RAMを最安で — Contabo
この用途でのコスパは圧倒的です。
| プラン | vCPU | RAM | 月額 | 動かせる目安 |
|---|---|---|---|---|
| Cloud VPS 5 | 4 | 8GB | €4.99 | 7B/4bit |
| Cloud VPS 10 | 6 | 16GB | €8.99 | 13B/4bit、7B/8bit |
| Cloud VPS 20 | 8 | 24GB | €14.99 | 32B/4bit |
| Cloud VPS 30 | 12 | 48GB | €26.99 | 70B/4bit |
48GB RAMが月€26.99(約4,500円)で、70Bクラスの4bit量子化まで載ります。他社で同じRAMを確保しようとすると数倍かかります。東京リージョンがあるのも利点です。
速度が要るなら — Vultr のGPUプラン
NVIDIA A100 / L40S などのGPUインスタンスが借りられます。ただし価格帯は格安VPSとは別物で、時間あたり数百円〜数千円です。
常時稼働させると月数万円〜になるため、必要なときだけ起動する運用が前提になります。Vultrは時間単位課金なので、この使い方と相性が良いです。
日本リージョンが不要なら — Hetzner
ARM64の CAX31(8vCPU / 16GB / €12.49)などが候補です。ARM64でもOllamaは動きます。ただし最寄りがシンガポール(実測68ms)なので、対話的に使うには遠いです。
バッチでモデルを回して結果だけ取りに行く運用なら、距離は問題になりません。
構成のポイント
ディスクを多めに取る
モデルファイルは大きいです。
- 7B/4bit: 約4GB
- 13B/4bit: 約8GB
- 32B/4bit: 約19GB
- 70B/4bit: 約40GB
複数のモデルを試すなら、100GB以上を見ておくべきです。25GBのプランではモデル2つで埋まります。
スワップは効かない
メモリ不足をスワップで補おうとしても、推論速度が実用外まで落ちます。モデルは全体がメモリに載っている必要があるため、RAMをケチる意味はありません。素直に上のプランを選んでください。
転送量に注意
モデルのダウンロードで数十GBを消費します。Contaboの東京リージョンは転送量無制限なのでここでも有利です。転送量が従量課金の会社では、モデルを何度も入れ直すと請求が膨らみます。
# Ollama の導入
curl -fsSL https://ollama.com/install.sh | sh
# メモリに載るか確認してから引く
ollama pull llama3.1:8b-instruct-q4_K_M
ollama run llama3.1:8b-instruct-q4_K_M
PR
大容量RAMならContaboが最安
48GB RAMが月€26.99。東京リージョンがあり転送量も無制限なので、モデルの入れ替えが多いローカルLLM用途に最も向いています。
- 日本リージョン: 東京
- 最安 €4.99〜 / 月単位(時間課金なし)
- スペック単価が圧倒的。8GB RAMが€4.99から
上記は広告リンクです。価格・特典は公式サイトの表示が最新です。
よくある質問
CPUだけでローカルLLMは実用になりますか
モデルサイズと用途によります。7Bクラスの4bit量子化モデルなら、CPU推論でも毎秒数トークン程度は出ます。バッチ処理や非同期の要約なら十分実用的ですが、対話用途としては待ち時間が長すぎると感じるはずです。
7Bモデルに必要なメモリはどれくらいですか
4bit量子化なら約5〜6GB、8bit量子化なら約9GB、量子化なし(FP16)なら約15GBが目安です。加えてOSとコンテキスト用に数GB必要なので、4bit量子化なら8GB、FP16なら24GBのプランを選んでください。
格安VPSでGPUは使えますか
VultrとDigitalOceanにGPUプランがありますが、時間あたり数百円〜数千円と格安VPSの価格帯ではありません。常時稼働させると月数万円になるため、必要なときだけ時間課金で起動する使い方が現実的です。
ContaboとHetznerのどちらがいいですか
日本リージョンが必要ならContabo東京一択です。不要ならHetznerのARM64も選択肢ですが、大容量RAMプランの単価ではContaboが有利です。