ローカルLLM 推奨 メモリは何GB?16GB・32GB・64GBの選び方

   


anatato.jp へ本日もお越しいただきありがとうございます!

耳で聞くだけで短時間に分かりやすく理解できる音声会話形式の動画はこちら

スライドショー動画で分かりやすく理解できる動画解説はこちら

 

ローカルLLMを自分のパソコンで動かしたいと思ったとき、最初に迷いやすいのがメモリ容量です。

16GBで足りるのか、32GBに増やすべきなのか、それとも64GBが必要なのか。

さらに、パソコンのメモリであるRAMと、グラフィックボードに搭載されるVRAMの違いも分かりにくいところです。

結論からいうと、ローカルLLMの推奨メモリは、モデルのパラメータ数だけでは決まりません

量子化方式、コンテキスト長、GPUへの読み込み方、RAGの利用、同時に動かすアプリなどを含めて判断する必要があります。

【この記事でわかること】

  • ローカルLLMの推奨メモリを用途別に判断する方法
  • 16GB・32GB・64GBでできることの違い
  • システムRAMとGPUのVRAMの役割
  • 7B・14B・32B級モデルのメモリ目安
  • 4ビット量子化とKVキャッシュの注意点
  • Windows PCとApple Silicon搭載Macの選び方
  • RAGや長文処理でメモリが増える理由

💡ローカルLLM 推奨 メモリの結論

ローカルLLM 推奨 メモリは16GB・32GB・64GBのどれか

まず、一般的な個人利用を想定した目安を整理します。

小型モデルを試すだけなら16GB、7B~14B級を継続して使うなら32GB、RAGや長文処理まで考えるなら64GBが候補です

ただし、この数字は全モデルに共通する保証値ではありません。

同じパラメータ数でも、量子化方式や最大コンテキスト長、画像入力の有無によって必要量は変わります。

メモリ容量 向いている用途 注意点
16GB 1B~4B級、小型の量子化モデル、短いチャット ブラウザや他アプリとの併用で余裕が減りやすい
32GB 7B~14B級、文書要約、軽いRAG、コード支援 大型モデルや非常に長い文脈では不足する場合がある
64GB 大型モデルのCPUオフロード、長文、複数アプリ、RAG GPU性能が低ければ生成速度は上がらない
96GB以上 32B~70B級、大規模な文書処理、検証環境 一般用途では費用対効果を慎重に検討

迷ったら32GBを基準に考える

これからローカルLLM用のパソコンを購入する場合、32GBは検討しやすい基準です。

16GBでも小型モデルは動かせますが、OS、ブラウザ、推論ソフト、モデルを同時に動かすと余裕が小さくなります。

32GBあれば、モデル以外のソフトにもメモリを残しながら、比較的幅広い量子化モデルを試しやすくなります

一方で、大型モデルをGPUへ完全に載せたい場合は、システムRAMよりもVRAMが先に制約になることがあります。

📝ローカルLLM 推奨 メモリを決める4つの要素

モデルのパラメータ数

LLMの名称に付く「7B」「14B」「32B」などのBは、一般に十億を表します。

7Bなら約70億、14Bなら約140億のパラメータを持つモデルという意味です。

基本的にはパラメータ数が多いほど、モデル重みを保存するためのメモリも増えます

ただし、MoEと呼ばれる構造では、推論時に使われる有効パラメータ数と、メモリへ読み込む総パラメータ数が異なる場合があります。

量子化方式

量子化は、モデルの数値表現を小さくして必要メモリを抑える技術です。

  • 16ビット:容量は大きいが元の精度を保ちやすい
  • 8ビット:16ビットより必要メモリを減らしやすい
  • 6ビット:品質と容量の中間を狙いやすい
  • 4ビット:個人PCで大型モデルを動かす際によく使われる
  • 3ビット以下:容量は小さいが、モデルによって品質低下が目立つ場合がある

4ビット量子化は便利ですが、どのモデルでも品質が変わらないわけではありません

同じ4ビットでもQ4_0、Q4_K_Mなど形式が異なり、容量や品質、対応する推論ソフトが変わります。

コンテキスト長

コンテキスト長は、モデルが一度に参照できる入力文と生成文の範囲です。

4K、32K、64K、128Kなどの設定があり、長いほど大量の文書や会話履歴を扱えます。

コンテキスト長を増やすとKVキャッシュが大きくなり、モデル重みとは別にRAMやVRAMを消費します

「128K対応」と書かれたモデルでも、自分のPCで128Kを快適に使えるとは限りません。

GPUへ載せる割合

モデルをGPUのVRAMへ完全に読み込めれば、高速に生成しやすくなります。

入りきらない場合は、一部の層をシステムRAMに置いてCPUで処理するオフロードが利用されます。

CPUオフロードは動作可能なモデルの幅を広げますが、GPUへ完全に載せる場合より遅くなる可能性があります

😲RAMとVRAMは何が違うのか

システムRAMの役割

RAMは、WindowsやmacOS、ブラウザ、ローカルLLMの実行ソフトなどが利用するメモリです。

CPUだけで推論する場合は、モデルの大部分がRAMへ読み込まれます。

モデルに必要な容量と同じだけRAMを搭載すればよいわけではなく、OSや周辺ソフトの余裕も必要です

RAMが不足すると、SSD上の仮想メモリが利用されることがありますが、物理メモリより遅いため、生成速度や操作性が低下しやすくなります。

VRAMの役割

VRAMはGPU専用のメモリです。

モデル重み、KVキャッシュ、計算途中のデータなどを保持します。

ローカルLLMの速度を重視するなら、GPUの演算性能だけでなくVRAM容量が重要です

例えば、NVIDIA(エヌビディア)の公式仕様では、GeForce RTX 5070は12GB、RTX 5070 Tiは16GBのGDDR7メモリを搭載しています。

12GBと16GBの差は、ゲームだけでなく、GPUへ載せられるモデル容量にも影響します。

モデル容量だけでは判断できない

5GBのモデルファイルだから、5GBのVRAMで必ず動くという考え方は危険です。

実行時には次の領域も必要になります。

  • モデル重み
  • KVキャッシュ
  • 計算用バッファ
  • 出力用バッファ
  • 画像・音声エンコーダー
  • 推論ソフトやGPUドライバーが使う領域

VRAM容量ぎりぎりのモデルを選ぶのではなく、追加領域を残せる構成が安全です

✨モデル規模別のローカルLLM 推奨 メモリ

1B~4B級モデル

1B~4B級は、ローカルLLMを初めて試す人に向いています。

短い会話、文章の下書き、簡単な要約、分類などで利用できます。

4ビット量子化された小型モデルなら、16GB RAMのパソコンでも試しやすい範囲です

ただし、性能や日本語能力はモデルによって異なります。

7B~14B級モデル

個人向けローカルLLMで選択肢が多いのが7B~14B級です。

文章生成、コード支援、文書要約、軽いRAGなど幅広い用途があります。

システムRAMは32GB、GPUを使う場合は8GB~16GB程度のVRAMが検討範囲になります

ただし、14B級を長いコンテキストでGPUへ完全に載せたい場合は、16GBを超えるVRAMが必要になることもあります。

20B~32B級モデル

20B~32B級では、4ビット量子化してもモデル重みだけで十数GB以上になることがあります。

画像入力や長文処理を加えると必要量はさらに増えます。

システムRAMは64GB以上、VRAMは24GB前後から検討しやすくなりますが、モデルごとの実測確認が欠かせません

CPUへ一部を逃がせば少ないVRAMでも動く場合がありますが、生成速度とのトレードオフがあります。

70B級モデル

70B級は4ビットの重みだけでも単純計算で約35GBになります。

実際には追加領域が必要なので、40GBを超えるRAMやVRAMを使う可能性があります。

70B級を快適に利用する構成は、一般的な家庭用PCの範囲を超えやすいと考えた方が安全です

大容量RAMでCPU推論する方法や複数GPUへ分割する方法もありますが、速度、消費電力、導入費用を含めて判断する必要があります。

モデル規模 RAMの候補 VRAMの候補 想定用途
1B~4B 16GB以上 GPUなし~8GB 入門、短文、分類、軽い要約
7B~8B 16GB~32GB 8GB~12GB 一般チャット、文章作成
12B~14B 32GB~64GB 12GB~24GB RAG、コード支援、長めの文書
20B~32B 64GB以上 24GB以上を検討 高品質生成、専門的な処理
70B級 96GB~128GB以上 大容量・複数GPU構成 検証、研究、高性能環境

上表は4ビット量子化モデルを中心にした購入判断の目安です。

動作や速度を保証する数値ではありません。

💡量子化で必要メモリはどこまで減るのか

理論上のモデル容量を計算する

モデル重みの単純な理論値は、次の計算で概算できます。

パラメータ数×1パラメータ当たりのビット数÷8

モデル 16ビットの理論値 8ビットの理論値 4ビットの理論値
8B 約16GB 約8GB 約4GB
14B 約28GB 約14GB 約7GB
32B 約64GB 約32GB 約16GB
70B 約140GB 約70GB 約35GB

これはモデル重みだけの単純計算です。

実際のファイルには量子化用の追加情報などが含まれ、推論時にはKVキャッシュや計算バッファも必要になります。

GoogleのGemma 4公式例

Google(グーグル)はGemma 4の公式資料で、量子化ごとの推論メモリ概算を公開しています。

例えばGemma 4 12Bは、BF16で26.7GB、8ビットで13.4GB、Q4_0で6.7GBとされています。

ただし、この公式値にもコンテキストウィンドウや周辺ソフトウェア用の追加VRAMは含まれていません

モデルごとの公式値がある場合は、単純なパラメータ計算より優先して確認しましょう。

参考:Google AI for Developers「Gemma 4モデルの概要」

4ビット量子化の注意点

4ビット量子化は、大型モデルを個人PCへ載せるための有力な手段です。

一方で、量子化方式やモデルによっては、文章品質、推論精度、ツール利用能力などに差が生じます。

最小容量の量子化ファイルを選ぶより、用途に必要な品質を保てる形式を選ぶことが重要です

📝RAG・長文処理・画像入力の推奨メモリ

RAGはLLM以外の処理も動く

RAGは、登録した文書を検索し、関連部分をLLMへ渡して回答を生成する仕組みです。

LLM本体に加えて、文書解析、埋め込みモデル、検索用データベースなどが動作します。

個人向けの小規模RAGなら32GBでも構築可能ですが、大量文書や複数利用者を扱う場合は64GB以上の余裕が役立ちます

必要量は文書数だけでなく、同時に読み込むデータ量や利用ソフトによって変わります。

長文処理ではKVキャッシュが増える

会議録、論文、マニュアル、コードベースなどを長いまま入力すると、コンテキスト長が大きくなります。

Ollama(オラマ)の公式ドキュメントでも、コンテキスト長を大きくするとモデルの実行に必要なメモリが増えると説明されています。

モデルが読み込めるかだけでなく、実際に使うコンテキスト長でメモリを見積もる必要があります

画像対応モデルは追加領域を使う

画像を理解できるマルチモーダルモデルでは、テキスト用のモデルに加えて画像エンコーダーなどが使われます。

画像の枚数や解像度、モデル構造によって追加メモリが変わります。

テキスト専用モデルの動作実績だけを見て、画像対応モデルも同じ容量で動くと判断しないようにしましょう

🍎Windows PCとMacのメモリ選び

WindowsはRAMとVRAMを別々に確認する

一般的なWindowsデスクトップでは、システムRAMとGPUのVRAMが分かれています。

例えばRAMが64GBあっても、VRAMが8GBなら大型モデルをGPUへ完全に載せられない場合があります。

速度を重視する場合は、RAM容量だけでなくVRAMへモデルとKVキャッシュを載せられるかを確認してください

Apple Siliconはユニファイドメモリ

Apple(アップル)のMシリーズチップでは、CPUとGPUがユニファイドメモリを共有します。

専用GPU搭載PCのように「RAM 32GBとVRAM 16GBを別々に持つ」という構成ではありません。

Macではユニファイドメモリの総量から、OSやアプリが使う分も差し引いて考える必要があります

Mac mini M4の選び方

Apple公式仕様では、Mac miniのM4モデルは16GBを標準とし、24GBまたは32GBを選べます。

M4 Proモデルは24GBを標準とし、48GBまたは64GBを選択できます。

ローカルLLMを継続的に使うなら24GB以上、12B~14B級やRAGも視野に入れるなら32GB以上が検討しやすい構成です

ユニファイドメモリは購入後に一般的なデスクトップPCのように増設できないため、将来使うモデルも考えて選びましょう。

用途 Windowsの考え方 Macの考え方
小型モデル RAM 16GB~32GB ユニファイドメモリ16GB~24GB
7B~14B級 RAM 32GB+VRAM 12GB以上を検討 24GB~32GB以上を検討
大型モデル・RAG RAM 64GB+大容量VRAM 48GB~64GB以上を検討

🔍購入前に確認したいローカルLLM 推奨 メモリの手順

使いたいモデルを先に決める

パソコンを先に買い、あとから動くモデルを探すより、使いたいモデルの候補を先に決める方が失敗を減らせます。

  1. チャット、要約、RAG、コード支援など用途を決める
  2. モデルのパラメータ数を確認する
  3. 量子化ファイルの容量を確認する
  4. 想定するコンテキスト長を決める
  5. 実行ソフトの対応GPUを確認する
  6. 同じ構成での実測例を探す

公式仕様と実際の利用報告の両方を確認すると、容量不足だけでなく速度不足も避けやすくなります

最低容量ではなく余裕を残す

モデルを読み込めたとしても、残りメモリがほとんどない状態では安定性が下がります。

ブラウザ、文書ソフト、開発環境などを同時に使うなら、その分も必要です。

モデル重みを載せたあとに、KVキャッシュと普段使うアプリのための余裕が残る構成を選びましょう

生成速度も確認する

「動く」と「快適に使える」は同じではありません。

CPUのみでも大きなモデルを読み込める場合がありますが、1秒当たりの生成トークン数が少ないと、日常利用では待ち時間が気になります。

メモリ容量だけでなく、GPU対応、メモリ帯域、生成速度の実測も購入判断に加えてください

⚠️ローカルLLM運用で注意したいこと

ローカルでも情報漏えい対策は必要

入力データを外部APIへ送らない構成は、プライバシーを管理しやすい利点があります。

しかし、ローカルで動かすだけで安全になるわけではありません。

  • 保存された会話ログ
  • RAGへ登録した機密文書
  • 利用者ごとのアクセス権
  • 外部ツールと連携する権限
  • ダウンロードしたモデルやソフトの入手元
  • バックアップデータ

機密情報を扱う場合は、モデルの実行場所だけでなく、保存、権限、ログ、更新まで管理する必要があります

ファインチューニングは推論より重い

この記事のメモリ目安は、主に完成済みモデルを使って文章を生成する推論を想定しています。

モデルを学習させるファインチューニングでは、勾配やオプティマイザー状態などの追加領域が必要です。

推論用に十分なVRAMがあっても、同じモデルをそのまま学習できるとは限りません

LoRAやQLoRAで必要量を減らせますが、モデルと学習条件ごとの確認が必要です。

ライセンスを確認する

ダウンロード可能なモデルでも、すべてが無条件で商用利用できるわけではありません。

モデルごとに利用規約、再配布、派生モデル、商用利用の条件が異なります。

業務や公開サービスで使用する場合は、モデルカードとライセンス原文を確認してください

✅ローカルLLM 推奨 メモリのまとめ

用途から逆算して選ぶ

ローカルLLMのメモリ選びでは、単に大容量を選べばよいわけではありません。

使いたいモデル、量子化、コンテキスト長、GPUへの読み込み方を決めてから逆算することが重要です。

入門なら16GB、幅広く試すなら32GB、RAGや大型モデルまで見据えるなら64GBが検討の起点になります

RAMとVRAMを混同しない

Windows PCではRAMとVRAMを別々に確認します。

Apple Silicon搭載Macでは、CPUとGPUがユニファイドメモリを共有します。

どちらの構成でも、モデルのファイル容量だけでなく、KVキャッシュや周辺ソフトの余裕を残すことが大切です

購入前にモデルごとの公式情報を確認する

モデルの構造や推論ソフトは更新され続けています。

同じパラメータ数でも、必要メモリや速度が異なることがあります。

最終的には、使用予定モデルの公式資料と、自分に近い構成での実測結果を確認して選びましょう

参考・引用元:

この記事をSNSでシェア!

 - コンピュータ・ゲーム , , , , , , , , ,