16GB VRAM GPU環境のOllamaにおけるLLMのパフォーマンス比較
RTX 4080(VRAM 16GB)におけるLLM速度テスト
大規模言語モデル(LLM)をローカルで実行することで、プライバシーの保護、オフラインでの利用、そしてAPIコストのゼロ化を実現できます。 このベンチマークでは、RTX 4080上でOllamaを使用する14のポピュラーなLLMの性能について、何を期待できるかを具体的に明らかにします。
16GBのVRAMを備えたGPUでは、常にトレードオフに直面します。 より品質が高い可能性がある大きなモデルか、推論速度が速い小さなモデルかです。 LLMの性能(スループットとレイテンシの比較、VRAMの制限、並列リクエスト、ランタイム横断のベンチマークなど)について詳しく知りたい方は、LLM性能:ベンチマーク、ボトルネックと最適化をご覧ください。
この記事ではOllamaに焦点を当てています。同じ16 GBクラスのGPUをllama.cppを用いて19K、32K、64Kコンテキストで計測した結果(VRAM使用量、GPU負荷、稠密型およびMoEチェックポイントにおける毎秒トークン数)については、16 GB VRAMでのLLMベンチマーク(llama.cppによる速度とコンテキスト)をご覧ください。
スループットとVRAMの割当が許容範囲であることを確認した後でも、エージェント型のワークロードには、QwenやGemmaスタイルのスタックにおいて適切な温度(temperature)とペナルティの設定が必要です。詳細は、QwenとGemma向けのエージェント推論パラメータを参照してください。

要点(TL;DR)
Ollama 0.17.7でRTX 4080 16GBにおけるLLM性能の更新済み比較表です。2026-03-09にQwen 3.5 9b、9bq8、27bおよび35bモデルを追加しました:
| モデル | RAM+VRAM使用量 | CPU/GPU分配 | トークン/秒 |
|---|---|---|---|
| gpt-oss:20b | 14 GB | GPU 100% | 139.93 |
| qwen3.5:9b | 9.3 GB | GPU 100% | 90.89 |
| ministral-3:14b | 13 GB | GPU 100% | 70.13 |
| qwen3:14b | 12 GB | GPU 100% | 61.85 |
| qwen3.5:9b-q8_0 | 13 GB | GPU 100% | 61.22 |
| qwen3-coder:30b | 20 GB | CPU 25% / GPU 75% | 57.17 |
| qwen3-vl:30b-a3b | 22 GB | CPU 30% / GPU 70% | 50.99 |
| glm-4.7-flash | 21 GB | CPU 27% / GPU 73% | 33.86 |
| nemotron-3-nano:30b | 25 GB | CPU 38% / GPU 62% | 32.77 |
| qwen3.5:35b | 27 GB | CPU 43% / GPU 57% | 20.66 |
| devstral-small-2:24b | 19 GB | CPU 18% / GPU 82% | 18.67 |
| mistral-small3.2:24b | 19 GB | CPU 18% / GPU 82% | 18.51 |
| gpt-oss:120b | 66 GB | CPU 78% / GPU 22% | 12.64 |
| qwen3.5:27b | 24 GB | CPU 43% / GPU 57% | 6.48 |
重要な洞察: VRAMに完全に収まるモデルは、劇的に高速です。GPT-OSS 20Bは毎秒139.93トークンを実現する一方、大量のCPUオフロードを行うGPT-OSS 120Bは毎秒12.64トークンという低速です——11倍の速度差があります。
テスト用ハードウェア構成
このベンチマークは、以下のシステムで実施されました:
- GPU: NVIDIA RTX 4080 (VRAM 16GB)
- CPU: Intel Core i7-14700 (Pコア 8 + Eコア 12)
- RAM: DDR5-6000 64GB
これは、ローカルでのLLM推論によく見られるハイエンドな消費向け構成です。 16GBのVRAMが重要な制約要因となり、どのモデルがGPUだけで動作し、どのモデルがCPUオフロードを必要とするかを決定します。
モデルがVRAM容量を超えた場合、CPUの性能がオフロードされたレイヤーの推論速度に直接影響を及ぼすため、OllamaがIntel CPUコアをどのように使用するかを理解することが重要になります。
このベンチマークの目的
主な目的は、現実的な条件下での推論速度を測定することでした。私の経験上、Mistral Small 3.2 24Bが言語品質に優れ、Qwen3 14Bが私の特定のユースケースにおいて上質な指示追従能力を持つことはすでに知っていました。
このベンチマークは、各モデルがどの速さでテキストを生成し、VRAM制限を超えた場合の速度ペナルティはどれほどかという実践的な質問に答えます。
テストパラメータは以下の通りです:
- コンテキストサイズ: 19,000トークン。私のGenerateリクエストにおける平均値です。
- プロンプト: “オーストラリアの首都の都市間の天気と気候を比較してください”
- 指標: 評価レート(生成中の毎秒トークン数)
Ollamaのインストールとバージョン
すべてのテストには、テスト時点での最新リリースであるOllamaバージョン 0.15.2を使用しました。 その後、Qwen3.5モデルを追加するためにOllama v 0.17.7で再実行しました。 このベンチマークで使用されたOllamaコマンドの完全なリファレンスについては、Ollama チートシートをご覧ください。
簡単な復習として、LinuxへのOllamaインストールは以下の通りです:
curl -fsSL https://ollama.com/install.sh | sh
インストールの確認:
ollama --version
容量の制約により別のドライブにモデルを保存する必要がある場合は、Ollamaモデルを別のドライブに移動する方法をチェックしてください。
対象モデル
以下のモデルがアルファベット順でベンチマークされました:
| モデル | パラメータ | 量子化 | 備考 |
|---|---|---|---|
| devstral-small-2:24b | 24B | Q4_K_M | コード特化 |
| glm-4.7-flash | 30B | Q4_K_M | 思考モデル |
| gpt-oss:20b | 20B | Q4_K_M | 総合で最速 |
| gpt-oss:120b | 120B | Q4_K_M | 最大のテスト対象 |
| ministral-3:14b | 14B | Q4_K_M | Mistralのエフィシェントモデル |
| mistral-small3.2:24b | 24B | Q4_K_M | 優れた言語品質 |
| nemotron-3-nano:30b | 30B | Q4_K_M | NVIDIAの製品 |
| qwen3:14b | 14B | Q4_K_M | 最良の指示追従 |
| qwen3.5:9b | 9B | Q4_K_M | 高速、GPU完全搭載 |
| qwen3.5:9b-q8_0 | 9B | Q8_0 | 高品質、GPU完全搭載 |
| qwen3.5:27b | 27B | Q4_K_M | 優れた品質、Ollama上では低速 |
| qwen3-vl:30b-a3b | 30B | Q4_K_M | 視覚対応 |
| qwen3-coder:30b | 30B | Q4_K_M | コード特化 |
| qwen3.5:35b | 35B | Q4_K_M | 良好なコーディング能力 |
任意のモデルをダウンロードするには:
ollama pull gpt-oss:20b
ollama pull qwen3:14b
CPUオフロードの理解
モデルのメモリ要件が利用可能なVRAMを超えると、Ollamaは自動的にモデルのレイヤーをGPUとシステムRAMの間に分配します。出力では、“18%/82% CPU/GPU"のようなパーセント分配として表示されます。
これは大きなパフォーマンスに影響を及ぼします。 各トークンの生成にはCPUとGPUメモリ間のデータ転送が必要であり、これはCPUにオフロードされたレイヤーごとにボトルネックが複合していきます。
結果からパターンは明確です:
- GPU 100%のモデル: 61-140 tokens/sec
- GPU 70-82%のモデル: 19-51 tokens/sec
- GPU 22%(主にCPU): 12.6 tokens/sec
これが、20Bパラメータのモデルが実質的に120Bモデルを11倍上回ることの説明になります。複数の並列リクエストを提供する計画がある場合、容量計画のためにOllamaが並列リクエストをどのように処理するかを理解することが不可欠になります。上記のCPUオフロード分配は、実はKVキャッシュと重みの予算問題でもあります — 16 GB GPUでのKVキャッシュでは、より小さなモデルに落とし込まずに余裕を確保するための正確な計算とOLLAMA_KV_CACHE_TYPE設定について説明しています。
詳細なベンチマーク結果
GPU 100%で動作するモデル
GPT-OSS 20B — 速度チャンピオン
ollama run gpt-oss:20b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:20b 14 GB 100% GPU 19000
eval count: 2856 token(s)
eval duration: 20.410517947s
eval rate: 139.93 tokens/s
毎秒139.93トークンという速度で、GPT-OSS 20Bは速度重視アプリケーションにおける明確な勝者です。VRAMをわずか14GBしか使用しないため、大きなコンテキストウィンドウや他のGPUワークロードのための余裕を残します。
Qwen3 14B — 優れたバランス
ollama run qwen3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3:14b 12 GB 100% GPU 19000
eval count: 3094 token(s)
eval duration: 50.020594575s
eval rate: 61.85 tokens/s
私の経験上、Qwen3 14Bは最適な指示追従能力を提供し、快適な12GBのメモリフットプリントを持っています。毎秒61.85トークンという速度は、対話的な利用に対応するほどレスポンスが速いです。
Qwen3をアプリケーションに統合する開発者のための、構造化JSONレスポンスの抽出方法については、OllamaとQwen3によるLLM構造化出力をご覧ください。
Ministral 3 14B — 高速かつコンパクト
ollama run ministral-3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
ministral-3:14b 13 GB 100% GPU 19000
eval count: 1481 token(s)
eval duration: 21.11734277s
eval rate: 70.13 tokens/s
Mistralの小型モデルは、VRAMに完全に収まりながら毎秒70.13トークンを提供します。最大速度でMistralファミリーの品質が必要な場合の、堅実な選択肢です。
qwen3.5:9b - 高速で新型
ollama run qwen3.5:9b --verbose
/set parameter num_ctx 19000
オーストラリアの首都の都市間の天気と気候を比較してください
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b 6488c96fa5fa 9.3 GB 100% GPU 19000
eval count: 3802 token(s)
eval duration: 41.830174597s
eval rate: 90.89 tokens/s
qwen3.5:9b-q8_0 - q8量子化
この量子化により、q4と比較してqwen3.5:9bのパフォーマンスが30%低下します。
ollama run qwen3.5:9b-q8_0 --verbose
/set parameter num_ctx 19000
オーストラリアの首都の都市間の天気と気候を比較してください
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b-q8_0 441ec31e4d2a 13 GB 100% GPU 19000
eval count: 3526 token(s)
eval duration: 57.595540159s
eval rate: 61.22 tokens/s
CPUオフロードを必要とするモデル
qwen3-coder:30b - 30b LLMセットの中で最速(テキストオンリーのため)
ollama run qwen3-coder:30b --verbose
/set parameter num_ctx 19000
オーストラリアの首都の都市間の天気と気候を比較してください
NAME ID SIZE PROCESSOR CONTEXT
qwen3-coder:30b 06c1097efce0 20 GB 25%/75% CPU/GPU 19000
22%/605%
eval count: 559 token(s)
eval duration: 9.77768875s
eval rate: 57.17 tokens/s
Qwen3-VL 30B — 部分オフロードでの最良パフォーマンス
ollama run qwen3-vl:30b-a3b-instruct --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3-vl:30b-a3b-instruct 22 GB 30%/70% CPU/GPU 19000
eval count: 1450 token(s)
eval duration: 28.439319709s
eval rate: 50.99 tokens/s
レイヤーの30%がCPU上にあるにもかかわらず、Qwen3-VLは毎秒50.99トークンを維持しており、一部のGPU 100%モデルよりも速いです。視覚機能により、マルチモーダルタスクにおける柔軟性が向上します。
Mistral Small 3.2 24B — 品質と速度のトレードオフ
ollama run mistral-small3.2:24b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
mistral-small3.2:24b 19 GB 18%/82% CPU/GPU 19000
eval count: 831 token(s)
eval duration: 44.899859038s
eval rate: 18.51 tokens/s
Mistral Small 3.2は優れた言語品質を提供しますが、厳しい速度ペナルティを払います。毎秒18.51トークンは、対話的なチャットでは明らかに遅く感じます。レイテンシよりも品質が重要なタスクには価値があります。
GLM 4.7 Flash — MoE思考モデル
ollama run glm-4.7-flash --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
glm-4.7-flash 21 GB 27%/73% CPU/GPU 19000
eval count: 2446 token(s)
eval duration: 1m12.239164004s
eval rate: 33.86 tokens/s
GLM 4.7 Flashは30B-A3B Mixture of Experts (MoE) モデルです——合計30Bパラメータであり、トークンごとにアクティブなのはわずか3Bです。「思考」モデルとして、レスポンスの前に内部的な推論を生成します。毎秒33.86トークンには、思考トークンと出力トークンの両方が含まれます。CPUオフロードにもかかわらず、MoEアーキテクチャにより比較的速く保たれています。
qwen3.5:35b - 自己ホストで適度なパフォーマンスを発揮する新モデル
ollama run qwen3.5:35b --verbose
/set parameter num_ctx 19000
オーストラリアの首都の都市間の天気と気候を比較してください
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:35b 4af949f8bdf0 27 GB 43%/57% CPU/GPU 19000
eval count: 3418 token(s)
eval duration: 2m45.458926548s
eval rate: 20.66 tokens/s
GPT-OSS 120B — 大物
ollama run gpt-oss:120b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:120b 66 GB 78%/22% CPU/GPU 19000
eval count: 5008 token(s)
eval duration: 6m36.168233066s
eval rate: 12.64 tokens/s
16GBのVRAMで120Bモデルを動かすことは技術的に可能ですが、過酷です。CPUに78%をオフロードするため、毎秒12.64トークンという速度では対話的な利用が苛立ちを伴います。レイテンシが問題にならないバッチ処理に適しています。
qwen3.5:27b - 賢いがOllama上では遅い
ollama run qwen3.5:27b --verbose
/set parameter num_ctx 19000
オーストラリアの首都の都市間の天気と気候を比較してください
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:27b 193ec05b1e80 24 GB 43%/57% CPU/GPU 19000
eval count: 3370 token(s)
eval duration: 8m40.087510281s
eval rate: 6.48 tokens/s
qwen3.5:27bをテストし、OpenCodeでのこのモデルのパフォーマンスに対して極めて良い印象を持ちました。 非常に有能で、知識豊富で、ツール呼び出しも本当に優秀ですが、私のマシンではOllama上では遅いです。 他のLLM自己ホスティングプラットフォームを試しましたが、はるかに高い速度を得られました。 Ollamaとはお別れの時が来たと感じています。 少し後でこれについて書きます。
実践的な推奨事項
対話的なチャット向け
VRAMに100%収まるモデルを使用してください:
- GPT-OSS 20B — 最大速度 (139.93 t/s)
- Ministral 3 14B — Mistralの品質を備えた良好な速度 (70.13 t/s)
- Qwen3 14B — 最良の指示追従 (61.85 t/s)
より良いチャット体験を得るには、ローカルOllama向けのオープンソースチャットUIを検討してください。
バッチ処理向け
これは再度、私の機器(VRAM 14GB)での結果です。
速度がそれほど重要でない場合:
- Mistral Small 3.2 24B — 優れた言語品質
- Qwen3-VL 30B — 視覚 + テキスト対応
速度が全く重要でない場合:
- Qwen3.5:35b - 良好なコーディング能力
- Qwen3.5:27b - 極めて優秀ですが、Ollama上では遅いです。しかし、llama.cpp上でこのモデルをホストした際にはかなりの成功を収めました。
開発とコーディング向け
Ollamaでアプリケーションを構築している場合:
代替ホスティングオプション
Ollamaの限界が気になる場合(Ollamaの劣化(Enshittification)に関する懸念参照)、ローカルLLMホスティングガイドで他のオプションを探るか、Docker Model RunnerとOllamaの比較を比較検討してください。
結論
16GBのVRAMがあれば、賢く選べば、印象的な速度で有能なLLMを実行できます。主な調査結果は以下の通りです:
-
対話的な利用にはVRAM制限以内に留まること。20Bモデルが毎秒140トークンであることは、120Bモデルが毎秒12トークンであることより、ほとんどの実用的な目的において勝ります。
-
GPT-OSS 20Bが純粋な速度では勝りますが、Qwen3 14Bが指示追従タスクにおいて速度と能力の最良のバランスを提供します。
-
CPUオフロードは機能しますが、3-10倍の減速を想定してください。バッチ処理では許容範囲ですが、チャットでは苛立ちを伴います。
-
コンテキストサイズが重要です。ここでは19Kコンテキストを使用していますが、これはVRAM使用量を大幅に増加させます。GPU利用率を改善するためにコンテキストを減らすことを検討してください。
ローカルLLMとWeb検索結果を組み合わせたAI検索について詳しくは、Ollamaを用いたPerplexicaの自己ホスティングをご覧ください。
より多くのベンチマーク、VRAMとスループットのトレードオフ、Ollamaおよび他のランタイム間のパフォーマンスチューニングを探索するには、LLM性能:ベンチマーク、ボトルネックと最適化ハブをチェックしてください。
有用的リンク
内部リソース
- Ollama チートシート: 最も役立つOllamaコマンド
- Ollamaが並列リクエストをどのように処理するか
- OllamaがIntel CPUの性能コアと効率コアをどのように使用しているか
- ローカルLLMホスティング: 2026年完全ガイド - Ollama、vLLM、LocalAI、Jan、LM Studioなど
- 2026年のオープンモデルのエフィッシェント・フロンティア