オープンモデルの効率的フロンティア:2026年の最適点を探る

2026年のオープンLLMにおける最適解:30B前後

目次

2026年9月、オープンモデルにおける効率的フロンティアは25B〜34Bパラメータの間に位置しています。単一の24GB GPUで、70Bクラスのハードウェアを遥かに上回るコスト効率で、フロンティアに近いエージェント系タスクが実行可能です。

この帯域はスローガンではなく、実際のデプロイメントに現れています。パブリックリーダーボード、単一GPUでの実行結果、月間のAPI請求額がすべて、フロンティアモデルに近いツール使用能力を維持しつつ、重み付け(ウェイト)とKVキャッシュがレンタルまたは購入可能なハードウェアに収まるモデルに収束しています。

2026年のオープンモデルの効率的フロンティア:能力曲線と最適地点、その背後にある単一GPU

このページは、その選択のための判断のハブです。LLMパフォーマンスクラスタ内の一員です。小型の指示遵循モデルから70Bクラスの高密度(デンス)ウェイトに至るまでを追跡し、現在フロンティアを定義する2つのアーキテクチャで止まります。1枚の24GBカードで快適に動作するQwen3.8-27B、そして計算量は控えめに思えますが、大多数のエキスパートが無効な状態であるためLlama 4 Scoutです。秒ごとのトークン数のテーブルは、各セクションからリンクされているベンチマークページにあります。

読むことで、まずどのサイズをテストすべきか、ウェイトとキャッシュが実際にどれだけVRAMを消費するか、レンタルしたRTX 4090が現在のClaude Sonnetのトークン価格とどう比較されるか、そしてより大きなモデルを選ぶのが依然として正解となるタイミングが理解できるようになります。

なぜパブリックベンチマークは本番移行を過大評価するのか

モデルは、MMLUやHumanEvalでフロンティアAPIモデルの数点以内のスコアを記録していても、実際に提供しているタスクで失敗することがあります。マルチツールフローで2番目のツール呼び出しがドロップしたり、医療関連のクエリに対して拒否の調整が過剰拒否に偏ったり、バースト負荷時のP99レイテンシが2倍に膨らんだりします。リーダーボード上のギャップが小さく見えたのは、それらのベンチマークが固定されたプロンプトセット上の能力を測定しているからです。あなたのツール、文書、レイテンシ予算への移行を測定しているわけではありません。

効率的フロンティアとは、あなたが支払い続けられるコストで、あなたのワークロードにおいて安定して機能するモデルの集合です。これには、本番環境に近いタスクでのペアリング比較が必要であり、その間ずっと3つのシグナルを記録する必要があります:ツール呼び出しの成功、拒否の挙動、P99レイテンシです。Future AGIによる低コストフロンティア代替モデルに関する記事 は、評価の側面から同じことを述べています:パブリックベンチマークの小さな差は、モデルを置き換えるための許可証ではありません。

以下のスコアは、バインドテストを開始する場所を示す地図として扱ってください。これらは2026年9月のデータであり、いくつかの見出しとなるコーディング数値はベンダー主導ではなく独立したものです。

8B、30B、70Bは実際にどこにあるのか

下端では、8Bクラスの指示遵循モデルは、短い明示的な指示に従い、小さな関数を書くことができます。しかし、複数のサービスにまたがる失敗しているCIパイプラインをデバッグし、最初のツール呼び出しがエラーを返しても回復し、計画を維持しろと要求すると、実行は崩壊します。これはリーダーボード上の失敗ではなく、ワークロード上の失敗です。

範囲の中間は、汎用エージェント系作業が現在のプロユースGPUをクリアできる場所です。Qwen3.8-27Bはリファレンスのデンスモデルです。同じサイズ帯のアーキテクチャ、例えば Qwen3 30B vs GPT-OSS 20B で対戦比較されているQwen 30BクラスのMoE(ミクスチャー・オブ・エキスパート)を含むモデルは、より大きなものにお金をかける前にテストすべきものです。

上端では、4ビットの高密度70Bモデルは、KVキャッシュを加える前に約35〜40GBのウェイトが必要です。これは24GBカードには収まりません。48GB GPU、80GBのデータセンターカード、または2枚のGPU分割が必要になり、よく調整された27Bモデルとの品質差は、コーディングエージェント、ドキュメントパイプライン、サポートボットにおいてしばしば僅差です。Claude OpusのようなクローズドループのフロンティアAPIは、まったく異なる予算の領域にあります:トークンごとに支払いが発生し、ウェイトを保持する必要はありません。

チェックポイントを選ぶ前に、カードと空きメモリを確認してください。モデルのウェイトはフットプリントの一部にすぎません。コンテキスト(KVキャッシュ)はその上に乗ります。

# カスタム前 GPUの名前と空きVRAM
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv

# ロード後: プロセスがGPU上で維持されていることを確認
nvidia-smi

レイヤーがCPUに溢れると、生成スループットは崩壊します。GPUの memory.used とランタイムのオフロードログで分割を確認できます。16GBカードでデンスモデルとMoEチェックポイントが実際にどれだけの性能を発揮するかは、測定値が 16 GB VRAM llama.cpp ベンチマーク16 GB RTX 4080でのOllama比較 にあります。これらのページが速度テーブルを持っています。このページには、適合性の決定のみが必要です。

Qwen3.8-27B: 24GBのリファレンスポイント

AlibabaのQwen3.8-27Bはデンスモデルであり、エキスパートの混合物ではありません。Artificial Analysisでは、エージェントインデックスで約51(丸めた数値。基礎値は50.9)、最大推論努力でのインテリジェンスインデックスで約52を記録しています。これらは異なる測定です。エージェントインデックスはツール使用とマルチステップタスクです。インテリジェンスインデックスはより広い能力のブレンドです。MindStudioの実機ベンチ は、エージェントスコアを、はるかに大きなミクスチャー・オブ・エキスパートモデルであるKimi K2の直後として位置づけています。Qubridの分析 を次におすすめするのは、次のモデルとの差が1点未満であり、Qwen独自のSWE-bench Proスコア61.7が独立した実行として再現されていないからです。興味深い結果はスコアの形にあります。27Bモデルは、緊縮された予算を計画とツール使用に変換する能力が異様に優れており、広範な知識スイートでリードするわけではありません。

アーキテクチャが、長いコンテキストが手頃な価格で提供される理由です。64層のうち、フルアテンションを使用するのは16層のみです。残りの48層はGated DeltaNetレイヤーで、Gated Delta Networks の研究シリーズから生まれた線形アテンション設計であり、トークンごとのキー/バリュー履歴ではなく、固定された再帰状態を保持します。FP16では、フルアテンション層はトークンごとに約64KBのKVキャッシュコストがかかります。同じ層数を持つ従来のスタックは、その約4倍をキャッシュすることになります。Locally Uncensoredの量子化テーブル は、Q4_K_Mウェイトを17.1 GB、IQ4_XSを15.7 GBと示しています。Hardware Cornerのllama.cpp測定 では、24 GB GPUで短コンテキスト時約18 GB、64K時約22 GBで安定し、これがRTX 4090での実用的な目標です。16 GBカードでは、IQ4クラスの量子化されたウェイトと、ほとんどコンテキストを持てません。それがあなたのマシンである場合、16 GBで既に測定されているQwen 3.5と3.6の実行、例えば Qwen 3.6 27B MTP vs 標準デコーディング を維持してください。キャッシュ自体の予算化の方法は、16 GB GPUでのKVキャッシュ で説明されています。

実機レポート、MindStudioのものもそうですが、このモデルはコーディング、画像分析、エージェントループに実用的であることも発見しており、これは単一のインデックスでは示せない部分です。ビジョン(画像処理)は、テキストウェイトの上に小さなプロジェクターファイルを追加します。スクリーンショットを含むワークロードがある場合、計画に入れてください。

Llama 4 Scout: アクティブパラメータはVRAMではない

MetaのLlama 4 Scoutは、異なる種類の効率性です。Llama 4 モデルカード には、アクティブパラメータ170億、合計1090億、16のエキスパート、ネイティブ画像入力、1000万トークンコンテキストウィンドウが記載されています。Metaのローンチ記事 によれば、INT4チェックポイントは単一のH100に収まります。デコード計算は、各トークンごとに発火する17Bを追跡します。メモリは追跡しません。すべてのエキスパートは依然としてレジデント(メモリ上に存在)である必要があるため、FLOPs(浮動小数点演算回数)が17Bモデルのように見えても、VRAMの請求額は100Bクラスモデルのようになります。

マシンの予算を立てる前に、これに注意が必要です。Scoutは「3Bモデルのように動作する」わけではありません。アクティブパラメータが速度を決定します。レジデントパラメータが、カードがウェイトを保持できるかどうかを決定します。24 GB GPUでは、収まるモデルはQwen3.8-27Bです。Scoutが理にかなうのは、すでに80 GBカードを持っており、17Bクラスの計算量で、より大きなエキスパートプールと非常に長いコンテキストを望む場合です。

2025年6月の論文、Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources? は、総計算量とデータを固定し、アクティベーション率が実用的な範囲にある場合、MoEがデンスモデルに勝つ可能性があるという主張です。実用的な解釈は、見出しよりも狭いものです。MoEがコストで勝つのは、アイドルなエキスパートを保存するメモリを支払った後だけです。すでにこのサイズのモデルをサービングしており、ウェイトを変更せずに秒ごとのトークン数を増やしたい場合は、投機的デコーディング が隣接する技術です:草稿パスがトークンを提案し、メインモデルがそれらを検証します。

Phi-4: 数学における小型モデルの例外

MicrosoftのPhi-4は14Bのデンスモデルです。2024年12月の 技術レポート によると、simple-evalsでのMATHスコアは80.4で、同じテーブル内のGPT-4oの数値を上回り、コンテキストウィンドウは16Kまで拡張されています。Q4_K_M量子化は、約8 GBで一般的に実行されます。これは真の効率ですが、範囲は狭いです。Phi-4はSTEM(科学・技術・工学・数学)の質問応答のために訓練されました。タスクが数学や短編の技術的推論であり、マシンが小さい場合に試すべきモデルです。マルチツールエージェント、長い文書、ビジョンの2026年のデフォルトではありません。その作業のフロンティアは、上記の25〜34B帯域のままです。GPUがH100クラスカードの場合はScoutです。

自己ホストGPU時間 vs トークン単価API価格

価格は変動します。これらは2026年9月中旬の数値であり、2027年まで同じまま残ることはありません。

2026年9月18日確認の GPU Finder によると、在庫のあるRTX 4090はVastで約1 GPU時間あたり0.26ドル、RunPodコミュニティクラウドは0.34ドルと表示されていました。単一4090の6ヶ月間のオンデマンド下限は0.11〜0.60ドルの間でした。0.34ドル、月間730時間で、1ヶ月間ずっと稼働するカードは、税、ストレージ、エグレスを除いて約248ドルです。在庫価格0.26ドルでは、同じ月で約190ドルです。0.53ドル/時間という以前の計画数値は6ヶ月間の範囲内ですが、9月後半のマーケットプレイスの在庫が実際に求めていた価格を過大評価しています。

API側では、Anthropicの Sonnet 5 価格注記 は、入力トークン100万あたり2ドル、出力トークン100万あたり10ドルと記載しています。Sonnet 4.6は3ドルと15ドルのままです。2026年9月3日更新の BenchLMのレートカード も同じ分割を示しています。入力トークン1億、出力トークン1000万のワークロードは、Sonnet 5で300ドル、Sonnet 4.6で450ドルです。

1ヶ月間248ドルでレンタルした4090と比較すると、この例は「自己ホストが常に安い」とは言っていません。この量では、2つの請求額が同じ地域で交わる、と言っています。入力対出力比10:1のSonnet 5は、入力1000万+出力100万あたり30ドルです。248ドルのレンタルは、そのようなブロックの約8つ、つまり入力約8000万トークン、出力約800万トークンをカバーします。それを超えると、レンタルカードが有利になりますが、それを忙しい状態に保てることが条件です。それ未満では、APIの方が安く、アイドルなGPUの代金を払う必要はありません。所有ハードウェアは、レンタルを電気代と減価償却に置き換えます。その請求額周围的戦略—予算管理、キャッシュ、フォールバック—は LLMシステムのコスト最適化 にあります。低いトークン価格が依然として誤ったアーキテクチャになる理由は、データの重力とAPIロックイン です。

より大きなモデルを選ぶのが依然として正解となる場合

25〜34B帯域は、繰り返される本番ワークロードのデフォルトです:コーディングエージェント、サポートボット、ドキュメント処理、抽出、自動化です。しかし、いくつかの状況では誤ったデフォルトとなります。

  • ペアリングテストで小さいモデルがすでに失敗した問題におけるフロンティア推論。
  • 声の差が製品であり、量が少ないためトークン価格がノイズにすぎないプロース(文章)。
  • 複数の専門領域を同時に幅広くカバーする必要がある作業で、27Bモデルが同じ種類の事実を繰り返し見逃す場合。
  • 1回の誤答のコストが1年間のモデルレンタルを上回る、低量・高リスクの意思決定。

これらの場合、70BクラスのオープンモデルやフロンティアAPIにステップアップし、同じ3つの本番シグナルを維持してください。より大きなモデルが、ツール呼び出しの成功、拒否、P99をあなたが重視する方向に動かさない場合、余分なサイズはあなたが使えるものを何も買ってくれません。

フロンティア上のポイントをどう選ぶか

この順序を使用してください。27Bモデルで十分だと発見する方が、80 GBカードが不要だと発見するよりも安いです。

  1. ワークロードから始め、ダウンロードできる最大のオープンウェイトから始めるのではない。ワンショット指示と数学は8〜14Bから開始できます。マルチステップツール使用は、24 GBを持っている場合はQwen3.8-27Bから、持っていない場合は既に測定済みの最良の16 GB量子化から開始します。
  2. アクティブパラメータとレジデントパラメータを分離する。Scoutの17Bアクティブ数値は計算量の主張です。109Bの合計はVRAMの主張です。2番目の数値を予算化してください。
  3. 量子化し、次にメモリを再確認する。Qwen3.8-27BのQ4_K_Mは24 GBの会話で、カードが満杯になる前に約64Kのコンテキストがあります。ロード後、実際にサービングするコンテキスト長で nvidia-smi を実行してください。
  4. トークンではなく、月を価格設定する。レンタルするGPUの730時間を、既にログとして記録している入力と出力の混合と比較してください。上記の損益分岐点未満であれば、量が到来するまでAPIを維持してください。
  5. 自分のタスクで決定する。バースト下のツール呼び出しの成功、拒否の挙動、P99を記録するペアリング実行が、パブリックベンチマークが代替できないテストです。
flowchart TD A[ワークロードを定義] --> B{マルチステップツール使用?} B -- いいえ: ワンショットまたは数学 --> C[8-14Bから開始] B -- はい --> D{単一24 GB GPU?} D -- はい --> E[Qwen3.8-27B Q4付近、次にKVキャッシュ確認] D -- いいえ: 80 GBクラスカード --> F[Llama 4 Scout: 17Bアクティブ、109Bレジデント] C --> G[あなたのタスクでのペアリング実行] E --> G F --> G G --> H{ツール呼び出し、拒否、P99はパス?} H -- はい --> I[デプロイし、それら3つのシグナルを維持] H -- いいえ、量は低 --> J[70BクラスウェイトまたはフロンティアAPI] H -- いいえ、量は高 --> K[次のサイズアップ、次に月の価格再設定]

2026年に有用な質問は、どのウェイトがカード、コンテキスト、月間の請求額に適合し、なおかつ自分のタスクをクリアできるかです。多くのエージェント作業において、そのポイントは単一の24 GB GPU上の27Bハイブリッドモデルです。Scoutは、データセンターメモリにおける同じアイデアです:パラメータ合計が示唆するよりもトークンあたりの計算量は少ないですが、VRAMの割引はありません。

参考文献

  1. MindStudio. “Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests.” https://www.mindstudio.ai/blog/qwen-3-27b-local-benchmark
  2. Qubrid AI. “Qwen3.8-27B Benchmarks: Official and Independent Results.” https://www.qubrid.com/blog/qwen38-27b-benchmarks-official-and-independent-results
  3. Hardware Corner. “We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need?” https://www.hardware-corner.net/qwen3-8-27b-hardware-tests/
  4. Locally Uncensored. “How to Run Qwen 3.8 27B Locally: VRAM, Quants and the Template Trap.” https://locallyuncensored.com/blog/how-to-run-qwen-3-8-27b-locally.html
  5. Malik, Umesh. “Qwen3.8 27B VRAM: how to fit 262K context in 16 GiB, not 64.” https://umesh-malik.com/blog/qwen3-8-27b-vram-kv-cache-math
  6. Meta AI. “The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.” https://ai.meta.com/blog/llama-4-multimodal-intelligence
  7. Meta. “Llama 4 model card.” https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
  8. arXiv. “Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?” June 2025. https://arxiv.org/html/2506.12119v1
  9. Yang, S., Kautz, J., Hatamizadeh, A. “Gated Delta Networks: Improving Mamba2 with Delta Rule.” ICLR 2025. https://jankautz.com/publications/GatedDeltaNet_ICLR25.pdf
  10. Abdin, M., et al. “Phi-4 Technical Report.” arXiv:2412.08905, December 2024. https://arxiv.org/html/2412.08905v1
  11. GPU Finder. “RTX 4090 GPU Rental Prices & Live Availability.” Checked 18 September 2026. https://gpufinder.dev/gpu/rtx-4090
  12. Anthropic. “What’s new in Claude Sonnet 5” (pricing: $2 / $10 per million tokens). https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5
  13. BenchLM. “Claude API pricing.” Updated 3 September 2026. https://benchlm.ai/anthropic/api-pricing
  14. Future AGI. “Evaluating Cheap Frontier Models in 2026: Substitution Without a Quality Cliff.” https://futureagi.com/blog/evaluating-cheap-frontier-models-2026
  15. Northflank. “Qwen3.8-27B: Performance, benchmarks, GPU requirements & how to run it.” 17 August 2026. https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it

購読する

システム、インフラ、AIエンジニアリングの新記事をお届けします。