Die effiziente Frontiere offener Modelle: Den Sweet Spot für 2026 finden

Der ideale Bereich für offene LLMs im Jahr 2026: rund 30 Mrd. Parameter.

Inhaltsverzeichnis

Im September 2026 liegt die effiziente Frontier der offenen Modelle zwischen 25 Milliarden und 34 Milliarden Parametern: nahezu Frontier-nahes Agenten-Work auf einer einzigen 24-GB-GPU, mit einem Bruchteil der Hardware von 70B-Klasse.

Diese Bandbreite zeigt sich in den Deployments, nicht in einem Slogan zur Parameternzahl. Öffentliche Leaderboards, Single-GPU-Läufe und monatliche API-Abrechnungen konvergieren zu Modellen, die bei der Tool-Nutzung nahe an der Frontier bleiben, während die Gewichte und der KV-Cache weiterhin auf Hardware Platz finden, die man mieten oder besitzen kann.

Die effiziente Frontier offener Modelle im Jahr 2026: eine Fähigkeitskurve mit markiertem Sweet Spot und einer einzelnen GPU dahinter

Diese Seite ist der Entscheidungshub für diese Wahl innerhalb des LLM-Performance-Clusters. Sie führt von kleinen Instruct-Modellen zu dichten Gewichten der 70B-Klasse und hält dann bei den beiden Architekturen inne, die die Frontier derzeit definieren: Qwen3.8-27B, das sich auf einer einzigen 24-GB-Karte wohlfühlt, und Llama 4 Scout, dessen Rechenleistung nur deshalb bescheiden wirkt, weil die meisten seiner Experten im Leerlauf bleiben. Tabellen zur Token-pro-Sekunde-Rate verbleiben auf den Benchmark-Seiten, die aus jedem Abschnitt verlinkt sind.

Am Ende sollten Sie wissen, welche Größe Sie zuerst testen sollten, wie viel VRAM die Gewichte und der Cache tatsächlich in Anspruch nehmen, wie eine gemietete RTX 4090 mit den aktuellen Token-Preisen von Claude Sonnet verglichen wird und wann ein größeres Modell immer noch die richtige Wahl ist.

Warum öffentliche Benchmarks den Produktions-Transfer übertreiben

Ein Modell kann auf MMLU oder HumanEval innerhalb weniger Punkte an einem Frontier-API-Modell liegen und dennoch die Aufgabe, die Sie ausliefern, scheitern. Multi-Tool-Flows verfehlen den zweiten Tool-Aufruf, die Kalibrierung der Verweigerung neigt bei medizinisch naheliegenden Anfragen zu einer Über-Verweigerung, und die P99-Latenz unter Burst-Last verdoppelt sich. Die Lücke im Leaderboard wirkte klein, weil diese Benchmarks die Fähigkeit auf einem festen Prompt-Satz messen. Sie messen nicht den Transfer auf Ihre Tools, Ihre Dokumente und Ihr Latenz-Budget.

Die effiziente Frontier ist die Menge der Modelle, die bei Ihrer Arbeitslast mit Kosten standhalten, die Sie weiterhin tragen können. Dafür ist ein gepaarter Vergleich auf produktionsnahen Aufgaben erforderlich, bei dem drei Signale die ganze Zeit über erfasst werden: Erfolg der Tool-Aufrufe, Verweigerungsverhalten und P99-Latenz. Future AGIs Beitrag über billigen Frontier-Ersatz macht denselben Punkt aus der Bewertungsperspektive: Eine kleine Lücke im öffentlichen Benchmark ist keine Erlaubnis, Modelle auszutauschen.

Betrachten Sie die folgenden Scores als eine Landkarte, wo Sie den Abgleich (Bake-off) starten sollen. Sie sind auf September 2026 datiert, und einige der auffälligen Coding-Zahlen wurden vom Anbieter selbst und nicht unabhängig durchgeführt.

Wo 8B, 30B und 70B tatsächlich liegen

Am unteren Ende wird ein 8B-Instruct-Modell einer kurzen, expliziten Anweisung folgen und eine kleine Funktion schreiben. Bitten Sie es, eine fehlerhafte CI-Pipeline über mehrere Dienste hinweg zu debuggen, sich zu erholen, wenn der erste Tool-Aufruf einen Fehler zurückgibt, und den Plan intakt zu halten, zerfällt der Lauf. Das ist ein Workload-Fehler, kein Leaderboard-Fehler.

In der Mitte des Bereichs ist es, wo allgemeines Agenten-Work derzeit eine einzelne Prosumer-GPU übersteigt. Qwen3.8-27B ist das Referenz-Dichtmodell. Architekturen in derselben Größenordnung, einschließlich des in dem Vergleich Qwen3 30B vs GPT-OSS 20B kopfgelagerten verglichenen Qwen 30B-MoE, sind die, die Sie testen sollten, bevor Sie für etwas Größeres ausgeben.

Am oberen Ende wiegt ein dichter 70B-Modell bei 4-Bit-Quantisierung in der Größenordnung von 35–40 GB an Gewichten, noch bevor der KV-Cache kommt. Es passt nicht auf eine 24-GB-Karte. Sie landen auf einer 48-GB-GPU, einer 80-GB-Datenzentrums-Karte oder einer Zwei-GPU-Aufteilung, und die zusätzliche Qualität gegenüber einem gut abgestimmten 27B-Modell ist oft marginal bei Coding-Agenten, Dokumenten-Pipelines und Support-Bots. Geschlossene Frontier-APIs wie Claude Opus liegen in einem völlig anderen Budget: Sie zahlen pro Token und tragen die Gewichte gar nicht erst.

Bevor Sie einen Checkpoint auswählen, bestätigen Sie die Karte und den freien Speicher. Modellgewichte sind nur ein Teil des Fußabdrucks. Der Kontext (der KV-Cache) liegt zusätzlich obendrauf.

# GPU-Name und freier VRAM vor der Auswahl einer Quantisierung
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv

# nach dem Laden: bestätigen, dass der Prozess auf der GPU geblieben ist
nvidia-smi

Wenn Schichten auf die CPU ausweichen, kollabiert die Generierungs-Durchsatzrate. Sie können die Aufteilung im memory.used der GPU und im Offload-Log der Laufzeitumgebung sehen. Was dichte und MoE-Checkpointe auf einer 16-GB-Karte tatsächlich liefern, messen die 16-GB-VRAM-llama.cpp-Benchmarks und der Ollama-Vergleich auf einer 16-GB-RTX 4080. Diese Seiten besitzen die Geschwindigkeitstabellen. Diese hier benötigt nur die Passform-Entscheidung.

Qwen3.8-27B: der 24-GB-Referenzpunkt

Alibabas Qwen3.8-27B ist ein Dichtmodell, kein Mixture of Experts. Auf Artificial Analysis erzielt es etwa 51 auf dem Agentic Index (gerundete Zahl; der zugrunde liegende Wert ist 50,9) und etwa 52 auf dem Intelligence Index bei maximalem Reasoning-Aufwand. Das sind unterschiedliche Messungen. Der Agentic Index misst Tool-Nutzung und Multi-Step-Aufgaben. Der Intelligence Index ist eine breiter gemischte Fähigkeitsmessung. MindStudios Praxistest rahmt den Agenten-Score als knapp hinter Kimi K2 ein, einem viel größeren Mixture-of-Experts-Modell. Qubrids Aufschlüsselung ist die, die man daneben lesen sollte: Der Vorsprung gegenüber dem nächsten Modell beträgt weniger als einen Punkt, und Qwens eigener SWE-bench-Pro-Wert von 61,7 wurde nicht als unabhängiger Lauf reproduziert. Das interessante Ergebnis ist die Form der Scores. Ein 27B-Modell wandelt ein kompaktes Budget ungewöhnlich gut in Planung und Tool-Nutzung um, und es führt keine breite Wissens-Suite an.

Die Architektur ist der Grund, warum der lange Kontext erschwinglich ist. Von 64 Schichten nutzen nur 16 volle Aufmerksamkeitsmechanismen. Die anderen 48 sind Gated-DeltaNet-Schichten, ein linearer Aufmerksamkeitsansatz aus der Reihe der Gated Delta Networks, und sie halten einen festen rekurrenten Zustand anstelle einer per-Token-Schlüssel-/Wert-Historie. Bei FP16 kosten die Voll-Aufmerksamkeits-Schichten etwa 64 KB KV-Cache pro Token. Ein konventioneller Stack mit derselben Schichtanzahl würde ungefähr das Vierfache davon cachen. Locally Uncensoreds Quant-Tabelle setzt Q4_K_M-Gewichte auf 17,1 GB und IQ4_XS auf 15,7 GB. Hardware Corners llama.cpp-Messungen auf einer 24-GB-GPU landeten nahe bei 18 GB bei kurzem Kontext und etwa 22 GB bei 64K, was das praktische Ziel auf einer RTX 4090 ist. Eine 16-GB-Karte kann eine IQ4-Klasse-Quantisierung der Gewichte und fast keinen Kontext halten. Wenn das Ihre Maschine ist, bleiben Sie bei den Qwen 3.5 und 3.6-Läufen, die bereits auf 16 GB gemessen wurden, einschließlich Qwen 3.6 27B MTP gegenüber Standard-Dekodierung. Wie man den Cache selbst budgetiert, wird in KV-Cache auf 16-GB-GPUs behandelt.

Praxiskurze, darunter auch MindStudios, finden auch, dass das Modell für Coding, Bildanalyse und Agenten-Schleifen nutzbar ist, was der Teil ist, den ein einzelner Index nicht zeigen kann. Vision fügt eine kleine Projektordatei zu den Textgewichten hinzu. Planen Sie damit, wenn die Arbeitslast Screenshots enthält.

Llama 4 Scout: Aktive Parameter sind nicht VRAM

Metas Llama 4 Scout ist eine andere Art der Effizienz. Die Llama 4 Modell-Karte listet 17 Milliarden aktive Parameter und 109 Milliarden Gesamt-Parameter, mit 16 Experten, nativem Bild-Input und einem Kontextfenster von 10 Millionen Tokens. Metas Launch-Post besagt, dass der INT4-Checkpoint auf einer einzelnen H100 passt. Die Dekodier-Rechenleistung folgt den 17B, die für jedes Token feuern. Der Speicher tut das nicht. Jeder Experte muss immer noch resident sein, daher sieht die VRAM-Abrechnung wie bei einem 100B-Klassenmodell aus, obwohl die FLOPs wie bei einem 17B-Modell aussehen.

Das ist die Korrektur, die es wert ist, gemacht zu werden, bevor Sie eine Maschine budgetieren. Scout „läuft nicht wie ein 3B-Modell". Aktive Parameter setzen die Geschwindigkeit. Residente Parameter bestimmen, ob die Karte die Gewichte halten kann. Auf einer 24-GB-GPU ist Qwen3.8-27B das Modell, das passt. Scout ist das Modell, das Sinn ergibt, sobald Sie bereits eine 80-GB-Karte haben und 17B-Klassen-Rechenleistung mit einem viel größeren Expertenpool und einem sehr langen Kontext wollen.

Eine Juni-2025-Studie, Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?, argumentiert, dass MoE ein Dichtmodell schlagen kann, wenn der Vergleich die Gesamt-Rechenleistung und die Daten fix hält und die Aktivierungsrate in einem funktionalen Band liegt. Das praktische Lesen ist enger als die Schlagzeile. MoE gewinnt bei den Kosten nur dann, wenn Sie bereits für den Speicher bezahlt haben, der die inaktiven Experten speichert. Wenn Sie bereits ein Modell dieser Größe betreiben und mehr Tokens pro Sekunde wollen, ohne die Gewichte zu ändern, ist spekulative Dekodierung die benachbarte Technik: Ein Draft-Pfad schlägt Tokens vor und das Hauptmodell verifiziert sie.

Phi-4: die Small-Model-Ausnahme für Mathematik

Microsofts Phi-4 ist ein 14B-Dichtmodell. Im Dezember-2024 technischen Bericht bewertet simple-evals es mit 80,4 auf MATH, vor der GPT-4o-Zahl in derselben Tabelle, mit einem Kontextfenster, das der Bericht auf 16K erweitert. Eine Q4_K_M-Quantisierung wird häufig in etwa 8 GB ausgeführt. Das ist echte Effizienz, und sie ist schmal. Phi-4 wurde für STEM-Frage-Antwort-Systeme trainiert. Es ist das Modell, das man versuchen sollte, wenn die Aufgabe Mathematik oder kurzes technisches Reasoning ist und die Maschine klein ist. Es ist nicht der 2026-Standard für Multi-Tool-Agenten, lange Dokumente oder Vision. Die Frontier für diese Arbeit ist immer noch das 25–34B-Band oben, oder Scout, wenn die GPU eine H100-Klassen-Karte ist.

Self-hosted GPU-Stunden gegenüber Pro-Token-API-Preisen

Preise bewegen sich. Dies sind Zahlen von Mitte September 2026, und sie werden unverändert nicht in das Jahr 2027 überleben.

GPU Finder, geprüft am 18. September 2026, zeigte eine lagerhaltige RTX 4090 für etwa 0,26 USD pro GPU-Stunde auf Vast, mit RunPod Community Cloud auf 0,34 USD gelistet. Der sechswöchige On-Demand-Boden für eine einzelne 4090 lag zwischen 0,11 und 0,60 USD. Bei 0,34 USD und 730 Stunden im Monat ist eine Karte, die den ganzen Monat läuft, vor Steuern, Speicher und Egress etwa 248 USD. Zum Lagerpreis von 0,26 USD ist derselbe Monat etwa 190 USD. Eine frühere Planungsgröße von 0,53 USD pro Stunde liegt innerhalb dieses sechswöchigen Bereichs, übertreibt aber, was der Marktvorrat tatsächlich in der zweiten September-Hälfte verlangte.

Auf der API-Seite listen Anthropics Sonnet 5 Preisnotizen 2 USD pro Millionen Input-Tokens und 10 USD pro Millionen Output-Tokens. Sonnet 4.6 bleibt bei 3 USD und 15 USD. BenchLMs Tarifliste, aktualisiert am 3. September 2026, zeigt dieselbe Aufteilung. Eine Arbeitslast von 100 Millionen Input-Tokens und 10 Millionen Output-Tokens kostet 300 USD bei Sonnet 5 und 450 USD bei Sonnet 4.6.

Neben einer 4090, die für 248 USD den ganzen Monat gemietet wird, sagt dieses Beispiel nicht „Self-Hosting ist immer billiger". Es sagt, dass sich die beiden Rechnungen bei diesem Volumen in derselben Nachbarschaft treffen. Sonnet 5 bei einem 10:1-Input-zu-Output-Verhältnis kostet 30 USD pro 10 Millionen Input plus 1 Million Output. Die 248 USD Miete decken etwa acht dieser Blöcke: ungefähr 80 Millionen Input-Tokens und 8 Millionen Output-Tokens. Darüber hinaus zieht die gemietete Karte voraus, vorausgesetzt, Sie können sie ausgelasten. Darunter ist die API die billigere Zeile, und Sie zahlen nicht für eine inaktive GPU. Eigene Hardware ersetzt die Miete durch Strom und Abschreibung. Die Strategien um diese Rechnung – Budgetierung, Caching und Fallbacks – sind in Kostenoptimierung für LLM-Systeme. Der Grund, warum ein niedrigerer Token-Preis immer noch die falsche Architektur sein kann, ist [Daten-Gravitation und API-Lock-in](https://www.glukhov.org/de/llm-hosting/self-hosting/data-gravity-ai-vendor-lockin/.

Wann ein größeres Modell immer noch die richtige Wahl ist

Das 25–34B-Band ist der Standard für Produktions-Workloads, die sich wiederholen: Coding-Agenten, Support-Bots, Dokumentenverarbeitung, Extraktion und Automatisierung. Es ist der falsche Standard in einigen Situationen.

  • Frontier-Reasoning bei Problemen, bei denen das kleinere Modell in einem gepaarten Test bereits gescheitert ist.
  • Prosa, in der der Unterschied in der Stimme das Produkt ist und das Volumen niedrig genug ist, dass der Token-Preis Rauschen ist.
  • Arbeit, die breite Abdeckung über mehrere Spezialdomänen gleichzeitig benötigt, wobei das 27B-Modell immer wieder dieselbe Klasse von Fakten verfehlt.
  • Niedrigvolumige, hochriskante Entscheidungen, bei denen die Kosten einer falschen Antwort ein Jahr der Modellmiete übersteigen.

In diesen Fällen steigen Sie zu einem 70B-Klassen-Offenen-Modell oder einer Frontier-API auf und behalten dieselben drei Produktions-Signale bei. Wenn das größere Modell Tool-Aufrufe-Erfolg, Verweigerungen oder P99 nicht in die Richtung bewegt, die Sie betrifft, kauft die zusätzliche Größe nichts, was Sie nutzen können.

Wie man einen Punkt auf der Frontier wählt

Verwenden Sie diese Reihenfolge. Es ist billiger zu entdecken, dass ein 27B-Modell ausreicht, als zu entdecken, dass eine 80-GB-Karte unnötig war.

  1. Beginnen Sie mit der Arbeitslast, nicht mit den größten offenen Gewichten, die Sie herunterladen können. Single-Shot-Anweisungen und Mathematik können bei 8–14B beginnen. Multi-Step-Tool-Nutzung beginnt bei Qwen3.8-27B, wenn Sie 24 GB haben, oder bei der besten 16-GB-Quantisierung, die Sie bereits gemessen haben, wenn Sie es nicht tun.
  2. Trennen Sie aktive Parameter von residenten Parametern. Scouts 17B-Aktive-Zahl ist eine Rechenleistungsaussage. Die 109B-Gesamtzahl ist die VRAM-Aussage. Budgetieren Sie die zweite Zahl.
  3. Quantisieren Sie und überprüfen Sie dann den Speicher erneut. Q4_K_M von Qwen3.8-27B ist ein 24-GB-Gespräch, mit etwa 64K Kontext, bevor die Karte voll ist. Führen Sie nvidia-smi nach dem Laden aus, bei der Kontextlänge, die Sie tatsächlich bedienen werden.
  4. Preis für den Monat, nicht für das Token. Vergleichen Sie 730 Stunden der GPU, die Sie mieten würden, mit dem Input- und Output-Mix, den Sie bereits protokollieren. Wenn Sie unter dem Break-even oben liegen, bleiben Sie auf der API, bis das Volumen eintrifft.
  5. Entscheiden Sie auf Ihren eigenen Aufgaben. Ein gepaarter Lauf, der Tool-Aufrufe-Erfolg, Verweigerungsverhalten und P99 unter Burst aufzeichnet, ist der Test, den öffentliche Benchmarks nicht ersetzen können.
flowchart TD A[Workload definieren] --> B{Multi-Step-Tool-Nutzung?} B -- Nein: Single-Shot oder Mathematik --> C[Beginnen bei 8-14B] B -- Ja --> D{Eine 24-GB-GPU?} D -- Ja --> E[Qwen3.8-27B nahe Q4, dann KV-Cache prüfen] D -- Nein: 80-GB-Klassen-Karte --> F[Llama 4 Scout: 17B aktiv, 109B resident] C --> G[Gepaarter Lauf auf Ihren Aufgaben] E --> G F --> G G --> H{Tool-Aufrufe, Verweigerungen und P99 bestehen?} H -- Ja --> I[Deployen und diese drei Signale behalten] H -- Nein, Volumen ist niedrig --> J[70B-Klassen-Gewichte oder Frontier-API] H -- Nein, Volumen ist hoch --> K[Nächste Größe nach oben, dann den Monat neu preisgeben]

Die nützliche Frage im Jahr 2026 ist, welche Gewichte auf die Karte, den Kontext und die monatliche Rechnung passen, während sie noch Ihre eigenen Aufgaben erfüllen. Für viel Agenten-Work ist dieser Punkt ein 27B-Hybridmodell auf einer einzigen 24-GB-GPU. Scout ist dieselbe Idee bei Datenzentrum-Speicher: weniger Rechenleistung pro Token, als die Gesamtparameterzahl vermuten lässt, und kein Rabatt auf den VRAM.

Referenzen

  1. MindStudio. “Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests.” https://www.mindstudio.ai/blog/qwen-3-27b-local-benchmark
  2. Qubrid AI. “Qwen3.8-27B Benchmarks: Official and Independent Results.” https://www.qubrid.com/blog/qwen38-27b-benchmarks-official-and-independent-results
  3. Hardware Corner. “We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need?” https://www.hardware-corner.net/qwen3-8-27b-hardware-tests/
  4. Locally Uncensored. “How to Run Qwen 3.8 27B Locally: VRAM, Quants and the Template Trap.” https://locallyuncensored.com/blog/how-to-run-qwen-3-8-27b-locally.html
  5. Malik, Umesh. “Qwen3.8 27B VRAM: how to fit 262K context in 16 GiB, not 64.” https://umesh-malik.com/blog/qwen3-8-27b-vram-kv-cache-math
  6. Meta AI. “The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.” https://ai.meta.com/blog/llama-4-multimodal-intelligence
  7. Meta. “Llama 4 model card.” https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
  8. arXiv. “Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?” June 2025. https://arxiv.org/html/2506.12119v1
  9. Yang, S., Kautz, J., Hatamizadeh, A. “Gated Delta Networks: Improving Mamba2 with Delta Rule.” ICLR 2025. https://jankautz.com/publications/GatedDeltaNet_ICLR25.pdf
  10. Abdin, M., et al. “Phi-4 Technical Report.” arXiv:2412.08905, December 2024. https://arxiv.org/html/2412.08905v1
  11. GPU Finder. “RTX 4090 GPU Rental Prices & Live Availability.” Checked 18 September 2026. https://gpufinder.dev/gpu/rtx-4090
  12. Anthropic. “What’s new in Claude Sonnet 5” (pricing: $2 / $10 per million tokens). https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5
  13. BenchLM. “Claude API pricing.” Updated 3 September 2026. https://benchlm.ai/anthropic/api-pricing
  14. Future AGI. “Evaluating Cheap Frontier Models in 2026: Substitution Without a Quality Cliff.” https://futureagi.com/blog/evaluating-cheap-frontier-models-2026
  15. Northflank. “Qwen3.8-27B: Performance, benchmarks, GPU requirements & how to run it.” 17 August 2026. https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it

Abonnieren

Neue Beiträge zu Systemen, Infrastruktur und KI-Engineering.