Vergleich: Qwen3:30b vs. GPT-OSS:20b
Vergleich von Geschwindigkeit, Parametern und Leistung dieser beiden Modelle
Hier ist ein Vergleich zwischen Qwen3:30b und GPT-OSS:20b, der sich auf die Befolgung von Anweisungen sowie Leistungsparameter, Spezifikationen und Geschwindigkeit konzentriert.
Für weitere Informationen zu Durchsatz, Latenz, VRAM und Benchmarks über verschiedene Laufzeitumgebungen und Hardware hinweg, siehe LLM-Leistung: Benchmarks, Engpässe und Optimierung.

Für an Agent-Loops ausgerichtete Standard-Sampling-Einstellungen bei der neueren Qwen-Generation (einschließlich Strafen sowie Presets für Denken im Gegensatz zu Coden) empfehlen wir einen Abgleich mit agentischen Inferenz-Parametern für Qwen und Gemma.
Architektur und Parameter
| Funktion | Qwen3:30b-instruct | GPT-OSS:20b |
|---|---|---|
| Gesamtparameter | 30,5 Milliarden | 21 Milliarden |
| Aktivierte Parameter | ~3,3 Milliarden | ~3,6 Milliarden |
| Anzahl der Ebenen | 48 | 24 |
| MoE-Experten pro Ebene | 128 (8 aktiv pro Token) | 32 (4 aktiv pro Token) |
| Aufmerksamkeitsmechanismus | Grouped Query Attention (32Q / 4KV) | Grouped Multi-Query Attention (64Q / 8KV) |
| Kontextfenster | 32.768 nativ; bis zu 262.144 erweitert | 128.000 Token |
| Tokenizer | BPE-basiert, 151.936 Vokabular | GPT-basiert, ≈ 200k Vokabular |
Befolgung von Anweisungen
- Qwen3:30b-instruct ist für die Befolgung von Anweisungen optimiert und weist eine starke Ausrichtung an menschlichen Präferenzen auf. Es glänzt in kreativem Schreiben, Rollenspiel, mehrstufigen Dialogen und der Befolgung von Anweisungen in mehreren Sprachen. Diese Variante wurde speziell so feinabgestimmt (Fine-Tuned), um natürlichere, kontrolliertere und engagiertere Antworten zu liefern, die mit den Anweisungen der Nutzer übereinstimmen.
- GPT-OSS:20b unterstützt die Befolgung von Anweisungen, wird jedoch allgemein als etwas hinter Qwen3:30b-instruct bei der nuancierten Anpassung an Anweisungen (Instruction Tuning) eingeschätzt. Es bietet vergleichbare Funktionsaufrufe (Function Calling), strukturierte Ausgaben und Reasoning-Modi, kann aber bei der konversationellen Ausrichtung und kreativen Dialogführung zurückfallen.
Leistung und Effizienz
- Qwen3:30b-instruct excelliert im mathematischen Schlussfolgern, Coden, komplexen logischen Aufgaben und mehrsprachigen Szenarien, die 119 Sprachen und Dialekte abdecken. Sein „Thinking“-Modus ermöglicht erweitertes Reasoning, geht aber mit höheren Speicheranforderungen einher.
- GPT-OSS:20b erreicht eine Leistung, die vergleichbar mit dem o3-mini-Modell von OpenAI ist. Es verwendet weniger Ebenen, aber breitere Experten pro Ebene sowie native MXFP4-Quantisierung für effiziente Inferenz auf Consumer-Hardware mit geringeren Speicheranforderungen (ca. 16 GB im Vergleich zu höheren Werten bei Qwen3).
- GPT-OSS ist auf bestimmten Hardware-Setups, insbesondere auf Consumer-GPUs, etwa 33 % speichereffizienter und schneller, während Qwen3 oft eine bessere Ausrichtung und Reasoning-Tiefe bietet, besonders bei komplexen Anwendungsfällen.
- Qwen3 bietet eine längere optionale erweiterte Kontextlänge (bis zu 262.144 Token) im Vergleich zu 128.000 Token bei GPT-OSS, was Aufgaben zugutekommt, die ein sehr langes Kontextverständnis erfordern.
Empfehlung zur Nutzung
- Wählen Sie Qwen3:30b-instruct für Anwendungsfälle, die überlegene Befolgung von Anweisungen, kreative Generierung, mehrsprachige Unterstützung und komplexes Reasoning erfordern.
- Wählen Sie GPT-OSS:20b, wenn Speicher-effizienz, Inferenzgeschwindigkeit auf Consumer-Hardware und wettbewerbsfähige Basisleistung bei weniger Parametern im Vordergrund stehen.
Dieser Vergleich stellt Qwen3:30b-instruct als tieferes, fähigeres Modell mit fortschrittlichem Instruction Tuning dar, während GPT-OSS:20b eine kompaktere, effizientere Alternative mit wettbewerbsfähiger Leistung bei Standard-Benchmarks bietet.
Benchmarkscores, die Qwen3:30b-instruct und GPT-OSS:20b speziell hinsichtlich der Befolgung von Anweisungen und wichtiger Leistungsparameter (MMLU, LMEval, HumanEval) direkt vergleichen, sind in den Suchergebnissen nicht unmittelbar verfügbar. Basierend auf vorhandenen veröffentlichten mehrsprachigen und mehrstufigen Benchmark-Reports lässt sich jedoch Folgendes sagen:
MMLU (Massive Multitask Language Understanding)
Die Details sind schwer zu finden, aber im Wesentlichen:
- Modelle der Qwen3-Serie, insbesondere im 30B-Bereich und darüber, weisen starke MMLU-Werte auf, die typischerweise 89 % überschreiten. Dies deutet auf sehr wettbewerbsfähige Fähigkeiten im Wissensverständnis und Schlussfolgern in 57 verschiedenen Domänen hin.
- GPT-OSS:20b schneidet bei MMLU-Benchmarks ebenfalls gut ab, erzielt jedoch in der Regel niedrigere Scores als größere Qwen-Modelle, was auf die geringere Parameternzahl und den geringeren Fokus auf Instruction Fine-Tuning zurückzuführen ist.
LMEval (Language Model Evaluation Toolkit)
Aktuell (ATM) nicht viele Details:
- Qwen3-Modelle zeigen signifikante Verbesserungen bei Reasoning- und Cod-bezogenen Aufgaben innerhalb von LMEval, mit gesteigerten Scores bei Logik, mathematischem Schlussfolgern und allgemeinen Fähigkeiten.
- GPT-OSS:20b liefert robuste Basisleistung bei LMEval, bleibt aber allgemein hinter Qwen3:30b-instruct bei fortgeschrittenen Reasoning- und Instrukionsbefolgungs-Unteraufgaben zurück.
HumanEval (Benchmark zur Codegenerierung)
Nicht viele Daten, nur so viel:
- Qwen3:30b-instruct zeigt starke Leistung bei mehrsprachigen Codegenerierungs-Benchmarks wie HumanEval-XL, unterstützt über 20 Programmiersprachen und bietet eine überlegene Genauigkeit in der quellsprachenübergreifenden Codegenerierung.
- GPT-OSS:20b ist zwar wettbewerbsfähig, schneidet jedoch bei HumanEval-Benchmarks etwas schlechter ab als Qwen3:30b-instruct, insbesondere in mehrsprachigen und mit mehreren Programmiersprachen arbeitenden Kontexten, was auf ein weniger umfangreiches mehrsprachiges Training zurückzuführen ist.
Zusammenfassungstabelle (ungefähre Trends aus der Literatur):
| Benchmark | Qwen3:30b-instruct | GPT-OSS:20b | Anmerkungen |
|---|---|---|---|
| MMLU-Genauigkeit | ~89-91% | ~80-85% | Qwen3 stärker in breitem Wissen und Reasoning |
| LMEval-Scores | Hoch, fortgeschrittenes Reasoning & Code | Mittel, Basis-Reasoning | Qwen3 excelliert in Mathe und Logik |
| HumanEval | Hohe Leistung in mehrsprachiger Codegenerierung | Mittel | Qwen3 besser in quellsprachenübergreifender Codegenerierung |
Falls exakte Benchmark-Zahlen benötigt werden, liefern spezialisierte mehrsprachige Large-Scale-Benchmarks wie P-MMEval und HumanEval-XL, die in aktuellen Forschungspapern referenziert werden, detaillierte Scores für Modelle einschließlich Qwen3 und vergleichbare GPT-OSS-Varianten. Diese sind jedoch derzeit nicht öffentlich für eine direkte nebeneinanderstehende Abrufung von Scores aufbereitet.
Geschwindigkeitsvergleich zwischen Qwen3:30b und GPT-OSS:20b
Auf meiner Hardware (16 GB VRAM) lasse ich Qwen3:30b und GPT-OSS:20b mit einem Kontextfenster von 4000 laufen, und sie produzieren:
- qwen3:30b-a3b => 45,68 Token/s
- gpt-oss:20b => 129,52 Token/s
Und zum Vergleich habe ich auch qwen3:14b und gpt-oss:120b getestet:
- qwen3:14b => 60,12 Token/s
- gpt-oss:120b => 12,87 Token/s
Bei längeren Kontextfenstern wird die Geschwindigkeit langsamer sein; bei qwen3:30b-a3b voraussichtlich deutlich langsamer. Das gilt aber nur für meinen PC. Technische Details wurden aus der ausführenden Ausgabe (Verbose Output) übernommen; der zugeordnete Speicher ist unten angegeben. Befehle zum Testen:
- ollama run qwen3:30b-a3b –verbose beschreibe den Wetterunterschied zwischen den Staatshauptstädten in Australien
- ollama ps zeigt die Speicherallokation bei 4K-Kontext
qwen3:30b-a3b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-a3b 19e422b02313 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 28.151133548s
load duration: 1.980696196s
prompt eval count: 16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate: 98.41 tokens/s
eval count: 1188 token(s)
eval duration: 26.007424856s
eval rate: 45.68 tokens/s
qwen3:30b-thinking
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-thinking ad815644918f 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 1m8.317354579s
load duration: 1.984986882s
prompt eval count: 18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate: 81.95 tokens/s
eval count: 2722 token(s)
eval duration: 1m6.11230524s
eval rate: 41.17 tokens/s
gpt-oss:20b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:20b aa4295ac10c3 14 GB 100% GPU 4096 4 minutes from now
total duration: 31.505397616s
load duration: 13.744361948s
prompt eval count: 75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate: 300.77 tokens/s
eval count: 2268 token(s)
eval duration: 17.510262884s
eval rate: 129.52 tokens/s
qwen3:14b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:14b bdbd181c33f2 10 GB 100% GPU 4096 4 minutes from now
total duration: 36.902729562s
load duration: 38.669074ms
prompt eval count: 18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate: 509.61 tokens/s
eval count: 2214 token(s)
eval duration: 36.828268069s
eval rate: 60.12 tokens/s
gpt-oss:120b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:120b f7f8e2f8f4e0 65 GB 78%/22% CPU/GPU 4096 2 minutes from now
49GB RAM + 14.4GB VRAM
total duration: 3m59.967272019s
load duration: 76.758783ms
prompt eval count: 75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate: 252.26 tokens/s
eval count: 3084 token(s)
eval duration: 3m59.592764501s
eval rate: 12.87 tokens/s
Varianten von Qwen3:30b
Es gibt drei Varianten des qwen3:30b-Modells: qwen3:30b, qwen3:30b-instruct und qwen3:30b-thinking.
Wichtige Unterschiede und Empfehlungen
- qwen3:30b-instruct ist am besten für Konversationen geeignet, in denen Benutzeranweisungen, Klarheit und natürlicher Dialog Priorität haben.
- qwen3:30b ist die allgemeine Basis und geeignet, wenn sowohl die Befolgung von Anweisungen als auch die Nutzung von Tools bei verschiedenen Aufgaben wichtig sind.
- qwen3:30b-thinking excelliert, wenn tiefe Schlussfolgerungen, Mathematik und Coden der Hauptfokus sind. Es übertrifft die anderen bei Aufgaben, die logische/mathematische Strenge messen, ist aber nicht unbedingt besser für kreatives Schreiben oder lässige Konversationen.
Direkter Benchmark-Vergleich
| Modell | Reasoning (AIME25) | Coding (LiveCodeBench) | Allgemeines Wissen (MMLU Redux) | Geschwindigkeit & Kontext | Idealer Anwendungsfall |
|---|---|---|---|---|---|
| qwen3:30b | 70,9 | 57,4 | 89,5 | 256K Token; Schnell | Allgemeine Sprache/Agenten/mehrsprachig |
| qwen3:30b-instruct | N/A (Geplant nahe an 30b) | N/A | ~Gleich wie 30b | 256K Token | Befolgung von Anweisungen, Ausrichtung |
| qwen3:30b-thinking | 85,0 | 66,0 | 91,4 | 256K Token | Mathematik, Code, Reasoning, lange Dokumente |
Für weitere Benchmarks, Hardwareauswahlen und Leistungstuning, sehen Sie sich unser Hub LLM-Leistung: Benchmarks, Engpässe und Optimierung an.
Nützliche Links
- https://ollama.com/library/qwen3
- https://ollama.com/library/gpt-oss
- https://artificialanalysis.ai/articles/analysis-openai-gpt-oss-models
- https://artificialanalysis.ai/models/qwen3-30b-a3b-2507
- Ollama installieren und konfigurieren
- Ollama-Spickzettel - nützlichste Befehle
- LLMs mit strukturierter Ausgabe einschränken: Ollama, Qwen3 & Python oder Go
- Validierung strukturierter LLM-Ausgaben in Python, die standhält
- Integration von Ollama mit Python: REST API und Python-Client-Beispiele
- Die effiziente Frontier offener Modelle im Jahr 2026