Vergleich: Qwen3:30b vs. GPT-OSS:20b

Vergleich von Geschwindigkeit, Parametern und Leistung dieser beiden Modelle

Inhaltsverzeichnis

Hier ist ein Vergleich zwischen Qwen3:30b und GPT-OSS:20b, der sich auf die Befolgung von Anweisungen sowie Leistungsparameter, Spezifikationen und Geschwindigkeit konzentriert.

Für weitere Informationen zu Durchsatz, Latenz, VRAM und Benchmarks über verschiedene Laufzeitumgebungen und Hardware hinweg, siehe LLM-Leistung: Benchmarks, Engpässe und Optimierung.

7 llamas

Für an Agent-Loops ausgerichtete Standard-Sampling-Einstellungen bei der neueren Qwen-Generation (einschließlich Strafen sowie Presets für Denken im Gegensatz zu Coden) empfehlen wir einen Abgleich mit agentischen Inferenz-Parametern für Qwen und Gemma.

Architektur und Parameter

Funktion Qwen3:30b-instruct GPT-OSS:20b
Gesamtparameter 30,5 Milliarden 21 Milliarden
Aktivierte Parameter ~3,3 Milliarden ~3,6 Milliarden
Anzahl der Ebenen 48 24
MoE-Experten pro Ebene 128 (8 aktiv pro Token) 32 (4 aktiv pro Token)
Aufmerksamkeitsmechanismus Grouped Query Attention (32Q / 4KV) Grouped Multi-Query Attention (64Q / 8KV)
Kontextfenster 32.768 nativ; bis zu 262.144 erweitert 128.000 Token
Tokenizer BPE-basiert, 151.936 Vokabular GPT-basiert, ≈ 200k Vokabular

Befolgung von Anweisungen

  • Qwen3:30b-instruct ist für die Befolgung von Anweisungen optimiert und weist eine starke Ausrichtung an menschlichen Präferenzen auf. Es glänzt in kreativem Schreiben, Rollenspiel, mehrstufigen Dialogen und der Befolgung von Anweisungen in mehreren Sprachen. Diese Variante wurde speziell so feinabgestimmt (Fine-Tuned), um natürlichere, kontrolliertere und engagiertere Antworten zu liefern, die mit den Anweisungen der Nutzer übereinstimmen.
  • GPT-OSS:20b unterstützt die Befolgung von Anweisungen, wird jedoch allgemein als etwas hinter Qwen3:30b-instruct bei der nuancierten Anpassung an Anweisungen (Instruction Tuning) eingeschätzt. Es bietet vergleichbare Funktionsaufrufe (Function Calling), strukturierte Ausgaben und Reasoning-Modi, kann aber bei der konversationellen Ausrichtung und kreativen Dialogführung zurückfallen.

Leistung und Effizienz

  • Qwen3:30b-instruct excelliert im mathematischen Schlussfolgern, Coden, komplexen logischen Aufgaben und mehrsprachigen Szenarien, die 119 Sprachen und Dialekte abdecken. Sein „Thinking“-Modus ermöglicht erweitertes Reasoning, geht aber mit höheren Speicheranforderungen einher.
  • GPT-OSS:20b erreicht eine Leistung, die vergleichbar mit dem o3-mini-Modell von OpenAI ist. Es verwendet weniger Ebenen, aber breitere Experten pro Ebene sowie native MXFP4-Quantisierung für effiziente Inferenz auf Consumer-Hardware mit geringeren Speicheranforderungen (ca. 16 GB im Vergleich zu höheren Werten bei Qwen3).
  • GPT-OSS ist auf bestimmten Hardware-Setups, insbesondere auf Consumer-GPUs, etwa 33 % speichereffizienter und schneller, während Qwen3 oft eine bessere Ausrichtung und Reasoning-Tiefe bietet, besonders bei komplexen Anwendungsfällen.
  • Qwen3 bietet eine längere optionale erweiterte Kontextlänge (bis zu 262.144 Token) im Vergleich zu 128.000 Token bei GPT-OSS, was Aufgaben zugutekommt, die ein sehr langes Kontextverständnis erfordern.

Empfehlung zur Nutzung

  • Wählen Sie Qwen3:30b-instruct für Anwendungsfälle, die überlegene Befolgung von Anweisungen, kreative Generierung, mehrsprachige Unterstützung und komplexes Reasoning erfordern.
  • Wählen Sie GPT-OSS:20b, wenn Speicher-effizienz, Inferenzgeschwindigkeit auf Consumer-Hardware und wettbewerbsfähige Basisleistung bei weniger Parametern im Vordergrund stehen.

Dieser Vergleich stellt Qwen3:30b-instruct als tieferes, fähigeres Modell mit fortschrittlichem Instruction Tuning dar, während GPT-OSS:20b eine kompaktere, effizientere Alternative mit wettbewerbsfähiger Leistung bei Standard-Benchmarks bietet.

Benchmarkscores, die Qwen3:30b-instruct und GPT-OSS:20b speziell hinsichtlich der Befolgung von Anweisungen und wichtiger Leistungsparameter (MMLU, LMEval, HumanEval) direkt vergleichen, sind in den Suchergebnissen nicht unmittelbar verfügbar. Basierend auf vorhandenen veröffentlichten mehrsprachigen und mehrstufigen Benchmark-Reports lässt sich jedoch Folgendes sagen:

MMLU (Massive Multitask Language Understanding)

Die Details sind schwer zu finden, aber im Wesentlichen:

  • Modelle der Qwen3-Serie, insbesondere im 30B-Bereich und darüber, weisen starke MMLU-Werte auf, die typischerweise 89 % überschreiten. Dies deutet auf sehr wettbewerbsfähige Fähigkeiten im Wissensverständnis und Schlussfolgern in 57 verschiedenen Domänen hin.
  • GPT-OSS:20b schneidet bei MMLU-Benchmarks ebenfalls gut ab, erzielt jedoch in der Regel niedrigere Scores als größere Qwen-Modelle, was auf die geringere Parameternzahl und den geringeren Fokus auf Instruction Fine-Tuning zurückzuführen ist.

LMEval (Language Model Evaluation Toolkit)

Aktuell (ATM) nicht viele Details:

  • Qwen3-Modelle zeigen signifikante Verbesserungen bei Reasoning- und Cod-bezogenen Aufgaben innerhalb von LMEval, mit gesteigerten Scores bei Logik, mathematischem Schlussfolgern und allgemeinen Fähigkeiten.
  • GPT-OSS:20b liefert robuste Basisleistung bei LMEval, bleibt aber allgemein hinter Qwen3:30b-instruct bei fortgeschrittenen Reasoning- und Instrukionsbefolgungs-Unteraufgaben zurück.

HumanEval (Benchmark zur Codegenerierung)

Nicht viele Daten, nur so viel:

  • Qwen3:30b-instruct zeigt starke Leistung bei mehrsprachigen Codegenerierungs-Benchmarks wie HumanEval-XL, unterstützt über 20 Programmiersprachen und bietet eine überlegene Genauigkeit in der quellsprachenübergreifenden Codegenerierung.
  • GPT-OSS:20b ist zwar wettbewerbsfähig, schneidet jedoch bei HumanEval-Benchmarks etwas schlechter ab als Qwen3:30b-instruct, insbesondere in mehrsprachigen und mit mehreren Programmiersprachen arbeitenden Kontexten, was auf ein weniger umfangreiches mehrsprachiges Training zurückzuführen ist.
Benchmark Qwen3:30b-instruct GPT-OSS:20b Anmerkungen
MMLU-Genauigkeit ~89-91% ~80-85% Qwen3 stärker in breitem Wissen und Reasoning
LMEval-Scores Hoch, fortgeschrittenes Reasoning & Code Mittel, Basis-Reasoning Qwen3 excelliert in Mathe und Logik
HumanEval Hohe Leistung in mehrsprachiger Codegenerierung Mittel Qwen3 besser in quellsprachenübergreifender Codegenerierung

Falls exakte Benchmark-Zahlen benötigt werden, liefern spezialisierte mehrsprachige Large-Scale-Benchmarks wie P-MMEval und HumanEval-XL, die in aktuellen Forschungspapern referenziert werden, detaillierte Scores für Modelle einschließlich Qwen3 und vergleichbare GPT-OSS-Varianten. Diese sind jedoch derzeit nicht öffentlich für eine direkte nebeneinanderstehende Abrufung von Scores aufbereitet.

Geschwindigkeitsvergleich zwischen Qwen3:30b und GPT-OSS:20b

Auf meiner Hardware (16 GB VRAM) lasse ich Qwen3:30b und GPT-OSS:20b mit einem Kontextfenster von 4000 laufen, und sie produzieren:

  • qwen3:30b-a3b => 45,68 Token/s
  • gpt-oss:20b => 129,52 Token/s

Und zum Vergleich habe ich auch qwen3:14b und gpt-oss:120b getestet:

  • qwen3:14b => 60,12 Token/s
  • gpt-oss:120b => 12,87 Token/s

Bei längeren Kontextfenstern wird die Geschwindigkeit langsamer sein; bei qwen3:30b-a3b voraussichtlich deutlich langsamer. Das gilt aber nur für meinen PC. Technische Details wurden aus der ausführenden Ausgabe (Verbose Output) übernommen; der zugeordnete Speicher ist unten angegeben. Befehle zum Testen:

  • ollama run qwen3:30b-a3b –verbose beschreibe den Wetterunterschied zwischen den Staatshauptstädten in Australien
  • ollama ps zeigt die Speicherallokation bei 4K-Kontext

qwen3:30b-a3b

NAME             ID              SIZE     PROCESSOR          CONTEXT    UNTIL
qwen3:30b-a3b    19e422b02313    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       28.151133548s
load duration:        1.980696196s
prompt eval count:    16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate:     98.41 tokens/s
eval count:           1188 token(s)
eval duration:        26.007424856s
eval rate:            45.68 tokens/s

qwen3:30b-thinking

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:30b-thinking    ad815644918f    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       1m8.317354579s
load duration:        1.984986882s
prompt eval count:    18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate:     81.95 tokens/s
eval count:           2722 token(s)
eval duration:        1m6.11230524s
eval rate:            41.17 tokens/s

gpt-oss:20b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
gpt-oss:20b    aa4295ac10c3    14 GB    100% GPU     4096       4 minutes from now
total duration:       31.505397616s
load duration:        13.744361948s
prompt eval count:    75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate:     300.77 tokens/s
eval count:           2268 token(s)
eval duration:        17.510262884s
eval rate:            129.52 tokens/s

qwen3:14b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:14b    bdbd181c33f2    10 GB    100% GPU     4096       4 minutes from now    
total duration:       36.902729562s
load duration:        38.669074ms
prompt eval count:    18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate:     509.61 tokens/s
eval count:           2214 token(s)
eval duration:        36.828268069s
eval rate:            60.12 tokens/s

gpt-oss:120b

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    f7f8e2f8f4e0    65 GB    78%/22% CPU/GPU    4096       2 minutes from now
49GB RAM + 14.4GB VRAM
total duration:       3m59.967272019s
load duration:        76.758783ms
prompt eval count:    75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate:     252.26 tokens/s
eval count:           3084 token(s)
eval duration:        3m59.592764501s
eval rate:            12.87 tokens/s

Varianten von Qwen3:30b

Es gibt drei Varianten des qwen3:30b-Modells: qwen3:30b, qwen3:30b-instruct und qwen3:30b-thinking.

Wichtige Unterschiede und Empfehlungen

  • qwen3:30b-instruct ist am besten für Konversationen geeignet, in denen Benutzeranweisungen, Klarheit und natürlicher Dialog Priorität haben.
  • qwen3:30b ist die allgemeine Basis und geeignet, wenn sowohl die Befolgung von Anweisungen als auch die Nutzung von Tools bei verschiedenen Aufgaben wichtig sind.
  • qwen3:30b-thinking excelliert, wenn tiefe Schlussfolgerungen, Mathematik und Coden der Hauptfokus sind. Es übertrifft die anderen bei Aufgaben, die logische/mathematische Strenge messen, ist aber nicht unbedingt besser für kreatives Schreiben oder lässige Konversationen.

Direkter Benchmark-Vergleich

Modell Reasoning (AIME25) Coding (LiveCodeBench) Allgemeines Wissen (MMLU Redux) Geschwindigkeit & Kontext Idealer Anwendungsfall
qwen3:30b 70,9 57,4 89,5 256K Token; Schnell Allgemeine Sprache/Agenten/mehrsprachig
qwen3:30b-instruct N/A (Geplant nahe an 30b) N/A ~Gleich wie 30b 256K Token Befolgung von Anweisungen, Ausrichtung
qwen3:30b-thinking 85,0 66,0 91,4 256K Token Mathematik, Code, Reasoning, lange Dokumente

Für weitere Benchmarks, Hardwareauswahlen und Leistungstuning, sehen Sie sich unser Hub LLM-Leistung: Benchmarks, Engpässe und Optimierung an.

Abonnieren

Neue Beiträge zu Systemen, Infrastruktur und KI-Engineering.