Leistungsvergleich von LLMs mit Ollama auf einer GPU mit 16 GB VRAM
LLM-Geschwindigkeitstest auf RTX 4080 mit 16 GB VRAM
Das lokale Ausführen großer Sprachmodelle bietet Privatsphäre, Offline-Fähigkeit und null API-Kosten. Dieser Benchmark zeigt genau, was man von 14 populären LLMs auf Ollama auf einer RTX 4080 erwarten kann.
Mit einer 16-GB-VRAM-GPU stand ich vor einem ständigen Kompromiss: größere Modelle mit potenziell besserer Qualität oder kleinere Modelle mit schnellerer Inferenz. Für weitere Informationen zu LLM-Leistung – Durchsatz vs. Latenz, VRAM-Limits, parallele Anfragen und Benchmarks über verschiedene Laufzeitumgebungen hinweg – siehe LLM-Leistung: Benchmarks, Engpässe und Optimierung.
Dieser Artikel konzentriert sich auf Ollama. Für die gleiche Klasse von 16-GB-GPUs, gemessen mit llama.cpp bei 19K, 32K und 64K Kontext (VRAM, GPU-Auslastung, Tokens pro Sekunde über dichte und MoE-Checkpoints hinweg), siehe 16-GB-VRAM-LLM-Benchmarks mit llama.cpp (Geschwindigkeit und Kontext).
Sobald Durchsatz und VRAM-Verteilung akzeptabel erscheinen, benötigen agentenbasierte Workloads dennoch sinnvolle Voreinstellungen für Temperatur und Strafen für Qwen- und Gemma-ähnliche Stacks; siehe Agentic Inferenzparameter für Qwen und Gemma.

TL;DR
Hier ist die aktualisierte Vergleichstabelle der LLM-Leistung auf der RTX 4080 16GB mit Ollama 0.17.7, (09.03.2026) wurden die Modelle Qwen 3.5 9b, 9bq8, 27b und 35b hinzugefügt:
| Modell | RAM+VRAM verwendet | CPU/GPU-Aufteilung | Tokens/Sek |
|---|---|---|---|
| gpt-oss:20b | 14 GB | 100% GPU | 139,93 |
| qwen3.5:9b | 9,3 GB | 100% GPU | 90,89 |
| ministral-3:14b | 13 GB | 100% GPU | 70,13 |
| qwen3:14b | 12 GB | 100% GPU | 61,85 |
| qwen3.5:9b-q8_0 | 13 GB | 100% GPU | 61,22 |
| qwen3-coder:30b | 20 GB | 25%/75% CPU/GPU | 57,17 |
| qwen3-vl:30b-a3b | 22 GB | 30%/70% CPU/GPU | 50,99 |
| glm-4.7-flash | 21 GB | 27%/73% CPU/GPU | 33,86 |
| nemotron-3-nano:30b | 25 GB | 38%/62% CPU/GPU | 32,77 |
| qwen3.5:35b | 27 GB | 43%/57% CPU/GPU | 20,66 |
| devstral-small-2:24b | 19 GB | 18%/82% CPU/GPU | 18,67 |
| mistral-small3.2:24b | 19 GB | 18%/82% CPU/GPU | 18,51 |
| gpt-oss:120b | 66 GB | 78%/22% CPU/GPU | 12,64 |
| qwen3.5:27b | 24 GB | 43%/57% CPU/GPU | 6,48 |
Wichtigster Befund: Modelle, die vollständig in den VRAM passen, sind dramatisch schneller. GPT-OSS 20B erreicht 139,93 Tokens/Sekunde, während GPT-OSS 120B mit starkem CPU-Offloading nur 12,64 Tokens/Sekunde schafft – ein 11-facher Geschwindigkeitsunterschied.
Testhardware
Der Benchmark wurde auf dem folgenden System durchgeführt:
- GPU: NVIDIA RTX 4080 mit 16GB VRAM
- CPU: Intel Core i7-14700 (8 P-Kerne + 12 E-Kerne)
- RAM: 64GB DDR5-6000
Dies stellt eine gängige High-End-Consumer-Konfiguration für lokale LLM-Inferenz dar. Die 16GB VRAM sind die kritische Einschränkung – sie bestimmen, welche Modelle vollständig auf der GPU laufen und welche CPU-Offloading benötigen.
Das Verständnis davon, wie Ollama Intel CPU-Kerne nutzt wird wichtig, wenn Modelle die VRAM-Kapazität überschreiten, da die CPU-Leistung die Inferenzgeschwindigkeit der offgeladenen Schichten direkt beeinflusst.
Zweck dieses Benchmarks
Das Hauptziel war die Messung der Inferenzgeschwindigkeit unter realistischen Bedingungen. Ich wusste bereits aus Erfahrung, dass Mistral Small 3.2 24B bei der Sprachqualität überzeugt, während Qwen3 14B für meine spezifischen Anwendungsfälle eine überlegene Anweisungsfolge bietet.
Dieser Benchmark beantwortet die praktische Frage: Wie schnell kann jedes Modell Text generieren und was ist der Geschwindigkeitsnachteil bei Überschreitung der VRAM-Limits?
Die Testparameter waren:
- Kontextgröße: 19.000 Tokens. Dies ist der Durchschnittswert in meinen Generate-Anfragen.
- Prompt: “compare weather and climate between capital cities of australia”
- Metrik: eval rate (Tokens pro Sekunde während der Generierung)
Ollama-Installation und Version
Alle Tests verwendeten Ollama Version 0.15.2, den letzten Release zum Zeitpunkt des Testens. Später wurde es mit Ollama v 0.17.7 erneut durchgeführt – um die Qwen3.5-Modelle hinzuzufügen. Für einen vollständigen Referenzleitfaden der in diesem Benchmark verwendeten Ollama-Befehle, siehe das Ollama-Spickzettel.
Um schnell zu wiederholen – Ollama auf Linux installieren:
curl -fsSL https://ollama.com/install.sh | sh
Installation verifizieren:
ollama --version
Wenn Sie aufgrund von Platzmangel Modelle auf einem anderen Laufwerk speichern müssen, werfen Sie einen Blick auf wie man Ollama-Modelle auf ein anderes Laufwerk verschiebt.
Getestete Modelle
Die folgenden Modelle wurden in alphabetischer Reihenfolge getestet:
| Modell | Parameter | Quantisierung | Anmerkungen |
|---|---|---|---|
| devstral-small-2:24b | 24B | Q4_K_M | Code-fokussiert |
| glm-4.7-flash | 30B | Q4_K_M | Denk-Modell |
| gpt-oss:20b | 20B | Q4_K_M | Schnellstes insgesamt |
| gpt-oss:120b | 120B | Q4_K_M | Größtes getestetes |
| ministral-3:14b | 14B | Q4_K_M | Effizientes Modell von Mistral |
| mistral-small3.2:24b | 24B | Q4_K_M | Starke Sprachqualität |
| nemotron-3-nano:30b | 30B | Q4_K_M | Angebot von NVIDIA |
| qwen3:14b | 14B | Q4_K_M | Beste Anweisungsfolge |
| qwen3.5:9b | 9B | Q4_K_M | Schnell, vollständig auf GPU |
| qwen3.5:9b-q8_0 | 9B | Q8_0 | Höhere Qualität, vollständig auf GPU |
| qwen3.5:27b | 27B | Q4_K_M | Ausgezeichnete Qualität, langsam auf Ollama |
| qwen3-vl:30b-a3b | 30B | Q4_K_M | Seh- und Sprachsensitive |
| qwen3-coder:30b | 30B | Q4_K_M | Code-fokussiert |
| qwen3.5:35b | 35B | Q4_K_M | Gute Coding-Fähigkeiten |
Um ein Modell herunterzuladen:
ollama pull gpt-oss:20b
ollama pull qwen3:14b
CPU-Offloading verstehen
Wenn der Speicherbedarf eines Modells den verfügbaren VRAM überschreitet, verteilt Ollama die Model-Schichten automatisch zwischen GPU und System-RAM. Die Ausgabe zeigt dies als prozentuale Aufteilung wie “18%/82% CPU/GPU”.
Dies hat massive Auswirkungen auf die Leistung. Jede Token-Generierung erfordert einen Datentransfer zwischen CPU- und GPU-Speicher – ein Engpass, der sich mit jeder auf die CPU offgeladenen Schicht vervielfacht.
Das Muster ist aus unseren Ergebnissen klar:
- 100% GPU Modelle: 61-140 Tokens/Sek
- 70-82% GPU Modelle: 19-51 Tokens/Sek
- 22% GPU (vorallem CPU): 12,6 Tokens/Sek
Dies erklärt, warum ein 20B-Parameter-Modell in der Praxis ein 120B-Modell um das 11-fache übertrifft. Wenn Sie planen, mehrere parallele Anfragen zu bedienen, wird das Verständnis davon, wie Ollama parallele Anfragen handhabt für die Kapazitätsplanung essenziell. Die CPU-Offload-Aufteilung oben ist in Wirklichkeit ein KV-Cache- und Gewichts-Budget-Problem – KV Cache auf 16 GB GPUs führt durch die genaue Mathematik und die OLLAMA_KV_CACHE_TYPE-Einstellungen, die Ihnen erlauben, Speicher zu gewinnen, ohne auf ein kleineres Modell umzusteigen.
Detaillierte Benchmark-Ergebnisse
Modelle, die zu 100% auf der GPU laufen
GPT-OSS 20B – Der Geschwindigkeitsmeister
ollama run gpt-oss:20b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:20b 14 GB 100% GPU 19000
eval count: 2856 token(s)
eval duration: 20.410517947s
eval rate: 139.93 tokens/s
Mit 139,93 Tokens/Sekunde ist GPT-OSS 20B der klare Gewinner für geschwindigkeitskritische Anwendungen. Es verwendet nur 14GB VRAM und lässt Spielraum für größere Kontextfenster oder andere GPU-Workloads.
Qwen3 14B – Exzellentes Gleichgewicht
ollama run qwen3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3:14b 12 GB 100% GPU 19000
eval count: 3094 token(s)
eval duration: 50.020594575s
eval rate: 61.85 tokens/s
Qwen3 14B bietet nach meiner Erfahrung die beste Anweisungsfolge mit einer komfortablen 12GB-Speicherauslastung. Mit 61,85 Tokens/Sekunde ist es reaktionsfreudig genug für den interaktiven Gebrauch.
Für Entwickler, die Qwen3 in Anwendungen integrieren, siehe LLM-Strukturierte Ausgabe mit Ollama und Qwen3 zum Extrahieren strukturierter JSON-Antworten.
Ministral 3 14B – Schnell und kompakt
ollama run ministral-3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
ministral-3:14b 13 GB 100% GPU 19000
eval count: 1481 token(s)
eval duration: 21.11734277s
eval rate: 70.13 tokens/s
Das kleinere Modell von Mistral liefert 70,13 Tokens/Sekunde und passt vollständig in den VRAM. Eine solide Wahl, wenn Sie Mistral-ähnliche Qualität bei maximaler Geschwindigkeit benötigen.
qwen3.5:9b - schnell und neu
ollama run qwen3.5:9b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b 6488c96fa5fa 9.3 GB 100% GPU 19000
eval count: 3802 token(s)
eval duration: 41.830174597s
eval rate: 90.89 tokens/s
qwen3.5:9b-q8_0 - q8 Quantisierung
Diese Quantisierung senkt die Leistung von qwen3.5:9b um 30% im Vergleich zu q4.
ollama run qwen3.5:9b-q8_0 --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b-q8_0 441ec31e4d2a 13 GB 100% GPU 19000
eval count: 3526 token(s)
eval duration: 57.595540159s
eval rate: 61.22 tokens/s
Modelle, die CPU-Offloading erfordern
qwen3-coder:30b - schnellstes aus dem 30b LLM-Set, da text-only
ollama run qwen3-coder:30b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3-coder:30b 06c1097efce0 20 GB 25%/75% CPU/GPU 19000
22%/605%
eval count: 559 token(s)
eval duration: 9.77768875s
eval rate: 57.17 tokens/s
Qwen3-VL 30B – Beste Leistung mit teilweisem Offloading
ollama run qwen3-vl:30b-a3b-instruct --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3-vl:30b-a3b-instruct 22 GB 30%/70% CPU/GPU 19000
eval count: 1450 token(s)
eval duration: 28.439319709s
eval rate: 50.99 tokens/s
Trotz 30% der Schichten auf der CPU hält Qwen3-VL 50,99 Tokens/Sekunde – schneller als einige 100%-GPU-Modelle. Die Seh-Fähigkeit fügt Vielseitigkeit für multimodale Aufgaben hinzu.
Mistral Small 3.2 24B – Qualitäts- vs. Geschwindigkeits-Kompromiss
ollama run mistral-small3.2:24b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
mistral-small3.2:24b 19 GB 18%/82% CPU/GPU 19000
eval count: 831 token(s)
eval duration: 44.899859038s
eval rate: 18.51 tokens/s
Mistral Small 3.2 bietet überlegene Sprachqualität, aber bezahlt einen steilen Geschwindigkeitsnachteil. Mit 18,51 Tokens/Sekunde fühlt es sich für interaktiven Chat deutlich langsamer an. Es lohnt sich für Aufgaben, bei denen Qualität wichtiger ist als Latenz.
GLM 4.7 Flash – MoE Denk-Modell
ollama run glm-4.7-flash --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
glm-4.7-flash 21 GB 27%/73% CPU/GPU 19000
eval count: 2446 token(s)
eval duration: 1m12.239164004s
eval rate: 33.86 tokens/s
GLM 4.7 Flash ist ein 30B-A3B Mixture of Experts Modell – 30B Gesamtparameter mit nur 3B aktiven pro Token. Als „Denk-Modell" generiert es interne Schlussfolgerungen vor den Antworten. Die 33,86 Tokens/Sekunde umfassen sowohl Denk- als auch Ausgabetokens. Trotz CPU-Offloading hält die MoE-Architektur es relativ schnell.
qwen3.5:35b - Neues Modell mit anständig selbst gehosteter Leistung
ollama run qwen3.5:35b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:35b 4af949f8bdf0 27 GB 43%/57% CPU/GPU 19000
eval count: 3418 token(s)
eval duration: 2m45.458926548s
eval rate: 20.66 tokens/s
GPT-OSS 120B – Der Schwergewichtler
ollama run gpt-oss:120b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:120b 66 GB 78%/22% CPU/GPU 19000
eval count: 5008 token(s)
eval duration: 6m36.168233066s
eval rate: 12.64 tokens/s
Das Ausführen eines 120B-Modells auf 16GB VRAM ist technisch möglich, aber schmerzhaft. Mit 78% auf der CPU macht die 12,64 Tokens/Sekunde die interaktive Nutzung frustrierend. Eher für Batch-Verarbeitung geeignet, wo Latenz keine Rolle spielt.
qwen3.5:27b - Intelligenter, aber langsam auf Ollama
ollama run qwen3.5:27b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:27b 193ec05b1e80 24 GB 43%/57% CPU/GPU 19000
eval count: 3370 token(s)
eval duration: 8m40.087510281s
eval rate: 6.48 tokens/s
Ich habe qwen3.5:27b getestet und eine extrem gute Meinung über die Leistung dieses Modells mit OpenCode gewonnen. Es ist sehr fähig, wissend, wirklich gutes Tool-Calling, obwohl es auf meiner Maschine auf Ollama langsam ist. Ich habe andere LLM-Self-Hosting-Plattformen ausprobiert und deutlich höhere Geschwindigkeiten erhalten. Ich glaube, es ist Zeit, Ollama loszulassen. Ich werde darüber später ein wenig schreiben.
Praktische Empfehlungen
Für interaktiven Chat
Verwenden Sie Modelle, die zu 100% in den VRAM passen:
- GPT-OSS 20B – Maximale Geschwindigkeit (139,93 t/s)
- Ministral 3 14B – Gute Geschwindigkeit mit Mistral-Qualität (70,13 t/s)
- Qwen3 14B – Beste Anweisungsfolge (61,85 t/s)
Für ein besseres Chat-Erlebnis, erwägen Sie Open-Source-Chat-Oberflächen für lokale Ollama.
Für Batch-Verarbeitung
Dies ist erneut, auf meiner Ausrüstung – 14GB VRAM.
Wenn Geschwindigkeit weniger kritisch ist:
- Mistral Small 3.2 24B – Überlegene Sprachqualität
- Qwen3-VL 30B – Seh- und Textfähigkeit
Wenn Geschwindigkeit überhaupt nicht kritisch ist:
- Qwen3.5:35b - Gute Coding-Fähigkeiten
- Qwen3.5:27b - Extrem gut, aber langsam auf Ollama. Ich hatte jedoch ziemlich viel Erfolg, dieses Modell auf llama.cpp zu hosten.
Für Entwicklung und Coding
Wenn Sie Anwendungen mit Ollama bauen:
Alternative Hosting-Optionen
Wenn Sie sich Sorgen über die Einschränkungen von Ollama machen (siehe Bedenken zur Ollama-Entwertung), erkunden Sie andere Optionen im Local LLM Hosting Guide oder vergleichen Sie Docker Model Runner vs Ollama.
Fazit
Mit 16GB VRAM können Sie fähige LLMs mit beeindruckenden Geschwindigkeiten ausführen – wenn Sie weise wählen. Die wichtigsten Erkenntnisse:
-
Bleiben Sie innerhalb der VRAM-Limits für den interaktiven Gebrauch. Ein 20B-Modell mit 140 Tokens/Sekunde schlägt ein 120B-Modell mit 12 Tokens/Sekunde für die meisten praktischen Zwecke.
-
GPT-OSS 20B gewinnt bei der reinen Geschwindigkeit, aber Qwen3 14B bietet das beste Gleichgewicht aus Geschwindigkeit und Fähigkeit für Anweisungsfolge-Aufgaben.
-
CPU-Offloading funktioniert, aber erwarten Sie 3-10-fache Verlangsamungen. Akzeptabel für Batch-Verarbeitung, frustrierend für Chat.
-
Kontextgröße ist entscheidend. Der hier verwendete 19K-Kontext erhöht den VRAM-Verbrauch erheblich. Reduzieren Sie den Kontext für bessere GPU-Auslastung.
Für KI-gestützte Suche, die lokale LLMs mit Web-Ergebnissen kombiniert, siehe Self-Hosting von Perplexica mit Ollama.
Um weitere Benchmarks, VRAM- und Durchsatz-Kompromisse sowie Leistungsanpassungen über Ollama und andere Laufzeitumgebungen hinweg zu erkunden, schauen Sie in unserem LLM-Leistung: Benchmarks, Engpässe und Optimierung Hub.
Nützliche Links
Interne Ressourcen
- Ollama-Spickzettel: Die nützlichsten Ollama-Befehle
- Wie Ollama parallele Anfragen handhabt
- Wie Ollama Intel CPU Performance- und Efficient Cores nutzt
- Lokales LLM-Hosting: Der vollständige Leitfaden für 2026 - Ollama, vLLM, LocalAI, Jan, LM Studio & mehr
- Die effiziente Grenze offener Modelle im Jahr 2026