Comparaison des performances des LLM sur Ollama avec un GPU de 16 Go de VRAM
Test de vitesse d'un LLM sur une RTX 4080 avec 16 Go de VRAM
L’exécution de grands modèles de langage en local vous offre confidentialité, capacité hors ligne et zéro coût API. Ce benchmark révèle exactement ce que l’on peut attendre de 14 modèles LLM sur Ollama avec une RTX 4080.
Avec une GPU de 16 Go de VRAM, j’ai fait face à un compromis constant : des modèles plus volumineux avec une qualité potentiellement meilleure, ou des modèles plus petits avec une inférence plus rapide. Pour en savoir plus sur les performances des LLM — débit par rapport à la latence, limites de VRAM, requêtes parallèles et benchmarks à travers différents runtimes — voir Performances des LLM : Benchmarks, Goulots d’étranglement & Optimisation.
Cet article se concentre sur Ollama. Pour la même classe de GPU de 16 Go mesurée avec llama.cpp à 19K, 32K et 64K de contexte (VRAM, charge GPU, jetons par seconde sur des points de contrôle denses et MoE), voir Benchmarks LLM sur 16 Go de VRAM avec llama.cpp (vitesse et contexte).
Une fois que le débit et la répartition de la VRAM semblent acceptables, les charges de travail de type agent ont toujours besoin de préconfigurations raisonnables de température et de pénalités pour les stacks de type Qwen et Gemma ; voir Paramètres d’inférence agentic pour Qwen et Gemma.

En bref
Voici un tableau de comparaison mis à jour des performances des LLM sur RTX 4080 16 Go avec Ollama 0.17.7, (09/03/2026) ajout des modèles Qwen 3.5 9b, 9bq8, 27b et 35b :
| Modèle | RAM+VRAM Utilisé | Répartition CPU/GPU | Jetons/sec |
|---|---|---|---|
| gpt-oss:20b | 14 Go | 100% GPU | 139,93 |
| qwen3.5:9b | 9,3 Go | 100% GPU | 90,89 |
| ministral-3:14b | 13 Go | 100% GPU | 70,13 |
| qwen3:14b | 12 Go | 100% GPU | 61,85 |
| qwen3.5:9b-q8_0 | 13 Go | 100% GPU | 61,22 |
| qwen3-coder:30b | 20 Go | 25%/75% CPU/GPU | 57,17 |
| qwen3-vl:30b-a3b | 22 Go | 30%/70% CPU/GPU | 50,99 |
| glm-4.7-flash | 21 Go | 27%/73% CPU/GPU | 33,86 |
| nemotron-3-nano:30b | 25 Go | 38%/62% CPU/GPU | 32,77 |
| qwen3.5:35b | 27 Go | 43%/57% CPU/GPU | 20,66 |
| devstral-small-2:24b | 19 Go | 18%/82% CPU/GPU | 18,67 |
| mistral-small3.2:24b | 19 Go | 18%/82% CPU/GPU | 18,51 |
| gpt-oss:120b | 66 Go | 78%/22% CPU/GPU | 12,64 |
| qwen3.5:27b | 24 Go | 43%/57% CPU/GPU | 6,48 |
Point clé : Les modèles qui tiennent entièrement dans la VRAM sont considérablement plus rapides. GPT-OSS 20B atteint 139,93 jetons/sec, tandis que GPT-OSS 120B avec un déchargement CPU intense ne grimpe que à 12,64 jetons/sec — une différence de vitesse de 11 fois.
Configuration matérielle de test
Le benchmark a été réalisé sur le système suivant :
- GPU : NVIDIA RTX 4080 avec 16 Go de VRAM
- CPU : Intel Core i7-14700 (8 cœurs P + 12 cœurs E)
- RAM : 64 Go DDR5-6000
Cela représente une configuration grand haut de gamme courante pour l’inférence de LLM en local. La VRAM de 16 Go est la contrainte critique — elle détermine quels modèles tournent entièrement sur GPU et quels autres nécessitent un déchargement sur CPU.
Comprendre comment Ollama utilise les cœurs Intel du CPU devient important lorsque les modèles dépassent la capacité de VRAM, car la performance du CPU impacte directement la vitesse d’inférence des couches déchargées.
Objectif de ce benchmark
L’objectif principal était de mesurer la vitesse d’inférence dans des conditions réalistes. Je savais déjà par expérience que Mistral Small 3.2 24B excelle en qualité linguistique, tandis que Qwen3 14B offre un suivi des instructions supérieur pour mes cas d’usage spécifiques.
Ce benchmark répond à la question pratique : À quelle vitesse chaque modèle peut générer du texte, et quelle est la pénalité de vitesse pour dépasser les limites de VRAM ?
Les paramètres de test étaient :
- Taille de contexte : 19 000 jetons. C’est la valeur moyenne dans mes requêtes de génération.
- Invite : « comparez le temps et le climat entre les capitales de l’Australie »
- Métrique : taux d’évaluation (jetons par seconde pendant la génération)
Installation et version d’Ollama
Tous les tests ont utilisé la version 0.15.2 d’Ollama, la dernière version de publication au moment du test. Re-testé plus tard sur Ollama v 0.17.7 - pour ajouter les modèles Qwen3.5. Pour une référence complète des commandes Ollama utilisées dans ce benchmark, voir la Fiche de triche Ollama.
Pour un rappel rapide - installer Ollama sur Linux :
curl -fsSL https://ollama.com/install.sh | sh
Vérifier l’installation :
ollama --version
Si vous avez besoin de stocker les modèles sur un autre disque en raison de contraintes d’espace, consultez comment déplacer les modèles Ollama sur un autre disque.
Modèles testés
Les modèles suivants ont été benchmarkés, en ordre alphabétique :
| Modèle | Paramètres | Quantification | Notes |
|---|---|---|---|
| devstral-small-2:24b | 24B | Q4_K_M | Axé sur le code |
| glm-4.7-flash | 30B | Q4_K_M | Modèle de réflexion |
| gpt-oss:20b | 20B | Q4_K_M | Le plus rapide globalement |
| gpt-oss:120b | 120B | Q4_K_M | Le plus gros testé |
| ministral-3:14b | 14B | Q4_K_M | Le modèle efficace de Mistral |
| mistral-small3.2:24b | 24B | Q4_K_M | Qualité linguistique forte |
| nemotron-3-nano:30b | 30B | Q4_K_M | L’offre de NVIDIA |
| qwen3:14b | 14B | Q4_K_M | Le meilleur suivi des instructions |
| qwen3.5:9b | 9B | Q4_K_M | Rapide, entièrement GPU |
| qwen3.5:9b-q8_0 | 9B | Q8_0 | Qualité plus élevée, entièrement GPU |
| qwen3.5:27b | 27B | Q4_K_M | Qualité excellente, lent sur Ollama |
| qwen3-vl:30b-a3b | 30B | Q4_K_M | Capable en vision |
| qwen3-coder:30b | 30B | Q4_K_M | Axé sur le code |
| qwen3.5:35b | 35B | Q4_K_M | Bonnes capacités de codage |
Pour télécharger n’importe quel modèle :
ollama pull gpt-oss:20b
ollama pull qwen3:14b
Comprendre le déchargement CPU
Lorsque les besoins mémoire d’un modèle dépassent la VRAM disponible, Ollama distribue automatiquement les couches du modèle entre la GPU et la RAM système. La sortie affiche cela comme une répartition en pourcentage, telle que « 18%/82% CPU/GPU ».
Cela a des implications de performance majeures. Chaque génération de jeton nécessite un transfert de données entre la mémoire CPU et GPU — un goulot d’étranglement qui s’aggrave avec chaque couche déchargée sur le CPU.
Le schéma est clair d’après nos résultats :
- Modèles 100% GPU : 61-140 jetons/sec
- Modèles 70-82% GPU : 19-51 jetons/sec
- 22% GPU (principalement CPU) : 12,6 jetons/sec
Cela explique pourquoi un modèle de 20B paramètres peut surpasser un modèle de 120B de 11 fois en pratique. Si vous prévoyez de servir plusieurs requêtes concurrentes, comprendre comment Ollama gère les requêtes parallèles devient essentiel pour la planification de capacité. La répartition de déchargement CPU ci-dessus est en réalité un problème de budget de cache KV et de poids déguisé — Cache KV sur GPU 16 Go parcourt le calcul exact et les paramètres OLLAMA_KV_CACHE_TYPE qui vous permettent de récupérer de la marge sans passer à un modèle plus petit.
Résultats détaillés du benchmark
Modèles tournant 100% sur GPU
GPT-OSS 20B — Le champion de la vitesse
ollama run gpt-oss:20b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:20b 14 GB 100% GPU 19000
eval count: 2856 token(s)
eval duration: 20.410517947s
eval rate: 139.93 tokens/s
À 139,93 jetons/sec, GPT-OSS 20B est le grand vainqueur pour les applications critiques en termes de vitesse. Il n’utilise que 14 Go de VRAM, laissant de la marge pour des fenêtres de contexte plus grandes ou d’autres charges de travail GPU.
Qwen3 14B — Un excellent équilibre
ollama run qwen3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3:14b 12 GB 100% GPU 19000
eval count: 3094 token(s)
eval duration: 50.020594575s
eval rate: 61.85 tokens/s
Qwen3 14B offre, selon mon expérience, le meilleur suivi des instructions, avec une empreinte mémoire confortable de 12 Go. À 61,85 jetons/sec, il est suffisamment réactif pour une utilisation interactive.
Pour les développeurs intégrant Qwen3 dans des applications, voir Sortie structurée LLM avec Ollama et Qwen3 pour extraire des réponses JSON structurées.
Ministral 3 14B — Rapide et compact
ollama run ministral-3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
ministral-3:14b 13 GB 100% GPU 19000
eval count: 1481 token(s)
eval duration: 21.11734277s
eval rate: 70.13 tokens/s
Le plus petit modèle de Mistral délivre 70,13 jetons/sec tout en tenant entièrement dans la VRAM. Un choix solide quand vous avez besoin de la qualité de la famille Mistral à la vitesse maximale.
qwen3.5:9b - rapide et nouveau
ollama run qwen3.5:9b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b 6488c96fa5fa 9.3 GB 100% GPU 19000
eval count: 3802 token(s)
eval duration: 41.830174597s
eval rate: 90.89 tokens/s
qwen3.5:9b-q8_0 - quantification q8
Cette quantification fait chuter les performances de qwen3.5:9b de 30% par rapport à la q4.
ollama run qwen3.5:9b-q8_0 --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b-q8_0 441ec31e4d2a 13 GB 100% GPU 19000
eval count: 3526 token(s)
eval duration: 57.595540159s
eval rate: 61.22 tokens/s
Modèles nécessitant un déchargement CPU
qwen3-coder:30b - le plus rapide de la gamme 30b LLM car texte uniquement
ollama run qwen3-coder:30b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3-coder:30b 06c1097efce0 20 GB 25%/75% CPU/GPU 19000
22%/605%
eval count: 559 token(s)
eval duration: 9.77768875s
eval rate: 57.17 tokens/s
Qwen3-VL 30B — Meilleure performance partiellement déchargée
ollama run qwen3-vl:30b-a3b-instruct --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3-vl:30b-a3b-instruct 22 GB 30%/70% CPU/GPU 19000
eval count: 1450 token(s)
eval duration: 28.439319709s
eval rate: 50.99 tokens/s
Malgré 30% des couches sur le CPU, Qwen3-VL maintient 50,99 jetons/sec — plus rapide que certains modèles 100% GPU. La capacité en vision ajoute de la polyvalence pour les tâches multimodales.
Mistral Small 3.2 24B — Compromis qualité vs vitesse
ollama run mistral-small3.2:24b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
mistral-small3.2:24b 19 GB 18%/82% CPU/GPU 19000
eval count: 831 token(s)
eval duration: 44.899859038s
eval rate: 18.51 tokens/s
Mistral Small 3.2 offre une qualité linguistique supérieure mais paie une lourde pénalité de vitesse. À 18,51 jetons/sec, il semble nettement plus lent pour le chat interactif. En vaut la peine pour les tâches où la qualité compte plus que la latence.
GLM 4.7 Flash — Modèle de réflexion MoE
ollama run glm-4.7-flash --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
glm-4.7-flash 21 GB 27%/73% CPU/GPU 19000
eval count: 2446 token(s)
eval duration: 1m12.239164004s
eval rate: 33.86 tokens/s
GLM 4.7 Flash est un modèle Mixture of Experts de 30B-A3B — 30B paramètres au total avec seulement 3B actifs par jeton. En tant que modèle de « réflexion », il génère un raisonnement interne avant les réponses. Les 33,86 jetons/sec incluent à la fois les jetons de réflexion et de sortie. Malgré le déchargement CPU, l’architecture MoE le garde raisonnablement rapide.
qwen3.5:35b - Nouveau modèle avec des performances auto-hébergées correctes
ollama run qwen3.5:35b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:35b 4af949f8bdf0 27 GB 43%/57% CPU/GPU 19000
eval count: 3418 token(s)
eval duration: 2m45.458926548s
eval rate: 20.66 tokens/s
GPT-OSS 120B — Le poids lourd
ollama run gpt-oss:120b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:120b 66 GB 78%/22% CPU/GPU 19000
eval count: 5008 token(s)
eval duration: 6m36.168233066s
eval rate: 12.64 tokens/s
Faire tourner un modèle de 120B sur 16 Go de VRAM est techniquement possible mais pénible. Avec 78% sur le CPU, les 12,64 jetons/sec rendent l’utilisation interactive frustrante. Mieux adapté au traitement par lots où la latence n’a pas d’importance.
qwen3.5:27b - Intelligent mais lent sur Ollama
ollama run qwen3.5:27b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:27b 193ec05b1e80 24 GB 43%/57% CPU/GPU 19000
eval count: 3370 token(s)
eval duration: 8m40.087510281s
eval rate: 6.48 tokens/s
J’ai testé qwen3.5:27b et j’ai eu un avis extrêmement positif sur les performances de ce modèle avec OpenCode. Il est très capable, savant, avec un très bon appel d’outils, bien qu’il soit lent sur ma machine sur Ollama. J’ai essayé d’autres plateformes d’auto-hébergement de LLM, et obtenu des vitesses beaucoup plus élevées. Je pense qu’il est temps de laisser tomber Ollama. J’en écrirai un peu plus tard.
Recommandations pratiques
Pour le chat interactif
Utiliser des modèles qui tiennent 100% dans la VRAM :
- GPT-OSS 20B — Vitesse maximale (139,93 j/s)
- Ministral 3 14B — Bonne vitesse avec la qualité Mistral (70,13 j/s)
- Qwen3 14B — Meilleur suivi des instructions (61,85 j/s)
Pour une meilleure expérience de chat, envisagez les Interfaces de chat open source pour Ollama local.
Pour le traitement par lots
Ceci est, encore une fois, sur mon équipement - 14 Go de VRAM.
Lorsque la vitesse est moins critique :
- Mistral Small 3.2 24B — Qualité linguistique supérieure
- Qwen3-VL 30B — Capacité Vision + texte
Lorsque la vitesse n’est pas du tout critique :
- Qwen3.5:35b - Bonnes capacités de codage
- Qwen3.5:27b - Excellent, mais lent sur Ollama. J’ai eu pas mal de succès en hébergeant ce modèle sur llama.cpp.
Pour le développement et le codage
Si vous développez des applications avec Ollama :
Options d’hébergement alternatives
Si les limites d’Ollama vous inquiètent (voir les préoccupations quant à la dégradation d’Ollama), explorez d’autres options dans le Guide d’hébergement local de LLM ou comparez Docker Model Runner vs Ollama.
Conclusion
Avec 16 Go de VRAM, vous pouvez faire tourner des LLM capables à des vitesses impressionnantes — si vous choisissez judicieusement. Les principales conclusions :
-
Restez dans les limites de VRAM pour l’usage interactif. Un modèle de 20B à 140 jetons/sec bat un modèle de 120B à 12 jetons/sec pour la plupart des usages pratiques.
-
GPT-OSS 20B gagne en vitesse pure, mais Qwen3 14B offre le meilleur équilibre entre vitesse et capacité pour les tâches de suivi des instructions.
-
Le déchargement CPU fonctionne mais attendez-vous à des ralentissements de 3 à 10 fois. Acceptable pour le traitement par lots, frustrant pour le chat.
-
La taille du contexte compte. Le contexte de 19K utilisé ici augmente significativement l’utilisation de la VRAM. Réduisez le contexte pour une meilleure utilisation du GPU.
Pour une recherche alimentée par l’IA combinant des LLM locaux et des résultats web, voir auto-hébergement de Perplexica avec Ollama.
Pour explorer davantage de benchmarks, les compromis entre VRAM et débit, et l’optimisation des performances à travers Ollama et d’autres runtimes, consultez notre pôle Performances des LLM : Benchmarks, Goulots d’étranglement & Optimisation.
Liens utiles
Ressources internes
- Fiche de triche Ollama : Les commandes les plus utiles d’Ollama
- Comment Ollama gère les requêtes parallèles
- Comment Ollama utilise les cœurs de performance et d’efficacité du CPU Intel
- Hébergement local de LLM : Guide complet 2026 - Ollama, vLLM, LocalAI, Jan, LM Studio & Plus
- La frontière efficace des modèles ouverts en 2026