« La frontière efficiente des modèles ouverts : trouver le juste équilibre en 2026 »
Le point optimal de 2026 pour les LLM ouverts : environ 30 milliards de paramètres.
En septembre 2026, la frontière efficace des modèles ouverts se situe entre 25 et 34 milliards de paramètres : des tâches agentiques quasi frontalières sur un seul GPU de 24 Go, pour une fraction du matériel de la classe 70 milliards.
Cette bande de paramètres se manifeste dans les déploiements réels, pas dans des slogans sur le nombre de paramètres. Les classements publics, les exécutions sur GPU unique et les factures API mensuelles convergent vers des modèles qui restent proches des capacités frontalières en termes d’utilisation d’outils, tout en permettant aux poids et au cache KV de tenir dans du matériel que l’on peut louer ou posséder.

Cette page est le centre de décision pour ce choix, au sein du cluster Performance LLM. Elle parcourt les modèles instructifs de petite taille jusqu’aux poids denses de classe 70 milliards, puis s’arrête sur les deux architectures qui définissent la frontière actuelle : Qwen3.8-27B, à l’aise sur une carte de 24 Go, et Llama 4 Scout, dont les calculs paraissent modestes uniquement parce que la plupart de ses experts restent inactifs. Les tableaux de jetons par seconde restent sur les pages de référence liées à chaque section.
À la fin, vous devriez savoir quelle taille tester en premier, combien de VRAM les poids et le cache occupent réellement, comment une RTX 4090 louée se compare aux prix actuels des jetons Claude Sonnet, et quand un modèle plus grand reste le bon choix.
Pourquoi les benchmarks publics surestiment le transfert en production
Un modèle peut se situer à quelques points près d’un modèle API frontière sur MMLU ou HumanEval et tout de même échouer à la tâche que vous livrez. Les flux multi-outils échouent au deuxième appel d’outil, la calibration des refus dérive vers un sur-refus sur les requêtes proches du médical, et la latence P99 sous charge de pointe double. L’écart du classement semblait faible parce que ces bancs mesurent la capacité sur un ensemble de prompts fixe. Ils ne mesurent pas le transfert vers vos outils, vos documents et votre budget de latence.
La frontière efficace est l’ensemble des modèles qui tiennent la charge sur votre flux de travail à un coût que vous pouvez continuer à payer. Cela nécessite une comparaison appariée sur des tâches semblables à la production, avec trois signaux enregistrés tout au long : le succès des appels d’outils, le comportement de refus et la latence P99. L’article de Future AGI sur le remplacement par les modèles bon marché de la frontière fait la même chose côté évaluation : un petit écart sur les benchmarks publics n’est pas une licence pour changer de modèle.
Considérez les scores ci-dessous comme une carte pour savoir où commencer le test. Ils sont datés de septembre 2026, et plusieurs chiffres clés de codage sont fournis par les vendeurs plutôt que de manière indépendante.
Où se situent réellement les modèles 8B, 30B et 70B
À l’entrée de gamme, un modèle instructif de classe 8 milliards suivra une instruction courte et explicite et écrira une petite fonction. Demandez-lui de déboguer un pipeline CI défaillant sur plusieurs services, de récupérer si le premier appel d’outil renvoie une erreur et de maintenir le plan intact, et l’exécution s’effondre. C’est un échec de charge de travail, pas un échec au classement.
Le milieu de la gamme est là que le travail agentique polyvalent actuel dépasse un GPU grand public unique. Qwen3.8-27B est le modèle dense de référence. Les architectures de la même bande de taille, y compris le MoE de classe 30 milliards de Qwen comparé dans l’article Qwen3 30B contre GPT-OSS 20B face à face, sont celles qu’il faut tester avant de dépenser pour des modèles plus grands.
En haut de la gamme, un modèle dense de 70 milliards en 4 bits représente de l’ordre de 35 à 40 Go de poids avant tout cache KV. Il ne tient pas sur une carte de 24 Go. Vous entrez dans le domaine des GPU de 48 Go, des cartes data-center de 80 Go ou d’un découpage sur deux GPU, et la qualité supplémentaire par rapport à un modèle 27B bien réglé est souvent marginale sur les agents de codage, les pipelines de documents et les bots d’assistance. Les API frontières fermées telles que Claude Opus se situent dans un budget entièrement différent : vous payez par jeton et vous ne portez pas les poids du tout.
Avant de choisir un point de contrôle, confirmez la carte et la mémoire libre. Les poids du modèle ne sont qu’une partie de l’empreinte. Le contexte (le cache KV) s’ajoute par-dessus.
# Nom du GPU et VRAM libre avant de choisir une quantification
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv
# après chargement : confirmez que le processus est resté sur le GPU
nvidia-smi
Si des couches déborde vers le CPU, le débit de génération s’effondre. Vous pouvez voir la répartition dans memory.used sur le GPU et dans le journal de déchargement du temps d’exécution. Pour ce que les points de contrôle denses et MoE livrent réellement sur une carte de 16 Go, les mesures se trouvent dans les benchmarks llama.cpp sur 16 Go de VRAM et la comparaison Ollama sur une RTX 4080 de 16 Go. Ces pages possèdent les tableaux de vitesse. Celle-ci n’a besoin que de la décision d’ajustement.
Qwen3.8-27B : le point de référence de 24 Go
Qwen3.8-27B d’Alibaba est un modèle dense, pas un mélange d’experts. Sur Artificial Analysis, il obtient environ 51 à l’Indice Agentique (le chiffre arrondi ; la valeur sous-jacente est 50,9) et environ 52 à l’Indice d’Intelligence à l’effort de raisonnement maximal. Ce sont des mesures différentes. L’Indice Agentique concerne l’utilisation d’outils et les tâches multi-étapes. L’Indice d’Intelligence est un mélange de capacités plus large. Le test pratique de MindStudio situe le score agentique juste derrière Kimi K2, un modèle de mélange d’experts beaucoup plus grand. L’analyse de Qubrid est à lire à côté : la marge sur le modèle suivant est inférieure à un point, et le chiffre SWE-bench Pro de 61,7 de Qwen n’a pas été reproduit de manière indépendante. Le résultat intéressant est la forme des scores. Un modèle de 27 milliards convertit un budget compact en planification et en utilisation d’outils de manière inhabituellement bien, et ne mène pas de suite de connaissances large.
L’architecture explique pourquoi le long contexte est abordable. Sur 64 couches, seules 16 utilisent l’attention complète. Les 48 autres sont des couches Gated DeltaNet, un design d’attention linéaire issu de la ligne de travail des Gated Delta Networks, et elles maintiennent un état récurrent fixe au lieu d’une historique clé/valeur par jeton. En FP16, les couches d’attention complète coûtent environ 64 Ko de cache KV par jeton. Une pile conventionnelle avec le même nombre de couches mettrait en cache environ quatre fois cette quantité. Le tableau de quantification de Locally Uncensored place les poids Q4_K_M à 17,1 Go et IQ4_XS à 15,7 Go. Les mesures llama.cpp de Hardware Corner sur un GPU de 24 Go ont abouti près de 18 Go à contexte court et environ 22 Go à 64K, ce qui est la cible pratique sur une RTX 4090. Une carte de 16 Go peut retenir une quantification de classe IQ4 des poids et très peu de contexte. Si c’est votre machine, restez sur les exécutions Qwen 3.5 et 3.6 déjà mesurées sur 16 Go, y compris Qwen 3.6 27B MTP contre décodage standard. Comment budgéter le cache lui-même est couvert dans Cache KV sur GPU de 16 Go.
Les rapports pratiques, dont celui de MindStudio, trouvent également que le modèle est utilisable pour le codage, l’analyse d’images et les boucles agentiques, ce qui est la partie qu’un seul indice ne peut pas montrer. La vision ajoute un petit fichier projecteur sur les poids du texte. Prévoyez-le si le flux de travail inclut des captures d’écran.
Llama 4 Scout : les paramètres actifs ne sont pas la VRAM
Llama 4 Scout de Meta est un type d’efficacité différent. La carte du modèle Llama 4 liste 17 milliards de paramètres actifs et 109 milliards au total, avec 16 experts, une entrée d’image native et une fenêtre de contexte de 10 millions de jetons. Le post de lancement de Meta indique que le point de contrôle INT4 tient sur un seul H100. Les calculs de décodage suivent les 17B qui s’activent pour chaque jeton. La mémoire, non. Chaque expert doit être résident, donc la facture VRAM ressemble à celle d’un modèle de classe 100B même si les FLOPs ressemblent à ceux d’un modèle 17B.
C’est la correction à faire avant de budgéter une machine. Scout ne « fonctionne pas comme un modèle 3B ». Les paramètres actifs définissent la vitesse. Les paramètres résidents définissent si la carte peut retenir les poids. Sur un GPU de 24 Go, Qwen3.8-27B est le modèle qui tient. Scout est le modèle qui a du sens une fois que vous avez déjà une carte de 80 Go et que vous voulez des calculs de classe 17B avec un pool d’experts beaucoup plus grand et un très long contexte.
Un article de juin 2025, Les mélanges d’experts peuvent-ils dépasser les LLM denses avec des ressources strictement égales ?, soutient que le MoE peut battre un modèle dense lorsque la comparaison maintient le calcul total et les données fixes et que le taux d’activation se situe dans une bande praticable. L’interprétation pratique est plus étroite que le titre. Le MoE gagne en coût seulement après avoir payé la mémoire qui stocke les experts inactifs. Si vous servez déjà un modèle de cette taille et voulez plus de jetons par seconde sans changer les poids, le décodage spéculatif est la technique voisine : un chemin de brouillon propose des jetons et le modèle principal les vérifie.
Phi-4 : l’exception du petit modèle pour les mathématiques
Phi-4 de Microsoft est un modèle dense de 14 milliards. Dans le rapport technique de décembre 2024, simple-evals le score à 80,4 sur MATH, devant le chiffre GPT-4o dans le même tableau, avec une fenêtre de contexte que le rapport étend à 16K. Une quantification Q4_K_M est couramment exécutée en environ 8 Go. C’est une efficacité réelle, et elle est étroite. Phi-4 a été entraîné pour la question-réponse STEM. C’est le modèle à essayer lorsque la tâche est des mathématiques ou un raisonnement technique court et que la machine est petite. Ce n’est pas le défaut 2026 pour les agents multi-outils, les longs documents ou la vision. La frontière pour ce travail reste la bande 25–34 milliards ci-dessus, ou Scout lorsque le GPU est une carte de classe H100.
Heures GPU auto-hébergées contre prix API par jeton
Les prix bougent. Ce sont des chiffres de mi-septembre 2026, et ils ne survivront pas inchangés jusqu’en 2027.
GPU Finder, consulté le 18 septembre 2026, a montré une RTX 4090 en stock à environ 0,26 $ par heure-GPU sur Vast, avec le cloud communautaire RunPod listé à 0,34 $. Le plancher à la demande sur six mois pour une seule 4090 se situait entre 0,11 $ et 0,60 $. À 0,34 $ et 730 heures par mois, une carte qui reste en service tout le mois est d’environ 248 $ avant taxe, stockage et égress. Au tarif en stock de 0,26 $, le même mois est d’environ 190 $. Un chiffre de planification antérieur de 0,53 $ par heure est dans cette plage de six mois, mais il surestime ce que le stock du marché demandait réellement dans la deuxième moitié de septembre.
Côté API, les notes de tarification Sonnet 5 d’Anthropic listent 2 $ par million de jetons d’entrée et 10 $ par million de jetons de sortie. Sonnet 4.6 reste à 3 $ et 15 $. La grille tarifaire de BenchLM, mise à jour le 3 septembre 2026, montre la même répartition. Une charge de travail de 100 millions de jetons d’entrée et 10 millions de jetons de sortie est de 300 $ sur Sonnet 5 et 450 $ sur Sonnet 4.6.
Mise côte à côte avec une 4090 louée tout le mois à 248 $, cet exemple ne dit pas que « l’auto-hébergement est toujours moins cher ». Il dit que les deux factures se rencontrent dans le même voisinage pour ce volume. Sonnet 5 à un ratio d’entrée-sortie de 10:1 coûte 30 $ par 10 millions de jetons d’entrée plus 1 million de sortie. La location de 248 $ couvre environ huit de ces blocs : environ 80 millions de jetons d’entrée et 8 millions de jetons de sortie. Au-dessus de cela, la carte louée prend l’avantage, à condition que vous puissiez la garder occupée. En dessous, l’API est la ligne moins chère, et vous ne payez pas pour un GPU inactif. Le matériel possédé remplace la location par l’électricité et l’amortissement. Les stratégies autour de cette facture — budgétisation, cache et bascules — sont dans l’optimisation des coûts pour les systèmes LLM. La raison pour laquelle un prix de jeton plus bas peut toujours être la mauvaise architecture est la gravité des données et le verrouillage API.
Quand un modèle plus grand est encore le bon choix
La bande 25–34 milliards est le défaut pour les charges de travail de production qui se répètent : agents de codage, bots d’assistance, traitement de documents, extraction et automatisation. C’est le mauvais défaut dans quelques situations.
- Raisonnement frontière sur des problèmes sur lesquels le modèle plus petit a déjà échoué dans un test apparié.
- Prose où la différence de voix est le produit, et le volume est assez bas pour que le prix du jeton soit du bruit.
- Travail qui nécessite une couverture large à travers plusieurs domaines spécialisés en même temps, où le modèle 27B continue de rater la même classe de fait.
- Décisions à faible volume et à haut enjeu, où le coût d’une mauvaise réponse dépasse une année de location de modèle.
Dans ces cas, montez à un modèle ouvert de classe 70B ou à une API frontière, et gardez les mêmes trois signaux de production. Si le modèle plus grand ne déplace pas le succès des appels d’outils, les refus ou la P99 dans la direction qui vous importe, la taille supplémentaire n’achète rien d’utilisable.
Comment choisir un point sur la frontière
Utilisez cet ordre. Il est moins cher de découvrir qu’un modèle 27B suffit que de découvrir qu’une carte de 80 Go était inutile.
- Partez de la charge de travail, pas des poids ouverts les plus grands que vous pouvez télécharger. Les instructions one-shot et les mathématiques peuvent commencer à 8–14B. L’utilisation multi-étape d’outils commence à Qwen3.8-27B si vous avez 24 Go, ou à la meilleure quantification 16 Go que vous avez déjà mesurée si ce n’est pas le cas.
- Séparez les paramètres actifs des paramètres résidents. Le chiffre de 17B actifs de Scout est une affirmation de calcul. Le total de 109B est l’affirmation de VRAM. Budgétez le deuxième chiffre.
- Quantifiez, puis revérifiez la mémoire. Q4_K_M de Qwen3.8-27B est une conversation de 24 Go, avec environ 64K de contexte avant que la carte ne soit pleine. Exécutez
nvidia-smiaprès le chargement, à la longueur de contexte que vous servirez réellement. - Prixifiez le mois, pas le jeton. Comparez 730 heures du GPU que vous loueriez avec le mélange d’entrée et de sortie que vous journalisez déjà. Si vous êtes sous le seuil de rentabilité ci-dessus, restez sur l’API jusqu’à ce que le volume arrive.
- Décidez sur vos propres tâches. Une exécution appariée qui enregistre le succès des appels d’outils, le comportement de refus et la P99 sous charge de pointe est le test que les bancs publics ne peuvent pas remplacer.
La question utile en 2026 est quels poids tiennent la carte, le contexte et la facture mensuelle tout en nettoyant encore vos propres tâches. Pour beaucoup de travail agentique, ce point est un modèle hybride 27B sur un seul GPU de 24 Go. Scout est la même idée avec une mémoire data-center : moins de calcul par jeton que le total des paramètres ne le suggère, et pas de remise sur la VRAM.
Références
- MindStudio. « Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests. » https://www.mindstudio.ai/blog/qwen-3-27b-local-benchmark
- Qubrid AI. « Qwen3.8-27B Benchmarks: Official and Independent Results. » https://www.qubrid.com/blog/qwen38-27b-benchmarks-official-and-independent-results
- Hardware Corner. « We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need? » https://www.hardware-corner.net/qwen3-8-27b-hardware-tests/
- Locally Uncensored. « How to Run Qwen 3.8 27B Locally: VRAM, Quants and the Template Trap. » https://locallyuncensored.com/blog/how-to-run-qwen-3-8-27b-locally.html
- Malik, Umesh. « Qwen3.8 27B VRAM: how to fit 262K context in 16 GiB, not 64. » https://umesh-malik.com/blog/qwen3-8-27b-vram-kv-cache-math
- Meta AI. « The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation. » https://ai.meta.com/blog/llama-4-multimodal-intelligence
- Meta. « Llama 4 model card. » https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
- arXiv. « Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources? » Juin 2025. https://arxiv.org/html/2506.12119v1
- Yang, S., Kautz, J., Hatamizadeh, A. « Gated Delta Networks: Improving Mamba2 with Delta Rule. » ICLR 2025. https://jankautz.com/publications/GatedDeltaNet_ICLR25.pdf
- Abdin, M., et al. « Phi-4 Technical Report. » arXiv:2412.08905, Décembre 2024. https://arxiv.org/html/2412.08905v1
- GPU Finder. « RTX 4090 GPU Rental Prices & Live Availability. » Consulté le 18 septembre 2026. https://gpufinder.dev/gpu/rtx-4090
- Anthropic. « What’s new in Claude Sonnet 5 » (tarification : 2 $ / 10 $ par million de jetons). https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5
- BenchLM. « Claude API pricing. » Mise à jour le 3 septembre 2026. https://benchlm.ai/anthropic/api-pricing
- Future AGI. « Evaluating Cheap Frontier Models in 2026: Substitution Without a Quality Cliff. » https://futureagi.com/blog/evaluating-cheap-frontier-models-2026
- Northflank. « Qwen3.8-27B: Performance, benchmarks, GPU requirements & how to run it. » 17 août 2026. https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it