Comparaison : Qwen3:30b vs GPT-OSS:20b

Comparaison de la vitesse, des paramètres et des performances de ces deux modèles

Sommaire

Voici une comparaison entre Qwen3:30b et GPT-OSS:20b se concentrant sur le suivi des instructions et les paramètres de performance, les spécifications et la vitesse.

Pour en savoir plus sur le débit, la latence, la VRAM et les benchmarks à travers les différents environnements d’exécution et le matériel, consultez Performance LLM : Benchmarks, Goulets d’étranglement et Optimisation.

7 llamas

Pour les valeurs par défaut d’échantillonnage orientées boucle agentique sur la nouvelle gamme Qwen (y compris les pénalités et les préréglages « réflexion » et « codage »), consultez la référence Paramètres d’inférence agentique pour Qwen et Gemma.

Architecture et Paramètres

Fonction Qwen3:30b-instruct GPT-OSS:20b
Paramètres totaux 30,5 milliards 21 milliards
Paramètres activés ~3,3 milliards ~3,6 milliards
Nombre de couches 48 24
Experts MoE par couche 128 (8 actifs par jeton) 32 (4 actifs par jeton)
Mécanisme d’attention Attention par requête groupée (32Q /4KV) Attention multi-requête groupée (64Q /8KV)
Fenêtre de contexte 32 768 natif ; jusqu’à 262 144 étendu 128 000 jetons
Tokenizer Basé sur BPE, vocabulaire de 151 936 Basé sur GPT, ≈ 200k de vocabulaire

Suivi des Instructions

  • Qwen3:30b-instruct est optimisé pour le suivi des instructions avec un alignement fort sur les préférences humaines. Il excelle dans la rédaction créative, le jeu de rôle, les dialogues multi-tours et le suivi d’instructions multilingues. Cette variante est affinée spécifiquement pour fournir des réponses plus naturelles, contrôlées et engageantes, alignées sur les instructions de l’utilisateur.
  • GPT-OSS:20b prend en charge le suivi des instructions, mais est généralement évalué légèrement en retrait par rapport à Qwen3:30b-instruct en ce qui concerne l’ajustement fin des instructions. Il offre des capacités comparables en appel de fonctions, sortie structurée et modes de raisonnement, mais peut présenter un retard en matière d’alignement conversationnel et de dialogue créatif.

Performance et Efficacité

  • Qwen3:30b-instruct excelle dans le raisonnement mathématique, le codage, les tâches logiques complexes et les scénarios multilingues couvrant 119 langues et dialectes. Son mode « réflexion » permet un raisonnement amélioré, mais au prix de coûts mémoire plus élevés.
  • GPT-OSS:20b atteint une performance comparable au modèle o3-mini d’OpenAI. Il utilise moins de couches, mais des experts plus larges par couche et une quantification MXFP4 native pour une inférence efficace sur le matériel grand public, avec des exigences mémoire plus faibles (~16 Go contre plus élevé pour Qwen3).
  • GPT-OSS est environ 33 % plus efficace en termes de mémoire et plus rapide sur certains configurations matérielles, en particulier sur les GPU grand public, mais Qwen3 offre souvent un meilleur alignement et une plus grande profondeur de raisonnement, surtout pour les cas d’utilisation complexes.
  • Qwen3 offre une longueur de contexte étendue disponible plus longue (jusqu’à 262 144 jetons) par rapport aux 128 000 jetons de GPT-OSS, ce qui est bénéfique pour les tâches nécessitant la compréhension de contextes très longs.

Recommandation d’Usage

  • Choisissez Qwen3:30b-instruct pour les cas d’utilisation demandant un suivi supérieur des instructions, une génération créative, un support multilingue et un raisonnement complexe.
  • Choisissez GPT-OSS:20b si l’efficacité mémoire, la vitesse d’inférence sur le matériel grand public et une performance de référence compétitive avec moins de paramètres sont la priorité.

Cette comparaison met en lumière Qwen3:30b-instruct comme un modèle plus profond et plus capable avec un ajustement avancé des instructions, tandis que GPT-OSS:20b offre une alternative plus compacte et efficace avec des performances compétitives sur les benchmarks standard.

Les scores de benchmark comparant spécifiquement Qwen3:30b-instruct et GPT-OSS:20b pour le suivi des instructions et les paramètres de performance clés (MMLU, LMEval, HumanEval) ne sont pas directement disponibles dans les résultats de recherche. Cependant, sur la base des rapports existants de benchmarks multilingues et multitâches publiés :

MMLU (Massive Multitask Language Understanding)

Difficile de trouver les détails, seulement :

  • Les modèles de la série Qwen3, en particulier à l’échelle de 30B et au-dessus, montrent des scores MMLU solides dépassant typiquement 89 %, indiquant des capacités très compétitives de compréhension et de raisonnement à travers 57 domaines variés.
  • GPT-OSS:20b se débrouille également bien sur les benchmarks MMLU, mais obtient généralement des scores inférieurs aux modèles Qwen plus grands en raison d’un nombre plus faible de paramètres et d’une moindre emphase sur l’affinage des instructions.

LMEval (Language Model Evaluation Toolkit)

Pas beaucoup de détails pour l’instant :

  • Les modèles Qwen3 montrent une amélioration significative des tâches de raisonnement et de code au sein de LMEval, avec des scores améliorés en logique, raisonnement mathématique et capacités générales.
  • GPT-OSS:20b fournit des performances de référence robustes sur LMEval, mais reste généralement en retrait par rapport à Qwen3:30b-instruct sur les sous-tâches de raisonnement avancé et de suivi des instructions.

HumanEval (Benchmark de Génération de Code)

Pas beaucoup de données, seulement :

  • Qwen3:30b-instruct présente de fortes performances sur les benchmarks de génération de code multilingue comme HumanEval-XL, prenant en charge plus de 20 langages de programmation et offrant une précision supérieure de génération de code inter-linguistique.
  • GPT-OSS:20b, bien que compétitif, obtient des performances légèrement inférieures à Qwen3:30b-instruct sur les benchmarks HumanEval, en particulier dans les contextes de programmation multilingues et multi-langages, en raison d’un entraînement multilingue moins étendu.

Tableau Récapitulatif (tendances approximatives issues de la littérature) :

Benchmark Qwen3:30b-instruct GPT-OSS:20b Remarques
Précision MMLU ~89-91 % ~80-85 % Qwen3 plus fort en connaissances générales et raisonnement
Scores LMEval Élevés, raisonnement avancé & code Modéré, raisonnement de référence Qwen3 excelle en maths et logique
HumanEval Génération de code multilingue performante Modéré Qwen3 meilleur en génération de code inter-linguistique

Si des chiffres de benchmark exacts sont nécessaires, des benchmarks multilingues à grande échelle spécialisés comme P-MMEval et HumanEval-XL, cités dans des articles de recherche récents, fournissent des scores détaillés pour des modèles incluant Qwen3 et des variantes GPT-OSS comparables, mais ceux-ci ne sont pas encore simplifiés publiquement pour une récupération directe de scores côte à côte à ce stade.

Comparaison des vitesses de Qwen3:30b et GPT-OSS:20b

Sur mon matériel (16 Go VRAM), j’obtiens un fonctionnement de Qwen3:30b et GPT-OSS:20b avec une fenêtre de contexte de 4000 jetons, et ils produisent :

  • qwen3:30b-a3b => 45,68 jetons/s
  • gpt-oss:20b => 129,52 jetons/s

Et pour comparaison, j’ai également testé qwen3:14b et gpt-oss:120b

  • qwen3:14b => 60,12 jetons/s
  • gpt-oss:120b => 12,87 jetons/s

Avec des fenêtres de contexte plus longues, la vitesse sera plus lente, dans le cas de qwen3:30b-a3b probablement beaucoup plus lente. Encore une fois, sur mon PC. Les détails techniques extraits de la sortie détaillée et la mémoire allouée sont ci-dessous, commandes à essayer :

  • ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
  • ollama ps montrant l’allocation mémoire sur contexte 4K

qwen3:30b-a3b

NAME             ID              SIZE     PROCESSOR          CONTEXT    UNTIL
qwen3:30b-a3b    19e422b02313    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       28.151133548s
load duration:        1.980696196s
prompt eval count:    16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate:     98.41 tokens/s
eval count:           1188 token(s)
eval duration:        26.007424856s
eval rate:            45.68 tokens/s

qwen3:30b-thinking

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:30b-thinking    ad815644918f    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       1m8.317354579s
load duration:        1.984986882s
prompt eval count:    18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate:     81.95 tokens/s
eval count:           2722 token(s)
eval duration:        1m6.11230524s
eval rate:            41.17 tokens/s

gpt-oss:20b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
gpt-oss:20b    aa4295ac10c3    14 GB    100% GPU     4096       4 minutes from now
total duration:       31.505397616s
load duration:        13.744361948s
prompt eval count:    75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate:     300.77 tokens/s
eval count:           2268 token(s)
eval duration:        17.510262884s
eval rate:            129.52 tokens/s

qwen3:14b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:14b    bdbd181c33f2    10 GB    100% GPU     4096       4 minutes from now    
total duration:       36.902729562s
load duration:        38.669074ms
prompt eval count:    18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate:     509.61 tokens/s
eval count:           2214 token(s)
eval duration:        36.828268069s
eval rate:            60.12 tokens/s

gpt-oss:120b

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    f7f8e2f8f4e0    65 GB    78%/22% CPU/GPU    4096       2 minutes from now
49GB RAM + 14.4GB VRAM
total duration:       3m59.967272019s
load duration:        76.758783ms
prompt eval count:    75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate:     252.26 tokens/s
eval count:           3084 token(s)
eval duration:        3m59.592764501s
eval rate:            12.87 tokens/s

Variantes de Qwen3:30b

Il existe trois variantes du modèle qwen3:30b disponibles : qwen3:30b, qwen3:30b-instruct et qwen3:30b-thinking.

Différences Clés et Recommandations

  • qwen3:30b-instruct est le meilleur choix pour les conversations où les instructions de l’utilisateur, la clarté et le dialogue naturel sont prioritaires.
  • qwen3:30b est la base générale, appropriée si le suivi des instructions et l’utilisation d’outils sont importants à travers diverses tâches.
  • qwen3:30b-thinking excelle lorsque le raisonnement profond, les mathématiques et le codage sont les principaux objectifs. Il surpasse les autres sur les tâches mesurant la rigueur logique/mathématique, mais n’est pas forcément meilleur pour l’écriture créative ou les conversations décontractées.

Comparaison Directe des Benchmarks

Modèle Raisonnement (AIME25) Codage (LiveCodeBench) Connaissances Générales (MMLU Redux) Vitesse & Contexte Cas d’Usage Idéal
qwen3:30b 70,9 57,4 89,5 256K jetons ; Rapide Langage général/agents/multilingue
qwen3:30b-instruct N/A (Prévu proche de 30b) N/A ~Même que 30b 256K jetons Suivi des instructions, alignement
qwen3:30b-thinking 85,0 66,0 91,4 256K jetons Maths, code, raisonnement, documents longs

Pour plus de benchmarks, de choix de matériel et de réglages de performance, consultez notre centre Performance LLM : Benchmarks, Goulets d’étranglement et Optimisation.

Liens Utiles

S'abonner

Recevez de nouveaux articles sur les systèmes, l'infrastructure et l'ingénierie IA.