Confronto: Qwen3:30b vs GPT-OSS:20b
Confronto di velocità, parametri e prestazioni di questi due modelli
Ecco un confronto tra Qwen3:30b e GPT-OSS:20b, focalizzato sul rispetto delle istruzioni, sui parametri di prestazioni, sulle specifiche e sulla velocità.
Per maggiori informazioni su throughput, latenza, VRAM e benchmark su diversi runtime e hardware, consultare LLM Performance: Benchmark, Colli di Bottiglia e Ottimizzazione.

Per i parametri predefiniti di campionamento orientati al ciclo di agenti (agent-loop) nella linea Qwen più recente (inclusi le penalità e le preset per il thinking rispetto al coding), fare riferimento alla guida consolidata sui parametri di inferenza agentica per Qwen e Gemma.
Architettura e Parametri
| Funzionalità | Qwen3:30b-instruct | GPT-OSS:20b |
|---|---|---|
| Parametri Totali | 30,5 miliardi | 21 miliardi |
| Parametri Attivati | ~3,3 miliardi | ~3,6 miliardi |
| Numero di Livelli | 48 | 24 |
| Esperti MoE per Livello | 128 (8 attivi per token) | 32 (4 attivi per token) |
| Meccanismo di Attenzione | Grouped Query Attention (32Q /4KV) | Grouped Multi-Query Attention (64Q /8KV) |
| Finestra di Contesto | 32.768 nativa; fino a 262.144 estesa | 128.000 token |
| Tokenizer | Basato su BPE, vocabolario 151.936 | Basato su GPT, vocabolario ≈ 200k |
Rispetto delle Istruzioni
- Qwen3:30b-instruct è ottimizzato per il rispetto delle istruzioni con una forte allineamento alle preferenze umane. Eccelle nella scrittura creativa, nel role-playing, nei dialoghi multi-turno e nel rispetto delle istruzioni multilingue. Questa variante è sottoposta a fine-tuning specifico per fornire risposte più naturali, controllate e coinvolgenti, allineate alle istruzioni dell’utente.
- GPT-OSS:20b supporta il rispetto delle istruzioni ma è generalmente valutato leggermente al di sotto di Qwen3:30b-instruct nel tuning sfumato delle istruzioni. Offre prestazioni paragonabili nel function calling, nell’output strutturato e nei modalità di ragionamento, ma potrebbe arretrare nell’allineamento conversazionale e nel dialogo creativo.
Prestazioni ed Efficienza
- Qwen3:30b-instruct eccelle nel ragionamento matematico, nel coding, nei compiti logici complessi e negli scenari multilingue che coprono 119 lingue e dialetti. La sua modalità “thinking” consente un ragionamento migliorato ma comporta costi di memoria più elevati.
- GPT-OSS:20b raggiunge prestazioni paragonabili al modello o3-mini di OpenAI. Utilizza meno livelli ma esperti più ampi per livello e la quantizzazione nativa MXFP4 per un’inferenza efficiente sull’hardware consumer con requisiti di memoria inferiori (~16GB rispetto a valori più alti per Qwen3).
- GPT-OSS è circa il 33% più efficiente in termini di memoria e più veloce su determinate configurazioni hardware, specialmente su GPU consumer, ma Qwen3 spesso fornisce un migliore allineamento e una profondità di ragionamento, soprattutto nei casi d’uso complessi.
- Qwen3 offre un’opzione di lunghezza del contesto estesa maggiore (fino a 262.144 token) rispetto ai 128.000 token di GPT-OSS, vantaggioso per i compiti che richiedono la comprensione di contesti molto lunghi.
Raccomandazione d’Uso
- Scegliere Qwen3:30b-instruct per i casi d’uso che richiedono un superiore rispetto delle istruzioni, generazione creativa, supporto multilingue e ragionamento complesso.
- Scegliere GPT-OSS:20b se l’efficienza della memoria, la velocità di inferenza sull’hardware consumer e prestazioni di base competitive con meno parametri sono la priorità.
Questo confronto evidenzia Qwen3:30b-instruct come un modello più profondo e capace con avanzato tuning delle istruzioni, mentre GPT-OSS:20b offre un’alternativa più compatta ed efficiente con prestazioni competitive nei benchmark standard.
I punteggi di benchmark specifici che confrontano Qwen3:30b-instruct e GPT-OSS:20b per il rispetto delle istruzioni e i parametri di prestazione chiave (MMLU, LMEval, HumanEval) non sono direttamente disponibili nei risultati di ricerca. Tuttavia, in base ai rapporti esistenti su benchmark multilingue e multitask pubblicati:
MMLU (Massive Multitask Language Understanding)
Difficile trovare i dettagli, solo:
- I modelli della serie Qwen3, soprattutto alla scala di 30B e superiore, dimostrano forti punteggi MMLU che tipicamente superano l'89%, indicando capacità di comprensione delle conoscenze e di ragionamento molto competitive in 57 diversi ambiti.
- GPT-OSS:20b ottiene anche buoni risultati nei benchmark MMLU, ma ottiene generalmente punteggi inferiori rispetto ai modelli Qwen più grandi a causa del minor numero di parametri e di una minore enfasi sul fine-tuning delle istruzioni.
LMEval (Language Model Evaluation Toolkit)
Pochi dettagli al momento:
- I modelli Qwen3 mostrano un significativo miglioramento nel ragionamento e nei compiti relativi al codice all’interno di LMEval, con punteggi migliorati nella logica, nel ragionamento matematico e nelle capacità generali.
- GPT-OSS:20b fornisce prestazioni di base robuste su LMEval, ma generalmente arretra rispetto a Qwen3:30b-instruct sui sotto-compiti avanzati di ragionamento e rispetto delle istruzioni.
HumanEval (Code Generation Benchmark)
Pochi dati, solo:
- Qwen3:30b-instruct esibisce prestazioni forti su benchmark di generazione di codice multilingue come HumanEval-XL, supportando oltre 20 linguaggi di programmazione e fornendo un’accuratezza superiore nella generazione di codice cross-linguale.
- GPT-OSS:20b, pur essendo competitivo, ottiene prestazioni leggermente inferiori a Qwen3:30b-instruct nei benchmark HumanEval, specialmente nei contesti multilingue e multi-linguaggio di programmazione a causa di un addestramento multilingue meno esteso.
Tabella Riepilogativa (tendenze approssimative dalla letteratura):
| Benchmark | Qwen3:30b-instruct | GPT-OSS:20b | Note |
|---|---|---|---|
| Accuratezza MMLU | ~89-91% | ~80-85% | Qwen3 più forte nelle conoscenze ampie e nel ragionamento |
| Punteggi LMEval | Elevati, ragionamento avanzato e codice | Moderati, ragionamento di base | Qwen3 eccelle in matematica e logica |
| HumanEval | Alte prestazioni nella generazione di codice multilingue | Moderate | Qwen3 migliore nella generazione di codice cross-linguale |
Se sono necessari i numeri di benchmark esatti, benchmark multilingue su larga scala specializzati come P-MMEval e HumanEval-XL, citati in recenti paper di ricerca, forniscono punteggi dettagliati per modelli inclusi Qwen3 e varianti GPT-OSS comparabili, ma questi non sono ancora pubblici e organizzati per un recupero diretto dei punteggi affiancati al momento attuale.
Confronto Velocità tra Qwen3:30b e GPT-OSS:20b
Sul mio hardware (16GB VRAM) ottengo Qwen3:30b e GPT-OSS:20b funzionanti con una finestra di 4000 contesto, e producono:
- qwen3:30b-a3b => 45,68 token/s
- gpt-oss:20b => 129,52 token/s
E per confronto ho anche testato qwen3:14b e gpt-oss:120b
- qwen3:14b => 60,12 token/s
- gpt-oss:120b => 12,87 token/s
Su finestre di contesto più lunghe la velocità sarà inferiore; nel caso di qwen3:30b-a3b probabilmente molto inferiore. Questa è comunque la situazione sul mio PC. I dettagli tecnici presi dall’output dettagliato e la memoria allocata sono di seguito; comandi da provare:
- ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
- ollama ps che mostra l’allocazione della memoria su contesto 4K
qwen3:30b-a3b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-a3b 19e422b02313 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 28.151133548s
load duration: 1.980696196s
prompt eval count: 16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate: 98.41 tokens/s
eval count: 1188 token(s)
eval duration: 26.007424856s
eval rate: 45.68 tokens/s
qwen3:30b-thinking
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-thinking ad815644918f 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 1m8.317354579s
load duration: 1.984986882s
prompt eval count: 18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate: 81.95 tokens/s
eval count: 2722 token(s)
eval duration: 1m6.11230524s
eval rate: 41.17 tokens/s
gpt-oss:20b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:20b aa4295ac10c3 14 GB 100% GPU 4096 4 minutes from now
total duration: 31.505397616s
load duration: 13.744361948s
prompt eval count: 75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate: 300.77 tokens/s
eval count: 2268 token(s)
eval duration: 17.510262884s
eval rate: 129.52 tokens/s
qwen3:14b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:14b bdbd181c33f2 10 GB 100% GPU 4096 4 minutes from now
total duration: 36.902729562s
load duration: 38.669074ms
prompt eval count: 18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate: 509.61 tokens/s
eval count: 2214 token(s)
eval duration: 36.828268069s
eval rate: 60.12 tokens/s
gpt-oss:120b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:120b f7f8e2f8f4e0 65 GB 78%/22% CPU/GPU 4096 2 minutes from now
49GB RAM + 14.4GB VRAM
total duration: 3m59.967272019s
load duration: 76.758783ms
prompt eval count: 75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate: 252.26 tokens/s
eval count: 3084 token(s)
eval duration: 3m59.592764501s
eval rate: 12.87 tokens/s
Varianti di Qwen3:30b
Sono disponibili tre varianti del modello qwen3:30b: qwen3:30b, qwen3:30b-instruct e qwen3:30b-thinking.
Principali Differenze e Raccomandazioni
- qwen3:30b-instruct è la migliore per conversazioni in cui le istruzioni dell’utente, la chiarezza e il dialogo naturale sono prioritari.
- qwen3:30b è la base generale, adatta se sia il rispetto delle istruzioni che l’uso di strumenti sono importanti in compiti diversi.
- qwen3:30b-thinking eccelle quando il ragionamento profondo, la matematica e il coding sono il principale obiettivo. Supera gli altri in compiti che misurano la rigore logico/matematico ma non è necessariamente migliore per la scrittura creativa o le conversazioni informali.
Confronto Diretto dei Benchmark
| Modello | Ragionamento (AIME25) | Coding (LiveCodeBench) | Conoscenza Generale (MMLU Redux) | Velocità e Contesto | Caso d’Uso Ideale |
|---|---|---|---|---|---|
| qwen3:30b | 70,9 | 57,4 | 89,5 | 256K token; Veloce | Linguaggio generale/agenti/multilingue |
| qwen3:30b-instruct | N/D (Prevedibile vicino al 30b) | N/D | ~Stesso come 30b | 256K token | Rispetto istruzioni, allineamento |
| qwen3:30b-thinking | 85,0 | 66,0 | 91,4 | 256K token | Matematica, codice, ragionamento, documenti lunghi |
Per maggiori benchmark, scelte hardware e ottimizzazione delle prestazioni, consultare il nostro hub LLM Performance: Benchmark, Colli di Bottiglia e Ottimizzazione.
Link Utili
- https://ollama.com/library/qwen3
- https://ollama.com/library/gpt-oss
- https://artificialanalysis.ai/articles/analysis-openai-gpt-oss-models
- https://artificialanalysis.ai/models/qwen3-30b-a3b-2507
- Installare e configurare Ollama
- Scheda rapida Ollama - comandi più utili
- Vincolare LLM con Output Strutturato: Ollama, Qwen3 e Python o Go
- Validazione dell’output strutturato LLM in Python che regge
- Integrare Ollama con Python: Esempi REST API e Client Python
- La Frontiera Efficiente dei Modelli Aperti nel 2026