Confronto: Qwen3:30b vs GPT-OSS:20b

Confronto di velocità, parametri e prestazioni di questi due modelli

Indice

Ecco un confronto tra Qwen3:30b e GPT-OSS:20b, focalizzato sul rispetto delle istruzioni, sui parametri di prestazioni, sulle specifiche e sulla velocità.

Per maggiori informazioni su throughput, latenza, VRAM e benchmark su diversi runtime e hardware, consultare LLM Performance: Benchmark, Colli di Bottiglia e Ottimizzazione.

7 llamas

Per i parametri predefiniti di campionamento orientati al ciclo di agenti (agent-loop) nella linea Qwen più recente (inclusi le penalità e le preset per il thinking rispetto al coding), fare riferimento alla guida consolidata sui parametri di inferenza agentica per Qwen e Gemma.

Architettura e Parametri

Funzionalità Qwen3:30b-instruct GPT-OSS:20b
Parametri Totali 30,5 miliardi 21 miliardi
Parametri Attivati ~3,3 miliardi ~3,6 miliardi
Numero di Livelli 48 24
Esperti MoE per Livello 128 (8 attivi per token) 32 (4 attivi per token)
Meccanismo di Attenzione Grouped Query Attention (32Q /4KV) Grouped Multi-Query Attention (64Q /8KV)
Finestra di Contesto 32.768 nativa; fino a 262.144 estesa 128.000 token
Tokenizer Basato su BPE, vocabolario 151.936 Basato su GPT, vocabolario ≈ 200k

Rispetto delle Istruzioni

  • Qwen3:30b-instruct è ottimizzato per il rispetto delle istruzioni con una forte allineamento alle preferenze umane. Eccelle nella scrittura creativa, nel role-playing, nei dialoghi multi-turno e nel rispetto delle istruzioni multilingue. Questa variante è sottoposta a fine-tuning specifico per fornire risposte più naturali, controllate e coinvolgenti, allineate alle istruzioni dell’utente.
  • GPT-OSS:20b supporta il rispetto delle istruzioni ma è generalmente valutato leggermente al di sotto di Qwen3:30b-instruct nel tuning sfumato delle istruzioni. Offre prestazioni paragonabili nel function calling, nell’output strutturato e nei modalità di ragionamento, ma potrebbe arretrare nell’allineamento conversazionale e nel dialogo creativo.

Prestazioni ed Efficienza

  • Qwen3:30b-instruct eccelle nel ragionamento matematico, nel coding, nei compiti logici complessi e negli scenari multilingue che coprono 119 lingue e dialetti. La sua modalità “thinking” consente un ragionamento migliorato ma comporta costi di memoria più elevati.
  • GPT-OSS:20b raggiunge prestazioni paragonabili al modello o3-mini di OpenAI. Utilizza meno livelli ma esperti più ampi per livello e la quantizzazione nativa MXFP4 per un’inferenza efficiente sull’hardware consumer con requisiti di memoria inferiori (~16GB rispetto a valori più alti per Qwen3).
  • GPT-OSS è circa il 33% più efficiente in termini di memoria e più veloce su determinate configurazioni hardware, specialmente su GPU consumer, ma Qwen3 spesso fornisce un migliore allineamento e una profondità di ragionamento, soprattutto nei casi d’uso complessi.
  • Qwen3 offre un’opzione di lunghezza del contesto estesa maggiore (fino a 262.144 token) rispetto ai 128.000 token di GPT-OSS, vantaggioso per i compiti che richiedono la comprensione di contesti molto lunghi.

Raccomandazione d’Uso

  • Scegliere Qwen3:30b-instruct per i casi d’uso che richiedono un superiore rispetto delle istruzioni, generazione creativa, supporto multilingue e ragionamento complesso.
  • Scegliere GPT-OSS:20b se l’efficienza della memoria, la velocità di inferenza sull’hardware consumer e prestazioni di base competitive con meno parametri sono la priorità.

Questo confronto evidenzia Qwen3:30b-instruct come un modello più profondo e capace con avanzato tuning delle istruzioni, mentre GPT-OSS:20b offre un’alternativa più compatta ed efficiente con prestazioni competitive nei benchmark standard.

I punteggi di benchmark specifici che confrontano Qwen3:30b-instruct e GPT-OSS:20b per il rispetto delle istruzioni e i parametri di prestazione chiave (MMLU, LMEval, HumanEval) non sono direttamente disponibili nei risultati di ricerca. Tuttavia, in base ai rapporti esistenti su benchmark multilingue e multitask pubblicati:

MMLU (Massive Multitask Language Understanding)

Difficile trovare i dettagli, solo:

  • I modelli della serie Qwen3, soprattutto alla scala di 30B e superiore, dimostrano forti punteggi MMLU che tipicamente superano l'89%, indicando capacità di comprensione delle conoscenze e di ragionamento molto competitive in 57 diversi ambiti.
  • GPT-OSS:20b ottiene anche buoni risultati nei benchmark MMLU, ma ottiene generalmente punteggi inferiori rispetto ai modelli Qwen più grandi a causa del minor numero di parametri e di una minore enfasi sul fine-tuning delle istruzioni.

LMEval (Language Model Evaluation Toolkit)

Pochi dettagli al momento:

  • I modelli Qwen3 mostrano un significativo miglioramento nel ragionamento e nei compiti relativi al codice all’interno di LMEval, con punteggi migliorati nella logica, nel ragionamento matematico e nelle capacità generali.
  • GPT-OSS:20b fornisce prestazioni di base robuste su LMEval, ma generalmente arretra rispetto a Qwen3:30b-instruct sui sotto-compiti avanzati di ragionamento e rispetto delle istruzioni.

HumanEval (Code Generation Benchmark)

Pochi dati, solo:

  • Qwen3:30b-instruct esibisce prestazioni forti su benchmark di generazione di codice multilingue come HumanEval-XL, supportando oltre 20 linguaggi di programmazione e fornendo un’accuratezza superiore nella generazione di codice cross-linguale.
  • GPT-OSS:20b, pur essendo competitivo, ottiene prestazioni leggermente inferiori a Qwen3:30b-instruct nei benchmark HumanEval, specialmente nei contesti multilingue e multi-linguaggio di programmazione a causa di un addestramento multilingue meno esteso.

Tabella Riepilogativa (tendenze approssimative dalla letteratura):

Benchmark Qwen3:30b-instruct GPT-OSS:20b Note
Accuratezza MMLU ~89-91% ~80-85% Qwen3 più forte nelle conoscenze ampie e nel ragionamento
Punteggi LMEval Elevati, ragionamento avanzato e codice Moderati, ragionamento di base Qwen3 eccelle in matematica e logica
HumanEval Alte prestazioni nella generazione di codice multilingue Moderate Qwen3 migliore nella generazione di codice cross-linguale

Se sono necessari i numeri di benchmark esatti, benchmark multilingue su larga scala specializzati come P-MMEval e HumanEval-XL, citati in recenti paper di ricerca, forniscono punteggi dettagliati per modelli inclusi Qwen3 e varianti GPT-OSS comparabili, ma questi non sono ancora pubblici e organizzati per un recupero diretto dei punteggi affiancati al momento attuale.

Confronto Velocità tra Qwen3:30b e GPT-OSS:20b

Sul mio hardware (16GB VRAM) ottengo Qwen3:30b e GPT-OSS:20b funzionanti con una finestra di 4000 contesto, e producono:

  • qwen3:30b-a3b => 45,68 token/s
  • gpt-oss:20b => 129,52 token/s

E per confronto ho anche testato qwen3:14b e gpt-oss:120b

  • qwen3:14b => 60,12 token/s
  • gpt-oss:120b => 12,87 token/s

Su finestre di contesto più lunghe la velocità sarà inferiore; nel caso di qwen3:30b-a3b probabilmente molto inferiore. Questa è comunque la situazione sul mio PC. I dettagli tecnici presi dall’output dettagliato e la memoria allocata sono di seguito; comandi da provare:

  • ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
  • ollama ps che mostra l’allocazione della memoria su contesto 4K

qwen3:30b-a3b

NAME             ID              SIZE     PROCESSOR          CONTEXT    UNTIL
qwen3:30b-a3b    19e422b02313    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       28.151133548s
load duration:        1.980696196s
prompt eval count:    16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate:     98.41 tokens/s
eval count:           1188 token(s)
eval duration:        26.007424856s
eval rate:            45.68 tokens/s

qwen3:30b-thinking

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:30b-thinking    ad815644918f    20 GB    23%/77% CPU/GPU    4096       4 minutes from now
total duration:       1m8.317354579s
load duration:        1.984986882s
prompt eval count:    18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate:     81.95 tokens/s
eval count:           2722 token(s)
eval duration:        1m6.11230524s
eval rate:            41.17 tokens/s

gpt-oss:20b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
gpt-oss:20b    aa4295ac10c3    14 GB    100% GPU     4096       4 minutes from now
total duration:       31.505397616s
load duration:        13.744361948s
prompt eval count:    75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate:     300.77 tokens/s
eval count:           2268 token(s)
eval duration:        17.510262884s
eval rate:            129.52 tokens/s

qwen3:14b

NAME         ID              SIZE     PROCESSOR    CONTEXT    UNTIL              
qwen3:14b    bdbd181c33f2    10 GB    100% GPU     4096       4 minutes from now    
total duration:       36.902729562s
load duration:        38.669074ms
prompt eval count:    18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate:     509.61 tokens/s
eval count:           2214 token(s)
eval duration:        36.828268069s
eval rate:            60.12 tokens/s

gpt-oss:120b

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    f7f8e2f8f4e0    65 GB    78%/22% CPU/GPU    4096       2 minutes from now
49GB RAM + 14.4GB VRAM
total duration:       3m59.967272019s
load duration:        76.758783ms
prompt eval count:    75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate:     252.26 tokens/s
eval count:           3084 token(s)
eval duration:        3m59.592764501s
eval rate:            12.87 tokens/s

Varianti di Qwen3:30b

Sono disponibili tre varianti del modello qwen3:30b: qwen3:30b, qwen3:30b-instruct e qwen3:30b-thinking.

Principali Differenze e Raccomandazioni

  • qwen3:30b-instruct è la migliore per conversazioni in cui le istruzioni dell’utente, la chiarezza e il dialogo naturale sono prioritari.
  • qwen3:30b è la base generale, adatta se sia il rispetto delle istruzioni che l’uso di strumenti sono importanti in compiti diversi.
  • qwen3:30b-thinking eccelle quando il ragionamento profondo, la matematica e il coding sono il principale obiettivo. Supera gli altri in compiti che misurano la rigore logico/matematico ma non è necessariamente migliore per la scrittura creativa o le conversazioni informali.

Confronto Diretto dei Benchmark

Modello Ragionamento (AIME25) Coding (LiveCodeBench) Conoscenza Generale (MMLU Redux) Velocità e Contesto Caso d’Uso Ideale
qwen3:30b 70,9 57,4 89,5 256K token; Veloce Linguaggio generale/agenti/multilingue
qwen3:30b-instruct N/D (Prevedibile vicino al 30b) N/D ~Stesso come 30b 256K token Rispetto istruzioni, allineamento
qwen3:30b-thinking 85,0 66,0 91,4 256K token Matematica, codice, ragionamento, documenti lunghi

Per maggiori benchmark, scelte hardware e ottimizzazione delle prestazioni, consultare il nostro hub LLM Performance: Benchmark, Colli di Bottiglia e Ottimizzazione.

Iscriviti

Ricevi nuovi articoli su sistemi, infrastruttura e ingegneria AI.