La frontiera efficiente dei modelli open source: individuare il punto ottimale nel 2026
Il punto ideale del 2026 per i LLM aperti: circa 30B.
Nel settembre 2026, il fronte efficiente dei modelli open source si colloca tra i 25 e i 34 miliardi di parametri: lavoro agenziale quasi al livello di frontiera su una singola GPU da 24 GB, a una frazione dell’hardware di classe 70B.
Questa fascia emerge nei deployment, non nelle slogan sul numero di parametri. Classifiche pubbliche, esecuzioni su singola GPU e bollette mensili delle API convergono su modelli che mantengono un uso degli strumenti vicino al livello di frontiera, mentre pesi e cache KV continuano a stare nell’hardware che puoi affittare o possedere.

Questa pagina è il centro decisionale per quella scelta, all’interno del cluster Prestazioni LLM. Si passa dai modelli di istruzione di piccole dimensioni ai pesi densi di classe 70B, per poi soffermarsi sulle due architetture che definiscono il fronte in questo momento: Qwen3.8-27B, a suo agio su una singola scheda da 24 GB, e Llama 4 Scout, il cui calcolo sembra modesto solo perché la maggior parte dei suoi esperti rimane inattiva. Le tabelle sui token al secondo rimangono nelle pagine di benchmark collegate da ogni sezione.
Entro la fine, dovresti sapere quale dimensione testare per prima, quanta VRAM occupano effettivamente i pesi e la cache, come un’RTX 4090 affittata si confronta con i prezzi correnti dei token di Claude Sonnet e quando un modello più grande è ancora la scelta giusta.
Perché i benchmark pubblici sovrastimano il trasferimento in produzione
Un modello può trovarsi entro un paio di punti da un modello API di frontiera su MMLU o HumanEval e comunque fallire nel compito che stai sviluppando. I flussi multi-tool cadono nella seconda chiamata dello strumento, la calibrazione del rifiuto deriva verso il sovrarifiuto per query adiacenti al settore medico e la latenza P99 sotto carico a picco raddoppia. Il divario nelle classifiche sembrava piccolo perché quei benchmark misurano la capacità su un set di prompt fisso. Non misurano il trasferimento sui tuoi strumenti, sui tuoi documenti e sul tuo budget di latenza.
Il fronte efficiente è l’insieme dei modelli che reggono sul tuo carico di lavoro a un costo che puoi continuare a sostenere. Questo richiede un confronto accoppiato su compiti simili alla produzione, registrando tre segnali lungo tutto il percorso: successo delle chiamate agli strumenti, comportamento di rifiuto e latenza P99. La relazione di Future AGI sulla sostituzione con modelli economici di frontiera fa lo stesso punto dalla parte della valutazione: un piccolo divario nei benchmark pubblici non è una licenza per sostituire i modelli.
Considera i punteggi sottostanti come una mappa di dove iniziare il confronto. Sono datati settembre 2026 e diversi numeri chiave di coding sono eseguiti dal vendor piuttosto che in modo indipendente.
Dove si collocano davvero 8B, 30B e 70B
All’estremità bassa, un modello di istruzione di classe 8B seguirà un’istruzione breve ed esplicita e scriverà una piccola funzione. Chiedigli di debuggare una pipeline CI in fallimento attraverso più servizi, di riprendersi quando la prima chiamata dello strumento restituisce un errore e di mantenere intatto il piano, e l’esecuzione va in pezzi. Questo è un fallimento del carico di lavoro, non un fallimento in classifica.
La parte centrale della gamma è dove il lavoro agenziale generalizzato supera attualmente una singola GPU prosumer. Qwen3.8-27B è il modello denso di riferimento. Le architetture nella stessa fascia di dimensioni, incluso l’MoE di classe 30B di Qwen confrontato nel Qwen3 30B vs GPT-OSS 20B testa a testa, sono quelle da testare prima di spendere per qualcosa di più grande.
All’estremità alta, un modello denso da 70B a 4-bit è dell’ordine di 35–40 GB di pesi prima di qualsiasi cache KV. Non sta su una scheda da 24 GB. Ci si sposta su una GPU da 48 GB, una scheda data center da 80 GB o una suddivisione su due GPU, e la qualità aggiuntiva rispetto a un modello 27B ben tarato è spesso marginale per agenti di coding, pipeline di documenti e bot di supporto. Le API di frontiera chiuse come Claude Opus rientrano in un budget completamente diverso: si paga per token e non si portano affatto i pesi.
Prima di scegliere un checkpoint, conferma la scheda e la memoria libera. I pesi del modello sono solo una parte dell’impronta. Il contesto (la cache KV) si aggiunge sopra.
# Nome GPU e VRAM libera prima di scegliere una quantizzazione
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv
# dopo il caricamento: conferma che il processo è rimasto sulla GPU
nvidia-smi
Se gli strati finiscono su CPU, l’elaborazione della generazione crolla. Puoi vedere la suddivisione in memory.used sulla GPU e nel log di offload del runtime. Per ciò che i checkpoint densi e MoE offrono realmente su una scheda da 16 GB, le misurazioni si trovano nei benchmark llama.cpp su VRAM 16 GB e nel confronto Ollama su RTX 4080 da 16 GB. Quelle pagine possiedono le tabelle di velocità. Questa ha bisogno solo della decisione di adattamento.
Qwen3.8-27B: il punto di riferimento da 24 GB
Qwen3.8-27B di Alibaba è un modello denso, non un mixture of experts. Su Artificial Analysis ottiene circa 51 sull’Indice Agenziale (il valore arrotondato; il valore sottostante è 50.9) e circa 52 sull’Indice di Intelligenza con massimo sforzo di ragionamento. Sono misurazioni diverse. L’Indice Agenziale riguarda l’uso degli strumenti e i task multistep. L’Indice di Intelligenza è una miscela più ampia di capacità. Il test pratico di MindStudio colloca il punteggio agenziale appena dietro Kimi K2, un modello mixture-of-experts vastamente più grande. Il dettaglio di Qubrid è quello da leggere accanto: il margine rispetto al modello successivo è inferiore a un punto e la cifra di SWE-bench Pro di 61.7 di Qwen non è stata riprodotta come esecuzione indipendente. Il risultato interessante è la forma dei punteggi. Un modello da 27B converte un budget compatto in pianificazione e uso degli strumenti in modo insolitamente buono, e non guida una suite di conoscenze ampia.
L’architettura è il motivo per cui il lungo contesto è accessibile. Dei 64 strati, solo 16 usano l’attenzione completa. Gli altri 48 sono strati Gated DeltaNet, un design di attenzione lineare dalla linea di ricerca Gated Delta Networks, e mantengono uno stato ricorrente fisso invece di una storia chiave/valore per token. A FP16 gli strati di attenzione completa costano circa 64 KB di cache KV per token. Un stack convenzionale con lo stesso numero di strati cachezzerà circa quattro volte tanto. La tabella delle quantizzazioni di Locally Uncensored colloca i pesi Q4_K_M a 17.1 GB e IQ4_XS a 15.7 GB. Le misurazioni llama.cpp di Hardware Corner su una GPU da 24 GB hanno raggiunto circa 18 GB con contesto breve e circa 22 GB a 64K, che è l’obiettivo pratico su una RTX 4090. Una scheda da 16 GB può contenere una quantizzazione di classe IQ4 dei pesi e quasi nessun contesto. Se questa è la tua macchina, resta con le esecuzioni di Qwen 3.5 e 3.6 già misurate su 16 GB, incluso Qwen 3.6 27B MTP rispetto al decoding standard. Come budgetizzare la cache stessa è coperto in Cache KV su GPU da 16 GB.
I report pratici, incluso quello di MindStudio, trovano anche il modello utilizzabile per coding, analisi di immagini e loop di agenti, che è la parte che un singolo indice non può mostrare. La visione aggiunge un piccolo file projector sopra i pesi di testo. Prevedi questo spazio se il carico di lavoro include screenshot.
Llama 4 Scout: i parametri attivi non sono VRAM
Llama 4 Scout di Meta è un tipo diverso di efficienza. La scheda modello Llama 4 elenca 17 miliardi di parametri attivi e 109 miliardi totali, con 16 esperti, input nativo di immagini e una finestra di contesto di 10 milioni di token. Il post di lancio di Meta dice che il checkpoint INT4 sta su una singola H100. Il calcolo di decodifica segue i 17B che si attivano per ogni token. La memoria no. Ogni esperto deve ancora essere residente, quindi il conto della VRAM sembra quello di un modello di classe 100B anche se i FLOPs sembrano quelli di un modello 17B.
Questa è la correzione da fare prima di budgetizzare una macchina. Scout non “funziona come un modello 3B”. I parametri attivi determinano la velocità. I parametri residenti determinano se la scheda può contenere i pesi. Su una GPU da 24 GB, Qwen3.8-27B è il modello che sta. Scout è il modello che ha senso una volta che hai già una scheda da 80 GB e vuoi un calcolo di classe 17B con un pool di esperti molto più grande e un contesto molto lungo.
Un paper di giugno 2025, Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?, sostiene che l’MoE può battere un modello denso quando il confronto mantiene fissi il calcolo totale e i dati e il tasso di attivazione sta in una banda fattibile. La lettura pratica è più stretta del titolo. L’MoE vince sui costi solo dopo che hai pagato la memoria che archivia gli esperti inattivi. Se stai già servendo un modello di questa dimensione e vuoi più token al secondo senza cambiare i pesi, il decodifica speculativa è la tecnica vicina: un percorso di bozza propone i token e il modello principale li verifica.
Phi-4: l’eccezione dei piccoli modelli per la matematica
Phi-4 di Microsoft è un modello denso da 14B. Nel rapporto tecnico di dicembre 2024, simple-evals gli assegna 80.4 su MATH, avanti rispetto alla cifra di GPT-4o nella stessa tabella, con una finestra di contesto che il rapporto estende a 16K. Una quantizzazione Q4_K_M viene comunemente eseguita in circa 8 GB. Questa è un’efficienza reale, ed è stretta. Phi-4 è stato addestrato per question-answering STEM. È il modello da provare quando il compito è matematica o ragionamento tecnico breve e la macchina è piccola. Non è il predefinito del 2026 per agenti multi-tool, documenti lunghi o visione. Il fronte per quel lavoro è ancora la banda 25–34B sopra, o Scout se la GPU è una scheda di classe H100.
Ore di GPU auto-ospitate rispetto ai prezzi API per token
I prezzi cambiano. Queste sono cifre di metà settembre 2026 e non sopravvivranno invariati fino al 2027.
GPU Finder, verificato il 18 settembre 2026, mostrava una RTX 4090 in magazzino a circa $0.26 per ora GPU su Vast, con RunPod community cloud elencata a $0.34. Il pavimento on-demand a sei mesi per una singola 4090 era tra $0.11 e $0.60. A $0.34 e 730 ore in un mese, una scheda che resta accesa tutto il mese è circa $248 prima di tasse, storage ed egress. Alla quotazione in magazzino di $0.26 lo stesso mese è circa $190. Una cifra di pianificazione precedente di $0.53 all’ora è all’interno di quella gamma a sei mesi, ma sovrasta ciò che lo stock del mercato chiedeva effettivamente nella seconda metà di settembre.
Sul lato API, le note di prezzo Sonnet 5 di Anthropic elencano $2 per milione di token in input e $10 per milione di token in output. Sonnet 4.6 rimane a $3 e $15. La tabella tariffaria di BenchLM, aggiornata il 3 settembre 2026, mostra la stessa suddivisione. Un carico di lavoro di 100 milioni di token in input e 10 milioni di token in output costa $300 su Sonnet 5 e $450 su Sonnet 4.6.
Messo accanto a una 4090 affittata tutto il mese a $248, questo esempio non dice “l’auto-ospitata è sempre più economica”. Dice che le due bollette si incontrano nello stesso vicinato per questo volume. Sonnet 5 con un rapporto input-output di 10:1 costa $30 per 10 milioni di input più 1 milione di output. L’affitto di $248 copre circa otto di quei blocchi: circa 80 milioni di token in input e 8 milioni di token in output. Sopra questo livello, la scheda affittata prende il sopravvento, a patto che tu possa tenerla occupata. Sotto, l’API è la riga più economica e non stai pagando per una GPU inattiva. L’hardware posseduto sostituisce l’affitto con elettricità e deprezzamento. Le strategie attorno a quella bolletta — budget, caching e fallback — sono in ottimizzazione dei costi per sistemi LLM. Il motivo per cui un prezzo per token più basso può ancora essere l’architettura sbagliata è gravità dei dati e lock-in API.
Quando un modello più grande è ancora la scelta giusta
La banda 25–34B è il predefinito per i carichi di lavoro di produzione che si ripetono: agenti di coding, bot di supporto, elaborazione di documenti, estrazione e automazione. È il predefinito sbagliato in alcune situazioni.
- Ragionamento di frontiera su problemi in cui il modello più piccolo ha già fallito in un test accoppiato.
- Prosa in cui la differenza di voce è il prodotto e il volume è basso enough che il prezzo del token è rumore.
- Lavoro che necessita di copertura ampia attraverso più domini specialistici contemporaneamente, dove il modello 27B continua a perdere la stessa classe di fatto.
- Decisioni a basso volume e alto rischio, dove il costo di una risposta sbagliata supera un anno di affitto del modello.
In quei casi, passa a un modello open di classe 70B o a un’API di frontiera, e mantieni gli stessi tre segnali di produzione. Se il modello più grande non sposta il successo delle chiamate agli strumenti, i rifiuti o la P99 nella direzione che ti interessa, la dimensione aggiuntiva non sta comprando nulla che puoi usare.
Come scegliere un punto sul fronte
Usa questo ordine. È più economico scoprire che un modello 27B è sufficiente che scoprire che una scheda da 80 GB era necessaria.
- Parti dal carico di lavoro, non dai pesi open più grandi che puoi scaricare. Istruzioni one-shot e matematica possono iniziare da 8–14B. L’uso multi-step degli strumenti inizia da Qwen3.8-27B se hai 24 GB, o dalla migliore quantizzazione 16 GB che hai già misurato se non ce l’hai.
- Separa i parametri attivi dai parametri residenti. La cifra attiva di 17B di Scout è un’affermazione di calcolo. Il totale di 109B è l’affermazione di VRAM. Budgetizza il secondo numero.
- Quantizza, poi ricontrolla la memoria. Q4_K_M di Qwen3.8-27B è una conversazione da 24 GB, con circa 64K di contesto prima che la scheda sia piena. Esegui
nvidia-smidopo il caricamento, alla lunghezza di contesto che serviresti effettivamente. - Budgetizza il mese, non il token. Confronta 730 ore della GPU che affitteresti con la miscela di input e output che registri già. Se sei sotto il punto di pareggio sopra, resta sull’API fino a quando il volume arriva.
- Decidi sui tuoi compiti. Un’esecuzione accoppiata che registra il successo delle chiamate agli strumenti, il comportamento di rifiuto e la P99 sotto picco è il test che i benchmark pubblici non possono sostituire.
La domanda utile nel 2026 è quali pesi stanno nella scheda, nel contesto e nella bolletta mensile continuando a superare i tuoi compiti. Per molto lavoro agenziale, quel punto è un modello ibrido 27B su una singola GPU da 24 GB. Scout è la stessa idea con memoria data center: meno calcolo per token di quanto suggerisca il totale dei parametri, e nessun sconto sulla VRAM.
Riferimenti
- MindStudio. “Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests.” https://www.mindstudio.ai/blog/qwen-3-27b-local-benchmark
- Qubrid AI. “Qwen3.8-27B Benchmarks: Official and Independent Results.” https://www.qubrid.com/blog/qwen38-27b-benchmarks-official-and-independent-results
- Hardware Corner. “We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need?” https://www.hardware-corner.net/qwen3-8-27b-hardware-tests/
- Locally Uncensored. “How to Run Qwen 3.8 27B Locally: VRAM, Quants and the Template Trap.” https://locallyuncensored.com/blog/how-to-run-qwen-3-8-27b-locally.html
- Malik, Umesh. “Qwen3.8 27B VRAM: how to fit 262K context in 16 GiB, not 64.” https://umesh-malik.com/blog/qwen3-8-27b-vram-kv-cache-math
- Meta AI. “The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.” https://ai.meta.com/blog/llama-4-multimodal-intelligence
- Meta. “Llama 4 model card.” https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
- arXiv. “Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?” giugno 2025. https://arxiv.org/html/2506.12119v1
- Yang, S., Kautz, J., Hatamizadeh, A. “Gated Delta Networks: Improving Mamba2 with Delta Rule.” ICLR 2025. https://jankautz.com/publications/GatedDeltaNet_ICLR25.pdf
- Abdin, M., et al. “Phi-4 Technical Report.” arXiv:2412.08905, dicembre 2024. https://arxiv.org/html/2412.08905v1
- GPU Finder. “RTX 4090 GPU Rental Prices & Live Availability.” Verificato il 18 settembre 2026. https://gpufinder.dev/gpu/rtx-4090
- Anthropic. “What’s new in Claude Sonnet 5” (prezzi: $2 / $10 per milione di token). https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5
- BenchLM. “Claude API pricing.” Aggiornato il 3 settembre 2026. https://benchlm.ai/anthropic/api-pricing
- Future AGI. “Evaluating Cheap Frontier Models in 2026: Substitution Without a Quality Cliff.” https://futureagi.com/blog/evaluating-cheap-frontier-models-2026
- Northflank. “Qwen3.8-27B: Performance, benchmarks, GPU requirements & how to run it.” 17 agosto 2026. https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it