LLM Performance

KV Cache su GPU da 16 GB: far funzionare davvero i contesti lunghi

KV Cache su GPU da 16 GB: far funzionare davvero i contesti lunghi

Perché un contesto di 128K fallisce con 16 GB

Un modello può pubblicizzare una finestra di contesto da 128K eppure fallire a 40K token su una GPU da 16 GB. Il limite architetturale non ha mai promesso che pesi, KV cache, buffer di calcolo e il compositor desktop potessero coesistere sulla stessa scheda.

Speculative Decoding: inferenza degli LLM dal 20% al 50% più veloce

Speculative Decoding: inferenza degli LLM dal 20% al 50% più veloce

Inferenza LLM più veloce senza perdita di qualità: una guida pratica

Un modello da 70B genera un token per passaggio avanti e ogni passaggio ricarica i pesi dalla VRAM, calcola l’attenzione su tutto il contesto e sincronizza la memoria. Tra un token e l’altro, la GPU resta inattiva in attesa che si risolvano le dipendenze sequenziali.

Validazione dell'output strutturato degli LLM in Python che regge

Validazione dell'output strutturato degli LLM in Python che regge

Smetti di interpretare le vibrazioni. Convalida i contratti.

La maggior parte dei tutorial sull’output strutturato degli LLM è superficiale. Ti insegnano a chiedere JSON gentilmente e poi sperare che il modello si comporti correttamente. Quello non è convalida. È ottimismo con le parentesi graffe.

ASIC per LLM e chip di inferenza specializzati (perché sono importanti)

ASIC per LLM e chip di inferenza specializzati (perché sono importanti)

Le ASIC e il silicio personalizzato aumentano la velocità e l'efficienza dell'inferenza dei modelli LLM

Il futuro dell’AI non riguarda solo modelli più intelligenti. Riguarda anche il silicio che corrisponde al modo in cui questi modelli vengono effettivamente serviti. L’hardware specializzato per l’inferenza LLM sta seguendo un percorso simile al passaggio del mining di Bitcoin dalle GPU agli ASIC appositamente progettati, sebbene con vincoli più stringenti poiché i modelli e le ricette di precisione continuano a evolversi.