Llm

Instradamento del modello: smetti di usare un unico modello per tutto

Instradamento del modello: smetti di usare un unico modello per tutto

Il modello giusto per il compito giusto.

Eseguire un modello con 70 miliardi di parametri per riassumere un’email di 200 parole è uno spreco. Eseguire un modello da 3 miliardi di parametri per revisionare il codice in produzione è imprudente. La maggior parte dei sistemi si colloca da qualche punto intermedio: ed è qui che entra in gioco il routing dei modelli.

Sistemi di memoria negli assistenti AI

Sistemi di memoria negli assistenti AI

Memoria operativa, strutturata e di recupero per gli assistenti.

La memoria trasforma gli assistenti da sistemi reattivi a sistemi persistenti, ma è anche il luogo in cui molti sistemi degradano silenziosamente. I sondaggi sostengono che la distinzione tra memoria a breve e lungo termine non sia più sufficiente per la memoria dei moderni agenti; OpenAI e gli SDK di LangGraph indicano uno stack più semplice: memoria di lavoro, stato durevole e recupero (retrieval).

Validazione dell'output strutturato degli LLM in Python che regge

Validazione dell'output strutturato degli LLM in Python che regge

Smetti di interpretare le vibrazioni. Convalida i contratti.

La maggior parte dei tutorial sull’output strutturato degli LLM è superficiale. Ti insegnano a chiedere JSON gentilmente e poi sperare che il modello si comporti correttamente. Quello non è convalida. È ottimismo con le parentesi graffe.

Creazione di skill per l'agente Hermes — struttura e migliori pratiche per SKILL.md

Creazione di skill per l'agente Hermes — struttura e migliori pratiche per SKILL.md

Autore Hermes: abilità che si caricano rapidamente e funzionano in modo affidabile

Hermes Agent tratta le skills come il metodo predefinito per insegnare flussi di lavoro ripetibili. La documentazione ufficiale le descrive come documenti di conoscenza on-demand allineati alla specifica aperta agentskills.io, caricati tramite progressive disclosure in modo che il modello veda prima un indice ridotto e richieda le istruzioni complete solo quando un task ne ha effettivamente bisogno.