Sistemi di IA: assistenti self-hosted, RAG e infrastruttura locale
La maggior parte delle configurazioni AI locali inizia con un modello e un runtime.
Scarichi un modello quantizzato, lo avvii tramite Ollama o un altro runtime e inizi a generare prompt. Per fare esperimenti, questo è più che sufficiente. Ma una volta che superi la semplice curiosità — quando ti preoccupi della memoria, della qualità del recupero, delle decisioni di routing o della consapevolezza dei costi — la semplicità inizia a mostrare i suoi limiti.
Questo cluster esplora un approccio diverso: considerare l’assistente AI non come una singola invocazione di modello, ma come un sistema coordinato.
Questa distinzione potrebbe sembrare sottile all’inizio, ma cambia completamente il modo in cui pensi all’AI locale.

Cos’è un Sistema AI?
Un sistema AI è più di un modello. È un livello di orchestrazione che collega inferenza, recupero, memoria ed esecuzione in qualcosa che si comporta come un assistente coerente.
Eseguire un modello localmente è lavoro di infrastruttura. Progettare un assistente attorno a quel modello è lavoro di sistema.
Se hai esplorato le nostre guide più ampie su:
- Hosting LLM nel 2026: Confronto tra Infrastruttura Locale, Self-Hosted e Cloud
- Architettura LLM: Progettazione di Sistemi per AI in Produzione — routing, ottimizzazione dei costi, guardrail e orchestrazione multi-modello
- Tutorial su Retrieval-Augmented Generation (RAG): Architettura, Implementazione e Guida per la Produzione
- Cervello secondario spiegato per ingegneri e lavoratori della conoscenza
- Prestazioni LLM nel 2026: Benchmark, Colli di Bottiglia e Ottimizzazione
- Osservabilità per Sistemi AI
sai già che l’inferenza è solo uno strato dello stack.
Il cluster Sistemi AI si posiziona sopra questi strati. Non li sostituisce — li combina.
Per una mappa trasversale di come questi strati si integrino negli assistenti in produzione — LLM, memoria, tool, routing e osservabilità, con OpenClaw e Hermes come sistemi di riferimento — consulta Architettura Assistente AI: LLM, Memoria, Tool, Routing, Osservabilità.
Una volta che l’architettura dell’assistente è solida, il passo successivo è renderlo proattivo. Agenti di Polling negli Assistenti AI: 11 Pattern di Implementazione copre come i worker di polling in background, l’esecuzione basata su code, i workflow duraturi e gli evaluator LLM semantici trasformino un assistente reattivo in uno che monitora, decide e agisce in autonomia.
Quando un singolo assistente non basta e più agenti devono coordinarsi, la scelta del pattern di coordinamento determina tutto: latenza, tolleranza ai guasti, costi e capacità di debugging. Pattern di Orchestrazione Multi-Agente: Una Guida Pratica copre i sei pattern canonici — orchestrator-worker, pipeline sequenziale, fan-out, gerarchico, swarm e mesh — con specifiche modalità di errore e un framework decisionale per scegliere l’architettura giusta.
OpenClaw: Un Sistema di Assistente AI Self-Hosted
OpenClaw è un assistente AI open-source, self-hosted, progettato per operare su piattaforme di messaggistica mantenendo l’esecuzione su infrastruttura locale.
Su un piano pratico, esso:
- Utilizza runtime LLM locali come Ollama o vLLM
- Integra il recupero su documenti indicizzati
- Mantiene memoria oltre una singola sessione
- Esegue tool e task di automazione
- Può essere instrumentato e osservato
- Opera entro vincoli hardware
Non è solo un wrapper attorno a un modello. È un livello di orchestrazione che collega inferenza, recupero, memoria ed esecuzione in qualcosa che si comporta come un assistente coerente.
Iniziare e architettura:
- Guida rapida di avvio per OpenClaw — installazione basata su Docker utilizzando un modello Ollama locale o una configurazione cloud di Claude
- Panoramica del sistema OpenClaw — esplorazione architettonica di come OpenClaw si differenzia dalle configurazioni locali più semplici
- Guida a NemoClaw per operazioni sicure di OpenClaw — percorso security-first per OpenClaw con sandboxing OpenShell, tier di policy, inferenza instradata e operazioni di secondo livello
Contesto e analisi:
- Timeline della crescita e del declino di OpenClaw — l’economia dietro il picco virale, il taglio dell’abbonamento di aprile 2026 e ciò che il crollo rivela sui cicli di hype AI
- OpenClaw vs Hermes Agent — stelle, download e dati di utilizzo — classifica live di 20 framework con classifiche token OpenRouter, conteggi download package, metriche di salute della community e analisi delle tendenze di ricerca
Estensione e configurazione di OpenClaw:
I plugin estendono il runtime di OpenClaw — aggiungendo backend di memoria, provider di modelli, canali di comunicazione, tool web e osservabilità. Le skill estendono il comportamento dell’agente — definendo come e quando l’agente usa queste capacità. La configurazione di produzione significa combinare entrambi, modellati attorno a chi sta effettivamente usando il sistema.
- Plugin OpenClaw — Guida all’Ecosistema e Scelte Pratiche — tipi di plugin nativi, ciclo di vita CLI, rail di sicurezza e scelte concrete per memoria, canali, tool e osservabilità
- Ecosistema delle Skill OpenClaw e Scelte Pratiche per la Produzione — scoperta su ClawHub, flussi di installazione e rimozione, stack per ruolo e le skill da mantenere nel 2026
- Pattern di Setup di Produzione di OpenClaw con Plugin e Skill — configurazioni complete di plugin e skill per tipo di utente: sviluppatore, automazione, ricerca, supporto e crescita — ciascuna con script di installazione combinati
Hermes: Un Agente Persistente con Skill e Sandboxing dei Tool
Hermes Agent è un assistente self-hosted, agnostico rispetto al modello, focalizzato sull’operazione persistente: può essere eseguito come processo longevo, eseguire tool attraverso backend configurabili e migliorare i workflow nel tempo tramite memoria e skill riutilizzabili.
Su un piano pratico, Hermes è utile quando vuoi:
- Un assistente terminal-first che possa anche collegarsi ad app di messaggistica
- Flessibilità del provider tramite endpoint compatibili con OpenAI e cambio di modello
- Confini di esecuzione dei tool tramite backend locali e sandboxed
- Operazioni di secondo livello con diagnostiche, log e igiene della configurazione
I profili Hermes sono ambienti completamente isolati — ciascuno con la propria configurazione, segreti, memorie, sessioni, skill e stato — rendendo i profili la vera unità di proprietà in produzione, non la singola skill.
- Hermes AI Assistant - Installazione, Setup, Workflow e Troubleshooting — installazione, setup del provider, pattern di workflow e troubleshooting
- Scheda comandi CLI per Hermes Agent — comandi, flag e scorciatoie slash — indice tabellare dei sotto-comandi
hermes, flag globali, tooling per gateway e profili e comuni scorciatoie slash - Setup di Hermes Agent Headless Server e Desktop Remoto — topologia di deployment headless per l’accesso desktop remoto via LAN e VPN
- Controllo Vocale di Hermes dal tuo Telefono — workflow vocale mobile-first per Telegram e Discord, con tuning dei provider STT e TTS oltre al troubleshooting
- Sistema di Memoria di Hermes Agent: Come Funziona Davvero la Memoria AI Persistente — guida tecnica approfondita alla memoria core a due file, pattern di snapshot congelato, tutti gli 8 provider esterni e la filosofia della memoria limitata
- Skill per Hermes AI Assistant per Setup di Produzione Reali — architettura di skill profile-first per ingegneri, ricercatori, operatori e workflow esecutivi
- Creazione di Skill Hermes Agent — Struttura SKILL.md e Best Practice — layout pratico di
SKILL.md, metadati, attivazione condizionale e troubleshooting quando le skill scompaiono dall’indice - Kanban in Hermes Agent per Workflow LLM Self-Hosted — pattern di controllo pratici per la concorrenza del dispatcher, catene di dipendenza e batching cron-based su gateway self-hosted
- Come Migrare da OpenClaw a Hermes Agent in Sicurezza — runbook di switch a fasi che copre dry-run di
hermes claw migrate, policy di conflitto, gestione dei segreti, passaggio dei messaggi e rollback
Conoscenza e memoria persistenti
Alcuni problemi non sono risolti da una finestra di contesto più grande da soli — hanno bisogno di conoscenza persistente (giri, pipeline di ingestione) e plugin di memoria per agenti (Honcho, Mem0, Hindsight e backend simili) integrati in assistenti come Hermes o OpenClaw.
- Hub della Memoria per Sistemi AI — ambito del sottocluster di memoria oltre a link alle guide Cognee e contesto dello stack
- Sistemi di Memoria negli Assistenti AI che Aiutano Davvero — progettazione di memoria cross-framework per stato operativo, fatti strutturati e livelli di recupero
- Confronto dei provider di memoria per agenti — confronto completo di Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover e Supermemory per integrazioni in stile Hermes
MCP: Server del Protocollo di Contesto dei Modelli
Il Model Context Protocol (MCP) è uno standard aperto introdotto da Anthropic per collegare i modelli linguistici AI a fonti di dati esterne, tool e sistemi. Risolve il problema di integrazione N×M fornendo un’interfaccia universale — pensalo come una porta USB-C per le applicazioni AI. Costruire server MCP ti permette di estendere gli assistenti AI con integrazioni personalizzate per file, database, API e tool chiamabili, utilizzando un semplice protocollo basato su JSON-RPC su stdio o HTTP.
- Skill per Agenti vs Server MCP: Framework Decisionale — framework decisionale pratico per quando usare skill, quando costruire server MCP e come il pattern di server sottile combina entrambi
- Server MCP in Go — architettura del protocollo, struttura dei messaggi JSON-RPC, negoziazione delle capacità, SDK Go ufficiale e un tutorial passo-passo per costruire server MCP in Go
- Costruire Server MCP in Python — guida pratica all’implementazione in Python che copre server MCP per ricerca web e scraping, transport stdio e SSE, e integrazione con Claude Desktop
A2A: Protocollo Agent-to-Agent
Il Protocollo Agent2Agent (A2A) è uno standard aperto per la comunicazione tra sistemi di agenti AI indipendentemente distribuiti. Dove MCP collega un agente ai tool, A2A collega agenti ad altri agenti — permettendogli di scoprire l’uno l’altro tramite Agent Cards, scambiare task e messaggi, trasmettere progressi e restituire artefatti tipizzati. A2A è progettato per sistemi in cui gli agenti sono posseduti da diverse team, costruiti con framework diversi o distribuiti come servizi separati che devono interoperare.
- Cos’è il Protocollo A2A? Spiegazione di Agent Cards e Task — analisi approfondita dei concetti A2A: Agent Cards, ciclo di vita dei task, messaggi, parti, artefatti, streaming, sicurezza e il pattern orchestratore-più-specialisti
- Streaming A2A e Task Asincroni per Workflow di Agenti a Lungo Andamento — guida operativa allo streaming SSE, webhook push, flussi human-in-the-loop input_required, gestione degli errori e osservabilità per task che sopravvivono a una singola richiesta HTTP
- A2A vs MCP: Gli Agenti AI Hanno Davvero Bisogno di Entrambi i Protocolli? — confronto pratico dei due protocolli: quando MCP da solo è sufficiente, quando A2A aggiunge valore reale e come il pattern “A2A fuori, MCP dentro” funziona su scala
- Protocollo A2A di Google nel 2026: Adozione, Hype e Realtà — uno sguardo misurato su dove A2A ha effettivamente trazione in produzione nel 2026, cosa l’hype sbaglia e un framework decisionale pratico per quando usarlo
Cosa Rende Diversi i Sistemi AI
Diverse caratteristiche rendono i sistemi AI degni di un esame più approfondito.
Il Routing dei Modelli come Scelta di Design
La maggior parte delle configurazioni locali si predefinisce su un modello. I sistemi AI supportano la selezione dei modelli in modo intenzionale.
Questo introduce domande:
- I piccoli request dovrebbero usare modelli più piccoli?
- Quando il ragionamento giustifica una finestra di contesto più grande?
- Qual è la differenza di costo per 1.000 token?
Queste domande si collegano direttamente ai compromessi di prestazione discussi nella guida alle prestazioni LLM e alle decisioni infrastrutturali delineate nella guida all’hosting LLM.
I sistemi AI rendono visibili queste decisioni invece di nasconderle.
Il Recupero è Trattato come un Componente Evolutivo
I sistemi AI integrano il recupero dei documenti, ma non come un passo semplistico di “embed e cerca”.
Riconoscono:
- La dimensione dei chunk influisce sul recall e sui costi
- La ricerca ibrida (BM25 + vettoriale) può superare il recupero denso puro
- Il reranking migliora la rilevanza a costo di latenza
- La strategia di indicizzazione impatta il consumo di memoria
Questi temi si allineano alle considerazioni architettoniche più profonde discusse nel tutorial RAG.
La differenza è che i sistemi AI integrano il recupero in un assistente vivente piuttosto che presentarlo come una demo isolata.
La Memoria come Infrastruttura
Gli LLM stateless dimenticano tutto tra le sessioni.
I sistemi AI introducono livelli di memoria persistente. Questo solleva immediatamente domande di design:
- Cosa dovrebbe essere conservato a lungo termine?
- Quando il contesto dovrebbe essere riassunto?
- Come si previene l’esplosione dei token?
- Come si indicizza la memoria in modo efficiente?
Queste domande intersecano direttamente le considerazioni dello strato dati della guida all’infrastruttura dati. Per Hermes Agent specificamente — memoria a due file limitata, prefix caching, plugin esterni — iniziare con Sistema di Memoria di Hermes Agent e il confronto cross-framework Confronto dei provider di memoria per agenti. L’Hub della Memoria per Sistemi AI elenca le guide correlate di Cognee e dello strato di conoscenza.
La memoria smette di essere una funzione e diventa un problema di storage.
L’Osservabilità Non è Opzionale
La maggior parte degli esperimenti AI locali si ferma a “risponde”.
I sistemi AI rendono possibile osservare:
- Utilizzo dei token
- Latenza
- Utilizzo dell’hardware
- Pattern di throughput
Questo si collega naturalmente con i principi di monitoraggio descritti nella guida all’osservabilità.
Se l’AI gira su hardware, dovrebbe essere misurabile come qualsiasi altro workload.
Come Si Fa a Usarlo
Dall’esterno, un sistema AI potrebbe sembrare ancora un’interfaccia di chat.
Sotto la superficie, succede di più.
Se gli chiedi di riassumere un rapporto tecnico archiviato localmente:
- Recupera segmenti di documento rilevanti.
- Seleziona un modello appropriato.
- Genera una risposta.
- Registra l’utilizzo dei token e la latenza.
- Aggiorna la memoria persistente se necessario.
L’interazione visibile rimane semplice. Il comportamento del sistema è a strati.
Questo comportamento a strati è ciò che differenzia un sistema da una demo.
Dove i Sistemi AI Si Inseriscono nello Stack
Il cluster Sistemi AI si posiziona all’intersezione di diversi strati infrastrutturali:
- Hosting LLM: Lo strato di runtime dove i modelli si eseguono (Ollama, vLLM, llama.cpp)
- RAG: Lo strato di recupero che fornisce contesto e grounding
- Prestazioni: Lo strato di misurazione che traccia latenza e throughput
- Osservabilità: Lo strato di monitoraggio che fornisce metriche e tracciamento dei costi
- Infrastruttura Dati: Lo strato di storage che gestisce memoria e indicizzazione
Capire quella distinzione è utile. Eseguirlo da soli rende la differenza più chiara.
Per un’installazione locale minima con OpenClaw, consulta la guida rapida di avvio per OpenClaw, che spiega un setup basato su Docker utilizzando un modello Ollama locale o una configurazione cloud di Claude.
Se la tua configurazione dipende da Claude, questo cambio di policy per i tool degli agenti chiarisce perché la fatturazione via API è ora richiesta per i workflow di terze parti di OpenClaw.
Risorse Correlate
A2A: Protocollo Agent-to-Agent:
- Cos’è il Protocollo A2A? Spiegazione di Agent Cards e Task
- A2A vs MCP: Gli Agenti AI Hanno Davvero Bisogno di Entrambi i Protocolli?
- Protocollo A2A di Google nel 2026: Adozione, Hype e Realtà
Server MCP:
Guide per assistenti AI:
- Architettura Assistente AI: LLM, Memoria, Tool, Routing, Osservabilità
- Pattern di Orchestrazione Multi-Agente: Una Guida Pratica
- Agenti di Polling negli Assistenti AI: 11 Pattern di Implementazione
- Panoramica del sistema OpenClaw
- Timeline della crescita e del declino di OpenClaw
- Guida rapida di avvio per OpenClaw
- Plugin OpenClaw — Guida all’Ecosistema e Scelte Pratiche
- Ecosistema delle Skill OpenClaw e Scelte Pratiche per la Produzione
- Pattern di Setup di Produzione di OpenClaw con Plugin e Skill
- Hermes AI Assistant - Installazione, Setup, Workflow e Troubleshooting
- Sistema di Memoria di Hermes Agent: Come Funziona Davvero la Memoria AI Persistente
- Hub della Memoria per Sistemi AI
- Confronto dei provider di memoria per agenti
- Skill per Hermes AI Assistant per Setup di Produzione Reali
- Creazione di Skill Hermes Agent — Struttura SKILL.md e Best Practice
Strati infrastrutturali:
- Hosting LLM nel 2026: Confronto tra Infrastruttura Locale, Self-Hosted e Cloud
- Tutorial su Retrieval-Augmented Generation (RAG): Architettura, Implementazione e Guida per la Produzione
- Prestazioni LLM nel 2026: Benchmark, Colli di Bottiglia e Ottimizzazione
- Parametri di inferenza LLM agentici per Qwen e Gemma
- Osservabilità per Sistemi AI
- Infrastruttura Dati per Sistemi AI