KI-Systeme: Selbst gehostete Assistenten, RAG und lokale Infrastruktur
Die meisten lokalen KI-Setups beginnen mit einem Modell und einer Laufzeitumgebung.
Sie laden ein quantisiertes Modell herunter, starten es über Ollama oder eine andere Laufzeitumgebung und beginnen mit dem Prompting. Für Experimente ist das mehr als ausreichend. Aber sobald Sie über reine Neugier hinausgehen – sobald Ihnen Speicher, Abrufqualität, Routing-Entscheidungen oder Kostenbewusstsein wichtig sind –, zeigen sich die Grenzen dieser Einfachheit.
Dieser Cluster erkundet einen anderen Ansatz: den KI-Assistenten nicht als einzelne Modellaufrufe zu behandeln, sondern als koordiniertes System.
Diese Unterscheidung mag anfangs subtil erscheinen, sie verändert jedoch grundlegend, wie man über lokale KI denkt.

Was ist ein KI-System?
Ein KI-System ist mehr als nur ein Modell. Es ist eine Orchestrierungsschicht, die Inferenz, Abruf, Speicher und Ausführung verbindet, um etwas zu schaffen, das sich wie ein kohärenter Assistent verhält.
Ein Modell lokal auszuführen ist Infrastrukturarbeit. Einen Assistenten um dieses Modell herum zu gestalten, ist Systemarbeit.
Wenn Sie unsere umfassenderen Guides zu folgenden Themen erkundet haben:
- LLM-Hosting im Jahr 2026: Lokale, selbstgehostete und Cloud-Infrastrukturen im Vergleich
- LLM-Architektur: Systemdesign für produktionsreife KI — Routing, Kostenoptimierung, Sicherheitsmechanismen und Multi-Model-Orchestrierung
- Retrieval-Augmented Generation (RAG) Tutorial: Architektur, Implementierung und Produktionsleitfaden
- Second Brain erklärt für Ingenieure und Wissensarbeiter
- LLM-Leistung im Jahr 2026: Benchmarks, Engpässe & Optimierung
- Observability für KI-Systeme
wissen Sie bereits, dass Inferenz nur eine Schicht des Stacks ist.
Der KI-System-Cluster sitzt auf diesen Schichten. Er ersetzt sie nicht – er kombiniert sie.
Für eine querliegende Übersicht, wie diese Schichten in produktionsreifen Assistenten zusammenwirken – LLM, Speicher, Tools, Routing und Observability, mit OpenClaw und Hermes als Referenzsystemen –, sehen Sie KI-Assistenten-Architektur: LLM, Speicher, Tools, Routing, Observability.
Sobald die Architektur des Assistenten solide ist, besteht der nächste Schritt darin, ihn proaktiv zu machen. Polling-Agenten in KI-Assistenten: 11 Implementierungsmuster beschreibt, wie Hintergrund-Polling-Worker, wettenschlangenbasierte Ausführung, dauerhafte Workflows und semantische LLM-Evaluatoren einen reaktiven Assistenten in einen verwandeln, der selbstständig überwacht, entscheidet und handelt.
Wenn ein einzelner Assistent nicht ausreicht und mehrere Agenten koordinieren müssen, bestimmt die Wahl des Koordinationsmusters alles: Latenz, Fehlertoleranz, Kosten und Debuggbarkeit. Multi-Agent-Orchestrierungsmuster: Ein praktischer Leitfaden behandelt die sechs kanonischen Muster – Orchestrator-Worker, sequenzielle Pipeline, Fan-out, hierarchisch, Schwarm und Mesh – mit spezifischen Ausfallmodi und einem Entscheidungsrahmen für die richtige Architektur.
OpenClaw: Ein selbstgehostetes KI-Assistenten-System
OpenClaw ist ein Open-Source, selbstgehosteter KI-Assistent, der entwickelt wurde, um über Messaging-Plattformen hinweg zu arbeiten, während er auf lokaler Infrastruktur läuft.
Auf praktischer Ebene:
- Nutzt lokale LLM-Laufzeitumgebungen wie Ollama oder vLLM
- Integriert den Abruf über indizierte Dokumente
- Pflegt Speicher über eine einzelne Sitzung hinaus
- Führt Tools und Automatisierungsaufgaben aus
- Kann instrumentiert und beobachtet werden
- Operiert innerhalb von Hardwarebeschränkungen
Es ist nicht nur eine Hülle um ein Modell. Es ist eine Orchestrierungsschicht, die Inferenz, Abruf, Speicher und Ausführung verbindet, um etwas zu schaffen, das sich wie ein kohärenter Assistent verhält.
Einstieg und Architektur:
- OpenClaw Schnellstart-Leitfaden – Docker-basierte Installation unter Verwendung eines lokalen Ollama-Modells oder einer cloudbasierten Claude-Konfiguration
- OpenClaw Systemübersicht – architektonische Erkundung, wie sich OpenClaw von einfacheren lokalen Setups unterscheidet
- NemoClaw Leitfaden für sichere OpenClaw-Betrieb – sicherheitsorientierter OpenClaw-Pfad mit OpenShell-Sandboxing, Politikstufen, gerouteter Inferenz und Day-Two-Operationen
Kontext und Analyse:
- OpenClaw Aufstieg und Fall Zeitstrahl – die Wirtschaftlichkeit hinter dem viralen Anstieg, das Abonnement-Ende im April 2026 und was der Kollaps über KI-Hype-Zyklen offenbart
- OpenClaw vs. Hermes Agent – Sterne, Downloads und Nutzungsdaten – Live-Rangliste von 20 Frameworks mit OpenRouter-Token-Rankings, Paket-Download-Zahlen, Community-Health-Metriken und Suchtrendanalyse
Erweiterung und Konfiguration von OpenClaw:
Plugins erweitern die OpenClaw-Laufzeitumgebung – sie fügen Speicher-Backends, Modellprovider, Kommunikationskanäle, Web-Tools und Observability hinzu. Skills erweitern das Agentenverhalten – sie definieren, wie und wann der Agent diese Fähigkeiten nutzt. Produktionskonfiguration bedeutet, beide zu kombinieren, geformt um die Personen, die das System tatsächlich verwenden.
- OpenClaw Plugins – Ökosystem-Leitfaden und praktische Auswahl – native Plugin-Typen, CLI-Lifecycle, Sicherheitsmechanismen und konkrete Picks für Speicher, Kanäle, Tools und Observability
- OpenClaw Skills-Ökosystem und praktische Produktionspicks – ClawHub-Entdeckung, Installations- und Entfernungsabläufe, rollenbasierte Stacks und die Skills, die 2026 erhalten bleiben sollten
- OpenClaw Produktions-Setup-Muster mit Plugins und Skills – vollständige Plugin- und Skill-Konfigurationen nach Nutzertyp: Entwickler, Automatisierung, Forschung, Support und Wachstum – jeweils mit kombinierten Installationsskripten
Hermes: Ein persistenter Agent mit Skills und Tool-Sandboxing
Hermes Agent ist ein selbstgehosteter, modellagnostischer Assistent, der auf persistenter Operation fokussiert ist: Er kann als langlebiger Prozess laufen, Tools über konfigurierbare Backends ausführen und Workflows über Zeit durch Speicher und wiederverwendbare Skills verbessern.
Auf praktischer Ebene ist Hermes nützlich, wenn Sie folgendes wünschen:
- Einen terminalbasierten Assistenten, der auch in Messaging-Apps integrierbar ist
- Provider-Flexibilität durch OpenAI-kompatible Endpunkte und Modellwechsel
- Tool-Ausführungsgrenzen via lokalen und sandboxierten Backends
- Day-Two-Operationen mit Diagnosen, Logs und Konfigurationshygiene
Hermes-Profile sind vollständig isolierte Umgebungen – jedes mit eigener Konfiguration, Secrets, Speichern, Sitzungen, Skills und Status –, was Profile zur echten Einheit der Produktionsverantwortung macht, nicht den einzelnen Skill.
- Hermes KI-Assistent - Installation, Einrichtung, Workflow und Fehlerbehebung – Installation, Provider-Einrichtung, Workflow-Muster und Fehlerbehebung
- Hermes Agent CLI Cheat Sheet – Befehle, Flags und Slash-Shortcuts – tabellarischer Index von
hermes-Subbefehlen, globalen Flags, Gateway- und Profil-Tooling und häufigen Slash-Shortcuts - Hermes Sprachsteuerung von Ihrem Telefon – mobilorientierter Sprachworkflow für Telegram und Discord, mit STT- und TTS-Provider-Optimierung sowie Fehlerbehebung
- Hermes Agent Speichersystem: Wie persistente KI-Speicher tatsächlich funktioniert – tiefgehender technischer Leitfaden zum zwei-Datei-Kernspeicher, dem Frozen-Snapshot-Muster, allen 8 externen Providern und der Philosophie des begrenzten Speichers
- Hermes KI-Assistent Skills für echte Produktions-Setups – profilbasierte Skill-Architektur für Ingenieure, Forscher, Operatoren und exekutive Workflows
- Hermes Agent Skill-Autoring — SKILL.md Struktur und Best Practices – praktisches
SKILL.md-Layout, Metadaten, bedingte Aktivierung und Fehlerbehebung, wenn Skills aus dem Index verschwinden - Kanban in Hermes Agent für selbstgehostete LLM-Workflows – praktische Kontrollmuster für Dispatcher-Konkurrenz, Abhängigkeitsketten und cron-basierte Batching auf selbstgehosteten Gateways
Persistente Kenntnisse und Speicher
Einige Probleme werden nicht allein durch ein größeres Kontextfenster gelöst – sie benötigen persistente Kenntnisse (Graphen, Ingestion-Pipelines) und Agenten-Speicher-Plugins (Honcho, Mem0, Hindsight und ähnliche Backends), die in Assistenten wie Hermes oder OpenClaw eingebunden sind.
- KI-Systeme Speicher-Hub – Umfang des Speicher-Subclusters plus Links zu Cognee-Leitfäden und Stack-Kontext
- Speichersysteme in KI-Assistenten, die tatsächlich helfen – Cross-Framework-Speicherdesign für Arbeitszustand, strukturierte Fakten und Abrufschichten
- Agenten-Speicher-Provider im Vergleich – Vollständiger Vergleich von Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover und Supermemory für Hermes-ähnliche Integrationen
MCP: Model Context Protocol Server
Das Model Context Protocol (MCP) ist ein offener Standard, der von Anthropic eingeführt wurde, um KI-Sprachmodelle mit externen Datenquellen, Tools und Systemen zu verbinden. Es löst das N×M-Integrationsproblem, indem es eine universelle Schnittstelle bereitstellt – denken Sie daran als USB-C-Anschluss für KI-Anwendungen. Das Erstellen von MCP-Servern ermöglicht es Ihnen, KI-Assistenten mit benutzerdefinierten Integrationen für Dateien, Datenbanken, APIs und aufrufbare Tools zu erweitern, unter Verwendung eines einfachen JSON-RPC-basierten Protokolls über stdio oder HTTP.
- MCP-Server in Go – Protokollarchitektur, JSON-RPC-Nachrichtenstruktur, Fähigkeitsverhandlung, offizielles Go-SDK und ein Schritt-für-Schritt-Tutorial zum Erstellen von MCP-Servern in Go
- MCP-Server in Python erstellen – praktischer Python-Implementierungsleitfaden, der Websuche und Scraping-MCP-Server, stdio- und SSE-Transporte sowie Claude Desktop-Integration abdeckt
A2A: Agent-to-Agent Protocol
Das Agent2Agent Protocol (A2A) ist ein offener Standard für die Kommunikation zwischen unabhängig deployeden KI-Agenten-Systemen. Während MCP einen Agenten mit Tools verbindet, verbindet A2A Agenten mit anderen Agenten – was es ihnen ermöglicht, sich über Agent Cards zu entdecken, Aufgaben und Nachrichten auszutauschen, Fortschritt zu streamen und typisierte Artefakte zurückzugeben. A2A ist für Systeme konzipiert, in denen Agenten von verschiedenen Teams geführt werden, mit verschiedenen Frameworks gebaut oder als separate Services deployed werden, die interoperabel sein müssen.
- Was ist das A2A-Protokoll? Agent Cards und Aufgaben erklärt – Tiefenblick in A2A-Konzepte: Agent Cards, Aufgabenlebenszyklus, Nachrichten, Teile, Artefakte, Streaming, Sicherheit und das Orchestrator-plus-Spezialisten-Muster
- A2A Streaming und asynchrone Aufgaben für langlaufende Agenten-Workflows – Operativer Leitfaden zu SSE-Streaming, Push-Webhooks, input_required human-in-the-loop-Abläufen, Fehlerbehandlung und Observability für Aufgaben, die eine einzelne HTTP-Anfrage überdauern
- A2A vs. MCP: Brauchen KI-Agenten wirklich beide Protokolle? – Praktischer Vergleich der beiden Protokolle: wann MCP allein ausreicht, wann A2A echten Mehrwert bietet und wie das “A2A außen, MCP innen”-Muster im großen Maßstab funktioniert
- Google A2A-Protokoll im Jahr 2026: Adoption, Hype und Realität – Eine gemessene Betrachtung, wo A2A im Jahr 2026 tatsächlich Produktions-Traction hat, was der Hype falsch macht und ein praktischer Entscheidungsrahmen für den Einsatz
Was KI-Systeme unterscheidet
Mehrere Charakteristiken machen KI-Systeme näheres Untersuchen wert.
Modell-Routing als Designentscheidung
Die meisten lokalen Setups standardisieren auf ein Modell. KI-Systeme unterstützen die bewusste Auswahl von Modellen.
Das führt zu Fragen:
- Sollten kleine Anfragen kleinere Modelle verwenden?
- Wann rechtfertigt Reasoning ein größeres Kontextfenster?
- Was ist der Kostenunterschied pro 1.000 Token?
Diese Fragen verbinden sich direkt mit den Leistungszielkonflikten, die in dem LLM-Leistungsleitfaden diskutiert werden, und den Infrastruktur-Entscheidungen, die in dem LLM-Hosting-Leitfaden umrissen sind.
KI-Systeme bringen diese Entscheidungen an die Oberfläche, anstatt sie zu verstecken.
Abruf wird als sich entwickelnde Komponente behandelt
KI-Systeme integrieren Dokumentabruf, aber nicht als simplen “embed and search”-Schritt.
Sie erkennen an:
- Chunk-Größe beeinflusst Recall und Kosten
- Hybrid Search (BM25 + Vektor) kann reinen Dense Retrieval übertreffen
- Reranking verbessert Relevanz auf Kosten der Latenz
- Indexierungsstrategie beeinfligt Speicherverbrauch
Diese Themen stimmen mit den tieferen Architekturüberlegungen überein, die in dem RAG-Tutorial diskutiert werden.
Der Unterschied ist, dass KI-Systeme den Abruf in einen lebendigen Assistenten einbetten, anstatt ihn als isolierte Demo zu präsentieren.
Speicher als Infrastruktur
Stateless LLMs vergessen alles zwischen Sitzungen.
KI-Systeme führen persistente Speicherschichten ein. Das wirft sofort Designfragen auf:
- Was sollte langfristig gespeichert werden?
- Wann sollte Kontext zusammengefasst werden?
- Wie verhindert man Token-Explosion?
- Wie indiziert man Speicher effizient?
Diese Fragen überschneiden sich direkt mit Datenlayer-Überlegungen aus dem Dateninfrastruktur-Leitfaden. Für Hermes Agent spezifisch – begrenzter zwei-Datei-Speicher, Prefix-Caching, externe Plugins – beginnen Sie mit Hermes Agent Speichersystem und dem Cross-Framework-Vergleich Agenten-Speicher-Provider im Vergleich. Der KI-Systeme Speicher-Hub listet verwandte Cognee- und Knowledge-Layer-Leitfäden.
Speicher hört auf, ein Feature zu sein, und wird zu einem Speicherproblem.
Observability ist keine Option
Die meisten lokalen KI-Experimente hören bei “es antwortet” auf.
KI-Systeme machen es möglich zu beobachten:
- Token-Nutzung
- Latenz
- Hardwareauslastung
- Durchsatzmuster
Dies verbindet sich natürlich mit den Monitoring-Prinzipien, die in dem Observability-Leitfaden beschrieben sind.
Wenn KI auf Hardware läuft, sollte sie wie jede andere Workload messbar sein.
Wie es sich anfühlt, sie zu verwenden
Von außen mag ein KI-System immer noch nach einer Chat-Schnittstelle aussehen.
Unter der Oberfläche passiert mehr.
Wenn Sie es bitten, einen lokal gespeicherten technischen Bericht zusammenzufassen:
- Es ruft relevante Dokumentsegmente ab.
- Es wählt ein geeignetes Modell aus.
- Es generiert eine Antwort.
- Es zeichnet Token-Nutzung und Latenz auf.
- Es aktualisiert persistenten Speicher, falls nötig.
Die sichtbare Interaktion bleibt einfach. Das Systemverhalten ist geschichtet.
Dieses geschichtete Verhalten ist es, was ein System von einer Demo unterscheidet.
Wo KI-Systeme im Stack passen
Der KI-System-Cluster sitzt an der Schnittstelle mehrerer Infrastrukturschichten:
- LLM-Hosting: Die Laufzeitschicht, in der Modelle ausgeführt werden (Ollama, vLLM, llama.cpp)
- RAG: Die Abrufschicht, die Kontext und Grounding bereitstellt
- Leistung: Die Messschicht, die Latenz und Durchsatz verfolgt
- Observability: Die Monitoring-Schicht, die Metriken und Kostentracking bereitstellt
- Dateninfrastruktur: Die Speicherschicht, die Speicher und Indizierung handhabt
Das Verständnis dieser Unterscheidung ist nützlich. Selbst ausführen macht den Unterschied klarer.
Für eine minimale lokale Installation mit OpenClaw sehen Sie den OpenClaw Schnellstart-Leitfaden, der eine Docker-basierte Einrichtung unter Verwendung eines lokalen Ollama-Modells oder einer cloudbasierten Claude-Konfiguration durchgeht.
Wenn Ihr Setup von Claude abhängt, klärt diese Richtliniänderung für Agent-Tools, warum API-Abrechnung jetzt für dritte OpenClaw-Workflows erforderlich ist.
Verwandte Ressourcen
A2A: Agent-to-Agent Protocol:
- Was ist das A2A-Protokoll? Agent Cards und Aufgaben erklärt
- A2A vs. MCP: Brauchen KI-Agenten wirklich beide Protokolle?
- Google A2A-Protokoll im Jahr 2026: Adoption, Hype und Realität
MCP-Server:
KI-Assistenten-Leitfäden:
- KI-Assistenten-Architektur: LLM, Speicher, Tools, Routing, Observability
- Multi-Agent-Orchestrierungsmuster: Ein praktischer Leitfaden
- Polling-Agenten in KI-Assistenten: 11 Implementierungsmuster
- OpenClaw Systemübersicht
- OpenClaw Aufstieg und Fall Zeitstrahl
- OpenClaw Schnellstart-Leitfaden
- OpenClaw Plugins – Ökosystem-Leitfaden und praktische Auswahl
- OpenClaw Skills-Ökosystem und praktische Produktionspicks
- OpenClaw Produktions-Setup-Muster mit Plugins und Skills
- Hermes KI-Assistent - Installation, Einrichtung, Workflow und Fehlerbehebung
- Hermes Agent Speichersystem: Wie persistente KI-Speicher tatsächlich funktioniert
- KI-Systeme Speicher-Hub
- Agenten-Speicher-Provider im Vergleich
- Hermes KI-Assistent Skills für echte Produktions-Setups
- Hermes Agent Skill-Autoring — SKILL.md Struktur und Best Practices
Infrastrukturschichten:
- LLM-Hosting im Jahr 2026: Lokale, selbstgehostete und Cloud-Infrastrukturen im Vergleich
- Retrieval-Augmented Generation (RAG) Tutorial: Architektur, Implementierung und Produktionsleitfaden
- LLM-Leistung im Jahr 2026: Benchmarks, Engpässe & Optimierung
- Agentic LLM Inferenzparameter für Qwen und Gemma
- Observability für KI-Systeme
- Dateninfrastruktur für KI-Systeme