Architektur von KI-Assistenten: LLM, Speicher, Werkzeuge, Routing, Observability

Architektur von KI-Assistenten: LLM, Speicher, Werkzeuge, Routing, Observability

Wie seriöse Assistenten tatsächlich entwickelt werden.

Ein produktionsreifes KI-Assistentensystem ist nicht einfach „ein LLM mit einem Prompt“. Es handelt sich um ein System, das Absichten entgegennimmt, den Zustand verwaltet, entscheidet, wann Daten abgerufen oder Aktionen ausgeführt werden sollen, und genügend Laufzeitdetails bereitstellt, um Fehler zu debuggen.

Retrieval vs. Repräsentation in Wissenssystemen

Retrieval vs. Repräsentation in Wissenssystemen

Die Suche ist keine Wissensstruktur

Die meisten modernen Wissenssysteme optimieren die Abrufprozesse (Retrieval), und das ist verständlich. Die Suche ist sichtbar, leicht zu demonstrieren und wirkt fast magisch, wenn sie funktioniert. Frage eingeben, Antwort erhalten.

PKM vs. RAG vs. Wiki vs. Memory-Systeme klar erklärt

PKM vs. RAG vs. Wiki vs. Memory-Systeme klar erklärt

Eine Landkarte moderner Wissenssysteme

PKM, RAG, Wikis, KI-Speichersysteme und nun auch praktische, KI-gestützte Workflows werden oft so diskutiert, als lösten sie dasselbe Problem. Tun sie nicht. Sie alle befassen sich mit Wissen, arbeiten aber auf unterschiedlichen Ebenen:

Second Brain erklärt – für Ingenieure und Wissensarbeiter

Second Brain erklärt – für Ingenieure und Wissensarbeiter

Notizen sind Speicher. Ein zweites Gehirn ist Berechnung.

Informationsüberflutung hat weniger mit der schieren Menge zu tun als vielmehr mit ungelösten Eingaben. Moderne Wissensarbeit hinterlässt eine Spur aus Tabs, Chat-Verläufen, Dokumenten, Hervorhebungen, Code-Fragmenten, Transkripten, Screenshots und halbfertigen Notizen.

Strukturierte Ausgabevalidierung von LLMs in Python, die standhält

Strukturierte Ausgabevalidierung von LLMs in Python, die standhält

Hören Sie auf, auf Vibes zu vertrauen. Validieren Sie Verträge.

Die meisten Tutorials zu „strukturierten Ausgaben“ von LLMs sind wenig ernst gemeint. Sie lehren Sie, höflich um JSON zu bitten und darauf zu hoffen, dass das Modell sich entsprechend verhält. Das ist keine Validierung. Das ist Optimismus mit geschweiften Klammern.

Idempotenz in verteilten Systemen, die tatsächlich funktioniert

Idempotenz in verteilten Systemen, die tatsächlich funktioniert

Duplizierte Seiteneffekte vermeiden

Idempotenz in verteilten Systemen ist die Eigenschaft, die Sie rettet, wenn das Netzwerk lügt, die Warteschlange Wiederholungen versucht, der Client in Panik verfällt und der Operator den Replay-Button betätigt. In Produktionssystemen sind doppelte Zustellungen normal. Doppelte Nebeneffekte sind der Fehler.

Kanban in Hermes Agent für selbst gehostete LLM-Workflows

Kanban in Hermes Agent für selbst gehostete LLM-Workflows

Steuern Sie die Hermes-Kanban-Auslastung auf Ihrem selbst gehosteten LLM.

Der Hermes Agent wird mit einem Kanban-Board und dem Hermes Gateway ausgeliefert. Wenn zu viele Aufgaben auf einmal zugewiesen werden, kann dies Ihr selbst gehostetes LLM überlasten.

Hermes-Agent-Skill-Authoring – SKILL.md-Struktur und Best Practices

Hermes-Agent-Skill-Authoring – SKILL.md-Struktur und Best Practices

Autor Hermes Fähigkeiten, die schnell laden und zuverlässig funktionieren

Hermes Agent behandelt Skills als die Standardmethode, wiederholbare Workflows zu lehren. Die offizielle Dokumentation beschreibt sie als auf Abruf verfügbare Wissensdokumente, die dem offenen agentskills.io-Standard entsprechen und über progressive Offenlegung geladen werden, sodass das Modell zuerst einen kleinen Index sieht und nur dann die vollständigen Anweisungen lädt, wenn eine Aufgabe dies tatsächlich erfordert.

Abonnieren

Neue Beiträge zu Systemen, Infrastruktur und KI-Engineering.