Die effiziente Frontiere offener Modelle: Den Sweet Spot für 2026 finden

Die effiziente Frontiere offener Modelle: Den Sweet Spot für 2026 finden

Der ideale Bereich für offene LLMs im Jahr 2026: rund 30 Mrd. Parameter.

Im September 2026 liegt die effiziente Frontier der offenen Modelle zwischen 25 Milliarden und 34 Milliarden Parametern: nahezu Frontier-nahes Agenten-Work auf einer einzigen 24-GB-GPU, mit einem Bruchteil der Hardware von 70B-Klasse.

Selbstverstärkende Gedächtnisschleifen in KI-Agenten: Ursachen und Lösungen

Selbstverstärkende Gedächtnisschleifen in KI-Agenten: Ursachen und Lösungen

„Wenn erinnerte Schlüsse zu neuen Belegen werden.“

Persistenter Speicher verwandelt einen Agenten aus einem Werkzeug, das bei jedem neuen Dialog seine Kontextinformationen erklären muss, in ein System, das Kontext über die Zeit trägt – aber er öffnet dabei einen Fehlzustand, den stateless Chat vermeidet: Eine Interpretation kann zum Gedächtnisinhalt werden, als Fakt abgerufen werden und eine stärkere Version von sich selbst rechtfertigen.

Mnemosyne für den Hermes-Agenten: Schnellstart für lokale Erinnerungen

Mnemosyne für den Hermes-Agenten: Schnellstart für lokale Erinnerungen

Lokaler Hermes-Speicher mit kontrollierten Schreibvorgängen.

Mnemosyne ist ein lokalzenterter Gedächtnisanbieter für den Hermes Agent, der Arbeitsgedächtnis, strukturierte Fakten, zeitliche Daten und episodische Verläufe in lokalen SQLite-Datenbanken speichert – ohne gehosteten Service, ohne zwingende Netzwerkaufrufe und mit ungewöhnlich granularer Steuermöglichkeit beim Schreiben.

OpenSpec abgelehnte Vorschläge: Eine Konvention für die Entscheidungsgeschichte

OpenSpec abgelehnte Vorschläge: Eine Konvention für die Entscheidungsgeschichte

Kein Ablehnungszustand. Hier ist der Workaround.

Ein Agent, der vor sechs Monaten „Persistenz in eine Shared Library verlagern“ vorgeschlagen und umgesetzt hat, wird dieses Vorschlag im nächsten Quartal wieder gern machen, es sei denn, etwas Dauerhaftes teilt ihm mit, dass diese Idee bereits untersucht und abgelehnt wurde – und OpenSpec verfügt heute über keinen eingebauten Zustand dafür.

OpenSpec-Einstieg: Installation, Workflow und häufige Fehlerquellen

OpenSpec-Einstieg: Installation, Workflow und häufige Fehlerquellen

Spezifikationen als Deltas, nicht als 40-seitiges PRD.

OpenSpec ist eine kostenlose, Open-Source-CLI von Fission AI, die sicherstellt, dass Sie und Ihr Coding-Agent sich vor dem Schreiben von Code über eine Änderung in klarem Markdown einigen, ohne die phasenbasierte Formalität schwerer, spezifikationsgetriebener Frameworks.

So migrieren Sie sicher von OpenClaw auf Hermes Agent

So migrieren Sie sicher von OpenClaw auf Hermes Agent

Ein sicheres Cutover jenseits des einzeiligen Imports

Die Migration eines KI-Assistenten unterscheidet sich grundlegend vom einfachen Kopieren einer Anwendungs-Konfiguration. Die eigentliche Herausforderung besteht darin, Identität, Gedächtnis, Tool-Verhalten, geplante Aufgaben und den Messaging-Zugriff so zu erhalten, dass nicht zwei Gateways als derselbe Bot agieren.

KV-Cache auf 16-GB-GPUs: Lange Kontexte wirklich unterbringen

KV-Cache auf 16-GB-GPUs: Lange Kontexte wirklich unterbringen

Warum 128K Kontext auf 16 GB scheitert

Ein Modell kann einen 128K-Kontextfenster bewerben und trotzdem bei 40K Tokens auf einer 16-GB-GPU scheitern. Die architektonische Obergrenze hat nie versprochen, dass Modellgewichte, KV-Cache, Rechenspeicher und der Desktop-Compositor gleichzeitig auf Ihrer Grafikkarte Platz finden würden.

Was kommt nach LLMs? Mamba, Diffusion und World Models

Was kommt nach LLMs? Mamba, Diffusion und World Models

Was folgt auf LLMs? Das Zeitalter nach den Transformer-Architekturen.

Der KI-Hype folgt einem Rhythmus: In etwa dreijährigen Abständen wird die Architektur, auf die alle wetten, durch etwas Neues ersetzt. Der nächste Wandel formiert sich bereits in Forschungslaboren.

Agent-Fähigkeiten vs. MCP-Server: Entscheidungsrahmen

Agent-Fähigkeiten vs. MCP-Server: Entscheidungsrahmen

Fertigkeit, MCP-Server oder beides?

Agent Skills und MCP-Server werden oft als konkurrierende Ansätze zur Erweiterung eines KI-Agenten dargestellt. Diese Einordnung ist falsch: Eine Skill lehrt den Agenten, wie er arbeitet, während ein MCP-Server ihm kontrollierten Zugriff auf live Funktionen gewährt.

Superpowers Quickstart: Installation, Workflow und Test

Superpowers Quickstart: Installation, Workflow und Test

Erzwungene SDD-Funktionen, installiert mit einem einzigen Befehl.

Superpowers bündelt eine vollständige, spezifikationsteilgesteuerte Methodik in installierbare Claude-Skills, erzwinge Brainstorming, Planung, Subagent-gesteuerte Implementierung und strenges TDD, anstatt diese Struktur Ihnen zu überlassen.

Pi Coding Agent im Test: Minimale, anpassbare KI-CLI zum Programmieren

Pi Coding Agent im Test: Minimale, anpassbare KI-CLI zum Programmieren

Ein kleiner Coding-Agent, der darauf ausgelegt ist, von Ihnen geformt zu werden.

Pi Coding Agent ist ein minimalistisches, quelloffenes Terminal-Coding-Harness, das mit vier Standard-Tools ausgeliefert wird und das meiste Verhalten an Erweiterungen, Skills und Ihren eigenen Workflow überlässt.

GFM vs. CommonMark vs. Pandoc Markdown: Ein Syntax-Vergleich

GFM vs. CommonMark vs. Pandoc Markdown: Ein Syntax-Vergleich

Wissen Sie, welche Markdown-Funktionen sicher portabel sind

Markdown sieht auf den ersten Blick aus wie eine einzige Sprache, bis dieselbe Datei auf GitHub, Hugo, Obsidian oder Pandoc unterschiedlich gerendert wird. Und das Problem ist nicht, dass Markdown unzuverlässig wäre.

Datengravitation: Die echten Kosten der API-first-KI

Datengravitation: Die echten Kosten der API-first-KI

Warum Ihr KI-Stack jeden Monat klebriger wird.

Jeder API-Aufruf fühlt sich wie eine simple Transaktion an – bis genug von ihnen akkumuliert sind, sodass Ihre Feinabstimmungsdaten, Bewertungsumgebungen und Tool-Schemata alle um einen einzigen Anbieter herum geformt werden, und der Wechsel keine bloße Routing-Änderung mehr ist.

Abonnieren

Neue Beiträge zu Systemen, Infrastruktur und KI-Engineering.