Demnächst
Was ist ein Agent Harness und warum der WhatsApp-Support einen braucht
Die meiste KI im Kundenmessaging funktioniert nach dem Prinzip: eine Frage, eine Antwort. Ein Agent Harness macht aus einem Sprachmodell etwas, das einen Fall tatsächlich bearbeiten kann: planen, Tools nutzen, die eigene Arbeit prüfen und sich erinnern. Hier lesen Sie, was das bedeutet, welche Harnesses es heute gibt und wie sie zu MonoChat kommen.
Oder starten Sie mit $150 Guthaben – genug für einen ersten Monat Growth
Veröffentlicht:
Im vergangenen Jahr hat sich die Diskussion rund um KI still und leise verschoben: weg von den Modellen, hin zu dem, was sie umgibt. Dasselbe Modell kann ein Chatbot sein, der eine einzelne Nachricht beantwortet, oder ein Agent, der ein Lieferproblem über drei Systeme und zwei Tage hinweg löst. Der Unterschied liegt nicht im Modell, sondern im Harness, dem Ausführungsrahmen rund um das Modell.
Dieser Artikel erklärt das Konzept verständlich, vergleicht die Harnesses, die Sie heute einsetzen können, und zeigt, was wir in MonoChat einbauen, damit Unternehmen einen solchen Agenten auf WhatsApp, Instagram, im Webchat und auf allen anderen Kanälen ihres Posteingangs betreiben können.
Was ist ein Agent Harness?
Ein Agent Harness ist die Softwareschicht, die ein großes Sprachmodell umschließt und es handeln lässt, statt nur zu antworten. Das Modell denkt nach und entscheidet, was als Nächstes zu tun ist. Der Harness führt diese Entscheidung aus, gibt das Ergebnis an das Modell zurück und wiederholt das, bis die Aufgabe erledigt ist. Kurz gesagt: Agent = Modell + Harness.
Der Begriff hat sich durchgesetzt, als Teams bemerkten, dass Coding-Agenten wie Claude Code und Codex ihre Zuverlässigkeit zu einem großen Teil dieser umgebenden Schicht verdanken und nicht allein dem Modell. Anthropic, OpenAI, Google und Microsoft bieten ihre Harnesses inzwischen als Produkte an, auf denen Entwickler aufbauen können.
Woraus ein Harness besteht
- Die Schleife: Nachdenken, handeln, beobachten, wiederholen. Der Harness macht weiter, bis die Aufgabe erledigt ist oder ein Mensch gebraucht wird.
- Tools: Funktionen, die das Modell aufrufen darf: eine Bestellung prüfen, eine Buchung nachschlagen, eine Erstattung auslösen, eine Wissensdatenbank durchsuchen. Häufig über MCP angebunden.
- Gedächtnis und Zustand: Was bisher in diesem Fall passiert ist, was der Kunde bevorzugt und was bereits versucht wurde, festgehalten über Nachrichten und Sitzungen hinweg.
- Kontextmanagement: Die Entscheidung, was das Modell in jedem Schritt sieht, und das Zusammenfassen (Compaction) langer Verläufe, damit das Wichtige im Blick bleibt.
- Leitplanken und Freigaben: Berechtigungen, Richtlinien und menschliche Kontrollpunkte für Aktionen, die Geld kosten oder sich nicht rückgängig machen lassen.
- Sandbox und Dateien: Ein isolierter Arbeitsbereich, in dem der Agent Code ausführen, ein Dokument vorbereiten oder ein Angebot berechnen kann, ohne Live-Systeme anzutasten.
- Tracing und Evaluierung: Ein Protokoll jedes Schritts und jedes Tool-Aufrufs, damit Teams nachvollziehen können, warum der Agent so gehandelt hat, und ihn über viele Durchläufe hinweg messen können.
Inference oder Harness: Was ist der Unterschied?
Inference ist ein einzelner Aufruf eines Modells: Sie senden einen Prompt, das Modell liefert Text zurück, und der Austausch ist beendet. Das ist schnell, günstig und berechenbar und für viele Aufgaben genau das Richtige, etwa um eine Nachricht zu klassifizieren, eine Antwort zu entwerfen oder ein Gespräch zusammenzufassen.
Ein Harness führt viele Inference-Aufrufe in einer Schleife aus und ergänzt alles, was darum herum nötig ist: Tools, Gedächtnis, Prüfungen und Grenzen. Er ist langsamer und verbraucht pro Aufgabe mehr Tokens, kann dafür aber Arbeit abschließen, die mehrere Schritte, externe Daten oder eine Entscheidung unterwegs erfordert.
| KI-Inference | Agent Harness | |
|---|---|---|
| Was es ist | Eine Anfrage an ein Modell, eine Antwort | Eine Schleife um das Modell, die plant, handelt und prüft |
| Schritte pro Aufgabe | Einer | So viele, wie die Aufgabe braucht, innerhalb der von Ihnen gesetzten Grenzen |
| Tools und Systeme | Optional, meist ein einzelner Funktionsaufruf | Viele Tools, je nach Fall aufgerufen und verkettet |
| Gedächtnis | Nur das, was im Prompt steht | Fallverlauf und Zustand, festgehalten über Schritte und Sitzungen hinweg |
| Wenn etwas schiefgeht | Gibt zurück, was es erzeugt hat | Erkennt den Fehler, versucht es erneut oder fragt einen Menschen |
| Ideal für | Klassifizieren, Entwerfen, Zusammenfassen, einzelne Antworten | Fälle lösen, mehrstufige Anfragen, Nachverfolgung über Tage |
| Kosten und Tempo | Niedrigste Kosten, nahezu sofort | Höherer Token-Verbrauch, Sekunden bis Minuten pro Aufgabe |
In der Praxis setzen gute Teams beides ein: Inference für schnelle, klar umrissene Schritte und einen Harness dort, wo die Arbeit wirklich mehrere Schritte erfordert.
Was ein Harness im WhatsApp-Kundenservice verändert
Im Kundenmessaging zeigt sich der Unterschied zwischen Beantworten und Lösen am deutlichsten. Ein Kunde schreibt „Meine Bestellung ist nicht angekommen“ und erwartet, dass das Problem gelöst wird, nicht erklärt.
Fälle werden gelöst, nicht nur beantwortet
Der Agent kann die Bestellung nachschlagen, beim Versanddienstleister nachsehen, feststellen, dass das Paket festhängt, eine Reklamation anlegen und im selben Gespräch Ersatz anbieten.
Er prüft, bevor er etwas zusagt
Lagerbestand, Preise, freie Termine und Richtlinien werden im Moment der Antwort in Ihren Systemen geprüft, statt aus Trainingsdaten geraten zu werden.
Er erinnert sich an den Fall
Meldet sich der Kunde morgen wieder, weiß der Agent, was bereits versucht und was zugesagt wurde, auch nachdem das 24-Stunden-Fenster von WhatsApp geschlossen ist.
Er bleibt über die Zeit dran
Länger laufende Aufgaben, etwa das Warten auf eine Rückerstattung oder ein Ersatzteil, können weiterlaufen und den Kunden benachrichtigen, sobald sich etwas ändert, mit freigegebenen Vorlagen, wo WhatsApp diese verlangt.
Menschen behalten die Kontrolle
Erstattungen über einem Limit, Stornierungen oder alles Sensible warten auf die Freigabe durch ein Teammitglied, und bei der Übergabe an einen Menschen bleibt der komplette Verlauf erhalten.
Jeder Schritt ist sichtbar
Tool-Aufrufe und Entscheidungen werden protokolliert, sodass Supervisoren nachvollziehen können, warum der Agent gehandelt hat, und die Anweisungen verbessern können.
Ein Beispiel: eine Retoure über WhatsApp
- Die Kundin schickt ein Foto eines beschädigten Artikels und bittet um eine Rücksendung.
- Der Agent findet die Bestellung, prüft, ob die Rückgabefrist noch läuft, und wertet das Foto aus.
- Er legt die Retoure in Ihrem E-Commerce-System an und bucht für den nächsten Tag eine Abholung durch den Kurierdienst.
- Die Erstattung liegt über dem automatischen Limit, also bittet er ein Teammitglied, sie direkt im Posteingang freizugeben.
- Nach der Freigabe bestätigt er der Kundin alles, und zwei Tage später, wenn der Kurier das Paket scannt, sendet er die Bestätigung der Erstattung.
Mit reiner Inference ist das ein Chatbot, der die Rückgaberichtlinie erklärt. Mit einem Harness ist es die Retoure selbst.
Die Agent Harnesses, die Sie heute nutzen können
Mehrere Unternehmen und Open-Source-Projekte bieten inzwischen einen Harness an, auf dem Sie aufbauen können. Sie unterscheiden sich darin, wer sie hostet, welche Modelle sie ausführen und wie viel sie ab Werk mitbringen.
| Harness | Von | Hosting und Lizenz | Modelle | Highlights |
|---|---|---|---|---|
| Claude Agent SDK | Anthropic | Bibliothek (Python, TypeScript) | Claude | Der Harness hinter Claude Code: Tools, MCP, Sub-Agenten, Skills, Context Compaction, Berechtigungen |
| Claude Managed Agents | Anthropic | Gehostete API (Public Beta seit April 2026) | Claude | Anthropic betreibt die Schleife: Ausführung in der Sandbox, lang laufende Sitzungen, Multi-Agent-Arbeit, Tracing |
| OpenAI Agents SDK | OpenAI | Open Source, MIT (Python zuerst) | OpenAI-Modelle, andere über Adapter | Sandboxes verschiedener Anbieter, Gedächtnis, MCP, Skills, AGENTS.md, fortsetzbare Durchläufe |
| Codex | OpenAI | CLI als Open Source (Apache 2.0) plus Cloud | OpenAI-Modelle | Harness für Coding-Agenten mit einem SDK, um ihn aus eigenen Services heraus zu betreiben |
| Agent Development Kit (ADK) | Open Source, Apache 2.0 (Python, Java, Go, TypeScript) | Standardmäßig Gemini, modellunabhängig | Multi-Agent-Hierarchien, MCP, Agent2Agent-Protokoll (A2A), integrierte Evaluierung | |
| Agent Framework | Microsoft | Open Source, MIT (Python, .NET) | Azure OpenAI, OpenAI, Anthropic und weitere | Harness stabil seit Juli 2026: Tool-Schleife, Verlauf, Compaction, Skills, Freigaben, OpenTelemetry |
| Deep Agents | LangChain | Open Source, MIT | Modellunabhängig | Planung, Sub-Agenten, Dateisystem und Context Engineering auf Basis von LangGraph |
| Pi | Earendil Works | Open Source, MIT | Jeder Anbieter, eigener API-Schlüssel | Bewusst minimaler Kern (Lesen, Schreiben, Bearbeiten, Shell), erweiterbar mit teilbaren Skills |
| Mastra | Mastra | Open Source (TypeScript) | Modellunabhängig | Agenten mit persistenten Threads, Tool-Freigaben und einem lokalen Studio |
| OpenCode | OpenCode | Open Source, MIT | Modellunabhängig | Plan- und Build-Agenten, SDK, Terminal und Desktop |
Die Details ändern sich schnell; den aktuellen Stand finden Sie in der Dokumentation des jeweiligen Projekts. Produktnamen und Logos gehören ihren jeweiligen Inhabern.
In diesem Artikel verglichene Harnesses
Und was ist mit Metas eigenem Business Agent?
2026 hat Meta mit Meta Business Agent einen eigenen KI-Agenten für WhatsApp, Instagram und Messenger eingeführt. Im Grunde ist das ein Harness, den Meta selbst entwickelt und betreibt: Er antwortet auf Basis Ihrer Inhalte, ruft angebundene Systeme auf und übergibt an Ihr Team.
Für viele kleine Unternehmen ist das eine gute Option. Es ist aber auch ein geschlossenes System: Sie können das Modell nicht wählen, die Gesprächsdaten bleiben bei Meta, einige Branchen wie Finanzen und Gesundheit sind ausgeschlossen, und seit August 2026 wird pro Token abgerechnet, nach Metas eigener Schätzung etwa 4 bis 5 US-Cent pro Nachricht.
Die Ansätze im Vergleich
| Integrierter KI-Agent einer Messaging-Plattform | Meta Business Agent | Harness in MonoChat (demnächst) | |
|---|---|---|---|
| Modell wählbar | Meist fest vorgegeben oder eine kurze Liste | Nein | Ja, jedes Modell, das Sie anbinden |
| Eigenen Harness mitbringen | Nein | Nein | Ja: Claude Agent SDK, OpenAI Agents SDK, ADK, Pi und weitere |
| Gehostete Option ohne Code | Ja | Ja | Ja |
| Eigene Tools und APIs | Begrenzte Integrationen | Konnektoren | Eigene Funktionen, MCP, Webhooks und Ihre APIs |
| In Ihren Flows und Apps | Separater Bot-Builder | Getrennt von Ihren Flows | Ein Node und Methoden in Flows und Apps, direkt neben KI-Inference |
| Übergabe an Ihr Team | Ja | Ja, mit Thread-Steuerung | Gemeinsamer Posteingang mit komplettem Verlauf und Freigaben |
| Wo die Daten liegen | Plattform des Anbieters | Meta | MonoChat plus die Anbieter Ihrer Wahl |
Basierend auf öffentlichen Produktinformationen, Stand Oktober 2026. Die meisten von uns geprüften Messaging-Plattformen bieten einen integrierten KI-Agenten an; wir haben jedoch keine gefunden, bei der ein Unternehmen im selben Posteingang und in denselben Flows entweder einen gehosteten Harness betreiben oder einen eigenen Harness anbinden kann.
Was wir in MonoChat entwickeln
In MonoChat wählen Sie schon heute Ihr Sprachmodell und Ihre Vektordatenbank selbst: Nutzen Sie die von uns bereitgestellten oder binden Sie Ihre eigenen an. Harnesses werden genauso funktionieren.
Neben dem KI-Inference-Node und den Methoden, die Sie heute verwenden, bekommt MonoChat einen Harness-Node und Harness-Methoden. Ziehen Sie den Node in einen Flow oder rufen Sie die Methoden aus einer App auf, und das Gespräch wird an einen Agenten übergeben, der planen, Ihre Tools nutzen und Rückmeldung geben kann.
- Einen von uns gehosteten Harness ohne Code nutzen und festlegen, welches Modell und welche Tools er verwenden darf
- Oder einen eigenen Harness anbinden, gebaut mit dem Claude Agent SDK, OpenAI Agents SDK, Google ADK, Microsoft Agent Framework, Deep Agents, Pi oder eigenem Code
- Ihm Ihre Tools geben: eigene Funktionen, MCP-Server, Webhooks und die Daten in MonoChat
- Ihn in Flows und Apps einsetzen, auf WhatsApp, Instagram, Messenger, Telegram, TikTok, im Webchat und per SMS
- Freigaberegeln und Übergabe an Menschen festlegen, wobei jeder Schritt im Gespräch protokolliert wird
- Ihn mit Inference kombinieren: schnelle Schritte mit einem einzelnen Aufruf, komplexe Fälle über den Harness
Wann Inference und wann ein Harness?
- Nutzen Sie Inference für Aufgaben mit nur einem Schritt: Taggen, Routing, Übersetzen, eine Antwort entwerfen, einen Chat zusammenfassen.
- Nutzen Sie einen Harness, wenn die Anfrage des Kunden mehrere Schritte, Daten aus Ihren Systemen oder eine Entscheidung unterwegs erfordert.
- Fangen Sie klein an: Geben Sie dem Harness zwei oder drei Tools und eine Freigaberegel, messen Sie die Ergebnisse und erweitern Sie dann schrittweise, was er tun darf.
Demnächst in MonoChat
Harness-Nodes und -Methoden befinden sich in der Entwicklung und werden zuerst für MonoChat-Konten ausgerollt. Erstellen Sie schon heute ein kostenloses Konto, verbinden Sie Ihre Kanäle, richten Sie Ihre KI-Inference-Flows ein und seien Sie bereit, einen Harness zu aktivieren, sobald er verfügbar ist.
Seien Sie bereit für Agent Harnesses auf WhatsApp
Quellen und weiterführende Literatur
- Databricks: What is an AI agent harness?
- Anthropic: Claude Agent SDK overview
- Anthropic: Claude Managed Agents overview
- OpenAI: The next evolution of the Agents SDK
- Google: Agent Development Kit
- Microsoft: Agent Framework documentation
- LangChain: Deep Agents
- WhatsApp Business: Introducing Meta Business Agent
- Meta: WhatsApp Business Platform pricing