Zum Hauptinhalt springen

Demnächst

Was ist ein Agent Harness und warum der WhatsApp-Support einen braucht

Die meiste KI im Kundenmessaging funktioniert nach dem Prinzip: eine Frage, eine Antwort. Ein Agent Harness macht aus einem Sprachmodell etwas, das einen Fall tatsächlich bearbeiten kann: planen, Tools nutzen, die eigene Arbeit prüfen und sich erinnern. Hier lesen Sie, was das bedeutet, welche Harnesses es heute gibt und wie sie zu MonoChat kommen.

Oder starten Sie mit $150 Guthaben – genug für einen ersten Monat Growth

Veröffentlicht:

Diagramm eines Agent Harness, der ein Sprachmodell umschließt und mit WhatsApp verbunden ist

Im vergangenen Jahr hat sich die Diskussion rund um KI still und leise verschoben: weg von den Modellen, hin zu dem, was sie umgibt. Dasselbe Modell kann ein Chatbot sein, der eine einzelne Nachricht beantwortet, oder ein Agent, der ein Lieferproblem über drei Systeme und zwei Tage hinweg löst. Der Unterschied liegt nicht im Modell, sondern im Harness, dem Ausführungsrahmen rund um das Modell.

Dieser Artikel erklärt das Konzept verständlich, vergleicht die Harnesses, die Sie heute einsetzen können, und zeigt, was wir in MonoChat einbauen, damit Unternehmen einen solchen Agenten auf WhatsApp, Instagram, im Webchat und auf allen anderen Kanälen ihres Posteingangs betreiben können.

Was ist ein Agent Harness?

Ein Agent Harness ist die Softwareschicht, die ein großes Sprachmodell umschließt und es handeln lässt, statt nur zu antworten. Das Modell denkt nach und entscheidet, was als Nächstes zu tun ist. Der Harness führt diese Entscheidung aus, gibt das Ergebnis an das Modell zurück und wiederholt das, bis die Aufgabe erledigt ist. Kurz gesagt: Agent = Modell + Harness.

Der Begriff hat sich durchgesetzt, als Teams bemerkten, dass Coding-Agenten wie Claude Code und Codex ihre Zuverlässigkeit zu einem großen Teil dieser umgebenden Schicht verdanken und nicht allein dem Modell. Anthropic, OpenAI, Google und Microsoft bieten ihre Harnesses inzwischen als Produkte an, auf denen Entwickler aufbauen können.

Woraus ein Harness besteht

  • Die Schleife: Nachdenken, handeln, beobachten, wiederholen. Der Harness macht weiter, bis die Aufgabe erledigt ist oder ein Mensch gebraucht wird.
  • Tools: Funktionen, die das Modell aufrufen darf: eine Bestellung prüfen, eine Buchung nachschlagen, eine Erstattung auslösen, eine Wissensdatenbank durchsuchen. Häufig über MCP angebunden.
  • Gedächtnis und Zustand: Was bisher in diesem Fall passiert ist, was der Kunde bevorzugt und was bereits versucht wurde, festgehalten über Nachrichten und Sitzungen hinweg.
  • Kontextmanagement: Die Entscheidung, was das Modell in jedem Schritt sieht, und das Zusammenfassen (Compaction) langer Verläufe, damit das Wichtige im Blick bleibt.
  • Leitplanken und Freigaben: Berechtigungen, Richtlinien und menschliche Kontrollpunkte für Aktionen, die Geld kosten oder sich nicht rückgängig machen lassen.
  • Sandbox und Dateien: Ein isolierter Arbeitsbereich, in dem der Agent Code ausführen, ein Dokument vorbereiten oder ein Angebot berechnen kann, ohne Live-Systeme anzutasten.
  • Tracing und Evaluierung: Ein Protokoll jedes Schritts und jedes Tool-Aufrufs, damit Teams nachvollziehen können, warum der Agent so gehandelt hat, und ihn über viele Durchläufe hinweg messen können.

Inference oder Harness: Was ist der Unterschied?

Inference ist ein einzelner Aufruf eines Modells: Sie senden einen Prompt, das Modell liefert Text zurück, und der Austausch ist beendet. Das ist schnell, günstig und berechenbar und für viele Aufgaben genau das Richtige, etwa um eine Nachricht zu klassifizieren, eine Antwort zu entwerfen oder ein Gespräch zusammenzufassen.

Ein Harness führt viele Inference-Aufrufe in einer Schleife aus und ergänzt alles, was darum herum nötig ist: Tools, Gedächtnis, Prüfungen und Grenzen. Er ist langsamer und verbraucht pro Aufgabe mehr Tokens, kann dafür aber Arbeit abschließen, die mehrere Schritte, externe Daten oder eine Entscheidung unterwegs erfordert.

KI-InferenceAgent Harness
Was es ist Eine Anfrage an ein Modell, eine AntwortEine Schleife um das Modell, die plant, handelt und prüft
Schritte pro Aufgabe EinerSo viele, wie die Aufgabe braucht, innerhalb der von Ihnen gesetzten Grenzen
Tools und Systeme Optional, meist ein einzelner FunktionsaufrufViele Tools, je nach Fall aufgerufen und verkettet
Gedächtnis Nur das, was im Prompt stehtFallverlauf und Zustand, festgehalten über Schritte und Sitzungen hinweg
Wenn etwas schiefgeht Gibt zurück, was es erzeugt hatErkennt den Fehler, versucht es erneut oder fragt einen Menschen
Ideal für Klassifizieren, Entwerfen, Zusammenfassen, einzelne AntwortenFälle lösen, mehrstufige Anfragen, Nachverfolgung über Tage
Kosten und Tempo Niedrigste Kosten, nahezu sofortHöherer Token-Verbrauch, Sekunden bis Minuten pro Aufgabe

In der Praxis setzen gute Teams beides ein: Inference für schnelle, klar umrissene Schritte und einen Harness dort, wo die Arbeit wirklich mehrere Schritte erfordert.

Was ein Harness im WhatsApp-Kundenservice verändert

Im Kundenmessaging zeigt sich der Unterschied zwischen Beantworten und Lösen am deutlichsten. Ein Kunde schreibt „Meine Bestellung ist nicht angekommen“ und erwartet, dass das Problem gelöst wird, nicht erklärt.

Fälle werden gelöst, nicht nur beantwortet

Der Agent kann die Bestellung nachschlagen, beim Versanddienstleister nachsehen, feststellen, dass das Paket festhängt, eine Reklamation anlegen und im selben Gespräch Ersatz anbieten.

Er prüft, bevor er etwas zusagt

Lagerbestand, Preise, freie Termine und Richtlinien werden im Moment der Antwort in Ihren Systemen geprüft, statt aus Trainingsdaten geraten zu werden.

Er erinnert sich an den Fall

Meldet sich der Kunde morgen wieder, weiß der Agent, was bereits versucht und was zugesagt wurde, auch nachdem das 24-Stunden-Fenster von WhatsApp geschlossen ist.

Er bleibt über die Zeit dran

Länger laufende Aufgaben, etwa das Warten auf eine Rückerstattung oder ein Ersatzteil, können weiterlaufen und den Kunden benachrichtigen, sobald sich etwas ändert, mit freigegebenen Vorlagen, wo WhatsApp diese verlangt.

Menschen behalten die Kontrolle

Erstattungen über einem Limit, Stornierungen oder alles Sensible warten auf die Freigabe durch ein Teammitglied, und bei der Übergabe an einen Menschen bleibt der komplette Verlauf erhalten.

Jeder Schritt ist sichtbar

Tool-Aufrufe und Entscheidungen werden protokolliert, sodass Supervisoren nachvollziehen können, warum der Agent gehandelt hat, und die Anweisungen verbessern können.

Ein Beispiel: eine Retoure über WhatsApp

  1. Die Kundin schickt ein Foto eines beschädigten Artikels und bittet um eine Rücksendung.
  2. Der Agent findet die Bestellung, prüft, ob die Rückgabefrist noch läuft, und wertet das Foto aus.
  3. Er legt die Retoure in Ihrem E-Commerce-System an und bucht für den nächsten Tag eine Abholung durch den Kurierdienst.
  4. Die Erstattung liegt über dem automatischen Limit, also bittet er ein Teammitglied, sie direkt im Posteingang freizugeben.
  5. Nach der Freigabe bestätigt er der Kundin alles, und zwei Tage später, wenn der Kurier das Paket scannt, sendet er die Bestätigung der Erstattung.

Mit reiner Inference ist das ein Chatbot, der die Rückgaberichtlinie erklärt. Mit einem Harness ist es die Retoure selbst.

Die Agent Harnesses, die Sie heute nutzen können

Mehrere Unternehmen und Open-Source-Projekte bieten inzwischen einen Harness an, auf dem Sie aufbauen können. Sie unterscheiden sich darin, wer sie hostet, welche Modelle sie ausführen und wie viel sie ab Werk mitbringen.

HarnessVonHosting und LizenzModelleHighlights
Claude Agent SDK AnthropicBibliothek (Python, TypeScript)ClaudeDer Harness hinter Claude Code: Tools, MCP, Sub-Agenten, Skills, Context Compaction, Berechtigungen
Claude Managed Agents AnthropicGehostete API (Public Beta seit April 2026)ClaudeAnthropic betreibt die Schleife: Ausführung in der Sandbox, lang laufende Sitzungen, Multi-Agent-Arbeit, Tracing
OpenAI Agents SDK OpenAIOpen Source, MIT (Python zuerst)OpenAI-Modelle, andere über AdapterSandboxes verschiedener Anbieter, Gedächtnis, MCP, Skills, AGENTS.md, fortsetzbare Durchläufe
Codex OpenAICLI als Open Source (Apache 2.0) plus CloudOpenAI-ModelleHarness für Coding-Agenten mit einem SDK, um ihn aus eigenen Services heraus zu betreiben
Agent Development Kit (ADK) GoogleOpen Source, Apache 2.0 (Python, Java, Go, TypeScript)Standardmäßig Gemini, modellunabhängigMulti-Agent-Hierarchien, MCP, Agent2Agent-Protokoll (A2A), integrierte Evaluierung
Agent Framework MicrosoftOpen Source, MIT (Python, .NET)Azure OpenAI, OpenAI, Anthropic und weitereHarness stabil seit Juli 2026: Tool-Schleife, Verlauf, Compaction, Skills, Freigaben, OpenTelemetry
Deep Agents LangChainOpen Source, MITModellunabhängigPlanung, Sub-Agenten, Dateisystem und Context Engineering auf Basis von LangGraph
Pi Earendil WorksOpen Source, MITJeder Anbieter, eigener API-SchlüsselBewusst minimaler Kern (Lesen, Schreiben, Bearbeiten, Shell), erweiterbar mit teilbaren Skills
Mastra MastraOpen Source (TypeScript)ModellunabhängigAgenten mit persistenten Threads, Tool-Freigaben und einem lokalen Studio
OpenCode OpenCodeOpen Source, MITModellunabhängigPlan- und Build-Agenten, SDK, Terminal und Desktop

Die Details ändern sich schnell; den aktuellen Stand finden Sie in der Dokumentation des jeweiligen Projekts. Produktnamen und Logos gehören ihren jeweiligen Inhabern.

In diesem Artikel verglichene Harnesses

Claude Agent SDK
OpenAI Agents SDK
Codex
Google ADK
Microsoft Agent Framework
LangChain Deep Agents
Pi
Mastra
OpenCode

Und was ist mit Metas eigenem Business Agent?

2026 hat Meta mit Meta Business Agent einen eigenen KI-Agenten für WhatsApp, Instagram und Messenger eingeführt. Im Grunde ist das ein Harness, den Meta selbst entwickelt und betreibt: Er antwortet auf Basis Ihrer Inhalte, ruft angebundene Systeme auf und übergibt an Ihr Team.

Für viele kleine Unternehmen ist das eine gute Option. Es ist aber auch ein geschlossenes System: Sie können das Modell nicht wählen, die Gesprächsdaten bleiben bei Meta, einige Branchen wie Finanzen und Gesundheit sind ausgeschlossen, und seit August 2026 wird pro Token abgerechnet, nach Metas eigener Schätzung etwa 4 bis 5 US-Cent pro Nachricht.

Die Ansätze im Vergleich

Integrierter KI-Agent einer Messaging-Plattform Meta Business Agent Harness in MonoChat (demnächst)
Modell wählbar Meist fest vorgegeben oder eine kurze ListeNeinJa, jedes Modell, das Sie anbinden
Eigenen Harness mitbringen NeinNeinJa: Claude Agent SDK, OpenAI Agents SDK, ADK, Pi und weitere
Gehostete Option ohne Code JaJaJa
Eigene Tools und APIs Begrenzte IntegrationenKonnektorenEigene Funktionen, MCP, Webhooks und Ihre APIs
In Ihren Flows und Apps Separater Bot-BuilderGetrennt von Ihren FlowsEin Node und Methoden in Flows und Apps, direkt neben KI-Inference
Übergabe an Ihr Team JaJa, mit Thread-SteuerungGemeinsamer Posteingang mit komplettem Verlauf und Freigaben
Wo die Daten liegen Plattform des AnbietersMetaMonoChat plus die Anbieter Ihrer Wahl

Basierend auf öffentlichen Produktinformationen, Stand Oktober 2026. Die meisten von uns geprüften Messaging-Plattformen bieten einen integrierten KI-Agenten an; wir haben jedoch keine gefunden, bei der ein Unternehmen im selben Posteingang und in denselben Flows entweder einen gehosteten Harness betreiben oder einen eigenen Harness anbinden kann.

Was wir in MonoChat entwickeln

In MonoChat wählen Sie schon heute Ihr Sprachmodell und Ihre Vektordatenbank selbst: Nutzen Sie die von uns bereitgestellten oder binden Sie Ihre eigenen an. Harnesses werden genauso funktionieren.

Neben dem KI-Inference-Node und den Methoden, die Sie heute verwenden, bekommt MonoChat einen Harness-Node und Harness-Methoden. Ziehen Sie den Node in einen Flow oder rufen Sie die Methoden aus einer App auf, und das Gespräch wird an einen Agenten übergeben, der planen, Ihre Tools nutzen und Rückmeldung geben kann.

  • Einen von uns gehosteten Harness ohne Code nutzen und festlegen, welches Modell und welche Tools er verwenden darf
  • Oder einen eigenen Harness anbinden, gebaut mit dem Claude Agent SDK, OpenAI Agents SDK, Google ADK, Microsoft Agent Framework, Deep Agents, Pi oder eigenem Code
  • Ihm Ihre Tools geben: eigene Funktionen, MCP-Server, Webhooks und die Daten in MonoChat
  • Ihn in Flows und Apps einsetzen, auf WhatsApp, Instagram, Messenger, Telegram, TikTok, im Webchat und per SMS
  • Freigaberegeln und Übergabe an Menschen festlegen, wobei jeder Schritt im Gespräch protokolliert wird
  • Ihn mit Inference kombinieren: schnelle Schritte mit einem einzelnen Aufruf, komplexe Fälle über den Harness

Wann Inference und wann ein Harness?

  • Nutzen Sie Inference für Aufgaben mit nur einem Schritt: Taggen, Routing, Übersetzen, eine Antwort entwerfen, einen Chat zusammenfassen.
  • Nutzen Sie einen Harness, wenn die Anfrage des Kunden mehrere Schritte, Daten aus Ihren Systemen oder eine Entscheidung unterwegs erfordert.
  • Fangen Sie klein an: Geben Sie dem Harness zwei oder drei Tools und eine Freigaberegel, messen Sie die Ergebnisse und erweitern Sie dann schrittweise, was er tun darf.

Demnächst in MonoChat

Harness-Nodes und -Methoden befinden sich in der Entwicklung und werden zuerst für MonoChat-Konten ausgerollt. Erstellen Sie schon heute ein kostenloses Konto, verbinden Sie Ihre Kanäle, richten Sie Ihre KI-Inference-Flows ein und seien Sie bereit, einen Harness zu aktivieren, sobald er verfügbar ist.

Seien Sie bereit für Agent Harnesses auf WhatsApp

Quellen und weiterführende Literatur

Erster Monat Growth geht auf uns

Seien Sie bereit für Agent Harnesses auf WhatsApp

Eröffnen Sie ein kostenloses MonoChat-Konto, verbinden Sie WhatsApp und Ihre anderen Kanäle und aktivieren Sie Harness-gestützte Agenten, sobald sie verfügbar sind.

Ein Code pro Unternehmen • 30 Tage einlösbar • Keine Kreditkarte nötig

$150 zum Start.

Sichern