Der Reflex ist verständlich: Man baut einen Agenten, gibt ihm ein Ziel und lässt ihn machen. Das Ergebnis sind Berichte, die jedes Mal anders aussehen. Zwei aktuelle Fachbeiträge zeigen, was besser funktioniert: Wiederkehrendes fest verdrahten, den Agenten nur für das Urteil einsetzen, und den Erfolg an etwas messen, das man nachprüfen kann.
Ein Praxisbericht aus der Entwicklung beschreibt einen Fall aus der Pharmabranche: Ein System sollte Umsatzveränderungen erkennen und Maßnahmen vorschlagen, zuerst vollständig als Agent gebaut. Das Ergebnis, wörtlich: Die Berichte waren uneinheitlich, Ursachen wurden übersehen. Wer schon einmal einen Agenten zweimal dieselbe Aufgabe hat machen lassen, kennt das. Die Lösung war nicht ein besseres Modell, sondern eine andere Aufteilung.
Das Team hat zwei Phasen aus dem Agenten herausgenommen und fest verdrahtet. Erstens die Auffälligkeitsprüfung: Verkaufszahlen holen, nach Region gruppieren, sortieren, mit dem Vormonat vergleichen und die Veränderung auf einer Skala bewerten. Das ist reine Rechenarbeit, dafür braucht niemand ein Sprachmodell. Zweitens die Datenbeschaffung: feste Abfragen für die immer gleichen Kennzahlen.
Was beim Agenten blieb, ist der Teil, der Urteilsvermögen braucht: aus den aufbereiteten Zahlen die Ursache herleiten und Maßnahmen vorschlagen. Die Empfehlung des Autors ist ein Satz, den man sich aufhängen kann: Die erste Frage lautet nicht „Sollen wir Agenten einsetzen?“, sondern „Welche Teile müssen überhaupt agentisch sein?“
Übertragen auf einen normalen Betrieb sieht das so aus. Beim Angebot sind fest: Preise aus der Preisliste holen, Rabattregeln anwenden, Kundendaten einsetzen, Summen rechnen, Vorlage füllen. Agentisch ist: den Bedarf aus der Anfrage herauslesen, die passende Variante vorschlagen, die Begründung formulieren.
Beim Kundenservice sind fest: Auftragsstatus abfragen, Liefertermin nachsehen, Rechnung heraussuchen. Agentisch ist: verstehen, was der Kunde eigentlich will, und freundlich antworten. Der Unterschied ist immer derselbe: Was eine klare Regel hat, gehört nicht in die KI, sondern in ein festes Stück Ablauf.
Alles dem Agenten zu überlassen ist bequem, weil man nichts festlegen muss. Feste Schritte heißen: Regeln aufschreiben, Preise pflegen, Sonderfälle klären. Genau diese Arbeit fällt sonst später an, wenn sich jemand über ein falsches Angebot beschwert. Der Unterschied ist nur, ob du sie planbar erledigst oder unter Zeitdruck.
Der zweite Fachbeitrag beantwortet die Frage, die danach kommt: Wie prüft man, ob so ein Ablauf taugt? Die Antwort hat zwei Ebenen. Auf Schrittebene schaut man sich jeden einzelnen Zwischenschritt an, um zu finden, wo es klemmt. Für die Freigabe zählt aber das Endergebnis: Ist am Ende der Zustand erreicht, den du wolltest? Der Beitrag formuliert es so, dass Freigaben an nachprüfbaren Belegen hängen sollten, etwa dass der Datensatz tatsächlich aktualisiert wurde, die Tests bestanden sind oder der Vorgang geschlossen ist.
Bei den Kennzahlen empfiehlt er drei Paare statt einer Zahl: Erfolgsquote zusammen mit der Schwankungsbreite, also 82 bis 88 Prozent statt 85 Prozent, dazu die Zahl der Schritte je gelöster Aufgabe und die Kosten je gelöster Aufgabe.
Für deinen Betrieb übersetzt heißt das: Nimm 20 bis 30 echte Fälle, lass den Ablauf laufen und zähle, wie oft am Ende tatsächlich das Richtige passiert ist, also der Termin steht, das Angebot stimmt, die Antwort rausgeht. Wiederhole dasselbe eine Woche später. Wenn die Quote stark schwankt, ist der Ablauf nicht fertig, egal wie gut die einzelne Antwort klingt.
Und miss die Kosten je erledigter Aufgabe, nicht je Anfrage. Ein Ablauf, der drei Anläufe braucht, ist teuer, auch wenn jeder einzelne Aufruf billig aussieht. Gerade jetzt, wo die Preise fallen, ist das die ehrlichere Zahl.
Der häufigste Fehler beim Testen ist, die Antwort zu lesen und sie gut zu finden. Entscheidend ist, was danach passiert ist. Eine perfekt formulierte Terminbestätigung, die im falschen Kalender landet, ist ein Fehlschlag. Prüfe deshalb immer am Ergebnis im System, nicht am Text im Chatfenster.
Nimm den Ablauf, den du automatisieren willst, und schreib ihn in Schritten auf, so wie du ihn einem neuen Mitarbeiter erklären würdest. Geh die Liste durch und markiere jeden Schritt mit F oder A: F, wenn es eine klare Regel gibt, A, wenn jemand urteilen muss. Alles mit F baust du fest, alles mit A bekommt die KI. Am Ende zählst du die A-Schritte. Sind es mehr als zwei oder drei, hast du die Aufgabe noch nicht scharf genug beschrieben.
Der Satz, den ich mir merke, ist die Frage nach den Teilen: nicht ob Agent, sondern welcher Teil. In den Projekten, die ich sehe, ist der Anteil, der wirklich Urteilsvermögen braucht, meistens klein. Der Rest ist Fleißarbeit mit klaren Regeln, und genau dort sind feste Abläufe schneller, billiger und verlässlicher.
Und beim Messen bin ich ganz beim zweiten Beitrag: Eine Erfolgsquote ohne Schwankungsbreite ist eine Momentaufnahme. Wer zweimal misst und dabei stark schwankt, hat kein Modellproblem, sondern einen unfertigen Ablauf.
Quellen: LeanIX Engineering Blog, „Don't go all in on AI“ von Jernej Klancic vom 15. September 2026 (Fall aus der Pharmabranche, feste Schritte für Auffälligkeitsprüfung und Datenbeschaffung, Agent für Ursachen und Vorschläge, Leitfrage nach den agentischen Teilen); NVIDIA Developer Blog, „How to Evaluate AI Agents“ vom 21. September 2026 (Bewertung auf Schrittebene und am Endergebnis, Erfolgsquote mit Schwankungsbreite, Schritte und Kosten je erfolgreicher Aufgabe, Freigabe gegen nachprüfbare Belege). Die Beispiele aus Angebot und Kundenservice sind unsere Übertragung. Stand: 23.09.2026.
Welches Modell für welche Aufgabe, welche Tools wirklich zählen und wie du richtig promptest — komplett lesbar, kein Download.
Jetzt gratis lesen →Wir zerlegen mit dir einen Ablauf aus deinem Betrieb in Schritte, trennen das Feste vom Urteil und legen fest, woran ihr den Erfolg messt. Danach weißt du, was sich zu automatisieren lohnt und was besser eine einfache Regel bleibt.