KI-Strategie · 23. September 2026

Der Agent
muss nicht alles machen.

Der Reflex ist verständlich: Man baut einen Agenten, gibt ihm ein Ziel und lässt ihn machen. Das Ergebnis sind Berichte, die jedes Mal anders aussehen. Zwei aktuelle Fachbeiträge zeigen, was besser funktioniert: Wiederkehrendes fest verdrahten, den Agenten nur für das Urteil einsetzen, und den Erfolg an etwas messen, das man nachprüfen kann.

Lesedauer6 Minuten
KategorieKI-Strategie
QuellenLeanIX Engineering, NVIDIA Developer Blog, September 2026
Stand23. September 2026
ERST FRAGEN: WELCHE TEILE MÜSSEN ÜBERHAUPT AGENTISCH SEIN WIEDERKEHRENDE SCHRITTE GEHÖREN IN FESTE WERKZEUGE MESSEN: ERFOLGSQUOTE MIT SCHWANKUNGSBREITE, SCHRITTE, KOSTEN JE AUFGABE FREIGABE NUR GEGEN NACHPRÜFBARES ERGEBNIS ERST FRAGEN: WELCHE TEILE MÜSSEN ÜBERHAUPT AGENTISCH SEIN WIEDERKEHRENDE SCHRITTE GEHÖREN IN FESTE WERKZEUGE MESSEN: ERFOLGSQUOTE MIT SCHWANKUNGSBREITE, SCHRITTE, KOSTEN JE AUFGABE FREIGABE NUR GEGEN NACHPRÜFBARES ERGEBNIS

Warum die Ergebnisse
jedes Mal anders sind.

Ein Praxisbericht aus der Entwicklung beschreibt einen Fall aus der Pharmabranche: Ein System sollte Umsatzveränderungen erkennen und Maßnahmen vorschlagen, zuerst vollständig als Agent gebaut. Das Ergebnis, wörtlich: Die Berichte waren uneinheitlich, Ursachen wurden übersehen. Wer schon einmal einen Agenten zweimal dieselbe Aufgabe hat machen lassen, kennt das. Die Lösung war nicht ein besseres Modell, sondern eine andere Aufteilung.

1

Fest, wo es geht.
Agent, wo es zählt.

Das Team hat zwei Phasen aus dem Agenten herausgenommen und fest verdrahtet. Erstens die Auffälligkeitsprüfung: Verkaufszahlen holen, nach Region gruppieren, sortieren, mit dem Vormonat vergleichen und die Veränderung auf einer Skala bewerten. Das ist reine Rechenarbeit, dafür braucht niemand ein Sprachmodell. Zweitens die Datenbeschaffung: feste Abfragen für die immer gleichen Kennzahlen.

Was beim Agenten blieb, ist der Teil, der Urteilsvermögen braucht: aus den aufbereiteten Zahlen die Ursache herleiten und Maßnahmen vorschlagen. Die Empfehlung des Autors ist ein Satz, den man sich aufhängen kann: Die erste Frage lautet nicht „Sollen wir Agenten einsetzen?“, sondern „Welche Teile müssen überhaupt agentisch sein?“

Übertragen auf einen normalen Betrieb sieht das so aus. Beim Angebot sind fest: Preise aus der Preisliste holen, Rabattregeln anwenden, Kundendaten einsetzen, Summen rechnen, Vorlage füllen. Agentisch ist: den Bedarf aus der Anfrage herauslesen, die passende Variante vorschlagen, die Begründung formulieren.

Beim Kundenservice sind fest: Auftragsstatus abfragen, Liefertermin nachsehen, Rechnung heraussuchen. Agentisch ist: verstehen, was der Kunde eigentlich will, und freundlich antworten. Der Unterschied ist immer derselbe: Was eine klare Regel hat, gehört nicht in die KI, sondern in ein festes Stück Ablauf.

ABER: Das ist mehr Arbeit am Anfang

Alles dem Agenten zu überlassen ist bequem, weil man nichts festlegen muss. Feste Schritte heißen: Regeln aufschreiben, Preise pflegen, Sonderfälle klären. Genau diese Arbeit fällt sonst später an, wenn sich jemand über ein falsches Angebot beschwert. Der Unterschied ist nur, ob du sie planbar erledigst oder unter Zeitdruck.

Aufteilung im Betrieb

Daten holen, rechnen, prüfenfest verdrahten
Vorlage füllen, Summen bildenfest verdrahten
Bedarf verstehen, formulierenAgent
Ursache herleiten, vorschlagenAgent
Entscheiden und freigebenMensch
2

Woran du merkst,
ob es läuft.

Der zweite Fachbeitrag beantwortet die Frage, die danach kommt: Wie prüft man, ob so ein Ablauf taugt? Die Antwort hat zwei Ebenen. Auf Schrittebene schaut man sich jeden einzelnen Zwischenschritt an, um zu finden, wo es klemmt. Für die Freigabe zählt aber das Endergebnis: Ist am Ende der Zustand erreicht, den du wolltest? Der Beitrag formuliert es so, dass Freigaben an nachprüfbaren Belegen hängen sollten, etwa dass der Datensatz tatsächlich aktualisiert wurde, die Tests bestanden sind oder der Vorgang geschlossen ist.

Bei den Kennzahlen empfiehlt er drei Paare statt einer Zahl: Erfolgsquote zusammen mit der Schwankungsbreite, also 82 bis 88 Prozent statt 85 Prozent, dazu die Zahl der Schritte je gelöster Aufgabe und die Kosten je gelöster Aufgabe.

Für deinen Betrieb übersetzt heißt das: Nimm 20 bis 30 echte Fälle, lass den Ablauf laufen und zähle, wie oft am Ende tatsächlich das Richtige passiert ist, also der Termin steht, das Angebot stimmt, die Antwort rausgeht. Wiederhole dasselbe eine Woche später. Wenn die Quote stark schwankt, ist der Ablauf nicht fertig, egal wie gut die einzelne Antwort klingt.

Und miss die Kosten je erledigter Aufgabe, nicht je Anfrage. Ein Ablauf, der drei Anläufe braucht, ist teuer, auch wenn jeder einzelne Aufruf billig aussieht. Gerade jetzt, wo die Preise fallen, ist das die ehrlichere Zahl.

ABER: Gute Antworten sind nicht gleich gute Ergebnisse

Der häufigste Fehler beim Testen ist, die Antwort zu lesen und sie gut zu finden. Entscheidend ist, was danach passiert ist. Eine perfekt formulierte Terminbestätigung, die im falschen Kalender landet, ist ein Fehlschlag. Prüfe deshalb immer am Ergebnis im System, nicht am Text im Chatfenster.

Deine drei Kennzahlen

Erfolgsquoteimmer mit Schwankungsbreite
Schritte je Aufgabeje weniger, desto stabiler
Kosten je erledigter Aufgabenicht je Anfrage
Freigabenur gegen nachprüfbares Ergebnis

Deine Aufteilung in einer Stunde

Nimm den Ablauf, den du automatisieren willst, und schreib ihn in Schritten auf, so wie du ihn einem neuen Mitarbeiter erklären würdest. Geh die Liste durch und markiere jeden Schritt mit F oder A: F, wenn es eine klare Regel gibt, A, wenn jemand urteilen muss. Alles mit F baust du fest, alles mit A bekommt die KI. Am Ende zählst du die A-Schritte. Sind es mehr als zwei oder drei, hast du die Aufgabe noch nicht scharf genug beschrieben.

Was ich
daraus mitnehme.

Der Satz, den ich mir merke, ist die Frage nach den Teilen: nicht ob Agent, sondern welcher Teil. In den Projekten, die ich sehe, ist der Anteil, der wirklich Urteilsvermögen braucht, meistens klein. Der Rest ist Fleißarbeit mit klaren Regeln, und genau dort sind feste Abläufe schneller, billiger und verlässlicher.

Und beim Messen bin ich ganz beim zweiten Beitrag: Eine Erfolgsquote ohne Schwankungsbreite ist eine Momentaufnahme. Wer zweimal misst und dabei stark schwankt, hat kein Modellproblem, sondern einen unfertigen Ablauf.

Merken für die Praxis

Ein Praxisbericht zeigt: Ein vollständig agentisches System lieferte uneinheitliche Berichte, erst feste Schritte für Rechnen und Datenbeschaffung machten es verlässlich.
Die Leitfrage lautet nicht „Agenten ja oder nein“, sondern welche Teile überhaupt agentisch sein müssen.
Gemessen wird auf zwei Ebenen: Schritte zur Fehlersuche, Endergebnis für die Freigabe.
Drei Kennzahlen: Erfolgsquote mit Schwankungsbreite, Schritte je Aufgabe, Kosten je erledigter Aufgabe.

Quellen: LeanIX Engineering Blog, „Don't go all in on AI“ von Jernej Klancic vom 15. September 2026 (Fall aus der Pharmabranche, feste Schritte für Auffälligkeitsprüfung und Datenbeschaffung, Agent für Ursachen und Vorschläge, Leitfrage nach den agentischen Teilen); NVIDIA Developer Blog, „How to Evaluate AI Agents“ vom 21. September 2026 (Bewertung auf Schrittebene und am Endergebnis, Erfolgsquote mit Schwankungsbreite, Schritte und Kosten je erfolgreicher Aufgabe, Freigabe gegen nachprüfbare Belege). Die Beispiele aus Angebot und Kundenservice sind unsere Übertragung. Stand: 23.09.2026.

Gratis-Online-Guide

Der KI-Werkzeugkasten 2026

Welches Modell für welche Aufgabe, welche Tools wirklich zählen und wie du richtig promptest — komplett lesbar, kein Download.

Jetzt gratis lesen →
Kein Spam · Double-Opt-In · Abmeldung jederzeit
✓ Eingetragen — bitte bestätige noch die Mail in deinem Postfach.
Zum KI-Werkzeugkasten →

Welcher Teil
braucht wirklich KI?

Wir zerlegen mit dir einen Ablauf aus deinem Betrieb in Schritte, trennen das Feste vom Urteil und legen fest, woran ihr den Erfolg messt. Danach weißt du, was sich zu automatisieren lohnt und was besser eine einfache Regel bleibt.

Kennenlernen →