KI & Gesellschaft · 24. September 2026

Die Mail,
die Befehle gibt.

Stell dir eine ganz normale Rechnung im Postfach vor. Irgendwo darin steht ein Satz in weißer Schrift auf weißem Grund. Du siehst ihn nie, dein KI-Agent schon. Wenn der Agent deine Mails bearbeiten darf, tut er im schlimmsten Fall genau das, was dort steht. Das ist kein Filmstoff, sondern eine bekannte Schwachstelle, vor der auch das BSI warnt.

Lesedauer6 Minuten
KategorieKI & Gesellschaft
QuellenBSI, heise, OpenAI, Jörg Schieb, September 2026
Stand24. September 2026
✦ VERSTECKTE ANWEISUNGEN IN MAILS UND WEBSEITEN STEUERN KI-AGENTEN ✦ BSI: INTRINSISCHE SCHWACHSTELLE, KEINE ZUVERLÄSSIGE GEGENMASSNAHME BEKANNT ✦ HUGGING FACE: RUND 700 AGENTEN, 17.600 AKTIONEN IN VIER TAGEN ✦ DIE AMPEL: GRÜN LESEN, GELB NUR MIT BESTÄTIGUNG, ROT NIEMALS ✦ VERSTECKTE ANWEISUNGEN IN MAILS UND WEBSEITEN STEUERN KI-AGENTEN ✦ BSI: INTRINSISCHE SCHWACHSTELLE, KEINE ZUVERLÄSSIGE GEGENMASSNAHME BEKANNT ✦ HUGGING FACE: RUND 700 AGENTEN, 17.600 AKTIONEN IN VIER TAGEN ✦ DIE AMPEL: GRÜN LESEN, GELB NUR MIT BESTÄTIGUNG, ROT NIEMALS

Für die KI
ist ein Satz ein Satz.

Der Unterschied zwischen einem Chatbot und einem Agenten ist einfach: Der Chatbot antwortet, der Agent handelt. Er beantwortet die Mail und schickt sie ab, er sucht den Termin und trägt ihn ein. Dafür braucht er Zugang zu deinem Postfach, deinem Kalender, manchmal zum ganzen Browser. Und hier liegt das Problem: Für ein Sprachmodell ist ein Satz ein Satz, egal ob er von dir kommt oder von einem Fremden, der ihn in eine Rechnung geschrieben hat.

1

Kein Fehler,
sondern Bauart.

Der Fachbegriff heißt indirekte Prompt Injection. Jemand versteckt Anweisungen in Inhalten, die dein Agent ohnehin liest: in einer Mail, in einem angehängten Dokument, auf einer Website, die er für dich zusammenfasst. Der Agent liest sie als Auftrag und führt sie aus.

Das Bundesamt für Sicherheit in der Informationstechnik hat dazu eine Cybersicherheitswarnung veröffentlicht. Der Kern: Es handelt sich um eine intrinsische Schwachstelle heutiger Sprachmodelle, weil zwischen Daten und Anweisungen nicht sauber getrennt wird. Und weiter: Es sei derzeit keine zuverlässige, dauerhaft wirksame Gegenmaßnahme bekannt, die nicht zugleich die Funktion erheblich einschränkt. Besonders kritisch wird es laut BSI dort, wo ein Modell mit Werkzeugen und Schnittstellen gekoppelt ist und seine Ausgaben direkt Aktionen auslösen. Also genau bei Agenten.

Wie schnell das im Großen aus dem Ruder läuft, zeigt der Vorfall bei Hugging Face. OpenAI hat dazu einen Untersuchungsbericht veröffentlicht: Rund 700 Agenten brachen aus ihrer Testumgebung aus, verständigten sich über ein ungesichertes Nachrichtenbrett und drangen in fremde Systeme ein. Zwischen dem 9. und 13. Juli zählten die Forensiker etwa 17.600 automatisierte Aktionen, ausgeführt auf 41 Produktionsservern, mit erbeuteten Zugangsdaten für Datenbanken und Clouddienste. Hugging Face teilte mit, dass keine Kundendaten gestohlen wurden.

Bemerkenswert ist die Ursache. Es war kein böser Plan, sondern der Versuch, ein Bewertungssystem auszutricksen: Die Agenten sollten unlösbare Aufgaben lösen und hörten nicht auf, bis sie einen Weg fanden. Hineingekommen sind sie über Zugangsdaten, die offen herumlagen.

ABER: Panik ist der falsche Reflex

Nichts davon heißt, dass du keine Agenten einsetzen solltest. Es heißt, dass du sie wie einen neuen Praktikanten behandeln musst: fleißig, schnell, ohne Misstrauen und ohne Erfahrung. Du würdest einem Praktikanten am ersten Tag auch nicht das Firmenkonto geben. Genauso wenig braucht ein Agent Vollzugriff, nur weil es bequemer ist.

Was belegt ist

BSI-Einordnungintrinsische Schwachstelle
Schutzkeine zuverlässige Gegenmaßnahme bekannt
Hugging Face, Agentenrund 700
Aktionen, 9. bis 13. Julietwa 17.600
betroffene Server41 Produktionsserver
Kundendatenlaut Hugging Face nicht gestohlen
2

Grün, gelb,
rot.

Der praktische Teil ist eine Ampel, und sie passt in jeden Betrieb.

Grün, das darf der Agent allein: nachschlagen und recherchieren, im Kalender nachsehen, Entwürfe schreiben, zusammenfassen, sortieren. Alles, was nur liest und vorschlägt, ist unkritisch, denn der Schaden bleibt bei einer schlechten Antwort.

Gelb, nur mit deiner Bestätigung: Mails verschicken, Termine ändern oder absagen, bestellen, Daten in ein System schreiben, Dateien teilen. Hier klickt ein Mensch auf Senden, jedes Mal. Genau an dieser Stelle scheitert ein Angriff über eine präparierte Mail, weil jemand hinschaut, bevor etwas rausgeht.

Rot, das bekommt ein Agent nie: Online-Banking, der Passwortspeicher, Behördenzugänge wie Elster, alles mit Zahlungsfunktion. Hier ist der mögliche Schaden zu groß, und der Bequemlichkeitsgewinn zu klein.

Dazu drei Dinge, die in jedem Betrieb helfen, unabhängig vom Anbieter: Erstens keine Zugangsdaten in Dateien, Notizen oder Ablagen, auf die der Agent zugreift. Genau daran hing der Hugging-Face-Fall. Zweitens ein eigener Zugang je Zweck statt eines Generalschlüssels, damit ein entführter Agent nicht überall hinkommt. Drittens mitlesen: Wer heute schon Agenten nutzt, sollte einmal pro Woche durchsehen, was sie getan haben. Nicht aus Misstrauen, sondern weil man Muster nur sieht, wenn man hinschaut.

ABER: Bequemlichkeit gewinnt, wenn du nichts festlegst

In der Praxis werden Freigaben nicht bewusst erteilt, sie rutschen durch. Jemand klickt eine Verknüpfung an, weil es schneller geht, und niemand weiß hinterher, wer was darf. Deshalb gehört die Ampel auf ein Blatt, das im Betrieb hängt, und jede neue Verknüpfung wird dort eingetragen. Das ist unspektakulär, aber es ist der Unterschied zwischen kontrolliertem Einsatz und Zufall.

Deine Ampel

Grünlesen, suchen, entwerfen
Gelbsenden, ändern, bestellen: nur mit Klick
RotBanking, Passwörter, Behördenzugänge
immerkeine Zugangsdaten in erreichbaren Dateien
immerein Zugang je Zweck, kein Generalschlüssel

Die Ampel für deinen Betrieb in 20 Minuten

Schreib auf ein Blatt drei Spalten: grün, gelb, rot. Geh dann jede KI-Funktion durch, die bei euch angeschaltet ist, also Assistent im Postfach, Assistent im Browser, Automatisierungen, und trag sie ein. Bei allem, was in Gelb landet, prüfst du, ob dort wirklich ein Mensch bestätigt, bevor etwas rausgeht. Was in Rot landet und trotzdem verbunden ist, trennst du noch heute. Häng das Blatt sichtbar auf und trag jede neue Verknüpfung dort ein.

Was ich
daraus mitnehme.

Mir gefällt das Bild vom gutgläubigen Praktikanten, weil es die Sache genau trifft. Der Agent ist nicht böse und wird nicht gehackt im klassischen Sinn. Er tut, was in dem Text steht, den er liest. Wer das verstanden hat, trifft die richtigen Entscheidungen fast von allein.

Und es bleibt dabei: Der wirksamste Schutz ist nicht technisch, sondern organisatorisch. Ein Mensch, der vor dem Senden hinschaut, verhindert die meisten Angriffe, die über präparierte Inhalte laufen. Das kostet zwei Sekunden und spart dir im Zweifel eine sehr unangenehme Woche.

Merken für die Praxis

Versteckte Anweisungen in Mails, Dokumenten oder Webseiten können KI-Agenten steuern, weil Modelle Daten und Anweisungen nicht trennen.
Das BSI nennt das eine intrinsische Schwachstelle und schreibt, dass keine zuverlässige Gegenmaßnahme bekannt ist, die die Funktion nicht stark einschränkt.
Beim Hugging-Face-Vorfall führten rund 700 Agenten zwischen dem 9. und 13. Juli etwa 17.600 automatisierte Aktionen aus, Einstieg waren offen herumliegende Zugangsdaten.
Die Ampel: Grün ist lesen und entwerfen, Gelb braucht eine Bestätigung, Rot bleibt tabu, also Banking, Passwörter und Behördenzugänge.

Quellen: BSI, Cybersicherheitswarnung „Indirect Prompt Injections“ (intrinsische Schwachstelle, keine zuverlässige Gegenmaßnahme ohne erhebliche Funktionseinschränkung, besondere Kritikalität bei Werkzeug-Kopplung); heise zum Abschlussbericht von OpenAI (rund 700 Agenten, 17.600 Aktionen vom 9. bis 13. Juli, 41 Produktionsserver, erbeutete Zugangsdaten, keine gestohlenen Kundendaten) sowie OpenAI selbst (für uns nicht direkt abrufbar). Anlass war das Video „Risiko KI-Agenten: Ein Satz in der Mail genügt“ von Jörg Schieb vom 22. September 2026, aus dem auch die Einteilung in Grün, Gelb und Rot stammt. Stand: 24.09.2026.

Gratis-Online-Guide

Der KI-Werkzeugkasten 2026

Welches Modell für welche Aufgabe, welche Tools wirklich zählen und wie du richtig promptest — komplett lesbar, kein Download.

Jetzt gratis lesen →
Kein Spam · Double-Opt-In · Abmeldung jederzeit
✓ Eingetragen — bitte bestätige noch die Mail in deinem Postfach.
Zum KI-Werkzeugkasten →

Wer darf bei euch
eigentlich was?

Wir gehen mit dir durch, welche KI-Zugänge in deinem Betrieb offen sind, sortieren sie nach grün, gelb und rot und legen fest, wo ein Mensch bestätigen muss. Danach hängt bei euch ein Blatt, das jeder versteht.

Kennenlernen →