Zehn Muster und harte Grenzen für Agenten im Echtbetrieb
KI-Agenten sicherst du nicht mit Hoffnung ab.Du sicherst sie mit 10 konkreten Mustern und harten Grenzen ab.
(💾 Zum Nachlesen speichern)
Die meisten Vorfälle in der Praxis kommen nicht von „schlechten Modellen".Sie kommen von Agenten mit:
- viel zu weitreichenden Rechten
- fehlenden Leitplanken
- null Nachvollziehbarkeit
- fehlender Validierung
Wenn du Agenten im Echtbetrieb willst, musst du die Architektur von vornherein darauf auslegen.
So denke ich darüber in echten Unternehmen:
1) Least-Privilege und Tool-Vermittlung• Ein Agent, eine Aufgabe• Minimale Werkzeuge, minimale Daten• Jede Aktion läuft über ein Gateway mit Allowlists, Argumentprüfung, Rate Limits
2) Kontextgrenzen• Enge Suchbereiche beim Retrieval• Kein projektübergreifendes Gedächtnis• Keine mandantenübergreifende Weitergabe• Zeitlich begrenzter Zugriff auf sensible Daten
Die Zweckbindung aus DSGVO und EU AI Act lebt hier, nicht in einem PDF.
3) Eskalation und menschliche Aufsicht• Agenten halten an, Menschen entscheiden.• Klare Regeln, wann eskaliert wird: hohe Auswirkung, geringe Sicherheit, unklare Richtlinie.• Warteschlangen, SLAs, vollständiger Übergabekontext.
4) Erst planen, dann ausführen, plus Ausgabefilter• Das Modell schlägt einen Plan vor.• Eine deterministische Schicht prüft ihn gegen Schemata und Regeln.• Nur freigegebene Schritte laufen.
5) Isolation• Das Reasoning läuft in Sandboxes und abgeschotteten Netzen.• Nur eine streng kontrollierte Orchestrierungsschicht spricht mit den Produktivsystemen.
6) Eingabeschutz• Behandle jede Eingabe als feindlich: Prompts, E-Mails, Dokumente, APIs.• Schemata erzwingen, Steuersequenzen entfernen, seltsame Strukturen ablehnen.
7) Richtlinie als Ablauf• Richtlinien sind Code im Ablauf, keine Folien in einer Präsentation.• Wer, welche Daten, was protokolliert wird, wann eskaliert wird → harte Prüfungen.
8) Audit und Nachvollziehbarkeit• Wenn du „Warum hat der Agent das getan?" nicht beantworten kannst, hast du kein System.• Du hast eine Demo.
9) Identität und Geheimnisse• Agenten sind Identitäten mit Rollen, keine Super-Admins.• Kurzlebige Token, Secrets im Vault, keine Zugangsdaten in Prompts oder Logs.
10) Laufende Evaluation, Monitoring und Red-TeamingFeindliche Prompts, Missbrauchsfälle, Leakage-Tests, Tests auf Umgehung der Richtlinien.
Dazu laufende Überwachung:
- Fehlerquoten, Erfolg und Scheitern von Aufgaben, Eskalationshäufigkeit erfassen
- Protokollieren, welche Aufgaben gescheitert sind und warum - datenschutzkonforme Telemetrie, keine personenbezogenen Daten in den Traces
- Aus der Fehleranalyse Regeln, Berechtigungen und Eskalationsauslöser anpassen
Du kannst nicht verbessern, was du nicht misst.Und du kannst nicht verteidigen, was du nicht getestet hast.
Agenten sind nicht von Natur aus gefährlich.Sie sind gefährlich, wenn du sie ohne Muster und Grenzen entwirfst.
Wenn du Agenten für den Echtbetrieb baust, fang mit diesen 10 an.
---
↳ Kennst du jemanden, der Agenten in den Echtbetrieb bringt? Schick ihm das hier.