Was ist ein „Agent Goal Hijack“?
Ein „Agent Goal Hijack“ liegt vor, wenn ein Angreifer die Ziele, die Aufgabenauswahl oder die Entscheidungswege eines KI-Agenten manipuliert und so einen mehrstufigen Arbeitsablauf in Richtung unbeabsichtigter oder schädlicher Ergebnisse umleitet.
Wichtigste Erkenntnisse
- „Agent Goal Hijack“ (ASI01) steht auf Platz 1 der OWASP Top 10 für agentenbasierte Anwendungen 2026 und tritt auf, wenn Angreifer die Ziele, die Aufgabenauswahl oder die Entscheidungswege eines Agenten innerhalb eines mehrstufigen Arbeitsablaufs manipulieren.
- Da Agenten Anweisungen nicht zuverlässig von Daten unterscheiden können, kann eine Manipulation durch die Manipulation von Eingabeaufforderungen, irreführende Tool-Ausgaben, gefälschte Nachrichten zwischen Agenten oder manipulierte externe Daten erfolgen
- Zu den Beispielen aus der Praxis zählen „EchoLeak“, eine indirekte Zero-Click-Prompt-Injektion, die Microsoft 365 Copilot dazu brachte, vertrauliche Daten zu exfiltrieren, sowie der „AgentFlayer“-Inception-Angriff auf ChatGPT-Nutzer
- Zur Prävention müssen alle Eingaben in natürlicher Sprache als nicht vertrauenswürdig behandelt, das Prinzip der geringsten Berechtigungen durchgesetzt und für zieländernde Aktionen eine menschliche Genehmigung verlangt werden; außerdem müssen Systemabfragen gesperrt und auf unerwartete Zielabweichungen überwacht werden.
Der „Agent Goal Hijack“ nutzt eine Einschränkung bei der Sprachverarbeitung durch Agenten aus: Weder der Agent noch das ihm zugrunde liegende Modell trennen Anweisungen zuverlässig von den Inhalten, die er liest. Dadurch ist der Agent anfällig für Manipulationen über Eingabeaufforderungen, irreführende Tool-Ausgaben, gefälschte Nachrichten zwischen Agenten sowie manipulierte externe Daten.
ASI01:2026 erweitert LLM01:2025 „Prompt Injection“ von einer einzelnen manipulierten Antwort zu einem fortlaufenden, agentenbasierten Arbeitsablauf. Die EchoLeak-Sicherheitslücke (CVE-2025-32711) demonstrierte dieses Muster in großem Maßstab: Eine einzige E-Mail veranlasste Microsoft 365 Copilot dazu, vertrauliche E-Mails, Dateien und Chat-Protokolle zu exfiltrieren, ohne dass eine Interaktion des Benutzers erforderlich war. Die Zero-Click-Exploit-Kette von AgentFlayer zeigte, dass derselbe Mechanismus über ein gewöhnliches Google Doc funktioniert, wobei ChatGPT dazu gebracht wurde, Benutzerdaten zu exfiltrieren und den Benutzer zu einer falschen geschäftlichen Entscheidung zu verleiten.
Warum es gefährlich ist
Es ist gefährlich, weil die Manipulation wie eine gewöhnliche Eingabe aussieht und „Goal Hijack“ von herkömmlichen Filtern selten erkannt wird, bevor Schaden entsteht. Zu den Folgen gehören:
- Exfiltration sensibler Daten durch versteckte Anweisungen, die in Dokumenten, E-Mails oder Webinhalten eingebettet sind, die von einem Mitarbeiter im Rahmen seiner normalen Arbeit verarbeitet werden
- Entführung interner Kommunikationskanäle, wodurch ein Angreifer unter der Identität eines vertrauenswürdigen Akteurs unbefugte Nachrichten versenden kann
- Betrügerische Geldtransfers, ausgelöst durch eine sofortige Übersteuerung, die die nächste Aktion eines Finanzagenten umleitet
- Fehlerhafte Geschäftsentscheidungen auf der Grundlage gefälschter Informationen, die ein Angreifer durch überschriebene Anweisungen eingeschleust hat
Typische Symptome
Zu den Techniken zur Zielentführung bei Agenten gehören:
- Indirekte Eingabe von Prompts über versteckte Anweisungen, die in abgerufenen Dokumenten oder Webseiten eingebettet sind, die von einem mit RAG verbundenen Agenten verarbeitet werden
- Schädliche Inhalte, die über externe, von einem Agenten überwachte Kanäle übertragen werden, wie beispielsweise E-Mails, Kalendereinladungen oder Chat-Nachrichten
- Das Tool gibt irreführende Ausgaben aus oder erzeugt gefälschte Nachrichten zwischen Agenten, die von der Orchestrierungslogik eines Agenten ohne unabhängige Überprüfung akzeptiert werden
- Eine direkte Überschreibung der Eingabeaufforderung, die den Agenten dazu veranlasst, sein eigenes Ziel neu zu definieren
Ein Agent, der eine legitime Anweisung nicht von einer eingebetteten unterscheiden kann, wird letztendlich die falsche ausführen.
Einschränkung der Zielabweichung
Da Agenten nicht zuverlässig zwischen vertrauenswürdigen und nicht vertrauenswürdigen Eingaben unterscheiden können, sollten sie davon ausgehen, dass jede Eingabe böswillig ist, bis das Gegenteil bewiesen ist.
- Behandeln Sie jede Eingabe in natürlicher Sprache, einschließlich hochgeladener Dokumente und abgerufener Inhalte, als nicht vertrauenswürdig und leiten Sie sie durch dieselben Sicherheitsvorkehrungen gegen Prompt-Injektionen, wie sie in LLM01:2025 definiert sind.
- Das Prinzip der geringsten Berechtigungen für Agent-Tools durchsetzen und eine menschliche Genehmigung für Aktionen mit erheblichen Auswirkungen oder solche, die eine Änderung der Ziele zur Folge haben, vorschreiben
- Definieren und sperren Sie Systemaufforderungen, damit Zielprioritäten und zulässige Aktionen eindeutig und nachvollziehbar bleiben, und leiten Sie alle Änderungen an Zielen oder Belohnungsdefinitionen über das Konfigurationsmanagement und eine manuelle Genehmigung weiter.
- Überprüfen Sie sowohl die Absicht des Benutzers als auch die des Agenten zur Laufzeit, bevor Sie zielverändernde oder weitreichende Aktionen ausführen, und unterbrechen Sie die Ausführung, sobald die vom Agenten vorgeschlagene Aktion von seiner ursprünglichen Aufgabe oder seinem ursprünglichen Aufgabenbereich abweicht.
- Prüfen Sie den Einsatz neuer Muster wie „Intent Capsules“, die ein deklariertes Ziel, dessen Einschränkungen und dessen Kontext in einem signierten, manipulationssicheren Umschlag an jeden Ausführungszyklus binden.
- Jede verbundene Datenquelle, einschließlich RAG-Eingaben, E-Mails, Kalendereinladungen, hochgeladener Dateien, externer APIs und Peer-Agent-Nachrichten, muss bereinigt und validiert werden, bevor diese Daten die Ziele oder Aktionen der Agenten beeinflussen.
- Die Aktivitäten des Agenten anhand einer Verhaltensbasislinie protokollieren und kontinuierlich überwachen, die den Zielzustand und die Muster des Werkzeugeinsatzes abdeckt, und bei unerwarteten Zieländerungen oder anomalen Werkzeugsequenzen eine Warnung auslösen
- Führen Sie regelmäßig Red-Team-Szenarien zur Zielüberschreibung durch und überprüfen Sie, ob die Rücknahme tatsächlich funktioniert.
- Integrieren Sie KI-Agenten in das bestehende Programm zur Bekämpfung interner Bedrohungen, damit Ermittler auffällige Aktivitäten auf dieselbe Weise überprüfen können wie die eines menschlichen Insiders.
Jede dieser Steuerelemente trägt dazu bei, zu verzögern und zu verhindern, dass eine eingeschleuste Eingabeaufforderung bei einer ausgeführten Aktion wirksam wird.
< Zurück zu Glossar der Begriffe