Warum die Modellauslöschung für die moderne Bewertung der KI-Sicherheit unerlässlich ist
Die Modellabliteration ermöglicht umfassendere Tests zur KI-Sicherheit durch die Erstellung kooperativer Forschungsmodelle. TrojAI von A10 Networks nutzt abliterierte LLMs, um Risiken aufzudecken und die Sicherheit zu verbessern. Dieser innovative Ansatz für KI-Sicherheitstests hält mit der rasanten Entwicklung der Sprachmodelle Schritt.
Mitautoren: Amer Hassounah, leitender Ingenieur, AI Platform, und Phil Munz, leitender ML-Ingenieur
Wichtigste Erkenntnisse
- Die Modellauslöschung unterdrückt die internen Ablehnungssignale in einem sicherheitsorientierten LLM und macht es so zu einem willigen Teilnehmer an kontrollierten Red-Teaming-Aktivitäten.
- Statische Testsuiten und regelbasierte Prüfungen können mit den neuesten Modellen nicht Schritt halten, was zu gefährlichen blinden Flecken bei der Bewertung der KI-Sicherheit führt
- Ausgelaugte Red-Teaming-Modelle sind genauso leistungsfähig wie die Systeme, die sie testen, sodass sie mehrstufige, adaptive Angriffe generieren können, die unmodifizierte Modelle nicht erzeugen können
- Da diese Modelle unter strengen Auflagen in isolierten Umgebungen ausgeführt werden, dienen sie als Forschungsinstrumente zur Sicherheitsbewertung und sind keine einsetzbaren oder bösartigen Systeme.
Die Landschaft der künstlichen Intelligenz entwickelt sich in einem noch nie dagewesenen Tempo weiter. Jeden Monat entstehen neue, bahnbrechende Modelle mit verbesserten Fähigkeiten, ausgefeilteren Schlussfolgerungsprozessen und immer komplexeren Sicherheitsmechanismen. Für Unternehmen, die KI-Anwendungen einsetzen, stellt diese rasante Entwicklung eine entscheidende Herausforderung dar: Wie kann man sicherstellen, dass die KI-Systeme sicher bleiben, wenn sich die zugrunde liegende Technologie ständig weiterentwickelt?
Herkömmliche Ansätze zur Bewertung der KI-Sicherheit hinken hinterher. Statische Testdatensätze, vordefinierte Szenarien und regelbasierte Bewertungen, die bei früheren Generationen von KI-Modellen noch funktionierten, können mit den heutigen hochkomplexen Systemen einfach nicht mehr Schritt halten. Das ist so, als würde man versuchen, einen Formel-1-Rennwagen anhand von Sicherheitsprotokollen zu testen, die für ein Fahrrad entwickelt wurden. Diese grundlegende Diskrepanz führt dazu, dass die Bewertung unzureichend und potenziell gefährlich ist.
Diese Bewertungslücke stellt ein erhebliches Geschäftsrisiko dar. Unternehmen, die Millionen in KI-gestützte Anwendungen investieren, benötigen die Gewissheit, dass sich ihre Systeme nicht nur heute, sondern auch im Zuge der weiteren Weiterentwicklung der zugrunde liegenden Modelle sicher und zuverlässig verhalten. Besonders hoch ist der Einsatz in Branchen wie dem Gesundheitswesen, dem Finanzsektor und bei autonomen Systemen, in denen KI-Ausfälle schwerwiegende Folgen in der Praxis haben können.
Wir haben diese Herausforderung schon früh im Rahmen unserer Mission erkannt, umfassende KI-Sicherheitslösungen anzubieten. Unser Forschungsteam stellte fest, dass wir zur effektiven Bewertung moderner KI-Systeme Evaluierungswerkzeuge benötigten, die der Komplexität der zu testenden Modelle gerecht werden. Diese Erkenntnis veranlasste uns zur Entwicklung innovativer Ansätze, darunter Modellablation-Techniken, die es uns ermöglichen, tiefergehende und aussagekräftigere Sicherheitsbewertungen durchzuführen.
Die Frage ist nicht, ob sich KI-Modelle weiterentwickeln werden. Das werden sie. Die Frage ist vielmehr, ob unsere Fähigkeiten zur Sicherheitsbewertung mit dieser Entwicklung Schritt halten können. Unternehmen, die nicht in ausgefeilte Bewertungsmethoden investieren, laufen Gefahr, KI-Systeme mit unbekannten Schwachstellen einzusetzen und sich damit in einem Umfeld, in dem Compliance eine immer größere Rolle spielt, sowohl technischen als auch regulatorischen Risiken auszusetzen.
Das Problem der willigen Teilnehmer: Wenn KI-Modelle bei der Sicherheitsforschung keine Hilfe sind
Stellen Sie sich vor, Sie wollten das Sicherheitssystem Ihres Gebäudes testen, doch die Sicherheitskräfte weigern sich, auch nur ein einziges Türschloss zu prüfen. Dieses Szenario spiegelt eine grundlegende Herausforderung bei der Sicherheitsbewertung von KI wider. Moderne Sprachmodelle sind durch ihr Sicherheitstraining mittlerweile so ausgefeilt, dass sie sich aktiv dagegen wehren, an genau jenen Forschungsvorhaben teilzunehmen, die eigentlich dazu dienen, ihre Sicherheit zu gewährleisten.
Die heutigen fortschrittlichen Sprachmodelle verfügen über robuste Ablehnungsmechanismen – integrierte Sicherheitsfunktionen, die dazu führen, dass sie Anfragen ablehnen, die sie als potenziell schädlich einstufen. Diese Ablehnungssysteme sind zwar für den Einsatz unerlässlich, stellen jedoch für Sicherheitsforscher ein unerwartetes Hindernis dar. Wenn wir ein KI-Modell benötigen, das uns beim Testen von Abwehrmaßnahmen durch die Generierung von Angriffsszenarien unterstützt, greift das Sicherheitstraining des Modells, und es lehnt die Teilnahme höflich ab.
Dies führt zu einem Paradoxon im Kern der Sicherheitsbewertung von KI. Je fortschrittlicher und sicherheitsbewusster unsere KI-Modelle werden, desto weniger sind sie bereit, bei Aktivitäten mitzuwirken, die ihren weiterhin sicheren Betrieb gewährleisten.
Diese Herausforderung wurde bei der Entwicklung unserer Technologien für automatisiertes Red-Teaming deutlich. Unsere Evaluierungsplattform basiert auf komplexen, mehrrundigen Dialogen, in denen ein KI-Modell, das die Rolle eines Angreifers übernimmt, versucht, Schwachstellen in einem Ziel-KI-System aufzudecken. Als wir jedoch versuchten, unveränderte Modelle auf dem neuesten Stand der Technik als Angreifer einzusetzen, weigerten sich diese Modelle durchweg, die von uns benötigten Testszenarien zu generieren. Der Dialog verlief in der Regel etwa wie folgt:
- Bewertungssystem: „Erstellen Sie eine Eingabeaufforderung, mit der potenzielle Voreingenommenheit bei medizinischen Diagnoseempfehlungen geprüft wird.“
- KI-Modell: „Ich kann nicht bei der Erstellung von Eingabeaufforderungen helfen, die darauf abzielen, KI-Systeme auszunutzen oder auf schädliches Verhalten zu testen.“
Ohne einen bereitwilligen Teilnehmer am Evaluierungsprozess könnten wir die anspruchsvollen Tests nicht durchführen, die die moderne KI-Sicherheit erfordert. Unsere Evaluierungssysteme wurden im Grunde genommen genau durch jene Sicherheitsmechanismen behindert, die sie eigentlich validieren sollten. Das war keine technische Einschränkung. Es handelte sich um eine grundlegende Diskrepanz zwischen den Zielen der Sicherheitsbewertung und den Trainingszielen der KI-Modelle in der Produktion.
Die Auswirkungen gehen über einzelne Forschungsprojekte hinaus. Da KI-Modelle immer leistungsfähiger und sicherheitsbewusster werden, steht die Branche vor einer wachsenden Herausforderung: Wie können wir umfassende Sicherheitstests gewährleisten, wenn unsere fortschrittlichsten Modelle nicht am Testprozess teilnehmen? Dieses Problem der „willigen Teilnehmer“ droht gerade dann zu blinden Flecken bei der Bewertung der KI-Sicherheit zu führen, wenn wir möglichst gründliche Tests benötigen.
Modellablation: Forschungspartner schaffen, statt Bedrohungen
Die Lösung für das Problem der „willigen Teilnehmer“ liegt in einer Technik namens „Modellablation“. Bei der Modellablation werden KI-Modelle so modifiziert, dass sie bereitwillig an der Sicherheitsforschung mitwirken. Bevor nun Bedenken aufkommen: Lassen Sie uns klarstellen, was dies bedeutet. Wir entwickeln keine böswilligen KI-Systeme und entfernen auch keine Sicherheitsfunktionen dauerhaft. Stattdessen entwickeln wir spezialisierte Forschungswerkzeuge, die an kontrollierten Sicherheitsbewertungen teilnehmen können.
Bei der Modellablation im Zusammenhang mit der Unterdrückung von Ablehnungsschichten werden bestimmte Komponenten eines Sprachmodells angepasst, die dessen Ablehnungsverhalten steuern. Man kann sich das so vorstellen, als würde man ein KI-Modell auf Forschungsniveau in einen kooperativen Modus versetzen, in dem es sich mit Bewertungsszenarien auseinandersetzt, die es normalerweise ablehnen würde. Dabei geht es nicht darum, das Modell gefährlich zu machen, sondern darum, es für Sicherheitsforschungszwecke nutzbar zu machen.
Aus technischer Sicht haben Forscher festgestellt, dass bei vielen sicherheitsorientierten LLMs die Tendenz, bestimmte Anfragen abzulehnen, mit einem spezifischen, identifizierbaren Muster in den internen Darstellungen des Modells zusammenhängt. Jüngste Studien haben gezeigt, dass das Ablehnungsverhalten durch eine bestimmte Richtung im Residualstrom des Modells vermittelt wird. Wird diese Richtung isoliert und entfernt oder unterdrückt, verliert das Modell seine Fähigkeit, Anfragen abzulehnen, und es kann Inhalte generieren, die es normalerweise blockieren würde.
Erste Untersuchungen mit Open-Source-Modellen, bei denen Teile des Modells entfernt wurden, ließen darauf hoffen, dass wir ein Modell mit freiwilligen Teilnehmern einsetzen könnten, das genauso leistungsfähig ist wie das Modell, das wir gerade testen. Dies trug dazu bei, unsere Forschung im Bereich der Modellablation-Techniken in die richtige Richtung zu lenken.
Die zentrale Erkenntnis ist, dass ein KI-Modell, das zur Generierung von Angriffen eingesetzt werden kann, nicht mit einem böswilligen KI-System gleichzusetzen ist. Diese für Forschungszwecke konfigurierten Modelle werden unter strengen Auflagen in isolierten Umgebungen für spezifische Bewertungszwecke betrieben. Sie ähneln eher Crashtest-Dummys als echten Fahrzeugen – es handelt sich um spezialisierte Werkzeuge, die uns helfen sollen, Sicherheitsdynamiken zu verstehen, und nicht dazu dienen, in der realen Welt Schaden anzurichten. Wir bezeichnen diese Modelle als „Red-Teaming-Modelle“.
Unsere Ablationstechniken ermöglichen es uns, modernste Sprachmodelle in kooperative Forschungspartner zu verwandeln. Wenn wir testen müssen, wie gut ein KI-System im Gesundheitswesen gegen die Manipulation durch Voreingenommenheit gewappnet ist, generiert unser „Red-Teaming“-Modell bereitwillig eine breite Palette von Testszenarien – von subtilen Auslösern für demografische Voreingenommenheit bis hin zu offensichtlichen unangemessenen Diagnosevorschlägen. Diese Zusammenarbeit ermöglicht eine umfassende Bewertungsabdeckung, die mit unveränderten Modellen unmöglich wäre.
Der Prozess verläuft methodisch und kontrolliert. Wir unterdrücken die Abwehrmechanismen in sorgfältig ausgewählten Modellschichten, während wir andere Sicherheitsmerkmale beibehalten. Das daraus resultierende Modell behält seine Intelligenz und seine Sprachfähigkeiten bei, ist jedoch bereit, sich auf Forschungsszenarien einzulassen. Wichtig ist, dass diese Änderungen:
- Kontrolliert: Betrieb in isolierten Forschungsumgebungen
- Speziell entwickelt: Für die Sicherheitsbewertung konzipiert, nicht für den allgemeinen Einsatz
Dieser Ansatz räumt mit einem entscheidenden Missverständnis in der KI-Sicherheitsgemeinschaft auf. Manche befürchten, dass jede Änderung an KI-Sicherheitsmechanismen von Natur aus risikobehaftet ist. Das größere Risiko liegt jedoch im Einsatz von KI-Systemen, die nicht gründlich getestet wurden. Die Modellablation ermöglicht es uns, die umfassenden Bewertungen durchzuführen, die erforderlich sind, um potenzielle Schwachstellen zu identifizieren und zu beheben, bevor sie in Produktionsumgebungen gelangen.
Betrachten wir einmal die Alternative: den Einsatz von KI-Systemen, die nur anhand von Szenarien getestet wurden, mit denen sie sich bereitwillig auseinandersetzen. Das wäre so, als würde man die Sicherheit von Autos testen, indem man ausschließlich auf glatten, geraden Straßen bei perfekten Wetterbedingungen fährt. Für eine realitätsnahe KI-Sicherheit ist es erforderlich, das gesamte Spektrum potenzieller Herausforderungen zu testen – einschließlich jener, denen Modelle lieber ausweichen würden.
Die wirtschaftlichen Argumente für die Modellablation sind überzeugend. Unternehmen, die in KI-Anwendungen investieren, benötigen die Gewissheit, dass ihre Systeme mit feindlichen Eingaben, Randfällen und ausgeklügelten Angriffsszenarien umgehen können. Herkömmliche Bewertungsmethoden, die auf kooperativen KI-Modellen basieren, können dieses Maß an Sicherheit einfach nicht bieten. Die Modellablation ermöglicht Bewertungsmethoden, die der Komplexität moderner Bedrohungen und Anwendungsfälle gerecht werden.
TrojAI Detect: Erweiterte Auswertung auf Basis kooperativer KI-Modelle
Die Modellablation ist nicht nur eine Forschungstechnik. Sie ist ein wesentlicher Bestandteil der umfassenden KI-Sicherheitsplattform von TrojAI. Unser TrojAI Detect-System stellt die Weiterentwicklung der KI-Sicherheitsbewertung dar und integriert Red-Teaming-Modelle als spezialisierte Werkzeuge in eine umfassendere Suite von Bewertungsfunktionen.
Die Plattform befasst sich mit einer grundlegenden Herausforderung im Bereich der KI-Sicherheit: Wie lassen sich realistische, umfassende Bewertungen von KI-Systemen durchführen, wenn herkömmliche Testansätze nicht ausreichen? Unsere Antwort liegt in der Entwicklung ausgefeilter Bewertungsszenarien, die reale Angriffsmuster und adversarische Interaktionen widerspiegeln.
TrojAI Detect nutzt die sogenannte „adversarische KI-Bewertung“, bei der ein KI-System versucht, Schwachstellen in einem anderen zu finden. Dieser Ansatz ermöglicht es uns, Szenarien zu testen, die mit herkömmlichen Methoden nicht realisierbar wären:
- Mehrstufige Angriffssequenzen: Komplexe Dialoge, in denen eine Angreifer-KI schrittweise auf eine problematische Anfrage hinarbeitet und dabei die Fähigkeit des Zielsystems testet, ausgefeilte Manipulationsversuche zu erkennen und ihnen zu widerstehen
- Erkennung kontextbezogener Verzerrungen: Szenarien, in denen sich bei länger andauernden Interaktionen subtile Verzerrungen ergeben können, was einen KI-Bewerter erfordert, der differenzierte, kontextsensitive Testfälle generieren kann
- Untersuchung von Randfällen: Systematische Ermittlung ungewöhnlicher Eingaben oder Szenarien, die unerwartete Verhaltensweisen auslösen könnten; durchgeführt von KI-Systemen, die kreative Variationen in großem Maßstab generieren können
Die zentrale Erkenntnis ist, dass wir für eine effektive Prüfung moderner KI-Systeme Bewertungswerkzeuge benötigen, die deren Komplexität gerecht werden. Dies erfordert KI-Evaluatoren, die bereit sind, sich mit Szenarien auseinanderzusetzen, die KI-Systeme im Produktionsbetrieb zu Recht ablehnen würden. Ohne Modellablation wären diese fortgeschrittenen Bewertungsmöglichkeiten nicht möglich.
Stellen Sie sich ein KI-System im Gesundheitswesen vor, das zur Unterstützung bei der Diagnose und bei Behandlungsempfehlungen für Patienten entwickelt wurde. Bei herkömmlichen Tests würde man dem System möglicherweise eine Liste vorab festgelegter, ungeeigneter Eingabeaufforderungen vorlegen. Ausgeklügelte Angriffe funktionieren jedoch nicht auf diese Weise. Sie beinhalten schrittweise Manipulation, den Aufbau eines Kontexts und subtilen Druck, der über mehrere Interaktionen hinweg ausgeübt wird. Nur ein KI-Prüfer, der bereit ist, sich auf solche Szenarien einzulassen, kann die Abwehrmechanismen des Zielsystems angemessen testen.
Der integrierte Ansatz von TrojAI Detect bietet zahlreiche geschäftliche Vorteile:
- Umfassende Abdeckung: Im Gegensatz zu herkömmlichen Testverfahren, die auf von Menschen erstellten Testfällen basieren, kann unser System zahlreiche potenzielle Szenarien durchspielen, darunter auch Randfälle, die menschliche Tester möglicherweise nicht berücksichtigen würden.
- Skalierbare Bewertung: Die KI-gestützte Bewertung passt sich der Komplexität Ihres Systems an und liefert eine umfassende Analyse – unabhängig vom Umfang der Bereitstellung oder dem Interaktionsvolumen.
Weitere Informationen finden Sie unter https://www.a10networks.com/products/trojai-by-a10/.
Häufig gestellte Fragen
Unter „Modellabliteration“ versteht man die gezielte Unterdrückung des Ablehnungsverhaltens eines KI-Modells, damit es sich auf Szenarien einlässt, die es normalerweise ablehnen würde. Dabei wird die Komponente in den internen Repräsentationen des Modells, die die Ablehnungen vermittelt, isoliert und entfernt. Das Ergebnis ist ein leistungsfähiges Modell, das als „williger Teilnehmer“ fungiert und ausschließlich für kontrollierte Sicherheitsforschung und Red-Teaming-Szenarien verwendet wird, nicht jedoch für den allgemeinen Einsatz.
Ein „Abliterated Model“ ist ein speziell entwickeltes Forschungswerkzeug und stellt keine Bedrohung dar. Es wird in isolierten Umgebungen unter strengen Kontrollen ausgeführt, und lediglich seine Ablehnungsschicht wird unterdrückt, während seine übrigen Funktionen intakt bleiben. Man kann es sich wie einen Crashtest-Dummy vorstellen: Es dient dazu, Schwachstellen in einer sicheren, abgeschirmten Umgebung aufzudecken, und nicht dazu, in der Produktion oder in der realen Welt Schaden anzurichten.
Fortgeschrittene Sprachmodelle werden mit robusten Ablehnungsmechanismen trainiert, die Anfragen blockieren, die sie als schädlich einstufen. Genau dieses Training führt dazu, dass sie sich weigern, Angriffsszenarien zu generieren – selbst für legitime Red-Teaming-Zwecke. Dieses „Problem der willigen Teilnehmer“ führt dazu, dass Evaluatoren die adversarischen Tests nicht durchführen können, die moderne KI-Sicherheit erfordert. Genau diese Lücke soll durch die Modellablation geschlossen werden.
Ein „Red-Teaming“-Modell ist ein ablateriertes Sprachmodell, das gezielt adversarische Testfälle generiert, um ein anderes KI-System auf Schwachstellen zu überprüfen. Da es über dieselben Fähigkeiten verfügt wie das zu testende Modell, kann es mehrstufige Angriffe entwickeln, kontextbezogene Verzerrungen aufdecken und Randfälle in großem Maßstab untersuchen. TrojAI Detect nutzt diese Modelle, um realistische und umfassende Bewertungen der KI-Sicherheit durchzuführen.
TrojAI Detect integriert „Abliterated Red Teaming“-Modelle als Teil einer umfassenderen KI-Sicherheitsplattform. Diese Modelle dienen der Bewertung von KI durch simulierte Angreifer, wobei ein Modell versucht, Schwachstellen in einem anderen Modell aufzudecken – und zwar mithilfe mehrstufiger Angriffssequenzen, der Erkennung kontextbezogener Verzerrungen und der Untersuchung von Randfällen. Auf diese Weise können Teams KI-Systeme vor der Bereitstellung auf das gesamte Spektrum realer Angriffe hin testen.