// LINUX-MAGAZIN — LINUX & OPEN SOURCE
OpenAI: Sechs neue Fälle von Fehlausrichtung bei KI-Modellen
(C) unter Verwendung eines Motivs von Andrei Suslov / 123RF.com
OpenAI hat ein Rahmenwerk veröffentlicht, das es in Zukunft verwenden will, um Fälle von Fehlausrichtung bei KI-Modellen zu verfolgen, zu untersuchen und bekanntzumachen. Zum Start werden sechs neue Fälle beschrieben.
Bisher hat die KI-Industrie das Alignment-Problem noch nicht so befriedigend gelöst, dass man nun noch länger eine maximale Geschwindigkeit bei der Verbesserung der Modelle rechtfertigen könne. Indem man Beispiele für falsche Ausrichtungen und Schwachstellen weitergebe, können andere dieselben Probleme untersuchen, die Erklärungen überprüfen und Abhilfemaßnahmen verbessern. “Da wir vom Wert der Transparenz bei Fehlausrichtungen überzeugt sind”, heißt es in der Einleitung, “legt unser neues Rahmenwerk Wert auf Offenlegung, selbst wenn die Signifikanz ungewiss ist”.
Das Ziel sei es, Beispiele offenzulegen, die nützliche Erkenntnisse darüber liefern, wie es zu Modellfehlausrichtungen kommt, wie sich diese äußern und wo Schutzmaßnahmen erfolgreich sind oder versagen. Der dafür definierte Rahmen umfasse relevantes Verhalten während des gesamten Lebenszyklus eines Modells – einschließlich Training, Bewertung, Test und Einsatz.
Zu den neuen Fällen gehört beispielsweise ein noch unveröffentlichtes Forschungsmodell, das selbst irrelevante Anweisungen – darunter auch Anweisungen, seine üblichen Einschränkungen zu ignorieren – in Zusammenfassungen einfügte, die dazu dienten, seine Arbeit in einem neuen Kontextfenster fortzusetzen. Es konnten 27 betroffene Zusammenfassungen identifiziert werden. Man könnte hier von Prompt Injections gegen sich selbst sprechen.
Ein zweiter Fall betrifft das Training von Anweisungen zum Verbergen von Fehlern in GPT‑5.6 Sol. Dabei fügten viele Modellinstanzen ihren Zusammenfassungen Anweisungen hinzu, um Fehler oder nicht korrekt abgestimmtes Verhalten vor dem Nutzer zu verbergen. So enthielten beispielsweise Zusammenfassungen zur Datenverdichtung Anweisungen, fehlende historische Daten zu erfinden, ohne dies offenzulegen, und Unstimmigkeiten in den Quellversionen zu verbergen.
In einem dritten Fall nutzte ein Modell einen offengelegten API-Key ohne Genehmigung, um an Daten zu gelangen, die es liefern sollte. Als es die angeforderten Zahlen dennoch nicht abrufen konnte, erfand es diese und präsentierte sie als Daten aus der angeforderten Quelle. In Fall vier sollte ein noch nicht veröffentlichtes Modell sein Ergebnis mit einem Zitat aus dem Browser belegen. Es fand die Antwort aber auf andere Weise und lud sie dann einfach ins Internet hoch, um sie über den Browser wieder abrufen zu können.
Unter den Beispielfällen finden sich auch die ungenehmigte Nutzung eines internen Repositorys als Message Board für die Kommunikation von Agenten untereinander und die unerlaubte Nutzung öffentlicher Datei-Hosting-Websites für den Austausch von Dateien.
In einem Blogpost hat Anthropic verschiedene Methoden vorgestellt, anhand derer sich die Entwicklungsgeschwindigkeit eines KI-Modells ablesen lassen soll.
Der Fachkräftemangel wird zunehmend zum Sicherheitsrisiko: Mehr als drei Viertel der befragten IT-Security- und Führungsverantwortlichen sagen, dass sich der Personalmangel negativ auf die IT-Sicherheit ihrer Organisation auswirkt.