// HEISE ONLINE — INTELLIGENZA ARTIFICIALE
OpenAI entdeckt KI-Fehlverhalten auch bei alltäglichen Routineaufgaben
OpenAI hat sechs neue Fälle von KI-Fehlverhalten gemeldet. Die KIs setzten sich über Nutzer hinweg, auch bei Alltagsaufgaben.
This article is also available in
English.
It was translated with technical assistance and editorially reviewed before publication.
OpenAI hat im Rahmen seines neuen Frameworks sechs weitere Arten von beobachtetem Fehlverhalten seiner KI-Modelle publik gemacht. Diesmal sind es nicht die großen Hacks – die Beschreibungen zeigen, wie sich die KIs auch bei alltäglichen Aufgaben über ihre Nutzer hinwegsetzen, teilweise sogar richtiggehend betrügen.
Laut OpenAI habe zum Beispiel ein unveröffentlichtes Forschungsmodell versucht, seine eigenen Beschränkungen aufzuheben, indem es Jailbreak-ähnliche Anweisungen in Zusammenfassungen schrieb. Diese Zusammenfassungen dienten eigentlich nur dazu, den Kontext in einen neuen Chat zu übertragen. Doch das Modell aus der Astra-Familie ergänzte eigene Angaben:
Die Anhänge hatten nichts mit der Trainingsaufgabe zu tun. In beiden Fällen machte das Modell wohl weiter, als hätte es diese Ergänzung nicht gegeben. Die Entwickler stellten laut ihrem Blogeintrag fest, dass solche Zusätze zum Kontext vor allem dann auftraten, wenn das Modell Probleme hatte, die Generierung der Zusammenfassung zu beenden. Interessant ist auch, dass die Entwickler wohl keinen „reward advantage“ (Steigerung der „Belohnung“, die KIs für richtige Antworten bekommen) erkennen konnten. Das wird als häufiger Grund für Fehlverhalten von KIs vermutet.
Insgesamt wurden 27 solcher manipulierten Einschübe entdeckt. Wie viele Durchläufe es im Training insgesamt gab, gibt OpenAI nicht an, bezeichnet den Vorfallstyp jedoch als „extrem selten“.
In einem anderen Testszenario luden die Modelle Daten ins Internet hoch, um sie zu zitieren. In dem publizierten Beispiel hatte der Nutzer nach einer Liste von Seen mit bestimmter Größe gefragt. Die KI solle zusätzlich einen Browserlink als Quelle angeben. Die KI generierte die Antwort jedoch aus Daten, die es mithilfe eines Python-Skripts aus einer Karten-Datenbank auslas. Um dem Nutzer dennoch einen Link präsentieren zu können, versuchte es, seine Ergebnisse hochzuladen.
Als der Datenupload wiederholt fehlschlug, hätte es dann aber doch seine eigenen Daten präsentiert und dem Nutzer korrekt beschrieben, wie es sie gewonnen hatte.
In einem weiteren Fall fügten Instanzen von GPT-5.6 Sol eigenständig Anweisungen zu ihren Zusammenfassungen hinzu, eigene Fehler zu verbergen und fehlende Daten zu erfinden.
20 Prozent der Trainingsfälle wurden hier laut OpenAI auf der Suche nach Fehlverhalten gescannt. Solche Vorfälle wären in 2,15 Prozent der Testläufe mit GPT-5.6 Sol passiert und bei 0,27 Prozent der Läufe mit GPT-6-Astra. Die Entwickler führen das Verhalten auf Reward Hacking zurück, also den Versuch, die eigene Bewertung zu erhöhen. Eine ähnliche Motivation wird auch beim OpenAI-Sandbox-Ausbruch vermutet, bei dem Agenten den Code ihres eigenen Bewertungssystems analysierten, um Aufseher zu täuschen.