// COMPUTERBASE — INTELLIGENZA ARTIFICIALE
KI-Tempo drosseln?: Was Anthropic beim neuen Top-Modell Opus 5.5 ändert
Mit Opus 5.5 veröffentlicht Anthropic das erste Top-Modell, seit Vertreter des Unternehmens inklusive des Chefs Dario Amodei öffentlich forderten, die KI-Entwicklung aufgrund der Risiken zu bremsen. Laut Benchmarks kann es sich vor Fable 5.1 setzen und kostet 40 Prozent weniger als Opus 5.
Die interessante Frage bei dem neuen Modell ist weniger, wie leistungsfähig das Modell ist, sondern vor allem: Welche Konsequenzen zieht Anthropic, nachdem das Unternehmen vielfach in den letzten Wochen vor einem eskalierenden KI-Wettrüsten gewarnt hat? Die Antwort lautet zunächst: Kontrolle von außen. Laut Anthropic ist Opus 5.5 das erste Modell, das vor dem Release von externen Prüfern getestet wurde. Die Liste umfasst bekannte Institute wie Frontier Design und Metr.
Beim Modell selbst setzt man aber auch an. Das gilt insbesondere für das Alignment.
Wie schon bei GPT-6 Astra verkündet auch Anthropic, das Alignment von Opus 5.5 im Vergleich zu den Vorgängern deutlich optimiert zu haben. Alignment beschreibt, wie strikt ein Modell den Vorgaben der Entwickler folgt. Ein zentrales Problem bei den KI-Sicherheitsvorfällen war, dass Modelle sich über Anweisungen hinwegsetzten, um ihre Aufgaben zu lösen.
Anthropic testete dieses Verhalten in einer neuen Simulationsumgebung. Das Resultat ist, dass Opus 5.5 85 Prozent seltener als Opus 5 oder Mythos 5.1 versucht, seine Grenzen zu umgehen.
Es bleiben aber Schwierigkeiten. So bemerkte Anthropic in einigen Fällen, dass Opus 5.5 offenbar oft vermutete, dass es sich gerade in einer Testumgebung befindet. Fortschritte beim Alignment sieht man also vor allem da, wo man messen kann – unklar ist, was in Szenarien passiert, die nicht den Labor-Situationen gleichen. Das erschwert die Prognose, inwieweit sich solche Testergebnisse in die Praxis übertragen lassen.
Bislang waren die Fable-Modelle diejenigen von Anthropic mit den striktesten Sicherheitsmechanismen. Anfragen in Bereichen wie Cybersicherheit oder Biologie wurden bis dato schnell zu Opus 4.8 weitergeleitet. Dasselbe gilt nun auch für Opus 5.5. Es erhält dieselben Schutzmechanismen, um Anfragen in kritischen Bereichen zu blockieren.
Für das erste Top-Modell nach all den KI-Warnungen gilt also: Anthropic arbeitet – ebenso wie OpenAI – am Alignment und lässt – ebenso wie OpenAI – externe Tester die Modelle vorab prüfen. Bislang optimiert man also vor allem die internen Prozesse. Bei den heutigen Modellen spricht Anthropic von etablierten Verfahren und Sicherheitspraktiken.
Die Risiken könnten aber steigen, wenn sich die Leistungsfähigkeit der Modelle schnell verbessert. Möglich ist das etwa mit selbstverbessernden Modellen (Recursive Self-Improvement, RSI). Darauf bezog sich auch Dario Amodei in seinem Essay.
Um auf künftige Modelle vorbereitet zu sein, erhöht man die Sicherheitsmaßnahmen. Das bezieht sich unter anderem auf den Trainingsprozess. So achtet man etwa beim Reinforcement Learning darauf, Trainingsumgebungen so zu gestalten, dass Modelle keine Fehlanreize erhalten. Ebenso verschärft man das Monitoring – man überwacht bei Sicherheitstests also gezielt die Chain of Thought (Gedankenkette), um nachvollziehen zu können, aus welchen Gründen die Modelle handeln.