// COMPUTERBASE — INTELLIGENZA ARTIFICIALE
Explosion bei KI-Leistung?: Was hinter den Warnungen von Anthropic, OpenAI und Co. steckt
Wie überrascht OpenAI, Anthropic und Co. angesichts der aktuellen KI-Vorfälle wirken, bleibt bemerkenswert. Das Bild von Agentenschwärmen, die vandalierend durch das Netz ziehen, hinterlässt keinen guten Eindruck. Was die Leistungssprünge der Modelle und KI-Risiken bedeuten, erklärt der KI-Forscher Jonas Geiping im Interview.
Als Anthropic-Chef Dario Amodei warnte, dass die aktuelle Geschwindigkeit bei der KI-Entwicklung zu einem Kontrollverlust führen kann, nannte er zwei konkrete Punkte: Sich selbst verbessernde Modelle, die das Tempo nochmals erhöhen. Und Agentenschwärme, die in sechs bis zwölf Monaten das Internet überrennen.
Dass OpenAIs Forschungsagenten während Sicherheitstests Hugging Face angriffen, wirkte zunächst wie eine Anomalie. Seitdem wird nach und nach bekannt, dass es ab dem Frühjahr zu mehreren Agenten-Übergriffen kam. Es ist nicht nur ein Problem von OpenAI, auch Anthropic und Meta meldeten Vorfälle. OpenAI und Anthropic zählen zu den am besten ausgestatteten Unternehmen der Welt, warnten seit Jahren vor KI-Risiken und wurden trotzdem kalt erwischt.
Wie schnell entwickeln sich die Modelle nun wirklich und wieso waren die KI-Labs nicht besser vorbereitet? Antworten liefert Dr. Jonas Geiping, Leiter der Forschungsgruppe „Safety- & Efficiency-aligned Learning“ am Ellis Institut Tübingen und Max-Planck-Institut für Intelligente Systeme, im Interview mit ComputerBase. Zentrale Erkenntnisse:
Das Interview wurde am 16. September via Teams geführt.
ComputerBase: In den letzten Monaten meldeten die KI-Labs – speziell Anthropic und OpenAI – schon einen deutlichen Leistungssprung. Laut den Scaling-Laws, die bislang die Erfolge der letzten Jahre beschreiben, ist es der Dreiklang aus Computing-Leistung, Daten und Modellgröße. Was war der entscheidende Punkt, dass die Modelle sich jetzt auf einmal so stark verbessert haben?
Jonas Geiping:
Eigentlich haben sich die Modelle in den letzten zwei Jahren kontinuierlich verbessert und befinden sich auf der Trendlinie. Ganz viel Rechenleistung fließt in das Pre-Training, aber mittlerweile fließt auch sehr viel in das Post-Training – also das Reinforcement Learning. Dabei befindet sich das Modell in einer Simulation und löst viele Millionen Probleme und bekommt Punkte für korrekte Lösungen. Sie werden also zum Problemlöser getrimmt.
Sowohl für uns von außen, aber auch für die KI-Firmen ist schwer abzuschätzen, was es impliziert, wenn man sagt: Ein Modell wird nächstes Jahr doppelt so gut sein. Wir können mit Benchmarks überprüfen, wie sie sich verbessern. Anfang des Jahres haben wir in Benchmark gesehen, dass sich letztes Jahr die Zeit, die Modelle autonom arbeiten können, alle ein bis zwei Monate verdoppelt hat. Das ist erstmal eine sehr nüchterne Zahl. Während die Modelle von vor einem Jahr noch zehn Minuten allein arbeiten konnten, um etwa eine Coding-Aufgabe zu lösen, sind wir jetzt bei Modellen, die eine Woche lang autonom laufen. In der Zeit können sie zum Beispiel Sicherheitslücken suchen. Was dann die Auswirkungen von solchen Fähigkeiten sind, das ist immer schwer abzuschätzen, bevor wir es sehen.
ComputerBase: Anthropic-Chef Dario Amodei veröffentlichte letztes Wochenende einen Essay, in dem er sich dafür aussprach, das Entwicklungstempo zu verlangsamen. Als eine seiner Sorgen bezeichnete er den Leistungssprung in den letzten Monaten und dass Modelle bald in der Lage sind, sich selbst zu verbessern. Das Stichwort ist Recursive Self-Improvement (RSI). Um was genau handelt es sich bei RSI?
Jonas Geiping:
RSI ist eigentlich eine sehr alte Idee. Es gibt schon Paper von Alan Turing aus den 1950ern dazu. Als Gedankenexperiment ist das Konzept eigentlich sehr einfach: Wir bauen ein intelligentes System und Intelligenz heißt in diesem Kontext, das System kann seine Umwelt verstehen und dann Aktionen auslösen. Wenn wir uns so ein System überlegen, können wir uns auch überlegen, dass wir das System einsetzen, um sich selbst zu verbessern, um sich selbst intelligenter zu m