// HEISE ONLINE — INTELLIGENZA ARTIFICIALE
Googles Gemini 4 Argon legt Fokus auf Cybersicherheit
Google stellt Gemini 4 Argon für IT-Sicherheit und Enterprise-Workflows vor, doch die Benchmarks zeigen Lücken gegenüber GPT-6 Astra und Claude Sonnet 5.5.
Googles neues Spitzenmodell im Bereich künstliche Intelligenz heißt Gemini 4 Argon. Es soll insbesondere in komplexen Enterprise-Workflows, bei der Rechts- und Finanzanalyse sowie IT-Sicherheit punkten. Wie im offiziellen Blogbeitrag des Konzerns betont wird, bietet das Modell ein von 64.000 auf eine Million Token angehobenes Output-Limit und soll tiefgreifendes Schlussfolgern über lange, mehrstufige Prozesse hinweg ermöglichen. Zunächst erhalten nur ausgewählte Cyber-Verteidiger über das Fairwind-Programm Zugriff, später sollen zahlende API-Kunden und Abonnenten von Google AI Ultra folgen.
Google setzt Argon nach eigenen Angaben bereits intern ein und nennt drei Beispiele, die sich bislang nicht unabhängig überprüfen lassen. Bei der Optimierung von Quantenalgorithmen habe das Modell den Ressourcenbedarf (Qubits × Gatter) eines Unterprogramms innerhalb weniger Minuten um 40 Prozent unter den veröffentlichten Referenzwert gedrückt. In den Rechenzentren hätten Argon-Agenten anhand von Profiling-Daten eigenständig Speicheroptimierungen identifiziert und umgesetzt, die nach dem Rollout über 300 TByte Arbeitsspeicher freisetzen sollen. Insgesamt schätzt Google die Einsparung auf 500 TByte bis 1 PByte.
Außerdem sollen Argon-Agenten C/C++-Code nach Rust portieren, von Bibliotheken wie re2 und libgav1 mit einigen zehntausend Zeilen bis zum Zircon-Kernel des Betriebssystems Fuchsia mit mehr als 800.000 Zeilen. Wegen der Bedeutung vieler dieser Systeme durchlaufen die Umschreibungen laut Google automatisierte und manuelle Prüfungen sowie Emulationstests, bevor sie produktiv eingesetzt werden. Beim Video-Decoder libgav1 ersetzten die Agenten in einer bestehenden Rust-Portierung 32.000 Zeilen SIMD-Code durch sicheren Rust-Code, den der Compiler selbst vektorisiert. Das Ergebnis sei ein speichersicherer Decoder mit identischer Videoausgabe, der 2,7-mal schneller läuft als die bisherige Rust-Portierung und damit näher an die optimierte C++-Variante heranrückt.
Mit Ihrer Zustimmung wird hier ein externer Inhalt geladen.
Ich bin damit einverstanden, dass mir externe Inhalte angezeigt werden.
Damit können personenbezogene Daten an Drittplattformen übermittelt werden.
Mehr dazu in unserer
Datenschutzerklärung.
Wie bei KI-Modellankündigungen üblich, legt Google den Schwerpunkt auf jene Tests, in denen das eigene Modell vorn liegt. Im Blogbeitrag stehen vor allem zwei Werte im Vordergrund: DeepSWE v1.1 (langfristige Softwareentwicklung): 77,9 Prozent, laut Google ein neuer Bestwert. Auch beim Vals Index (wirtschaftlicher Nutzen in Finanzen, Recht, Steuern und Coding) liegt Argon demnach mit 68,9 Prozent auf dem ersten Platz, ebenso beim AutomationBench von Zapier (51,3 Prozent), beim Videoverständnis-Benchmark LVBench (91,7 Prozent) und beim Schwachstellen-Patching laut CWE-bench v1 (68 Prozent).
Laut Googles Vergleichstabelle erreicht GPT-6 Astra bei letzterem indes ebenfalls 68 Prozent. Nicht im Text erwähnt Google dagegen Tests, bei denen Argon nicht führt: FrontierSWE v2 (55,0 gegenüber 65,5 Prozent bei GPT-6 Astra), Terminal-Bench Science 0.1 (57,6 gegenüber 68,1 Prozent bei GPT-6 Astra), OSWorld-2.0 (69,2 gegenüber 72,6 Prozent bei GPT-6 Astra) und PostTrainBench (45,3 gegenüber 49,3 Prozent bei Claude Opus 5.5).
Besonders deutlich wird die selektive Darstellung beim Terminal-Bench 4.0 für agentisches Programmieren im Terminal. Mit 57,4 Prozent landet Argon hinter allen Konkurrenten aus Googles eigener Tabelle. Nimmt man das in Googles Tabelle fehlende Claude Sonnet 5.5 mit der Angabe von Anthropic hinzu, ergibt sich folgendes Bild:
Sonnet 5.5 schlägt Argon um mehr als 13 Punkte, und das bei identischen Tokenpreisen von zwei und zehn US-Dollar pro Million Input- beziehungsweise Output-Token. Die Abstände zu GPT-6 Astra und Fable 5.1 sind dagegen minimal. Dass Argon i