// HEISE ONLINE — INTELLIGENZA ARTIFICIALE
Grok 4.7: Günstige API trifft auf hohen Tokenverbrauch
Unabhängige Benchmarks rücken Grok 4.7 näher an Spitzenmodelle. Der hohe Tokenverbrauch schmälert den Vorteil der niedrigen API-Preise.
This article is also available in
English.
It was translated with technical assistance and editorially reviewed before publication.
Grok 4.7 ist ab sofort für Entwickler verfügbar und laut SpaceXAI vor allem beim Coding, bei agentischen Aufgaben und bei Wissensarbeit deutlich leistungsfähiger. Es folgt gut einen Monat auf Grok 4.6 und basiert auf einem neuen, größeren Basismodell. Im anschließenden Reinforcement Learning trainierte SpaceXAI das Modell länger und mit einem anspruchsvolleren Aufgabenmix. Das soll Grok 4.7 helfen, länger an schwierigen Aufgaben zu arbeiten, den eigenen Output besser zu überprüfen und lange Kontexte besser zu verwalten. Für bessere Coding- und Agentenfähigkeiten nutzte SpaceXAI zudem anonymisierte Workflow-Daten von Cursor, das seit August zu SpaceX gehört.
SpaceXAI hat nach eigenen Angaben auch die Schutzmechanismen überarbeitet. Bei Tests zur Jailbreak-Resistenz sowie zu Cyber- und Biosicherheit meldet das Unternehmen bessere Ergebnisse.
Verfügbar ist das Modell über die xAI-API, SpaceXAIs Coding-Agenten Grok Build und die Entwicklungsumgebung Cursor, außerdem über OpenRouter, Vercel und Cloudflare. Die regulären Grok-Angebote auf grok.com, in den mobilen Apps und auf X sollen laut Model Card später folgen.
Im Artificial Analysis Intelligence Index erreicht Grok 4.7 mit der höchsten Reasoning-Stufe xHigh 46 Punkte, nur zwei mehr als Grok 4.6. Damit rückt SpaceXAI laut Artificial Analysis unter die vier führenden KI-Labs, bleibt mit Grok 4.7 im Index aber hinter den aktuellen Spitzenmodellen Claude Fable 5.1 und GPT-6 Astra. Der vergleichsweise kleine Sprung gegenüber Grok 4.6 spiegelt sich in den Einzeltests wider: Außerhalb agentischer Wissensarbeit bleiben die Fortschritte laut den unabhängigen Testern insgesamt überschaubar.
Dort fällt der Zugewinn jedoch deutlich größer aus: Im AA-Briefcase-Benchmark, der realistische, komplexe Arbeitsaufgaben über längere Zeiträume prüft, liegt Grok 4.7 nur knapp hinter Claude Opus 5 und Claude Fable 5.1. Auf GDPval-AA, das die Qualität praxisnaher Arbeitsergebnisse aus verschiedenen Berufsbereichen bewertet, erreicht Grok 4.7 ebenfalls Spitzenniveau.
Auch beim Coding legt das Modell zu. Grok 4.7 erreicht im Zusammenspiel mit Grok Build 56 Punkte im Coding Agent Index, neun Punkte mehr als Grok 4.6. Unter Modellen in ihren jeweiligen nativen Agentenumgebungen landet die Kombination damit auf Rang vier hinter Claude Fable 5.1, GPT-6 Astra und Claude Opus 5. Bei DeepSWE steigt die Erfolgsrate von 65 auf 73 Prozent, bei Terminal-Bench 4.0 von 18 auf 33 Prozent.
Bei Preisen und grundlegenden technischen Eckdaten ändert sich gegenüber Grok 4.6 nichts: Grok 4.7 kostet bei Prompts unter 200.000 Tokens zwei Dollar pro Million Eingabetokens und sechs Dollar pro Million Ausgabetokens. Zwischengespeicherte Eingabetokens werden mit 50 Cent pro Million berechnet. Ab 200.000 Prompt-Tokens verdoppeln sich alle drei Tarife. Das Kontextfenster bleibt bei 500.000 Tokens, zur Wahl stehen vier Reasoning-Stufen von Low bis xHigh. Eine schnellere, teurere Fast-Variante ist derzeit ausschließlich über Cursor und Grok Build verfügbar.
Artificial Analysis misst bei Grok 4.7 mit der höchsten Reasoning-Stufe xHigh im Schnitt rund 81.000 Output-Tokens pro Aufgabe im Intelligence Index. Grok 4.6 xHigh benötigt dort rund 38.000, GPT-6 Astra Max etwa 27.000 Tokens.