Mitten in die Spekulationen um das anstehende Modellrennen der Woche platzt Elon Musks KI-Schmiede mit einem handfesten Release: SpaceXAI hat am 21. September 2026 offiziell Grok 4.7 vorgestellt. Das neue Flaggschiff zielt primär auf Programmieraufgaben und anspruchsvolle Wissensarbeit ab. Bemerkenswert ist dabei vor allem die Preisstrategie: Trotz eines deutlich vergrößerten Basismodells bleibt der Nominalpreis identisch zum Vorgänger Grok 4.6.

Laut offizieller Mitteilung von xAI basiert Grok 4.7 auf einer überarbeiteten Modellarchitektur, die in einer verlängerten Trainingsphase mit bestärkendem Lernen (Reinforcement Learning) auf stundenlange Workflows getrimmt worden sei. Das Modell solle dadurch länger an komplexen Problemen feilen, Zwischenschritte sorgfältiger prüfen und Kontexte von bis zu 500.000 Token zuverlässiger bewältigen.

Neues Basismodell verzahnt sich direkt mit dem Grok Bot

Ein zentraler technischer Hebel liegt in der direkten Anbindung an die eigene Software-Infrastruktur. SpaceXAI betont, dass Grok 4.7 speziell für das Zusammenspiel mit der Ausführungsumgebung (dem sogenannten Harness) des im August gestarteten Grok Bot trainiert wurde. Dadurch verstehe das Modell Entwicklerumgebungen, Terminal-Sitzungen und Dateioperationen nativ, anstatt Befehle nur über generische Schnittstellen abzuwickeln.

Gleichzeitig steht Grok 4.7 ab dem ersten Tag in der Programmierumgebung Cursor sowie im hauseigenen Terminal-Agenten Grok Build bereit. Neben dem Standardmodell stellt xAI eine Fast-Variante zur Verfügung, die bei doppeltem Token-Preis die doppelte Ausgabegeschwindigkeit liefern soll.

CursorBench und Wissens-Index rücken Grok an die Spitzengruppe

Die unabhängigen Auswertungen von Artificial Analysis und die Daten von CursorBench 4.0 zeichnen ein differenziertes Bild der Leistungsfähigkeit. Im Coding Agent Index von Artificial Analysis klettert Grok 4.7 mit Grok Build auf 56 Punkte - ein Zuwachs von neun Zählern gegenüber Version 4.6. Damit belegt das Modell Rang vier unter allen Systemen mit nativer Entwicklerumgebung, knapp hinter Claude Fable 5.1, GPT-6 Astra und Claude Opus 5.

Besonders deutlich fällt der Zuwachs bei professioneller Wissensarbeit aus. Im Wissens-Benchmark AA-Briefcase, der realistische mehrstündige Büro- und Rechercheaufgaben von Analysten simuliert, gewinnt Grok 4.7 111 Elo-Punkte hinzu und erreicht 1.657 Punkte. Damit schließt das Modell direkt zur Spitzengruppe um Claude Opus 5 und Fable 5.1 auf. Auch im GDPval-AA erreicht es mit 1.695 Elo ein neues Niveau für die Grok-Familie.

Benchmark / Metrik Grok 4.7 (xhigh) Grok 4.6 (high) GPT-5.6 Sol (max) Claude Fable 5.1 (max)
CursorBench 4.0 46,3 % 40,4 % 41,7 % 51,8 %
Kosten / Aufgabe (CursorBench) $ 6,01 - $ 8,23 $ 17,28
DeepSWE v1.1 71,0 %* 65,2 % 72,7 % 70,0 %
AA Briefcase v1.1 (Elo) 1.657 1.546 1.487 1.678
Terminal-Bench 4.0 38,0 % 20,3 % 37,3 % 57,9 %
Harvey Legal Agent 19,6 % 15,8 % 2,5 % 6,7 %
EEBench (Elektrotechnik) 64,0 % 53,0 % 39,4 % 56,4 %
Input-Preis (je 1M Token) $ 2,00 $ 2,00 $ 4,00 $ 10,00
Output-Preis (je 1M Token) $ 6,00 $ 6,00 $ 20,00 $ 50,00

* Wert für Grok 4.7 auf DeepSWE markiert eine Messung unter maximaler Denkstufe (High Effort). Bei Terminal-Bench 4.0 weichen die Herstellerangaben von xAI (38,0 %) und die unabhängige Messung von Artificial Analysis (33 %) voneinander ab.

Grok halbiert die Aufgabenkosten gegenüber Claude Opus 5

Der wirtschaftliche Hebel wird auf CursorBench 4.0 greifbar: Während Fable 5.1 Max mit 51,8 % die absolute Tabellenspitze anführt, kostet eine gelöste Aufgabe dort im Schnitt 17,28 US-Dollar. Grok 4.7 erreicht in der Stufe Extra High 46,3 % Erfolgsquote bei durchschnittlichen Kosten von nur 6,01 Dollar.

Damit unterbietet xAI sowohl Claude Opus 5 Max (46,6 % bei 11,95 Dollar) als auch GPT-5.6 Sol Max (41,7 % bei 8,23 Dollar) spürbar. Für Entwicklerteams mit hohem monatlichen Durchsatz verschiebt das Modell die wirtschaftliche Pareto-Grenze, wie es zuvor schon Grok 4.5 im Sommer getan hatte.

Der versteckte Token-Hunger

Hoher Token-Ausstoß: Laut Messung von Artificial Analysis erzeugt Grok 4.7 bei maximaler Denkstufe (xhigh) rund 81.000 Output-Token pro Testaufgabe. Das sind 125 Prozent mehr als bei Grok 4.6 und fast dreimal so viele wie bei GPT-6 Astra max.

Kostenfalle bei langen Schleifen: Zwar ist der Nominalpreis von 6 Dollar pro Million Token sehr günstig, doch der exzessive Denkprozess kann bei komplexen Mehrstunden-Aufgaben die Ersparnis teilweise wieder aufzehren.

Erste Praxis-Demos reichen von detailliertem Code bis zu Grafik-Pannen

In ersten Praxistests auf X zeigen sich die Stärken und Tücken des neuen Modells. Ein Entwickler testete eine Python-Simulation einer Einbahnstraßen-Ampelsteuerung mit variablen Fahrzeugströmen und lobte die bisher unerreichte Detailtiefe des generierten Codes. Ein anderer Ersteller demonstrierte funktionierende 3D-Spieleprototypen wie einen Sonic-Klon und einen Doodle-Shooter.

Doch nicht alle Reaktionen fallen euphorisch aus. Mehrere Nutzer äußerten sich enttäuscht über den Abstand zwischen Musks Vorankündigungen und der Praxisleistung. Ein Tester scheiterte beim Versuch, eine aufwendige 3D-Raketenstart-Szene mit Three.js zu generieren: Trotz eines Token-Verbrauchs von 1,59 Dollar lieferte Grok 4.7 optisch mangelhafte Resultate, während Kimi im selben Szenario überzeugte.

Unabhängige Tester in der Entwicklerszene bilanzieren, dass Grok 4.7 zwar ein spürbarer Schritt nach vorn gegenüber Version 4.6 sei und dank doppeltem Durchsatz flüssig arbeite, bei reiner Spitzen-Logik aber noch nicht ganz an Fable 5.1 oder GPT-5.6 Sol heranreiche. Auch die Testberichte in den Arena-Ranglisten zeigen, dass Grok 4.7 vor allem dort glänzt, wo klare Coding-Harnesse vorliegen.

Neuer Sicherheits-Stack soll Unternehmen gegen Cyber-Risiken absichern

Neben den Leistungsdaten hebt SpaceXAI einen komplett neu aufgesetzten Sicherheits-Stack hervor. Auf dem hauseigenen HackerBench v0.3, der potenziell schädliche Cyber-Operationen prüft, lasse das Modell lediglich 3,3 Prozent der riskanten Prompts durch, ohne legitime Sicherheitsforschung zu blockieren. Ausgewählte Partner sollen künftig Zugriff auf sogenannte Red-Teaming-Fähigkeiten (gezielte Härtetests durch simulierte Cyberangriffe) für defensive Analysen erhalten.

Gleichzeitig erzielte Grok 4.7 auf LatchBios Biosicherheits-Benchmark einen Wert von 62,4 Prozent. Das Unternehmen positioniert das Modell damit gezielt für sicherheitskritische Enterprise-Kunden, die bisher vor den oft laxeren Richtlinien früherer Grok-Versionen zurückschreckten.

Ernüchterung in der Entwickler-Community überwiegt

In den ersten Stunden nach der Veröffentlichung kippte die anfängliche Neugierde in weiten Teilen der Entwicklerszene in spürbare Ernüchterung. Während xAIs offizielle Benchmarks Grok 4.7 nahe an der Tabellenspitze verorten, zeichnen vertiefte Praxistests auf X ein ernüchterndes Bild: Für komplexe Frontend-, SVG- und 3D-Aufgaben sehen viele Programmierer das Modell hinter etablierten Konkurrenten zurückbleiben.

„Look at the gap between Grok 4.7 and Fable. Benchmarks have lost all credibility.“

Entwickler auf X zur Diskrepanz zwischen synthetischen Testzahlen und der realen Code-Praxis

Besonders die Diskrepanz zwischen synthetischen Testwerten und der Anwendungsqualität im Editor sorgt für anhaltenden Frust. Auch der Test mit Vektorgrafiken (SVG) für einen Xbox-Controller offenbarte zwar sichtbare Fortschritte gegenüber Grok 4.6, blieb laut Testern aber weit hinter den Erwartungen an ein echtes Frontier-Modell zurück.

Auch Indie-Entwickler und Solo-Programmierer äußern sich ernüchtert: Nach monatelangem Warten und großspurigen Vorankündigungen sei das Ergebnis im Alltagseinsatz weit von den hochgesteckten Erwartungen entfernt. Statt eines gefühlten Quantensprungs präsentiere sich Grok 4.7 als inkrementelles Update mit spürbaren Ecken und Kanten.

Als gravierender Knackpunkt erweist sich zudem die extreme Token-Verbrennung bei tieferen Denkprozessen. Entwickler Srikanth Valluri dokumentierte eine 58-minütige Modellsitzung zur Generierung eines Apache-Hubschraubers, die über 11,3 Millionen Token verschlang - davon allein 182.000 Output-Token und 135.000 reine Reasoning-Token - und mit 11,48 US-Dollar zu Buche schlug. Tester Bhavani berichtete ebenfalls über rapide aufgebrauchte Kontingente bei gleichzeitig instabiler Physik im generierten 3D-Code.

Zwar verteidigen pragmatische Stimmen Grok 4.7 als schnelles und kostengünstiges Arbeitstier für über 90 Prozent der routinemäßigen Coding-Aufgaben, doch der Tenor unter Power-Usern ist eindeutig: Die Erwartung eines echten Fable- oder Sol-Killers erfüllt das Modell nicht. Die Blicke vieler Entwickler richten sich daher bereits auf das in Aussicht gestellte Grok 5.

🎯 Was das für die Praxis bedeutet

1. Coding-Budgets neu kalkulieren: Mit 6,01 Dollar pro CursorBench-Aufgabe bietet Grok 4.7 nahezu das Leistungsniveau von Claude Opus 5 zum halben Preis. Für Entwicklungsteams lohnt sich ein A/B-Test in Cursor ab sofort.

2. Denkaufwand pro Task begrenzen: Da Grok 4.7 auf der Stufe xhigh über 80.000 Output-Token generieren und Sessions mit über 135.000 Reasoning-Token die Rechnung trotz günstigem Tokenpreis auf über 11 Dollar treiben können, sollten Teams den Reasoning-Aufwand konfigurieren.

3. Frontend- und 3D-Erwartungen dämpfen: Für UI-Design, komplexe SVG-Erstellung und 3D-Simulationen bleibt Claude weiterhin die verlässlichere Wahl. Grok 4.7 empfiehlt sich primär für Backend-Code, System-Skripte und datenintensive Wissensarbeit.

4. Sicherheitsarchitektur vor Rollout prüfen: Die nachgewiesenen Fortschritte bei HackerBench machen Grok 4.7 für regulierte IT-Infrastrukturen interessanter als die Vorgänger. Für europäische Unternehmen bleiben jedoch Datenschutzfragen zur US-Cloud-Verarbeitung vor dem Produktiveinsatz obligatorisch.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
SpaceXAI auf X ↗ xAI News ↗ CursorBench 4.0 ↗ Artificial Analysis auf X ↗ yohakujpn auf X ↗ diegocabezas01 auf X ↗ cherry_mx_reds auf X (3D Sonic) ↗ synthwavedd auf X ↗ Bhavani_00007 auf X ↗ cb_doge auf X ↗ cherry_mx_reds auf X (Doodle Shooter) ↗ Srikanth Valluri auf X (Token-Session) ↗ Adam Holter auf X (SVG-Test) ↗ Token Gremlin auf X (Xbox-Controller SVG) ↗ Da7em auf X (Kritik & Fable-Vergleich) ↗ Bhavani auf X (3D-Frontend-Kritik) ↗ Sahil Panhotra auf X (Indie-Builder-Fazit) ↗
Teilen: