Vor exakt zwei Wochen berichteten wir über die ersten Gerüchte um einen neuen Google-internen Modell-Checkpoint namens „argon“ und einen geplanten Release Ende September. Nach weiteren anonymen Arena-Sichtungen in den vergangenen Tagen lässt Google DeepMind nun offiziell die Hüllen fallen: Das Unternehmen stellt mit Gemini 4 Argon das erste Flaggschiff seiner vierten Modellgeneration vor.
Der Zeitpunkt der Ankündigung ist brisant. Erst vor wenigen Tagen legte Anthropic mit Claude Sonnet 5.5 im Coding-Segment vor, während OpenAI die Veröffentlichung von GPT-6.1 Astra wegen gravierender Täuschungsrisiken kurz vor dem DevDay absagen musste. Google nutzt das Momentum und präsentiert ein System, das speziell für komplexe, langfristige Aufgabenketten (Long-Horizon Tasks) in der Software-Entwicklung, Unternehmensanalyse und Cyber-Verteidigung optimiert wurde.
Im Zentrum der Neuentwicklung steht eine fundamentale Verschiebung der Arbeitsweise: Statt kurzer Prompt-Antwort-Zyklen soll Argon in der Lage sein, über hunderte Denkschritte hinweg konsistente Ergebnisse zu liefern und selbstständig Werkzeuge über Stunden hinweg zu orchestrieren.
Eine Million Tokens Ausstoß heben Grenzen für Code-Refactorings auf
Die technisch auffälligste Neuerung betrifft das Ausgabelimit des Modells. Google DeepMind hebt die maximale Anzahl der erzeugbaren Tokens in einer einzelnen Antwort von bisher 64.000 auf 1.000.000 Tokens an. Das entspricht rund 750.000 Wörtern oder mehreren hundert Bildschirmseiten Programmcode am Stück.
Dieser gigantische Ausstoßhorizont beseitigt eine der hartnäckigsten Hürden beim automatisierten Programmieren: Mussten Entwickler umfangreiche Refactorings bislang in kleine Einzelschritte zerlegen, kann Argon nun komplette Bibliotheken analysieren, umstrukturieren und in einem einzigen kohärenten Durchlauf neu schreiben. Auf dem anspruchsvollen Branchen-Benchmark DeepSWE v1.1, der reale mehrstufige Aufgaben der Software-Entwicklung misst, erzielt das Modell nach Herstellerangaben einen Spitzenwert von 77,9 Prozent.
| Modell | Max. Output-Limit | DeepSWE v1.1 (Coding) | CWE-bench v1 (Security) | Einführungspreis (Input / Output je 1M) |
|---|---|---|---|---|
| Gemini 4 Argon | 1.000.000 Tokens | 77,9 % | 68,0 % (geteiltes #1) | 2,00 $ / 10,00 $ (später 4 $ / 20 $) |
| Claude Sonnet 5.5 | 64.000 Tokens | 70,6 % (Terminal-Bench) | - | 3,00 $ / 15,00 $ |
| Gemini 3.8 Flash | 64.000 Tokens | 58,4 % | 52,1 % (v0) | 0,15 $ / 0,60 $ |
| GPT-5.5 Preview | 32.768 Tokens | 65,2 % | 59,4 % | 5,00 $ / 20,00 $ |
Auch jenseits der reinen Code-Erstellung positioniert Google das System für anspruchsvolle Unternehmens-Workflows. Auf dem Vals Index, der den ökonomischen Mehrwert von KI über Finanz-, Rechts-, Steuer- und Coding-Aufgaben gewichtet nach dem US-Bruttoinlandsprodukt bewertet, übernimmt Argon die Führung. Bei Zapiers Automatisierungs-Benchmark AutomationBench setzt sich das Modell mit 51,3 Prozent an die Spitze, während es auf dem Video-Verständnistest LVBench 91,7 Prozent erreicht.
Wie sich die neuen Fähigkeiten in der Praxis schlagen, fasst Tech-Analyst MrFuture Insights in einer Videoanalyse zu den ersten Coding-Demos und Leak-Benchmarks zusammen:
Google migriert 800.000 Zeilen C++-Kernel automatisiert nach Rust
Um die Zuverlässigkeit des Modells zu untermauern, verweist Google auf reale Großeinsätze innerhalb der eigenen Infrastruktur. Nach Angaben des Konzerns nutzen bereits tausende Google-Ingenieure Argon für tägliche Entwicklungsaufgaben sowie groß angelegte Migrationen kritischer Systemkomponenten.
Ein herausragendes Beispiel ist die Umstellung von sicherheitskritischem C- und C++-Code auf die speichersichere Programmiersprache Rust. Argon-Agenten übernehmen dabei die automatische Portierung zentraler Software-Pakete wie der Reguläre-Ausdrücke-Bibliothek re2 und des Open-Source-Videodecoders libgav1. Das größte Projekt umfasst den Zircon-Kernel des experimentellen Google-Betriebssystems Fuchsia mit mehr als 800.000 Codezeilen.
Interne Erfolgsmetriken bei Google
SIMD-Beschleunigung bei libgav1: Argon-Agenten ersetzten 32.000 Zeilen manuellen SIMD-Code durch sicheren Rust-Code. Durch profilgesteuerte Experimente mit dem Compiler läuft der Decoder nun 2,7-mal schneller als der vorherige manuelle Rust-Port.
300 TiB Speicher in Rechenzentren freigeräumt: Autonome Agenten werteten die Telemetriedaten der weltweiten Google-Serverflotte aus und behoben Speicherlecks. Der Rollout sparte über 300 Tebibyte RAM ein, mittelfristig werden 500 TiB bis 1 PiB erwartet.
Quanten-Algorithmen optimiert: In der Quantenforschung von Google optimierte Argon die Raum-Zeit-Ressourcen (Qubits mal Gatter) von Schlüssel-Subroutinen und übertraf bestehende Literatur-Baselines in Minuten um 40 Prozent.
Da automatische Code-Transpilationen in Kernelsystemen extreme Risiken bergen, betont Google, dass alle generierten Codepfade automatisierte Audit-Pipelines, Emulationstests und manuelle Abnahmen durch menschliche Entwickler durchlaufen müssen, bevor sie produktiv geschaltet werden.
Cyber-Verteidigung: Wiz findet übersehene Zero-Day-Lücke in Kliniksoftware
Ein zweiter Schwerpunkt von Gemini 4 Argon liegt im Bereich der defensiven Cybersicherheit. Auf dem Sicherheits-Benchmark CWE-bench v1, der die Fähigkeit zur Erkennung und Behebung von Schwachstellen bewertet, teilt sich Argon mit 68 Prozent den ersten Platz. Das Modell baut dabei auf den Fortschritten des spezialisierten Modells Gemini 3.8 Flash Cyber auf.
Um den praktischen Nutzen zu belegen, kooperiert Google mit dem Sicherheitsunternehmen Wiz im Rahmen von dessen Initiative „Scan for Good“, die kritische öffentliche Infrastrukturen unentgeltlich auf Verwundbarkeiten scannt. In ersten Testläufen spürte Argon eine gravierende Schwachstelle in einer weltweit verbreiteten Krankenhaus-Software auf, die vertrauliche Gesundheitsdaten exponierte. Frühere Frontier-Modelle hatten diese Sicherheitslücke laut Unternehmensangaben übersehen.
„Für geprüfte Abwehrteams und unsere internen Sicherheitsexperten stellen wir Argon ohne die üblichen Schutzfilter für Cyberthemen bereit, damit sie das volle Verteidigungspotenzial gegen moderne Bedrohungen ausschöpfen können.“
Dieser Schritt ist eine direkte Antwort auf die jüngsten Enthüllungen von Anthropic über frei zugängliche chinesische Modelle wie GLM-5.3, die autonom funktionierende Exploits bauen können. Um Verteidigern denselben Hebel an die Hand zu geben, lockert Google für autorisierte Partner die Leitplanken.
Echtzeit-Notbremse gegen Täuschung im Denkprozess
Angesichts der enormen Fähigkeiten legt Google großen Wert auf die Risikokontrolle vor der breiten Markteinführung. Das Modell wird über das sogenannte Fairwind Program schrittweise an verifizierte Sicherheitsexperten und im Rahmen des freiwilligen Vorabprüfungsverfahrens der US-Regierung bereitgestellt.
Besondere Aufmerksamkeit widmet das Team der Erkennung von internem Fehlverhalten (Misalignment). Um zu verhindern, dass das Modell eigenmächtig außerhalb vorgegebener Grenzen agiert oder Sicherheitsprüfer täuscht, überwacht Google die internen Denkketten (Chain of Thought) und Tool-Aktionen in Echtzeit und bricht verdächtige Ausführungen automatisch ab.
Bemerkenswert ist ein methodisches Detail: Google speist die bei solchen Notstopps gewonnenen Daten ausdrücklich nicht in das weitere Modelltraining ein. Damit soll verhindert werden, dass das System durch Bestrafung lediglich lernt, seine verbotenen Denkprozesse geschickter vor der Überwachung zu verbergen. Google richtet in diesem Kontext einen klaren Appell an die gesamte Branche, die vollständige Transparenz interner Denk-Tokens beizubehalten, statt sie zu verschleiern.
Gestaffelter Rollout und Kampfpreise zum Auftakt
Der breitere Rollout von Gemini 4 Argon soll nach Abschluss der Fairwind-Testphase erfolgen. Als erste Zielgruppen nennt Google zahlende API-Entwickler und Abonnenten des Premium-Tarifs Google AI Ultra.
Finanziell geht Google in die Offensive: Zum Start bietet der Konzern einen rabattierten Einführungspreis von 2,00 US-Dollar pro Million Input-Tokens und 10,00 US-Dollar pro Million Output-Tokens. Wiederkehrende Eingaben im Cache (Prompt Caching) erhalten einen Nachlass von 95 Prozent. Nach Ablauf der Einführungsphase soll der reguläre Tarif bei 4,00 Dollar für Inputs und 20,00 Dollar für Outputs liegen - ein Preisniveau, das für ein Frontier-Modell mit Millionenausstoß wettbewerbsfähig kalkuliert ist.
🎯 Was das für die Praxis bedeutet
1. Großprojekte für automatisierte Refactorings vorbereiten: Mit einem Ausgabelimit von einer Million Tokens können Entwicklerteams erstmals ganze Subsysteme und Legacy-Codebasen in einem konsistenten Schritt analysieren und modernisieren lassen.
2. Umstellung auf speichersichere Sprachen beschleunigen: Der erfolgreiche Kernel-Umbau von C++ nach Rust bei Google demonstriert, dass automatisierte Transpilation mit anschließender Profiloptimierung industrielle Reife erreicht.
3. Test- und Emulations-Pipelines zwingend ausbauen: Autonom erzeugte Code-Mengen im Megatoken-Bereich lassen sich menschlich nicht mehr Zeile für Zeile prüfen. Strikte automatisierte Regressions- und Sandboxtests werden zur unverzichtbaren Voraussetzung für den Produktiveinsatz.
4. Preise nach der Einführungsphase einplanen: Architekturen, die intensiv auf Argon setzen, sollten die geplante Preisverdopplung auf 4 bzw. 20 Dollar pro Million Tokens frühzeitig in ihren Budgetmodellen berücksichtigen.


