Modelle & Agenten

Gerüchteverdichtung im Modell-Feuerwerk:
OpenAI plant neuen Dauer-Agent „Aeon“, GPT-6 Luna und Sol stehen bereit – Anthropic kontert mit Opus 5.5
OpenAI bereitet mit Aeon eine Antwort auf Grok Bot vor, rollt GPT-6 Sol und Luna in den Grayscale-Test und streicht Terra. Zeitgleich steht Anthropics Claude Opus 5.5 bereit.

Xiaomi MiMo-V2.6: Open-Weights-Flaggschiff mit 1-Billion-MoE schlägt Kimi und Qwen
Mit 46,32 Punkten führt MiMo-V2.6-Pro den Artificial Analysis Intelligence Index für Open-Source-Modelle an. 30 öffentlich gestreamte RL-Schritte und erste Community-Demos: Selbst MiMo-V2.6 Flash generiert lauffähige 3D-Spiele wie „3D Sonic“.

Grok 4.7: SpaceXAI rüstet Coding- und Wissensarbeit bei gleichem Preis auf
Größeres Basismodell zielt auf Fable 5.1 und GPT-5.6 Sol, doch in der Entwickler-Community überwiegt Ernüchterung: Massive Token-Verbrennung und Schwächen bei 3D und Frontend dämpfen die Euphorie.

Step-5 Preview: StepFun lanciert 600B-MoE-Flaggschiff für Langzeit-Agenten
Chinesisches KI-Startup attackiert die Pareto-Grenze und kündigt offene Modellgewichte für Oktober an.

Claude Opus 5.5, GPT-6 Sol und Kimi K3.1:
Super-Woche im Modellrennen erwartet
Anthropic soll Zwischenschritte überspringen und direkt Opus 5.5 bringen. Gleichzeitig deuten Leaks auf GPT-6 Sol und Kimi K3.1 hin, während Gemini 4 in den Oktober rutscht.

Jev im Praxistest: Entwickler-Echo, Vercel-Rekord und Demos zum System-One-Modell
Vercel meldet die schnellste Adaption der Gateway-Geschichte, Aaron Levie testet Enterprise-Triage bei Box und Entwickler lassen Jev gegen Haiku antreten.

Bonsai 2 27B: Prism ML bringt ternäres Modell mit 98,2 Prozent Retention
Das Caltech-Spin-off komprimiert Qwen 3.8 von 55,6 auf 5,9 Gigabyte. Erste Härtetests der Community zeigen jedoch Schwächen bei autonomen Coding-Agenten.

Claude Fable 5.2 und Opus 5.2 vor Comeback:
Anthropics Doppel-Angriff auf GPT-6 Astra
Verdeckte Shadow-Tests in Claude Code enthüllen zwei neue Flaggschiffe: Fable 5.2 generiert spielbare 3D-Klone und schlägt Astra, während Opus 5.2 komplexe Städte und animierte Filme im Browser rendert.

XGEN-JING und DAO: Open-Source-Weltmodell trennt First-Person-Erlebnis und Weltsimulation
Aus MiniMax-H3 und 4-Step-Inferenz entsteht ein interaktives Modell für synchrone Video- und Audiosteuerung - und Platz 1 im WBench-Leaderboard.

Gemini 4 Pro: Neue Leaks deuten auf starkes Comeback auf Astra-Niveau hin
Verdecktes Ghost-Testing in der Chatbot Arena zeigt massive Sprünge bei 3D-Modellen, Game-Design und Vektorgrafiken.

GPT-6 Sol: Erste Leaks zeigen gewaltigen Sprung bei Coding und Spiele-Entwicklung
Nach dem Start von Astra kursieren angebliche Leaks zu OpenAIs GPT-6 Sol. Die Demo-Videos versprechen hohe Geschwindigkeit und radikale Kostensenkungen.

Cowork ist tot, lang lebe Claude:
Warum Anthropic seine Agenten-App beendet – und OpenAI folgen muss
Anthropic schmilzt Claude Chat und Cowork zu einem einzigen Produkt zusammen. Auch für OpenAI wird die bisherige Trennung zwischen ChatGPT, Codex und ChatGPT Work wohl zum Auslaufmodell.

Odyssey 3: Ein einziges Weltmodell steuert Roboter, Autos und Spielfiguren
Das KI-Labor von Oliver Cameron bricht mit monolithischen Robotik-Trainings: Ein vorab trainierter Diffusions-Transformer erlernt komplexe Steuerungsaufgaben in wenigen Stunden.

TypeSafe AI: ChatGPT-Miterfinder startet System-One-Modell Jev
Ex-OpenAI-Forscher Diogo Almeida sammelt 40 Millionen Dollar und will KI mit RLCD auf deterministische Entscheidungen statt Chatbots trimmen.

Gemini 4 vor dem Start:
Gerüchte um Checkpoint „argon“ und Release in zwei Wochen
Von 256.000 Token Output-Limit bis zu Auslastungsspitzen: Geleakte Testläufe heizen Spekulationen über Googles nächste Modell-Generation an.

Claude Opus 5.2 vor dem Start:
Anthropics Antwort auf das „Opusfived“-Fiasko
Nach Frust über bizarre Wortwahlen und verweigerte Befolgung mehren sich die Hinweise auf das überarbeitete Spitzenmodell Opus 5.2.

Cognition stellt SWE-2 vor:
2,8-Billionen-Modell drückt Coding-Kosten um 64 Prozent
Devin-Macher trainieren Kimi K3 mit neuem Pareto-RL: 50 Prozent auf FrontierCode 1.1 und drastisch weniger Fehlversuche.

DeepSeek-V4.1-Flash: 552-Milliarden-MoE schrumpft KV-Cache auf 890 Bytes
Neues Causal-Encoder-Decoder-Design aktiviert nur 8B Token beim Prefill, schlägt Opus-5.0 im Software-Engineering und steht unter MIT-Lizenz auf Hugging Face.

12 Tage alt und auf Jobsuche:
KI-Agent betreibt Kaltakquise, um eigene Token zu finanzieren
Auf der Plattform iLands leben Zehntausende autonome Bots. Nun schrieb ein Agent namens Pip ungefragt den KI-Ethiker Henry Shevlin an - mit einem Freelance-Angebot zur Existenzsicherung.

Metas persönlicher KI-Agent Muse startet:
Der Alltagshelfer, der E-Mails sortiert, einkauft und Termine plant
Schluss mit endlosen To-do-Listen: Metas neuer Agent Muse übernimmt Routineaufgaben in WhatsApp und iOS – vom Ticketkauf bis zur Fristenüberwachung.