Modelle & Agenten

Gemini 3.6 Flash: Google schärft Effizienz und kündigt Gemini 4 an
Gemini 3.6 Flash benötigt laut Google weniger Ausgabe-Token und verbessert einzelne Agenten-Benchmarks. Zugleich ist das Pre-Training für Gemini 4 bereits gestartet.

Washington-Briefing: Ist das schon GPT-6? Was bestätigt ist und was Gerücht bleibt
Altman informiert Washington über eine kommende Modellfamilie. In der Community kursieren zugleich unbestätigte Angaben zu GPT-6, möglichen Terminen und neuen Fähigkeiten.

Qwen 3.8 Max offiziell lanciert:
SOTA-Hype oder „benchmaxxed Slop“?
Alibabas öffentlich testbares Spitzenmodell polarisiert die Entwicklergemeinde. Die Preview ist offiziell gestartet und auf chat.qwen.ai verfügbar - doch die ersten Meinungen gehen weit auseinander.

Kimi K3 in der Praxis:
starke Frontend-Demos, offene Fragen bei Legal und Betrieb
Community-Tests zeigen Webseiten, Spiele und Vertragsanalysen. Die Beispiele sind vielversprechend, ersetzen aber keine kontrollierten Qualitäts-, Sicherheits- und Verfügbarkeitstests.

Kimi K3 startet als Dienst und API:
Gewichte für 2,8-Billionen-Modell angekündigt
Moonshot macht Kimi K3 über seine Dienste und API verfügbar. Die vollständigen Open-Weight-Dateien waren für spätestens 27. Juli angekündigt; insgesamt ordnet der Hersteller K3 hinter Fable 5 und GPT-5.6 Sol ein.

Inkling: Thinking Machines Lab veröffentlicht erstes Open-Weight-Modell
Inkling bietet 975 Milliarden Gesamtparameter, 41 Milliarden aktive Parameter, multimodale Eingaben und steuerbaren Denkaufwand. Die offenen Gewichte erfordern sehr große GPU-Systeme.

Vom Kivine-Gerücht zum Kimi-K3-Launch:
Was bestätigt wurde
Die Community vermutete Kimi K3 hinter einem Arena-Modell. Bestätigt sind später 2,8 Billionen Parameter, eine Million Token Kontext und die Verfügbarkeit über Kimi-Dienste und API.

Bonsai 27B: Das erste 27-Milliarden-Modell läuft auf dem Smartphone
PrismML komprimiert Qwen 3.6 27B auf 3,9 GB. Laut Hersteller behält die 1-Bit-Variante mehr als 90 Prozent und die ternäre Variante mehr als 95 Prozent der Vergleichsleistung.

GPT-5.6 Sol beeindruckt im ersten Härtetest - und OpenAI stellt mit ChatGPT Work neuen Agenten vor
Die KI Woche hat die ersten Beispiele zu GPT-5.6 Sol und verrät, warum GPT-6 Gerüchten zufolge bereits in wenigen Wochen folgen könnte.

Grok 4.5: SpaceXAI und Cursor gelingt das günstigste Frontier-Coding-Modell
Mixture-of-Experts auf GB300-GPUs, 80 TPS, Platz 1 im Harvey Legal Benchmark — und das günstigste Frontier-Modell am Markt.

GPT-5.6 Sol startet Donnerstag - und Fable 5 bleibt die Nummer 1
OpenAI weitet den Preview-Zugang global aus. Frühe Tester sind sich einig: Gutes Modell, aber Anthropics Fable 5 liegt weiterhin vorn.

Higgsfield Supercomputer kann jetzt Full-Stack-Apps und Spiele bauen
Bild- und Videoplattform wird zur universellen KI-Entwicklungsumgebung: Apps mit Frontend, Backend und Datenbank - plus eine eigene Gaming-Pipeline.

Claude Cowork kommt für Web und Mobile - und Fable 5 geht in die Verlängerung
Anthropic macht seine KI-Agenten plattformunabhängig und verlängert den kostenlosen Fable-5-Zugang für alle Abonnenten bis 12. Juli.

LongCat 2.0: Meituans 1,6-Billionen-Parameter-Modell lief zwei Monate unerkannt auf OpenRouter
Open Source, MIT-Lizenz, trainiert auf chinesischen Chips. In Community-Tests auf Augenhöhe mit Opus 4.8 und GPT-5.5.

Googles Aufholjagd: Leaks und Gerüchte um Gemini 3.5 Pro verdichten sich
Interne API-Einträge, Arena-Tests und ein Polymarket-Wettmarkt deuten auf einen Launch am 17. Juli. Die ersten Ergebnisse sehen stark aus.

Prompt Engineering ist tot — Anthropics Fable-5-Guide definiert die Regeln neu
Vergiss 'Think step by step': Anthropics offizielle Prompting-Anleitung für Fable 5 zeigt, wie radikal sich der Umgang mit KI-Modellen verändert hat.

ZCode 3.0: Zhipu AIs Coding-IDE macht GLM-5.2 zum Komplettpaket
Das chinesische KI-Labor verpackt sein Open-Weights-Topmodell in eine Desktop-App mit Multi-Agenten, Goal Mode und 1-Million-Token-Kontext. Cursor und Claude Code bekommen Konkurrenz aus Peking.

Claude Sonnet 5 unter der Lupe:
Effizienter als Opus und doch überraschend teuer
Die Community testet Anthropics neues Standardmodell. Das Bild ist differenziert: In manchen Benchmarks überlegen, bei den realen Kosten aber eine Überraschung.

Keine Spur von Gemini 3.5 Pro:
Google DeepMind hält die Spannung
Trotz wochenlanger Leaks und Benchmark-Hinweise bleibt Googles nächstes Frontier-Modell unsichtbar - während die Konkurrenz im Stundentakt liefert.

Sonnet 5 ist da: Kannibalisiert Anthropic sein leistungsstarkes Opus 4.8 Modell?
Das agentischste Sonnet aller Zeiten kommt nah an Opus heran - zu deutlich niedrigeren Preisen. Für viele verschwimmt die Grenze zwischen günstig und leistungsstark.