Modelle & Agenten

Hermes Desktop: Nous Research bringt Open-Source-Agenten auf Mac, Windows und Linux
Mit Hermes Desktop wird der offene KI-Agent zur nativen App. Die Software integriert sich tief in das Betriebssystem und bietet persistentes Gedächtnis sowie isolierte Sandbox-Umgebungen.

Project Solara: Microsoft baut Agent-First-Hardware auf Android-Basis
Auf der Build 2026 zeigt Microsoft zwei Referenzgeräte - Desktop Hub und Wearable Badge - die keine Apps mehr ausführen, sondern ausschließlich KI-Agenten. Die Plattform läuft auf Android, nicht Windows.

Sieben neue MAI-Modelle:
Microsoft setzt auf Hillclimbing-Architektur
Microsoft AI launcht sieben spezialisierte Modelle - von Reasoning über Coding bis Multimodal. Die Hillclimbing-Strategie ersetzt den Alles-in-einem-Ansatz.

Nemotron 3 Ultra: Nvidia liefert das stärkste offene KI-Modell der USA
550 Milliarden Parameter, 55 Milliarden aktiv, 309 Tokens pro Sekunde: Mit Nemotron Ultra greift Nvidia die proprietären Frontier-Modelle an - und veröffentlicht alles als Open Source.

MiniMax M3: Chinas erstes Open-Weight-Modell auf Frontier-Niveau
MiniMax veröffentlicht M3 mit einer neuen Sparse-Attention-Architektur, die eine Million Token Kontext bei einem Zwanzigstel der bisherigen Rechenkosten ermöglicht. In Benchmarks liegt es auf Augenhöhe mit GPT-5.5 und Claude Opus 4.7.

ForecastBench: Können KI-Modelle die Zukunft vorhersagen?
Ein neuer Benchmark testet KI-Prognosen gegen menschliche Superforecaster. Die Modelle holen auf - aber die besten Prognostiker liegen noch vorn.

OpenAI Rosalind Biodefense:
Ein KI-Modell für die Pandemieabwehr - und ein strategischer Schachzug
OpenAI gibt Regierungen und Forschungslaboren Zugang zu GPT-Rosalind, einem Frontier-Modell für Biosicherheit. Die Strategie dahinter ist mindestens so interessant wie die Technologie.

Computer nur mit Stimme steuern:
Was GPT-Realtime 2.0 als Betriebssystem-Schnittstelle kann
Ein Entwickler zeigt, wie OpenAIs Echtzeit-Sprachmodell den Computer ohne Tastatur und Maus bedient - und warum das mehr ist als eine Demo.

PiD: NVIDIAs Pixel-Decoder macht KI-Bilder in unter einer Sekunde 4K-scharf
Der neue Decoder vereint Dekodierung und Upscaling in einem Schritt - sechsmal schneller als bisherige Verfahren, Open Source, und läuft auf einer Consumer-Grafikkarte.

Codex Thursday ohne Codex:
OpenAIs geheimnisvoller Nicht-Launch
Statt des erwarteten großen Releases gab es nur ein CLI-Update. Was OpenAI am Mittwoch zurückgehalten hat, bleibt unklar.

Opus 4.8 in der Praxis:
Shader, Spiele und eine Boeing 747 ohne menschliches Zutun
Entwickler testen Anthropics neues Topmodell und staunen: autonomes Debugging, sieben Feedback-Loops, spielbare Browser-Games in einem Prompt. Nicht alles ist perfekt.

Gemini 3.5 Flash schreibt ein Betriebssystem und bootet Doom
93 Subagenten, 15.314 Model Calls, 12 Stunden: Googles Antigravity-Team lässt einen Schwarm KI-Agenten Kernel, Dateisystem und Treiber von Grund auf programmieren.

Claude Opus 4.8 und Dynamic Workflows:
Anthropic legt nach
Neues Topmodell, dynamische Workflows in Claude Code und zurückgesetzte Limits - Anthropic dreht an allen Stellschrauben gleichzeitig.

GPT-5.5 stiehlt im DeepSWE Benchmark allen die Show
Auf dem härtesten Coding-Benchmark der Stunde erreicht OpenAIs Flaggschiff 70 Prozent - 16 Punkte vor dem Zweitplatzierten. Wie das Datacurve-Team Benchmark-Manipulation aufdeckt.

Bonsai Image 4B: Das erste 1-Bit-Bildmodell läuft auf dem iPhone
PrismML komprimiert einen Bildgenerator auf unter 1 GB – und erreicht dabei 88 bis 95 Prozent der Originalqualität. Lokal, offline, unter Apache 2.0.

Von Street View in die begehbare Welt mit Genie 3
Google DeepMind stellt Genie 3 vor - ein neues Modell, das Street-View-Panoramen in interaktive, begehbare Welten verwandelt.

Google Gemini Spark: Die Ära der Hintergrund-Agenten beginnt
Google-Labs-Chef Josh Woodward im Interview über den Wandel von Ausführung zu Steuerung und die Bedeutung des persönlichen Kontexts.

Alibaba launcht Flaggschiff Qwen3.7-Max für das Agenten-Zeitalter
Das neue Modell erzielt Spitzenwerte in Coding- und Agenten-Benchmarks und läuft bis zu 35 Stunden autonom auf der neuen Zhenwu-M890-Hardware.

Google führt das KI-Rennen wieder an
Gemini Flash 3.5 auf Opus-4.7-Level - und viermal so schnell bei halben Kosten. Doch der nächste Schlag kommt bestimmt.

Google I/O Vorschau: Gemini Spark soll mit eigenem KI-Agenten Codex und Cowork angreifen
Der Desktop-Client bekommt Voice Mode, kontextbewussten Cursor, Videogenerierung und lokalen Dateizugriff - direkt vor der Google I/O.