Der Schlagabtausch im Markt für kompakte KI-Modelle erreicht eine neue Eskalationsstufe: Mit Claude Haiku 5.5 bringt Anthropic die jüngste Ausbaustufe seines kleinsten Sprachmodells an den Start - und attackiert OpenAIs erst kürzlich gefeiertes Sparmodell GPT-6 Luna frontal. Die von Anthropic vorgelegten Benchmark-Werte zeigen keinen knappen Vorsprung, sondern eine massive Überlegenheit des neuen Modells in zentralen Praxisdisziplinen wie Programmieraufgaben, visueller Analyse und der direkten Steuerung von Benutzeroberflächen.

Während das Spitzenmodell Claude Opus 5.5 als Architekt für tiefgehende Refactorings agiert und Claude Sonnet 5.5 die Allround-Entwicklung anführt, übernimmt Haiku 5.5 die Rolle des schnellen Zuarbeiters. Gegenüber dem Vorgänger Haiku 4.5 sinken die Betriebskosten laut Anthropics offizieller Ankündigung im Schnitt um rund 75 Prozent.

Dass Anthropic im Hintergrund an der neuen Modellgeneration feilte, hatte sich in der Entwickler-Community bereits angedeutet. Aufmerksame Nutzer bemerkten wenige Tage vor der offiziellen Freigabe auffällige Routing-Verschiebungen bei Abfragen:

Sofortiger Start in Claude Code und Cursor

Anthropic stellt das neue Modell ab Tag eins in den Mittelpunkt seiner Entwickler-Werkzeuge. Wie das Team von ClaudeDevs mitteilte, ist Haiku 5.5 unmittelbar auf der Claude-Plattform sowie im Terminal-Werkzeug Claude Code verfügbar - maßgeschneidert für datenintensive Aufgaben wie Code-Zusammenfassungen und Datenbankabfragen:

Auch Drittanbieter reagierten ohne Zeitverzug. Das Team des führenden KI-Code-Editors Cursor schaltete Claude Haiku 5.5 wenige Minuten nach der Veröffentlichung frei und verwies darauf, dass kurze Abfragen bis zu zehnmal günstiger ausfallen als beim Vorgänger:

In ersten Praxistests zeigen sich Entwickler vor allem von den großzügigen Kontingenten und der Geschwindigkeit angetan. Bei parallelen Programmierläufen verbrauchte das Modell kaum messbare Anteile des fünfstündigen Nutzungslimits:

Haiku 5.5 deklassiert GPT-6 Luna bei Coding und Computer Use

Besonders deutlich fällt der Abstand bei anspruchsvollen Agenten-Aufgaben aus. Im Benchmark Terminal-Bench 4.0, der komplexe, mehrstufige Arbeitsabläufe in der Kommandozeile überprüft, erzielt Haiku 5.5 laut Herstellerangaben 39,2 Prozent. OpenAIs GPT-6 Luna muss sich hier mit 16,4 Prozent begnügen - Haiku liefert damit mehr als die doppelte Erfolgsquote. Der Vorgänger Haiku 4.5 scheiterte an dieser Testsuite noch mit glatten null Prozent.

Ein ähnliches Bild zeichnet sich bei der automatisierten Desktop-Bedienung ab. Im Benchmark OSWorld 2.1, der reale Arbeitsaufträge per Maus und Tastatur in virtuellen Umgebungen simuliert, erreicht Haiku 5.5 einen Wert von 72,4 Prozent im Offline-Subset. Luna liegt mit 48,9 Prozent spürbar zurück. Auch bei der optischen Diagrammanalyse auf Chartography lässt Haiku 5.5 das OpenAI-Gegenstück mit 46,4 zu 29,1 Prozent weit hinter sich.

Disziplin / Benchmark Haiku 5.5 GPT-6 Luna (OpenAI) Haiku 4.5
Terminal-Bench 4.0 (Coding) 39,2 % 16,4 % 0,0 %
OSWorld 2.1 (Computer Use) 72,4 % 48,9 % 15,7 %
Chartography (Bild-Reasoning) 46,4 % 29,1 % 6,4 %
GDPval-AA v2.1 (Wissensarbeit) 1620 1437 735
FrontierCode 1.1 (Agentic Code) 46,4 % 42,4 % —

Dass sich dieser theoretische Vorsprung auch im praktischen Einsatz niederschlägt, belegen erste Community-Versuche. In einem direkten 3D-Vergleich einer browserbasierten Simulation mit der Grafikbibliothek Three.js ließ Haiku 5.5 das OpenAI-Modell Luna klar hinter sich:

3D-Welten, Motion Design und Voxel-Grafik für Kleingeld

Neben reinem Programmcode sorgt das Modell in der Kreativ- und Spielebranche für Aufsehen. Trotz des extrem niedrigen Preispunkts beherrscht Haiku 5.5 komplexe Gestaltungsaufgaben. Ein Motion-Designer demonstrierte animierte Design-Elemente, die das Modell in nur 15 Minuten erzeugte:

Andere Anwender nutzten das Modell zur schnellen Erstellung dreidimensionaler Voxel-Objekte und hoben hervor, dass die geometrische Kohärenz selbst größere Vorjahresmodelle deutlich in den Schatten stellt:

Auch interaktive WebGL-Szenen für Spiele lassen sich mit dem Modell kostengünstig generieren. Für eine virtuelle Teegarten-Szenerie lieferte das System einsatzbereite Assets im passenden Farbkonzept:

Aggressive Preisstaffel: Bis zu 90 Prozent Kostensturz

Um die gewonnene Leistungsstärke in den Markt zu drücken, setzt Anthropic auf eine zweistufige Preisstaffel. Für Abfragen mit bis zu 100.000 Token - nach Angaben des Anbieters fallen rund 90 Prozent aller typischen Haiku-Anfragen in diesen Bereich - verlangt Anthropic 0,10 US-Dollar pro Million Eingabe-Token sowie 0,50 US-Dollar für die Ausgabe. Das bedeutet einen Preisnachlass von 90 Prozent gegenüber Haiku 4.5. Erst bei langen Kontexten über 100.000 Token greift der höhere Satz von 0,50 Dollar für den Input und 2,50 Dollar für den Output.

Den stärksten Hebel für hochfrequente Zuarbeiter bilden die Zwischenspeicher-Gebühren (Cache Reads): Häufig wiederkehrende Codebasen, Dokumente oder Systemprompts schlagen bei Haiku 5.5 mit lediglich 0,01 US-Dollar pro Million Token zu Buche. Zeitgleich halbiert Anthropic auch die Cache-Read-Kosten für das Flaggschiff Sonnet 5.5 auf 0,10 Dollar, was komplexe Agenten-Workflows dort um rund 20 Prozent verbilligen soll.

Der Subagenten-Hebel

Warum kleine Modelle unverzichtbar sind: Moderne KI-Systeme arbeiten selten isoliert. Ein großes Leitmodell plant das Gesamtprojekt, schickt für einzelne Arbeitsschritte wie Dateisuchen oder Fehlerprüfungen jedoch kleinere Subagenten los.

Kumulierte Latenzen: Wenn jeder Zuarbeiter mehrere Sekunden Reaktionszeit benötigt oder pro Schleife Cent-Beträge auflaufen, stocken Entwicklungsprozesse schnell. Haiku 5.5 zielt darauf ab, diese Nebenschleifen in Millisekunden und für Bruchteile von Cent-Beträgen zu erledigen.

Erstes Haiku-Modell mit regulierbarem Denkaufwand

Mit Haiku 5.5 führt Anthropic erstmals auch in seiner Einstiegsklasse eine anpassbare Denkzeit ein. Entwickler können per Parameter festlegen, ob das Modell auf minimale Ausführungszeit getrimmt sein soll oder zusätzliche Rechenschritte investieren darf, um knifflige Logikprobleme tiefer zu durchdenken.

Im multidisziplinären Test Humanity’s Last Exam (HLE) erreicht das Modell ohne Werkzeuge 45,9 Prozent und mit Werkzeugen 57,4 Prozent - verglichen mit 10,2 beziehungsweise 18,7 Prozent beim Vorgänger. Auch Partnerunternehmen zeigen sich in frühen Tests beeindruckt:

„Claude Haiku 5.5 ergänzt das Team in Devin Fusion als hervorragende Option. Mit Haiku als Sidekick hält Fusion einen Spitzenwert von 66,2 Punkten auf FrontierCode, während Kosten und Latenz spürbar sinken.“

Walden Yan, Mitgründer von Cognition

Andere Softwarehäuser melden vergleichbare Fortschritte. Asana berichtet von über 30 Prozent geringerer Latenz bei Routineprüfungen im hauseigenen KI-Assistenten. HubSpot hebt bei CRM-Prüfungen eine Trefferquote von 92,8 Prozent bei minimaler Fehlerrate hervor.

Verfügbarkeit und monatliche API-Guthaben

Claude Haiku 5.5 ist ab sofort unter der Modellkennung claude-haiku-5-5 über die Claude-Plattform sowie auf den Cloud-Diensten Amazon Web Services (Bedrock), Google Cloud (Vertex AI) und Microsoft Azure verfügbar. Bei den Sicherheitsfiltern erlaubt Anthropic ein breiteres Spektrum defensiver Cybersicherheits-Aufgaben als bei Sonnet 5.5, blockiert offensive Angriffswerkzeuge jedoch weiterhin strikt.

Um die Entwicklung eigener Agenten zu subventionieren, verteilt das Unternehmen ab dieser Woche zudem monatliche API-Guthaben an Abonnenten. Nutzer des Tarifs Claude Max 5x erhalten monatlich 100 Dollar, bei Max 20x sind es 200 Dollar und Team-Abonnenten bekommen bis zu 500 Dollar als geteiltes Entwicklerbudget gutgeschrieben.

🎯 Was das für die Praxis bedeutet

1. Kleines Modell als Coding-Zuarbeiter testen: Mit 39,2 Prozent auf Terminal-Bench 4.0 und direkter Cursor-Anbindung eignet sich Haiku 5.5 als vollwertiger Sidekick für Routine-Commits, Dateiprüfungen und Unit-Tests, ohne teure Hauptmodelle zu beanspruchen.

2. Browser- und Desktop-Automatisierung beschleunigen: Der Sprung auf 72,4 Prozent im OSWorld-Benchmark macht automatisierte Web-Recherchen und Klickabläufe erstmals bei minimalen Latenzen massentauglich.

3. Denkaufwand gezielt steuern: Über das anpassbare Effort-Setting lassen sich simple Klassifizierungen auf maximale Geschwindigkeit trimmen, während logisch anspruchsvollere Teilschritte zusätzliche Denktokens erhalten.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
Anthropic ↗ Claude auf X ↗ Cursor auf X ↗ ClaudeDevs ↗
Teilen: