Wer einem autonomen KI-Agenten schon einmal dabei zugesehen hat, wie er eine Flugreise plant oder einen Restauranttisch reserviert, kennt das Phänomen: Die Software löst die Aufgabe zwar eigenständig, braucht dafür aber oft quälend lange Minuten. Während ein geübter Mensch die Buchungsmaske in gut einer halben Minute ausfüllt, klicken sich aktuelle Sprachmodelle mühsam von Unterseite zu Unterseite, lesen jedes Menü neu ein und überlegen nach jedem einzelnen Klick sekundenlang, was als Nächstes zu tun ist. Der Chiphersteller Cerebras Systems hat diesen Latenz-Flaschenhals nun in einer detaillierten Testreihe analysiert und demonstriert, wie sich die Ausführungszeit von über sieben Minuten auf gerade einmal 22 Sekunden drücken lässt.

In dem vom Entwicklerteam um Sarah Chieng und Sherif Cherfa dokumentierten Experiment schickte das Unternehmen mehrere etablierte KI-Assistenten mit demselben Auftrag ins Rennen: Für zwei Personen sollte ein Abendsitzplatz in einem italienischen Restaurant im San-Francisco-Viertel Hayes Valley reserviert werden. Die Ergebnisse zeigen, wie weit die Reaktionszeiten moderner Alltags-Assistenten in der Praxis auseinanderklaffen.

Der Latenz-Vergleich im Praxistest

Für den Testlauf traten führende Systeme gegeneinander an. Das Ergebnis war ernüchternd für die bisherigen Marktführer: Während ein menschlicher Tester die Buchung laut den Messungen in 37 Sekunden abschloss, benötigte Meta Muse 4 Minuten und 36 Sekunden. Das auf Büro- und Browser-Workflows spezialisierte Claude Cowork benötigte 6 Minuten und 25 Sekunden bei insgesamt 57 einzelnen Werkzeug-Aufrufen. Das Schlusslicht bildete der von Elon Musks KI-Sparte entwickelte Grok Bot, der mit 7 Minuten und 40 Sekunden mehr als das Zwölffache der menschlichen Ausführungszeit beanspruchte.

Assistent / Ausführung Modell / Plattform Gemessene Gesamtdauer Ablauf & Besonderheiten
Cerebras-Agent (optimiert) Qwen 3.8 27B auf Cerebras-Hardware (Pi-Harness) 22 Sekunden Parallele Abfragen, 80 % weniger Tool-Aufrufe durch wiederverwendbare Navigations-Skills
Menschliche Referenz Manuelle Buchung im Browser 37 Sekunden Direkter Klickpfad ohne Erkundungs-Schleifen und Modell-Denkpausen
Meta Muse Metas Consumer-Assistent 4 Minuten 36 Sekunden Nutzt neun direkte API-Aufrufe an den Reservierungsdienst OpenTable
Claude Cowork Anthropic Agenten-Plattform 6 Minuten 25 Sekunden 57 Werkzeug-Aufrufe zur schrittweisen Erkundung des Webseiten-Aufbaus
Grok Bot xAI / SpaceXAI 7 Minuten 40 Sekunden Sequenzielle Prüfung: verbrachte allein 2:18 Minuten damit, drei Lokale nacheinander abzuklappern

Der von Cerebras konfigurierte Test-Assistent benötigte für dieselbe Aufgabe im Median zweier erfolgreicher Durchläufe lediglich 22 Sekunden - und war damit rund 19-mal schneller als die Konkurrenz und sogar schneller als der Mensch am Rechner.

Warum herkömmliche Agenten so langsam arbeiten

Die Ursache für die langen Wartezeiten liegt laut der Analyse von Cerebras nicht allein in der Rechenleistung, sondern vor allem in der Architektur der Ausführungsumgebung (dem sogenannten Agenten-Harness). Ein Agent arbeitet typischerweise in einer endlosen Feedback-Schleife: Er liest die Webseite ein, schickt den HTML-Zustand an das KI-Modell, wartet auf dessen Entscheidung, führt einen Klick aus und wartet erneut auf das Modell. Diese Zyklen summieren sich dramatisch.

Hinzu kommt die sogenannte Erkundungsphase: Da die Modelle die Struktur einer Buchungsplattform nicht fest verinnerlicht haben, verhalten sie sich wie ein Besucher, der eine Website zum ersten Mal sieht. Sie suchen nach Buttons, probieren Eingabefelder aus und scheitern an irrelevanten Elementen. Bei Grok Bot zeigte die Ablaufverfolgung, dass das System allein 2 Minuten und 18 Sekunden damit verbrachte, drei Restaurants (A Mano, Il Borgo und Doppio Zero) streng nacheinander aufzurufen und deren Freigaben zu prüfen, anstatt die Abfragen gleichzeitig abzusenden.

Drei Hebel für den Geschwindigkeits-Sprung

Um die Latenz von Minuten auf Sekunden zu senken, kombinierte Cerebras drei architektonische Anpassungen, die als Blaupause für künftige Agenten-Entwicklungen dienen dürften:

  • 1. Parallele Abfragen statt sequenzieller Einzelschritte: Das Prüfen von Tisch-Verfügbarkeiten ist eine klassisch parallelisierbare Aufgabe. Anstatt erst Restaurant A, dann Restaurant B und schließlich Restaurant C abzufragen, startete der Cerebras-Agent alle Abfragen gleichzeitig. Allein dieser Schritt reduzierte den Browser- und API-Anteil von zuvor 4 Minuten und 31 Sekunden auf 6,8 Sekunden.
  • 2. Wiederverwendbare Navigations-Skills: Statt das Rad bei jedem Aufruf neu zu erfinden, hinterlegten die Entwickler das Wissen über die Navigation auf der Buchungsseite vorab als strukturierte Anleitung (Skill). Das Modell wusste dadurch bereits vor dem Start, welche Klickfolge zur Reservierung führt, und musste die Seitenarchitektur nicht erst mühsam erforschen. Dies senkte die Zahl der Werkzeug-Aufrufe um mehr als 80 Prozent.
  • 3. Extrem schnelle Modell-Inferenz: Als Sprachmodell diente das offene Modell Qwen 3.8 27B, das auf der hauseigenen Wafer-Scale-Hardware von Cerebras ausgeführt wurde. Durch die extrem hohe Ausgabegeschwindigkeit von vielen hundert Tokens pro Sekunde - eine Technologie, die auch OpenAI für seinen Ultrafast-Modus bei GPT-5.6 Sol nutzt - schrumpften die Pausen zwischen Wahrnehmen, Entscheiden und Handeln auf Bruchteile von Sekunden zusammen.

Grenzen des Benchmarks

Vorbereiteter Vorsprung: Cerebras betont ausdrücklich, dass es sich bei den 22 Sekunden um aufgezeichnete Testläufe und kein allgemeingültiges Ranking handelt. Der Testassistent ging mit einem entscheidenden Startvorteil ins Rennen: Er kannte den Klickpfad der Seite bereits. Das Auskundschaften fand vor der Zeitmessung statt.

Live-Daten bleiben Pflicht: Gespeichert wurde lediglich die Navigationsroutine. Relevante Echzeit-Daten wie freie Uhrzeiten, Menüpreise oder eine eventuelle Kreditkarten-Garantie mussten weiterhin in Echtzeit abgefragt und geprüft werden.

Die Untersuchung von Cerebras fällt in eine Phase, in der die Leistungsfähigkeit autonomer Assistenten zunehmend an Alltagstauglichkeit und Zuverlässigkeit gemessen wird, wie kürzlich auch der Wajo-Benchmark für Consumer-Agenten verdeutlichte. Nutzer akzeptieren Wartezeiten von mehreren Minuten schlichtweg nicht, wenn sie die gleiche Aktion auf ihrem Smartphone in wenigen Sekunden selbst erledigen können. Der Test beweist: Nicht größere Modelle sind die Lösung für praxistaugliche Agenten, sondern clevere Orchestrierung, vorbereitete Wissensmodule und kompromisslos schnelle Inferenz-Hardware.

🎯 Was das für die Praxis bedeutet

1. Tool-Orchestrierung vor Modellgröße: Wer eigene Agenten-Workflows baut, sollte Prozesse radikal parallelisieren. Sequenzielle API- und Browser-Checks sind der größte Zeitfresser im System.

2. Navigations-Skills vorab definieren: Agenten sollten bekannte Webseiten und interne Tools nicht jedes Mal neu erkunden müssen. Vorab gespeicherte Ablaufbeschreibungen (Playbooks) reduzieren teure Modellaufrufe um über 80 Prozent.

3. Latenz bestimmt die Nutzerakzeptanz: Für produktive Assistenten im Kundenkontakt oder Support sind spezialisierte High-Speed-Inferenz-Plattformen oft wichtiger als riesige Frontier-Modelle mit langen Denkpausen.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
Cerebras Blog ↗ Superpower Daily ↗
Teilen: