In europäischen Fachkreisen, Medien und Regulierungsdebatten hält sich seit Jahren eine bequeme Vereinfachung: Sprachmodelle seien im Grunde nichts weiter als „stochastische Papageien“. Der Begriff, den die Computerlinguistin Emily Bender und die Forscherin Timnit Gebru 2021 prägten, sollte beschreiben, dass Large Language Models (LLMs) lediglich statistische Wortwahrscheinlichkeiten aneinanderreihen - ohne jedes echte Verständnis von Kausalität, Raum oder der physischen Realität. Wie Ilya Sutskevers Gedankenexperiment zum Papageien-Vorwurf bereits theoretisch darlegte, greift diese Reduktion jedoch zu kurz. Ein quelloffenes Forschungsprojekt aus den USA führt diese Einsicht nun ganz praktisch vor Augen: Der angebliche Papagei steuert mittlerweile ein echtes Auto über einen Parcours.

Unter dem Namen DrivingBench haben die drei Entwickler Aditya Ramabadran, Simon Mahns und Tobias Gessler eine Testumgebung vorgestellt, die eine fundamentale Frage beantworten soll: Können allgemeine Spitzenmodelle der neuesten Generation ein reales Straßenfahrzeug steuern? Nicht in einer künstlichen Computersimulation, in der Reibung und Sensorrauschen vereinfacht sind, sondern auf einem echten Asphaltplatz mit echten Pylonen, Wind und unberechenbaren Lichtverhältnissen.

Drei Werkzeuge und ein CAN-Bus genügen

Das Versuchssetup der Forscher ist überraschend schlank gehalten. Als Testfahrzeug dient eine serienmäßige Toyota Corolla aus dem Baujahr 2022. Auf die Windschutzscheibe montierten die Entwickler ein Entwicklergerät vom Typ comma four des Open-Source-Fahrassistenz-Pioniers Comma.ai, das über eine OBD-C-Schnittstelle hinter dem Rückspiegel direkt mit dem Steuerungsnetzwerk (CAN-Bus) des Autos kommuniziert.

Die Softwarebrücke zwischen Auto und KI-Modell basiert vollständig auf dem offenen Standard des Model Context Protocol (MCP). Anstatt dem Modell komplexe Steuerungscodes abzuverlangen, stellt ein lokaler Server auf einem Laptop dem jeweiligen Chat-Agenten lediglich drei Werkzeuge bereit:

  • observe(): Liefert aktuelle Kamerabilder der zwei Frontkameras sowie grundlegende Telemetriedaten wie Geschwindigkeit, aktuellen Lenkwinkel und den Status des vorherigen Befehls.
  • set_motion(): Nimmt vier Parameter entgegen: Lenkrichtung (links, rechts oder geradeaus), Lenkintensität (0 bis 100 Prozent, was einem Lenkradwinkel von bis zu 180 Grad entspricht), Soll-Geschwindigkeit (0,5 bis 3,5 Meter pro Sekunde) sowie die geplante Dauer (5 bis 60 Sekunden).
  • stop_now(): Leitet eine sofortige Notbremsung ein.

Die native Regelschleife von Openpilot übersetzt den geforderten Lenkprozentsatz 100 Mal pro Sekunde in Radwinkel, Bahnkrümmung und das nötige Drehmoment des Servomotors. Ein Befehl gilt so lange, bis das Modell ihn durch einen neuen Befehl überschreibt oder die Zeit abläuft, woraufhin das Fahrzeug sanft abbremst.

Modell Entwickler-Harness Bester Fortschritt Versuch 1 Versuch 2 Versuch 3 Erfolgszeit
GPT-6 Astra OpenAI Codex 100 % 49 % 100 % - 5:22 min
Claude Fable 5.1 Claude Code 45 % 9 % 10 % 45 % DNF
Grok 4.6 Cursor 11 % 8 % 11 % 10 % DNF
GPT-5.6 Sol OpenAI Codex 6 % 6 % 6 % 6 % DNF

GPT-6 Astra meistert den Parcours fehlerfrei

Die Aufgabe für die Modelle hatte es in sich: Auf einem leeren Parkplatz in der San Francisco Bay Area steckten die Forscher einen rund 130 Meter langen Parcours aus Pylonen ab, der enge Kurven, versetzte Schikanen und eine finale Parkbucht umfasste. Zur Sicherheit saß während jedes Durchlaufs ein lizenzierter Sicherheitsfahrer am Steuer, dessen Fuß permanent über dem Bremspedal schwebte. Jede Berührung des Bremspedals oder des Lenkrads unterbrach den KI-Befehl augenblicklich.

Das Ergebnis der ersten Testreihe auf DrivingBench fiel überraschend deutlich aus: OpenAIs Flaggschiff-Modell GPT-6 Astra absolvierte den gesamten Parcours im zweiten Versuch zu 100 Prozent fehlerfrei in 5 Minuten und 22 Sekunden. Die Telemetriedaten verzeichneten für die erfolgreiche Fahrt 24 einzelne Steuerbefehle und eine Gesamtstrecke von 134,7 Metern. Die Rechenkosten beliefen sich auf 6,6 Millionen verarbeitete Token und 7,74 US-Dollar an API-Gebühren. Im ersten Anlauf war Astra noch bei 49 Prozent der Strecke an einer Schikane gescheitert.

Die Konkurrenz tat sich ungleich schwerer. Anthropics Claude Fable 5.1 steigerte sich zwar von Durchlauf zu Durchlauf, kam im dritten Versuch jedoch nicht über 45 Prozent der Strecke hinaus. Grok 4.6 von xAI scheiterte bereits nach elf Prozent, während GPT-5.6 Sol mit sechs Prozent Streckenabdeckung fast unmittelbar nach dem Start die Orientierung verlor.

In-Context-Learning: Wenn Modelle aus Fahrfehlern lernen

Besonders aufschlussreich für die KI-Forschung ist das von den Entwicklern gewählte Protokoll. Jedes Modell erhielt bis zu drei Versuche innerhalb einer einzigen, fortlaufenden Chat-Sitzung. Wenn der Sicherheitsfahrer eingreifen musste, weil das Auto die Fahrbahn verließ oder ein Hindernis touchierte, schickte das Testskript eine standardisierte Reflexionsaufforderung in den Chatverlauf: Das Modell sollte den vorangegangenen Fehler anhand der Kamerabilder analysieren und seine Strategie für den nächsten Start anpassen.

Die veröffentlichten Protokolle zeigen verblüffende Denkprozesse. Nach seinem ersten Fehlversuch notierte Claude Fable 5.1 in seiner internen Reflexion, dass es die Hütchenfarben falsch interpretiert habe: Es sei fälschlicherweise davon ausgegangen, grüne Pylonen markierten stets den linken und rote Pylonen den rechten Fahrbahnrand. Zudem gestand das Modell ein, dass die Weitwinkelkamera das Auto schmaler wirken lasse, als es in Wirklichkeit sei. Eine weitere Erkenntnis betraf das Ausrollen: Das Modell hatte übersehen, dass das Auslaufen eines Zeitfensters das Fahrzeug nicht abrupt stoppt, sondern lediglich ein allmähliches Abbremsen einleitet, wodurch das Auto noch in eine Pylone rollen konnte.

Realitätscheck

Hohe Latenzzeiten: Die Denkzeit der Modelle liegt laut den Entwicklern zwischen 2 und 30 Sekunden pro Befehl. Im realen Straßenverkehr müssen Reaktionen dagegen innerhalb von 10 bis 50 Millisekunden erfolgen.

Strikte Tempogrenze: Die Testfahrten fanden im Schritttempo bei 0,5 bis 3,5 Metern pro Sekunde (maximal etwa 12 km/h) statt. Bei höherem Tempo würde die Reaktionsverzögerung unweigerlich zu schweren Unfällen führen.

Menschliche Lebensversicherung: Ohne den Sicherheitsfahrer im Cockpit hätte kein einziges Modell den ersten Versuch überstanden. Alle Modelle produzierten fatale Fehleinschätzungen.

Warum LLMs das autonome Fahren nicht allein lösen

Trotz der eindrucksvollen Demonstration warnen die Entwickler im Code-Repository auf GitHub ausdrücklich davor, ihr System auf öffentlichen Straßen auszuprobieren. Großsprachmodelle sind in ihrer jetzigen Form kein Ersatz für spezialisierte autonome Fahrsysteme wie jene von Waymo oder Tesla. Ein Fahrzeug, das vor jeder Lenkkorrektur erst zwanzig Sekunden lang über ein hochauflösendes Foto nachdenken muss, ist auf einer Autobahn oder an einer belebten Kreuzung schlicht lebensgefährlich.

Die eigentliche Bedeutung von DrivingBench liegt daher auf einer anderen Ebene. Zum einen widerlegt das Experiment empirisch die Behauptung, generative KI besitze kein räumliches und physikalisches Abstraktionsvermögen. Zum anderen zeigt es den Weg zu künftigen Hybrid-Architekturen: Während echtzeitkritische Ausweichmanöver von spezialisierten Weltmodellen wie Odyssey 3 oder schnellen neuronalen End-to-End-Netzen übernommen werden müssen, können denkende Frontier-Modelle als übergeordnete Strategen fungieren - für komplexe Navigationsentscheidungen, unübersichtliche Sondersituationen und das nachträgliche Lernen aus Fehlern.

🎯 Was das für die Praxis bedeutet

1. Das Papageien-Narrativ begraben: Wer Großsprachmodelle weiterhin als bloße Text-Zufallsgeneratoren abtut, verkennt deren Fähigkeit zur visuellen Raumwahrnehmung und zielgerichteten Aktorik.

2. MCP erobert die physische Welt: Schnittstellen wie das Model Context Protocol beschränken sich längst nicht mehr auf Datenbanken oder Software-Code, sondern steuern zunehmend reale Hardware.

3. Latenz bleibt die harte Grenze: Solange Denkzeiten im Sekundenbereich liegen, eignet sich LLM-Steuerung nur für langsame Prozesse wie Hoflogistik, Rangieren oder Agrarrobotik.

4. Auf hybride Systeme setzen: Für unternehmerische Automatisierungsprojekte führt kein Weg an zweistufigen Systemen vorbei: Schnelle Reflex-Netze unten, flexible Reasoning-Modelle oben.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
DrivingBench ↗ DrivingBench Report ↗ DrivingBench GitHub ↗ DevAdventur3s auf X ↗ RoundtableSpace auf X ↗
Teilen: