// SCINEXX — SPAZIO & SCIENZA
Können KI-Chatbot ein echtes Auto steuern?
Große Sprachmodelle können ein echtes Auto prinzipiell durch einen einfachen Parcours steuern, doch die Unterschiede sind enorm. Im DrivingBench-Test absolvierte nur GPT-6 Astra den kompletten Kurs, während drei andere aktuelle Modelle schon deutlich früher scheiterten. Der Versuch zeigt zugleich, wie stark Wahrnehmung, Latenz und Lernen aus vorherigen Fehlversuchen über den Erfolg entscheiden.
Bay Area (U.S.A.). Große Sprachmodelle beantworten längst nicht mehr nur Fragen, sondern können über Softwarewerkzeuge auch Aktionen in anderen Systemen auslösen. Ob diese allgemeine Agentenfähigkeit schon reicht, um eine reale Maschine in einer sich ständig verändernden Umgebung zu kontrollieren, ist jedoch eine deutlich schwierigere Aufgabe. Beim DrivingBench-Test wurde dies nun an einem echten Auto auf einem abgesperrten Parkplatz erprobt.
Der nicht fachbegutachtete Forschungsbericht beschreibt einen Benchmark, der Wahrnehmung, Planung, Fahrzeugkontrolle und Reaktionsgeschwindigkeit zugleich fordert. Die Modelle mussten Kamerabilder und Telemetriedaten auswerten, ihre eigenen Steuerbefehle anpassen und mit den Verzögerungen zwischen Beobachtung, Denken und neuer Aktion zurechtkommen.
Für DrivingBench verband das Team einen Toyota Corolla des Baujahrs 2022 mit einem comma four und der Fahrassistenzsoftware openpilot. Ein Laptop leitete Bilder und Fahrzeugdaten über das Model Context Protocol (MCP) an das jeweilige Sprachmodell weiter, dessen Befehle anschließend über den Fahrzeugbus zum Lenksystem und zur Geschwindigkeitsregelung gelangten.
Den Modellen standen nur drei Funktionen zur Verfügung, die Beobachtung, Bewegung und Abbremsen abdeckten. Mit observe() konnten sie aktuelle Kamerabilder, Geschwindigkeit und Lenkwinkel abrufen, während set_motion() Fahrtrichtung, Lenkausschlag, Geschwindigkeit und Dauer eines Bewegungsbefehls festlegte. stop_now() löste das Abbremsen aus, und jeder neue Bewegungsbefehl ersetzte den vorherigen, sodass die Modelle auch ihre eigene Reaktionszeit berücksichtigen mussten.
Jedes Modell erhielt bis zu drei Versuche in demselben fortlaufenden Chat und sollte nach einem Fehlversuch die eigenen Fehler reflektieren. Gewertet wurde der Fortschritt entlang einer festgelegten Mittellinie des Pylonenparcours, solange das Auto höchstens vier Meter davon entfernt blieb. Während aller Versuche saß ein menschlicher Fahrer am Steuer, der jederzeit bremsen und damit die Modellsteuerung beenden konnte.
Die Unterschiede zwischen den vier getesteten Modellen waren groß. GPT-6 Astra erreichte im ersten Versuch 49 Prozent des Parcours und scheiterte nach 67,3 Metern, absolvierte im zweiten Anlauf aber die gesamte Strecke von 134,7 Metern. Für die erfolgreiche Fahrt benötigte das Modell 5 Minuten und 22 Sekunden sowie 24 akzeptierte Fahrbefehle.
Claude Fable 5.1 kam im besten seiner drei Versuche auf 45 Prozent, Grok 4.6 erreichte maximal 11 Prozent und GPT-5.6 Sol blieb bei 6 Prozent. Laut der Auswertung scheiterten die meisten erfolglosen Fahrten bereits an der ersten Kurve, weil die Modelle die schräg verlaufende Pylonenbegrenzung visuell falsch interpretierten. Damit lag das Hauptproblem häufig schon in der Wahrnehmung und nicht erst in der eigentlichen Lenkbewegung.
Besonders auffällig war die Veränderung zwischen den Versuchen. Astra fuhr im erfolgreichen zweiten Anlauf deutlich vorsichtiger, überschritt laut Bericht 0,8 Meter pro Sekunde nicht und nutzte bei 20 von 24 Bewegungsbefehlen den maximal vorgesehenen Lenkausschlag. Auch Fable verbesserte sich über die Versuche hinweg von zunächst 9 und 10 Prozent auf 45 Prozent, was auf Lernen innerhalb des fortlaufenden Gesprächskontexts hindeutet, aber noch keine allgemein übertragbare Lernfähigkeit belegt.
Der Benchmark wurde unter stark kontrollierten Bedingungen durchgeführt. Reguläre Fahrbefehle waren auf höchstens 3,5 Meter pro Sekunde begrenzt, zusätzlich gab es eine Notabschaltung oberhalb von 6 Metern pro Sekunde. Der menschliche Fahrer hielt den Fuß übe