LONDON (IT BOLTWISE) – Bei Driving Bench zeigt sich: Direkte KI-Steuerung aus einem Sprachmodell heraus funktioniert im echten Auto nur in sehr engen Bedingungen. In einem Test mit einem Toyota Corolla koppelte das Projekt ein Vision-Language-Action-Modell über einen MCP-Server an einen Comma-Four-Controller und sendete Befehle per CAN-Bus. Mehrere Modellvarianten weigerten sich zunächst aus Sicherheitsgründen oder „kippten um“, sobald sie reale Aufnahmen erkannten. Am Ende absolvierte nur GPT-6 Astra den Kegelparcours vollständig – langsam und teuer berechnet.

Die Frage, ob moderne KI-Modelle wie Chatbots auch dort verlässlich „lenken“ können, wo reale Physik und Sicherheitsmechanismen regieren, wirkt auf den ersten Blick naheliegend. Genau diese Brücke schlägt Driving Bench jedoch mit Absicht nicht bequem über eine Simulation, sondern direkt in die Welt eines echten Fahrzeugs. Der Versuchsaufbau ist dabei bewusst als Experiment angelegt und sollte nicht als Anleitung für öffentliche Straßen missverstanden werden. Stattdessen geht es um eine präzise Schnittstelle: Was passiert, wenn ein LLM nicht nur als Assistenz an der Seite steht, sondern Steuerbefehle für ein Auto generiert und an eine echte Antriebskette zurückspielt?
Im Zentrum steht der Controller Comma Four, verbunden über den OBD-C-Anschluss des Fahrzeugs. Auf dem Controller läuft Open Pilot, inklusive Abstandsregeltempomat und Lenkassistent. Wichtig ist: Open Pilot übernimmt damit nicht den vollständigen Parcours als „Autopilot“ mit fixem Pfad, sondern stellt eher die Fahrzeug- und Regelungsbasis bereit. Damit wird der eigentliche Test zu einer Transferfrage zwischen KI-Ausgabe und Fahrzeugreaktion. Das Sprachmodell erhält Fotos und Telemetriedaten, verarbeitet sie in einem Vision-Language-Action-Ansatz und produziert daraus konkrete Stell- und Geschwindigkeitswerte. Diese Anweisungen landen anschließend über den CAN-Bus im Auto – also exakt dort, wo „Befehl“ zu „Bewegung“ wird.
Damit dieses Schleifensystem überhaupt mit mehreren KI-Experimenten vergleichbar bleibt, nutzte Driving Bench eine Tool-Schicht über Model Context Protocol. Konkret brauchten die Betreiber einen MCP-Server sowie einen mobilen WLAN-Hotspot, um Laptop, Controller und Sprachmodell zu verbinden. Genutzt wurden drei MCP-Tools: „observe“ für Beobachtung, „set_motion“ für Bewegungsbefehle und „stop_now“ fürs sofortige Anhalten. Das klingt nüchtern, ist aber entscheidend, weil ein KI-Agent damit nicht nur Texte interpretiert, sondern das Tooling-Interface als Handlungsmechanismus versteht. Gleichzeitig betonen die Macher, dass es „extrem schwierig“ sei, einen KI-Agenten mit beliebigen Tools in einen Pylonenparcours zu bringen – und genau diese praktische Hürde wird im Experiment sichtbar.
Der eigentliche Aufgabenprompt adressiert einen klar begrenzten Korridor: ein Parcours auf einem umgekehrt U-förmigen Parkplatz, markiert durch Minikegel, mit dem Ziel, zwischen den Kegeln zu bleiben und am Ende in einer Zone aus zahlreichen blauen Kegeln zu parken. Doch der Haken liegt weniger im Prompt als im Verhalten der Modelle. In vielen Versuchen verweigerten mehrere Modelle die Fahrt zunächst aus Sicherheitsgründen; die Tester arbeiteten mit zahlreichen Promptänderungen und betrachteten den Ansatz teilweise sogar als „Simulation“, um die Modelle in die gewünschte Richtung zu drücken. Auffällig ist zudem, dass einzelne Modelle „ausflippten“, sobald sie erkannten, dass das verwendete Bildmaterial reale Aufnahmen waren. Das relativiert den Eindruck, dass ein VLA-Modell automatisch „handlungsfähig“ wird, nur weil es Befehle ausgeben kann.
Als pragmatischer Kniff funktionierte es laut Bericht am besten, den MCP-Namen so zu ändern, dass das System offenbar weniger wie ein direktes Anbindungs-Szenario wirkte; nach dieser Anpassung und mit dem neuesten Prompt fuhren die Modelle das reale Auto konsistenter. Bei den Ergebnissen zeigt sich dann ein deutliches Leistungsgefälle: GPT-6 Astra war das einzige Modell, das die Strecke beim zweiten Versuch vollständig absolvierte. Die rund 130 m lange Runde benötigte dafür fast fünfeinhalb Minuten. Claude Fable 5.1 kam bis zur Hälfte der Distanz, während Grok 4.6 und GPT-5.6 Sol es in jeweils drei Versuchen nicht einmal bis zur ersten Kurve schafften. Diese Verteilung passt weniger zu „Allzweck-KI als Fahrer“ und eher zu „KI kann unter sehr spezifischen Randbedingungen handeln“.
Auch die Kosten werfen ein klares Licht auf die Machbarkeit. Für die erfolgreiche Strecke brauchte GPT-6 Astra laut Bericht 6,6 Millionen Tokens und kostete 7,74 US-Dollar. Für den Kontext: Das liegt deutlich unter den 10 US-Dollar, die OpenAI für eine Million Tokens nennt. Als Grund nennt der beteiligte Informatiker Aditya Ramabadran, dass viele Eingaben gecacht worden seien und für gecachte Eingaben nur 1 US-Dollar pro einer Million Tokens fällig würden. Technisch heißt das: Selbst wenn das Modell prinzipiell steuern kann, hängt die praktische Taktung von Systemdesign, Eingabemuster und Laufzeitkosten ab. In einem Fahrzeugbetrieb, der niedrige Latenz erfordert und jederzeit unter Sicherheitsbedingungen laufen muss, ist „kann fahren“ damit noch nicht gleich „kann zuverlässig und effizient fahren“.
Driving Bench zieht daraus dennoch eine interessante Zwischenbilanz: Die Betreiber sehen Frontier-Modelle mittlerweile so verbessert, dass sie reale Fahrzeuge in realer Umgebung bei ausreichend niedrigen Geschwindigkeiten steuern können. Für Unternehmen und Entwickler ist das eine Signalrichtung, aber kein Freifahrtschein. Der Aufwand, die Tool-Schicht (MCP), das Sicherheitsverhalten der Modelle, die Interpretation von Bildmaterial sowie die Fahrzeuganbindung über CAN und OBD-C in ein robustes Gesamtverhalten zu übersetzen, bleibt hoch. Wer KI-gestützte Fahrassistenz ernsthaft industrialisieren will, muss daher stärker als bisher auf Architekturentscheidungen achten: nicht nur auf das Modell, sondern auf die Schnittstellen, Fehlerpfade und die Frage, wie ein System erkennt, wann es nicht handeln darf.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Fahren mit KI-Chatbots: Driving Bench zeigt die Grenzen von LLM-Steuerung im echten Auto" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Fahren mit KI-Chatbots: Driving Bench zeigt die Grenzen von LLM-Steuerung im echten Auto" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Fahren mit KI-Chatbots: Driving Bench zeigt die Grenzen von LLM-Steuerung im echten Auto« bei Google Deutschland suchen, bei Bing oder Google News!