LONDON (IT BOLTWISE) – Ein 500-Tage-Benchmark für KI-Agents simuliert den Alltag eines Startup-CEOs: Budget, Pricing, R&D, Support und Marktzyklen – und misst am Ende nur noch den verbliebenen Cash. In den Tests schneiden von 14 Modellen nur drei so gut ab, dass sie über dem Startkapital bleiben, darunter Claude Fable 5 und Claude Opus 4.8. Besonders auffällig: Ein einfacher regelbasierter Ansatz schlägt die meisten KI-Systeme. Der Befund macht deutlich, wo heutige KI-Entwicklungen bei strategischem Steuern über lange Horizonte noch Lücken haben.

Wer KI-Agents heute primär nach ihrer Fähigkeit beurteilt, einzelne Aufgaben korrekt zu lösen, übersieht womöglich den härtesten Teil echter Unternehmensführung: Entscheidungen über lange Horizonte, unter Unsicherheit und mit verzögertem Feedback. Genau hier setzt CEO-Bench an. Die in der Beschreibung hervorgehobene Idee der Princeton-Forschenden: Ein Agent soll eine fiktive Softwarefirma über 500 simulierte Tage steuern und dabei so wirtschaften, dass das Startbudget von 1.000.000 US-Dollar nicht nur am Ende, sondern nie zwischendurch unter Null rutscht. Anders als bei vielen Kurztests zählt damit nicht „kann ich die Aufgabe?”, sondern „kann ich über Monate eine tragfähige Strategie halten?”.
Technisch besteht CEO-Bench aus einer Umgebung, in der der Agent Managementaktionen ausführt und Daten verarbeitet. Der Agent kontrolliert das Unternehmen über eine Python-API mit 34 Tools und einer Datenbasis mit 19 Tabellen. Entscheidend ist, dass er nicht ausschließlich Kommandos absetzt, sondern eigenen Code schreibt, Daten per SQL abfragt und Workflows aus den Ergebnissen baut. Damit reproduziert das Setup zentrale Muster, die auch menschliche CEOs antreiben: erst interpretieren, dann priorisieren, dann in wiederkehrenden Loops handeln. Dazu gehören Pricing- und Tier-Entscheidungen, Budgetverteilung für Werbung, R&D und Support sowie mehrstufige Verhandlungen mit Enterprise-Kunden.
Der Test macht außerdem deutlich, warum „schnell und präzise” nicht automatisch „profitabel” bedeutet. Einnahmen erscheinen nur zu Billing-Daten, Forschungs- und Entwicklungsprojekte benötigen Tage bis Wochen, und Fehler schlagen oft erst später durch Abwanderung oder Reputationsschäden durch. Gleichzeitig fallen Kosten sofort an, was das Timing der Investitionsentscheidungen besonders kritisch macht. Zusätzlich bleibt der Zustand des Unternehmens teilweise verborgen: Der Agent kann Kundenzufriedenheit, Zahlungsbereitschaft oder Qualitätsuntergrenzen nicht direkt sehen, sondern erschließt sie aus verrauschten Signalen wie Kündigungen, Support-Tickets und Reaktionen in einem simulierten Social-Netzwerk. Die Welt verändert sich zudem laufend, etwa durch sich verschiebende Präferenzen, Wettbewerbsbewegungen und einen Business Cycle.
Auf der Market- und Wettbewerbsseite ist der Befund für viele Teams unbequem. In der beschriebenen Auswertung wurden 14 Modelle getestet, die in der Lage waren, valide Befehle und Datenbankabfragen zu erzeugen, aber nur wenige konnten eine kohärente Strategie über die Zeit aufrechterhalten. Der größte Teil ging bereits vor Ende der Simulation pleite. Lediglich drei Modelle beendeten den eigenen Best-Run oberhalb des Startkapitals: Claude Fable 5 mit 47,15 Millionen US-Dollar, Claude Opus 4.8 mit 27,8 Millionen US-Dollar sowie GPT-5.5 mit 21,3 Millionen US-Dollar. Interessant ist: Claude Fable 5 blieb dabei in mehr als einem Run erfolgreich, während GPT-5.5 in zwei der drei Läufe bankrott ging.
Noch stärker wird der Punkt, wenn man den Vergleich erweitert. Die Forschenden setzen CEO-Bench bewusst mit festen, transparenten Regeln als Prüfsystem um, statt ein Sprachmodell als Schiedsrichter zu verwenden. Damit soll verhindert werden, dass ein Agent durch überzeugende, aber wirtschaftlich falsche Versprechen „durchrutscht” – ein Problem, das sie bereits aus einem früheren Vending-Bench-Ansatz kennen. Außerdem schnitt eine regelbasierte Heuristik ohne Language-Model deutlich besser ab als die meisten KI-Modelle: Sie arbeitete mit festen Preisen, Quoten und Segment-Fokus, passte die Kapazität an jüngere Nutzung an und erreichte 15,76 Millionen US-Dollar. Damit ist der Haupttreffer nicht nur „Modelle sind schlecht”, sondern: KI muss lernen, Entscheidungen systematisch zu koordinieren, statt nur gut zu formulieren.
Die Verhaltensanalyse liefert ein klares Muster. GPT-5.5 und Claude Opus 4.8 probierten während sich ändernder Bedingungen öfter neue Strategien aus: etwa Kundengewinnung hochfahren, Tiers anpassen oder Budgets für Support und R&D verschieben. Claude Opus 4.7 reagierte dagegen auf Rückschläge eher passiv, indem es Kosten senkte und Cash schonte, statt aktiv in Wachstum und Produktqualität zu investieren. Diese „Vorsicht” schützt zwar das Überleben bis zum Ende der Simulation, verhindert aber häufig den Profit. Laut Beschreibung erreichten Opus 4.8 und GPT-5.5 am Ende ähnliche Resultate auf unterschiedlichen Wegen: Opus 4.8 holte früh Kunden, fiel dann aber in einen Abschnitt auf null Kunden ab, während GPT-5.5 seine Kundenzahl stabiler hielt und seine Planung über Verhandlungen und Datenbank-Historien anreicherte.
Zurück auf die technischen Stellschrauben: Die Studie identifiziert vier Fähigkeiten, die mit Erfolg korrelieren. Erstens das Entdecken versteckter Information, etwa welche Werbekanäle für Segmente wirklich funktionieren. Zweitens das Vorhersagen der Zukunft, gemessen über Fehler in Vier-Wochen-Cash-Forecasts. Drittens das schnelle Anpassen an Veränderungen, etwa wie schnell ein Modell erkennt, wenn Wettbewerber die Qualitätsanforderungen anheben. Viertens vorausschauendes Planen, teilweise sichtbar daran, wie häufig if-then-Szenarien in den Notizen des Agents auftauchen. Opus 4.8 und GPT-5.5 lagen bei diesen Punkten über dem Durchschnitt der übrigen Modelle. Ein wichtiger Vergleich liefert der Werkzeugkontext: Wenn Claude Opus 4.7 mit Claude Code oder GPT-5.5 mit Codex arbeitet, wird das Verhalten weniger aktiv, und die Leistung sinkt – vermutlich wegen Prompts, die primär auf Softwareentwicklung statt Unternehmenssteuerung optimiert sind.
Für die Zukunft lässt sich daraus eine klare Produkt- und Sicherheitsbotschaft ableiten. Selbst bei einem komprimierten Horizont von 50 Tagen schafft nur GPT-5.5 den Profit, was nahelegt, dass kurzfristiges Planen allein die Lücke nicht schließt. Gleichzeitig räumen die Forschenden Grenzen des Setups ein: Die Produktqualität wird als einzelner Score abgebildet, wodurch qualitative Produktänderungen schwerer bewertbar sind. Außerdem wurden Themen wie Compliance, Security und Fundraising bewusst ausgelassen, um den Run wirtschaftlich und simulativ handhabbar zu halten. Für Unternehmen bedeutet das: KI-gestützte „Agenten-Software” braucht neben Tool-Kompetenz vor allem Governance-fähige Entscheidungsarchitekturen, Datenherkunft und messbare Sicherheitschecks. Wer diese Lücke adressiert, kann in der KI-Entwicklung von Metriken wie Cash-Forecasts, Feedback-Delays und Strategie-Kohärenz profitieren – und gleichzeitig Datenschutz- und Sicherheitsanforderungen früh in die Pipeline einbauen.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "CEO-Bench: Nur drei KI-Modelle überleben 500 Tage im Startup-Planungsstress" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "CEO-Bench: Nur drei KI-Modelle überleben 500 Tage im Startup-Planungsstress" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »CEO-Bench: Nur drei KI-Modelle überleben 500 Tage im Startup-Planungsstress« bei Google Deutschland suchen, bei Bing oder Google News!