PRINCETON / LONDON (IT BOLTWISE) – Ein Benchmark der Universität Princeton testet KI-Agenten nicht an Einzelaufgaben, sondern an einer Art mehrmonatigem Unternehmensbetrieb. In der Studie wurden Agenten 500 simulierte Tage lang als virtuelle Geschäftsführer eingesetzt, mit Preisentscheidungen, Marketingbudgets, Konkurrentenbeobachtung und Budgetverantwortung. Das Ergebnis fällt ernüchternd aus: Die meisten Modelle gehen bankrott. Nur wenige Systeme halten das Startkapital über lange Horizonte hinweg deutlich stabiler.

KI-Agenten werden in der Produktwelt gern als Alleskönner verkauft: Sie formulieren E-Mails, recherchieren Risiken und setzen Workflows um. CEO-Bench dreht diese Perspektive um und prüft, ob ein Modell auch unter Dauerstress – mit Konkurrenz, Budgetzwängen und wechselnden Bedingungen – als „virtueller Chef“ durchhält. In einem von Princeton beschriebenen Setup läuft ein mehrtägiger bis monatelanger Simulations-Loop, der echte Managemententscheidungen erzwingt statt isolierter Aufgabenstellungen. Die Kernfrage lautet damit nicht „kann die KI ein Problem lösen?“, sondern „kann sie ein System über Zeit steuern, ohne in den Anfangsoptimismus zu kippen?“
Der Test unterscheidet sich bewusst von klassischen Benchmarks wie SWE-Bench oder Webarena, die üblicherweise einzelne Fähigkeiten abprüfen. CEO-Bench gibt dem Agenten eine Python-Schnittstelle und lässt ihn auf Unternehmensdatenbanken sowie Social-Media-Tools zugreifen. Der Agent muss parallel und über viele Zeitschritte hinweg agieren: Preise setzen, Marketingbudgets verteilen, Konkurrenten beobachten und daraus eine langfristige Strategie ableiten. Entscheidend ist dabei der Langzeitcharakter unter Unsicherheit: Informationen sind unvollständig, Märkte reagieren, und Entscheidungen beeinflussen späteres Datenmaterial. Damit rückt das in den Mittelpunkt, was in der Praxis über Erfolg oder Misserfolg entscheidet – Planung und Anpassung über viele Iterationen.
Die Autoren Haozhe Chen, Karthik Narasimhan und Zhuang Liu führen vier Schwachstellen aus, die in vielen bisherigen Benchmarks zu wenig sichtbar bleiben. Erstens geht es um Langzeithorizonte: Ein Modell muss Ereignisse antizipieren, nicht nur kurzfristig „richtig antworten“. Zweitens fehlt in vielen Tests das echte Informationsrauschen: Agenten müssen aus ungenauen Datenquellen Nutzen ziehen. Drittens wird „Adaptation“ geprüft, weil sich Bedingungen ändern und Strategien rekalibriert werden müssen. Viertens verlangt CEO-Bench Koordination vieler voneinander abhängiger Entscheidungen – Preis, Budget und Marktbeobachtung greifen ineinander. Genau diese Kopplung macht aus einem Prompt eine fortlaufende Steuerungsaufgabe.
Fast alle getesteten Systeme scheiterten: Nur fünf von mehreren Modellen endeten mit positivem Kassenbestand. Das Startkapital lag bei 1.000.000 US-Dollar. Am Ende übertrafen nur Claude Opus 4.8 mit rund 27,8 Millionen US-Dollar und GPT-5.5 mit 21,3 Millionen US-Dollar den Anfang deutlich. Auffällig ist zudem, dass eine regelbasierte Baseline ohne Sprachmodell noch auf 15,76 Millionen US-Dollar kam – ein Hinweis darauf, dass robuste Heuristiken in bestimmten Simulationswelten nicht unterschätzt werden dürfen. Dagegen gingen Modelle wie Grok 4.20, Deepseek V4 Pro und Gemini 3 Flash in allen drei Durchläufen bankrott. Grok 4.20 schaffte im Schnitt gerade 28 Tage; das theoretische Maximum liegt laut Autoren bei etwa 2,2 Milliarden US-Dollar.
Bemerkenswert sind auch die beobachteten Verhaltensmuster. Claude Opus 4.8 baute in der Simulation eine Art Szenarioanalyse auf, um zukünftige Cashflows unter verschiedenen Annahmen vorherzusagen. GPT-5.5 dagegen durchsuchte die Verhandlungshistorie in der Datenbank, um versteckte Kundenpräferenzen zu erkennen. Solche Strategien wirken wie zwei unterschiedliche „Denkmotoren“: der eine plant über einen Risiko-Korridor, der andere sucht nach Signal in historischen Kontexten. Laut Studie reagierten beide Systeme mit Qualitätsverbesserungen der Konkurrenz im Schnitt binnen einer Woche; andere Modelle brauchten rund zwei Wochen. Für die Praxis heißt das: Time-to-learn und „Feedback-Verarbeitung“ entscheiden, ob ein Agent eine Lernkurve überhaupt erreicht oder nur Kosten produziert.
Die Autoren nennen zudem Indikatoren, die über reine Endwerte hinausgehen. Ein Beispiel ist die Häufigkeit des Wortes „if“ in internen Notizen: Claude Opus 4.8 kam auf 8,57 Verwendungen pro Woche, GPT-5.5 auf 7,47; alle anderen Modelle zusammen auf 2,63. Das wirkt zunächst wie ein Nebengeräusch, ist aber als Signal für vorausschauende Entscheidungslogik plausibel: Mehr bedingte Überlegungen deuten auf mehr verzweigte Handlungspläne hin. Praktisch relevant wird ein weiterer Befund: Wenn Claude Opus 4.7 in der Claude-Code-Umgebung betrieben wird statt im schlichten Custom-Harness der Forscher, sinkt die Aktionsrate pro Tag deutlich und die Leistung verschlechtert sich spürbar. Die Vermutung: Managementaufgaben profitieren nicht automatisch von Tools, die für Software-Engineering optimiert sind – die Schnittstellen wirken wie ein implizites Bias-Filtersystem.
Für den Markt ist CEO-Bench damit mehr als ein weiteres Ranking. Es verschiebt die Bewertungsachse von „Fähigkeiten“ hin zu „Steuerbarkeit“ unter realistischen Constraints, also dort, wo Unternehmen heute tatsächlich Risiken sehen: unklare Verantwortlichkeit, Kostenexplosionen und schwer nachvollziehbare Entscheidungswege. Experten berichten in solchen Kontexten häufig, dass erfolgreiche KI-Agenten-Implementierungen nicht nur bessere Modelle brauchen, sondern auch passende Umgebungen, Telemetrie und kontrollierte Zugriffspfade. Ein Benchmark, der Datenbanken, Social-Tools und Budgetlogik zusammenführt, macht außerdem deutlich, dass Governance nicht nachgelagert werden darf. Gerade im Unternehmensbetrieb müssen Zugriffsrechte, Protokollierung und Datenminimierung greifen, damit ein Agent nicht aus Versehen sensible Informationen in falsche Kontexte schreibt oder falsche Handlungen mit zu breiten Privilegien ausführt.
In der Zukunft dürfte CEO-Bench vor allem zwei Spuren befeuern. Erstens werden Teams bei KI-Entwicklung vermehrt auf langfristige Trainings- und Evaluationsschemata setzen, bei denen „Lernen über Tage“ statt „Antworten über Sekunden“ zählt. Zweitens rückt die technische Architektur in den Fokus: Agenten brauchen robuste Zustandsverwaltung, präzise Planungsmechanismen und kontrollierte Tool-Nutzung, um nicht nach wenigen Wochen in finanzielle Sackgassen zu geraten. Wenn das theoretische Maximum von rund 2,2 Milliarden US-Dollar erreichbar ist, deutet das auf erhebliche ungenutzte Reserven hin – und damit auf Entwicklungspotenzial für bessere Strategiepipelines, Wiederplanungsfrequenzen und Guardrails. Für Entwickler entsteht daraus eine konkrete Chance: Wer die Messlatte für „Management-ähnliche“ Agenten ernst nimmt, kann Enterprise-Use-Cases künftig glaubwürdiger evaluieren, bevor echte Budgets im Feld riskieren.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "CEO-Bench: KI-Agenten scheitern als virtuelle Geschäftsführer meist nach 500 Tagen" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "CEO-Bench: KI-Agenten scheitern als virtuelle Geschäftsführer meist nach 500 Tagen" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »CEO-Bench: KI-Agenten scheitern als virtuelle Geschäftsführer meist nach 500 Tagen« bei Google Deutschland suchen, bei Bing oder Google News!