PRINCETON / LONDON (IT BOLTWISE) – Eine neue Princeton-Studie stellt die Idee infrage, KI-Modelle einfach als Unternehmenslenker einzusetzen. In einem simulierten 500-Tage-Startup ließ sich für die meisten KI-Ansätze kein nachhaltiger Erfolg nachweisen. Besonders stark schnitt Anthropics Claude Fable 5 ab und steigerte den fiktiven Unternehmenswert auf 47,15 Millionen Euro. Gleichzeitig zeigte der Test, dass sogar einfache regelbasierte Logik in komplexen, langfristigen Entscheidungen oft nicht klar unterlegen ist.

Der Hype um „autonome“ KI-Agents trifft gerade auf eine unangenehme Messlatte: In einem simulierten 500-Tage-Startup-Experiment testen Forschende der Princeton-Universität, ob KI-Systeme tatsächlich wie ein CEO handeln können. Das Setup ist bewusst streng: Die Modelle müssen ein fiktives Unternehmen namens NovaMind steuern, das mit einem Startkapital von einer Million Euro startet. Am Ende zählt nicht die „Intelligenz“ im Chat, sondern das Ergebnis über Zeit: Nur drei KI-Agenten beendeten die Simulation mit mehr Geld als sie zu Beginn hatten. Damit rückt ein Problem in den Fokus, das in vielen Pilotprojekten von KI im Unternehmen unterschätzt wird – Entscheidungsqualität unter Unsicherheit.
Technisch basiert der Test auf dem sogenannten CEO-Bench, also einer Benchmarksuite, die Führungs- und Managementaufgaben in wiederholten Spielzügen abbilden soll. Entscheidend ist dabei die langfristige Zielführung: Ein CEO muss Budget priorisieren, Risiken abfedern und Entscheidungen so timen, dass sie in späteren Taktungen nicht zu Folgekosten führen. Genau an dieser Stelle fällt die Studie aus Sicht vieler Stakeholder ernüchternd aus. Zwar konnten einzelne Systeme Rendite erzeugen, aber die Mehrheit scheiterte in der Summe über 500 Tage. Das ist ein starkes Indiz dafür, dass „gute“ Sprach- und Wissensleistung nicht automatisch zu belastbaren Unternehmensentscheidungen wird, besonders wenn externe Einflüsse, Annahmen und Planungsfehler zusammenspielen.
Das Ergebnis bleibt trotzdem spannend, weil es klare Sieger und deutliche Abstände zeigt. Anthropics Claude Fable 5 schnitt demnach mit großem Vorsprung am besten ab und steigerte den Unternehmenswert auf 47,15 Millionen Euro. Dahinter folgten Claude Opus 4.8 mit 27,8 Millionen und OpenAIs GPT-5.5 mit 21,3 Millionen Euro. Gleichzeitig kommt die eigentliche Überraschung: Ein regelbasiertes System – also ohne moderne KI-„Magie“ im engeren Sinn – schlug die meisten Hightech-Modelle und erreichte immerhin 15,76 Millionen Euro. Für die KI-Entwicklung bedeutet das: Agenten benötigen nicht nur bessere Generatoren, sondern robuste Entscheidungslogik, bessere Zustandsmodelle und verlässliche Kosten-Nutzen-Schätzungen, die über viele Schritte stabil bleiben.
Über die reine Modellleistung hinaus ordnet die Studie die Ergebnisse in eine breitere Marktbewegung ein. Autonome KI-Systeme sind in der Praxis längst dabei, Prototyping-Zyklen zu verkürzen – so berichten Branchenbeobachter, dass Kosten, Zeit und Personalaufwand sinken. Gleichzeitig deuten Beobachtungen darauf hin, dass sich die Zeitspanne für komplexe Aufgaben durch KI-Agenten etwa alle sieben Monate verdoppeln könnte. Doch genau diese Dynamik erzeugt Druck: Wer KI-Agenten als „Produktionsarbeiter“ einsetzt, muss mit Drift, unvollständigen Kontextannahmen und fehlerhaften Handlungsfolgen rechnen. Wie Branchenanalysten betonen, verlagert sich das Wertversprechen daher von der reinen Modellfähigkeit zur Engineering-Disziplin rund um Planung, Monitoring und Governance – besonders dann, wenn Entscheidungen finanzielle oder rechtliche Auswirkungen haben.
Auch am Wettbewerb zwischen den großen Playern sieht man, wie stark Geopolitik und Zugriff auf Rechen- und Modellkapazitäten inzwischen den Ton angeben. Laut den vorliegenden Angaben verhängten die USA Mitte Juni ein Exportverbot für bestimmte Anthropics-Modelle, was internationale Wettbewerber zu alternativen Strategien drängt. Parallel dazu bringt China Spezialisierungen auf den Markt, etwa mit dem auf Cybersicherheit getrimmten Modell Tulongfeng von 360. In Japan spielt Sakana AI mit einem Orchestrator namens Fugu eine andere Rolle: weniger „ein großes Modell“, mehr ein Steuerungs- und Koordinationslayer. OpenAI wiederum beschränkt den Zugang zur neuesten GPT-5.6-Serie: Modelle Sol, Terra und Luna seien demnach nur für US-regierungsautorisierte Partner verfügbar. Für Unternehmen heißt das: Plattformwahl wird zunehmend zur Compliance-Entscheidung.
Damit rückt auch Softwareentwicklung als zweites Feld in den Mittelpunkt, weil dort die Erfolgskennzahlen konkreter messbar sind. Im Ende Juni veröffentlichten MirrorCode-Benchmark wird ein großer Schritt beim autonomen Codieren beschrieben: Claude Opus 4.7 habe ein Projekt mit rund 60.000 Zeilen Code erfolgreich neu implementiert; die Erfolgsquote lag bei 56 Prozent. GPT-5.5 und Gemini 3.1 Pro werden mit 44 bzw. 32 Prozent genannt. Interessant ist der Zusammenhang zum CEO-Bench: Autonomes Handeln wirkt oft dann „real“, wenn Tests, Build-Prozesse und Fehlerfeedback schnell kommen. In Management- oder Finanzentscheidungen fehlt dieses enge Feedback-Lab – und das erklärt vermutlich, warum reine Sprach- und Codierfähigkeit nicht 1:1 in nachhaltige Geschäftsergebnisse überspringt. Technischer Vergleich: In der Softwarewelt ist die Zielfunktion klarer (kompilieren, Tests bestehen), im Startup-Experiment dagegen verteilen sich Ergebnisse über Zeit, Marktannahmen und mehrere Zielkonflikte.
Regulatorisch und datenschutzbezogen wird der Druck im gleichen Atemzug größer. Die vorliegende Meldung bettet die Debatte in den EU AI Act ein, der je nach Use Case Pflichten, Dokumentationsanforderungen und Risikoklassen festlegt. Für Verantwortliche heißt das praktisch: Ein KI-Agent, der Rechnungen automatisiert, Verträge vorbereitet oder Entscheidungen über Risiken beeinflusst, fällt nicht automatisch in die niedrigste Kategorie. Vielmehr müssen Betreiber nachweisen, dass sie Risiken beherrschen – inklusive Monitoring, Logging, menschlicher Aufsicht (Human-in-the-loop, wo erforderlich) und klarer Verantwortlichkeiten. Die Studie selbst untersucht zwar „nur“ ein simuliertes Startup, liefert aber indirekt die Argumente: Wenn selbst starke Modelle langfristig scheitern, steigt der Bedarf an kontrollierenden Mechanismen, um unerwünschtes Verhalten in realen Prozessen zu verhindern.
Der Ausblick zeigt schließlich, dass die Branche nicht beim Benchmark stehen bleibt, sondern in Richtung Infrastruktur und Hardware denkt. Auf Marktdatenebene wird ein Boom beschrieben: In den letzten zwölf Monaten soll der Umsatz im Bereich generative KI bei 110 Millionen Euro gelegen haben, annualisiert bei 175 Milliarden Euro; zusätzlich wird für Anthropic eine Umsatzrate von 47 Milliarden Euro im Mai 2026 genannt. Solche Zahlen sind als Branchenindikation zu verstehen, aber sie unterstreichen die Investitionsbereitschaft. Parallel dazu arbeitet OpenAI eigenen Angaben zufolge an Hardware: Der hauseigene KI-Chip Jalapeño soll in neunmonatiger Zusammenarbeit mit Broadcom entstanden sein. Bei Hardware- und KI-Infrastruktur-Entscheidungen gewinnt auch die Frage nach Datengovernance, besonders bei internationalen Rollouts. In Neu-Delhi diskutierte Premierminister Modi mit 16 DeepTech- und KI-Startups laut Bericht Themen wie Datengovernance sowie den Ausbau lokaler KI-Lösungen für Landwirtschaft und Bildung. Für Unternehmen folgt daraus eine klare Konsequenz: KI-Agenten müssen nicht nur „smart“ sein, sondern in ihre IT-Landschaft passen – inkl. Rechenzugang, Observability und regulatorischer Standortstrategie.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro« bei Google Deutschland suchen, bei Bing oder Google News!