PRINCETON / LONDON (IT BOLTWISE) – Eine neue Princeton-Studie stellt die Idee infrage, KI-Modelle einfach als Unternehmenslenker einzusetzen. In einem simulierten 500-Tage-Startup ließ sich für die meisten KI-Ansätze kein nachhaltiger Erfolg nachweisen. Besonders stark schnitt Anthropics Claude Fable 5 ab und steigerte den fiktiven Unternehmenswert auf 47,15 Millionen Euro. Gleichzeitig zeigte der Test, dass sogar einfache regelbasierte Logik in komplexen, langfristigen Entscheidungen oft nicht klar unterlegen ist.

KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro
KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro (Foto: IT BOLTWISE)
🧠 KI & Robotik auf Google News abonnieren

Der Hype um „autonome“ KI-Agents trifft gerade auf eine unangenehme Messlatte: In einem simulierten 500-Tage-Startup-Experiment testen Forschende der Princeton-Universität, ob KI-Systeme tatsächlich wie ein CEO handeln können. Das Setup ist bewusst streng: Die Modelle müssen ein fiktives Unternehmen namens NovaMind steuern, das mit einem Startkapital von einer Million Euro startet. Am Ende zählt nicht die „Intelligenz“ im Chat, sondern das Ergebnis über Zeit: Nur drei KI-Agenten beendeten die Simulation mit mehr Geld als sie zu Beginn hatten. Damit rückt ein Problem in den Fokus, das in vielen Pilotprojekten von KI im Unternehmen unterschätzt wird – Entscheidungsqualität unter Unsicherheit.

Technisch basiert der Test auf dem sogenannten CEO-Bench, also einer Benchmarksuite, die Führungs- und Managementaufgaben in wiederholten Spielzügen abbilden soll. Entscheidend ist dabei die langfristige Zielführung: Ein CEO muss Budget priorisieren, Risiken abfedern und Entscheidungen so timen, dass sie in späteren Taktungen nicht zu Folgekosten führen. Genau an dieser Stelle fällt die Studie aus Sicht vieler Stakeholder ernüchternd aus. Zwar konnten einzelne Systeme Rendite erzeugen, aber die Mehrheit scheiterte in der Summe über 500 Tage. Das ist ein starkes Indiz dafür, dass „gute“ Sprach- und Wissensleistung nicht automatisch zu belastbaren Unternehmensentscheidungen wird, besonders wenn externe Einflüsse, Annahmen und Planungsfehler zusammenspielen.

Das Ergebnis bleibt trotzdem spannend, weil es klare Sieger und deutliche Abstände zeigt. Anthropics Claude Fable 5 schnitt demnach mit großem Vorsprung am besten ab und steigerte den Unternehmenswert auf 47,15 Millionen Euro. Dahinter folgten Claude Opus 4.8 mit 27,8 Millionen und OpenAIs GPT-5.5 mit 21,3 Millionen Euro. Gleichzeitig kommt die eigentliche Überraschung: Ein regelbasiertes System – also ohne moderne KI-„Magie“ im engeren Sinn – schlug die meisten Hightech-Modelle und erreichte immerhin 15,76 Millionen Euro. Für die KI-Entwicklung bedeutet das: Agenten benötigen nicht nur bessere Generatoren, sondern robuste Entscheidungslogik, bessere Zustandsmodelle und verlässliche Kosten-Nutzen-Schätzungen, die über viele Schritte stabil bleiben.

Über die reine Modellleistung hinaus ordnet die Studie die Ergebnisse in eine breitere Marktbewegung ein. Autonome KI-Systeme sind in der Praxis längst dabei, Prototyping-Zyklen zu verkürzen – so berichten Branchenbeobachter, dass Kosten, Zeit und Personalaufwand sinken. Gleichzeitig deuten Beobachtungen darauf hin, dass sich die Zeitspanne für komplexe Aufgaben durch KI-Agenten etwa alle sieben Monate verdoppeln könnte. Doch genau diese Dynamik erzeugt Druck: Wer KI-Agenten als „Produktionsarbeiter“ einsetzt, muss mit Drift, unvollständigen Kontextannahmen und fehlerhaften Handlungsfolgen rechnen. Wie Branchenanalysten betonen, verlagert sich das Wertversprechen daher von der reinen Modellfähigkeit zur Engineering-Disziplin rund um Planung, Monitoring und Governance – besonders dann, wenn Entscheidungen finanzielle oder rechtliche Auswirkungen haben.

Auch am Wettbewerb zwischen den großen Playern sieht man, wie stark Geopolitik und Zugriff auf Rechen- und Modellkapazitäten inzwischen den Ton angeben. Laut den vorliegenden Angaben verhängten die USA Mitte Juni ein Exportverbot für bestimmte Anthropics-Modelle, was internationale Wettbewerber zu alternativen Strategien drängt. Parallel dazu bringt China Spezialisierungen auf den Markt, etwa mit dem auf Cybersicherheit getrimmten Modell Tulongfeng von 360. In Japan spielt Sakana AI mit einem Orchestrator namens Fugu eine andere Rolle: weniger „ein großes Modell“, mehr ein Steuerungs- und Koordinationslayer. OpenAI wiederum beschränkt den Zugang zur neuesten GPT-5.6-Serie: Modelle Sol, Terra und Luna seien demnach nur für US-regierungsautorisierte Partner verfügbar. Für Unternehmen heißt das: Plattformwahl wird zunehmend zur Compliance-Entscheidung.

Damit rückt auch Softwareentwicklung als zweites Feld in den Mittelpunkt, weil dort die Erfolgskennzahlen konkreter messbar sind. Im Ende Juni veröffentlichten MirrorCode-Benchmark wird ein großer Schritt beim autonomen Codieren beschrieben: Claude Opus 4.7 habe ein Projekt mit rund 60.000 Zeilen Code erfolgreich neu implementiert; die Erfolgsquote lag bei 56 Prozent. GPT-5.5 und Gemini 3.1 Pro werden mit 44 bzw. 32 Prozent genannt. Interessant ist der Zusammenhang zum CEO-Bench: Autonomes Handeln wirkt oft dann „real“, wenn Tests, Build-Prozesse und Fehlerfeedback schnell kommen. In Management- oder Finanzentscheidungen fehlt dieses enge Feedback-Lab – und das erklärt vermutlich, warum reine Sprach- und Codierfähigkeit nicht 1:1 in nachhaltige Geschäftsergebnisse überspringt. Technischer Vergleich: In der Softwarewelt ist die Zielfunktion klarer (kompilieren, Tests bestehen), im Startup-Experiment dagegen verteilen sich Ergebnisse über Zeit, Marktannahmen und mehrere Zielkonflikte.

Regulatorisch und datenschutzbezogen wird der Druck im gleichen Atemzug größer. Die vorliegende Meldung bettet die Debatte in den EU AI Act ein, der je nach Use Case Pflichten, Dokumentationsanforderungen und Risikoklassen festlegt. Für Verantwortliche heißt das praktisch: Ein KI-Agent, der Rechnungen automatisiert, Verträge vorbereitet oder Entscheidungen über Risiken beeinflusst, fällt nicht automatisch in die niedrigste Kategorie. Vielmehr müssen Betreiber nachweisen, dass sie Risiken beherrschen – inklusive Monitoring, Logging, menschlicher Aufsicht (Human-in-the-loop, wo erforderlich) und klarer Verantwortlichkeiten. Die Studie selbst untersucht zwar „nur“ ein simuliertes Startup, liefert aber indirekt die Argumente: Wenn selbst starke Modelle langfristig scheitern, steigt der Bedarf an kontrollierenden Mechanismen, um unerwünschtes Verhalten in realen Prozessen zu verhindern.

Der Ausblick zeigt schließlich, dass die Branche nicht beim Benchmark stehen bleibt, sondern in Richtung Infrastruktur und Hardware denkt. Auf Marktdatenebene wird ein Boom beschrieben: In den letzten zwölf Monaten soll der Umsatz im Bereich generative KI bei 110 Millionen Euro gelegen haben, annualisiert bei 175 Milliarden Euro; zusätzlich wird für Anthropic eine Umsatzrate von 47 Milliarden Euro im Mai 2026 genannt. Solche Zahlen sind als Branchenindikation zu verstehen, aber sie unterstreichen die Investitionsbereitschaft. Parallel dazu arbeitet OpenAI eigenen Angaben zufolge an Hardware: Der hauseigene KI-Chip Jalapeño soll in neunmonatiger Zusammenarbeit mit Broadcom entstanden sein. Bei Hardware- und KI-Infrastruktur-Entscheidungen gewinnt auch die Frage nach Datengovernance, besonders bei internationalen Rollouts. In Neu-Delhi diskutierte Premierminister Modi mit 16 DeepTech- und KI-Startups laut Bericht Themen wie Datengovernance sowie den Ausbau lokaler KI-Lösungen für Landwirtschaft und Bildung. Für Unternehmen folgt daraus eine klare Konsequenz: KI-Agenten müssen nicht nur „smart“ sein, sondern in ihre IT-Landschaft passen – inkl. Rechenzugang, Observability und regulatorischer Standortstrategie.


💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!


Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
152 Bewertungen
Sense Robot Go KI-Go-Brett mit Roboterarm – Automatische Steinplatzierung, interaktives Lernen, Spielwiederholung – Intelligenter Weiqi-Trainer für Kinder & Erwachsene
  • ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
334 Bewertungen
ENERGIZE LAB Eiliko Coral Pink - Ihr winziger KI-Charm-Roboter, der zu jedem täglichen Outfit passt, lustiges elektronisches Anhängerspielzeug, für Paare und beste Freunde
  • IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
Eilik intelligenter Schreibtisch Roboter | für Kinder & Erwachsene, mit Emotionen Interaktionen und Animationen, Spielzeug Unterhaltung Begleiter Haustier Persönlicher Assistent, für mehr Spaß
1.501 Bewertungen
Eilik intelligenter Schreibtisch Roboter | für Kinder & Erwachsene, mit Emotionen Interaktionen und Animationen, Spielzeug Unterhaltung Begleiter Haustier Persönlicher Assistent, für mehr Spaß
  • NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
53 Bewertungen
Plantbot Upgraded Large Smart Flower Pot Pet Planter Robot with Artificial Intelligence, Time Temperature Display, and Numerous Expressive Animations Based, for Indoor Decoration, Gifts (White)
  • 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
946 Bewertungen
Loona KEYI Premium Haustier-Roboter mit Ladestation (Smarte AI ChatGPT-4o, Stimmen- & Gestensteuerung, Echtzeit-Interaktion, Heimüberwachung)
  • V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.


Hat Ihnen der Artikel bzw. die News - KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro - gefallen? Dann abonnieren Sie uns doch auf Insta: AI News, Tech Trends & Robotics - Instagram - Boltwise

Unseren KI-Morning-Newsletter «Der KI News Espresso» mit den besten KI-News des letzten Tages gratis per eMail - ohne Werbung: Hier kostenlos eintragen!





Folgen Sie aktuellen Beiträge über KI & Robotik auf Twitter, Telegram, Facebook oder LinkedIn!
Hinweis: Teile dieses Textes könnten mithilfe Künstlicher Intelligenz generiert worden sein. Die auf dieser Website bereitgestellten Informationen stellen keine Finanzberatung dar und sind nicht als solche gedacht. Die Informationen sind allgemeiner Natur und dienen nur zu Informationszwecken. Wenn Sie Finanzberatung für Ihre individuelle Situation benötigen, sollten Sie den Rat von einem qualifizierten Finanzberater einholen. IT BOLTWISE® schließt jegliche Regressansprüche aus.









Ergänzungen und Infos bitte an die Redaktion per eMail an de-info[at]it-boltwise.de. Da wir bei KI-erzeugten News und Inhalten selten auftretende KI-Halluzinationen nicht ausschließen können, bitten wir Sie bei Falschangaben und Fehlinformationen uns via eMail zu kontaktieren und zu informieren. Bitte vergessen Sie nicht in der eMail die Artikel-Headline zu nennen: "KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro".
Stichwörter Agent AI Anthropic Artificial Intelligence Automatisierung Benchmark Chip Clustern Entscheidungen EU AI Act Führung Hardware Intelligenz KI Künstliche Künstliche Intelligenz Modell OpenAI Rechenzentrum Regulierung Software Startup
Alle Märkte in Echtzeit verfolgen - 30 Tage kostenlos testen!

Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro" für unsere Leser?

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

  • Die aktuellen intelligenten Ringe, intelligenten Brillen, intelligenten Uhren oder KI-Smartphones auf Amazon entdecken! (Sponsored)


  • Es werden alle Kommentare moderiert!

    Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.

    Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.

    Du willst nichts verpassen?

    Du möchtest über ähnliche News und Beiträge wie "KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
    Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »KI-CEOs im Test: Claude gewinnt CEO-Bench mit 47,15 Mio. Euro« bei Google Deutschland suchen, bei Bing oder Google News!


    2.346 Leser gerade online auf IT BOLTWISE
    KI-Jobs