LONDON (IT BOLTWISE) – Meta-Insiderchef Alexandr Wang sagt intern, sein kommendes Modell „Watermelon“ liege bei wichtigen Benchmarks bereits auf Augenhöhe mit OpenAI GPT‑5.5. Parallel kündigt Meta eine zeitnahe Aktualisierung des aktuellen Muse‑Spark-Systems an, die vor allem bei Coding und agentischem Verhalten zulegen soll. Der Schritt wäre ein deutliches Signal, dass die jahrelange Investitions- und Talentstrategie von Meta erste Ergebnisse liefert – während der Abstand in der Modellgeneration gleichzeitig weiter schnell schrumpft. Unklar bleibt jedoch, welche Benchmarks genau gemeint sind und wie sich die Leistung in realen Unternehmens-Workflows messen lässt.

Meta will nach eigener Darstellung im AI-Modellrennen nicht nur „nachziehen“, sondern bei Kernkompetenzen gleichziehen. In einem internen Townhall-Event hat Alexandr Wang, der das KI-Projekt bei Meta Superintelligence Labs mitprägt, laut zwei informierten Personen erklärt, dass das nächste Modell mit dem Codenamen „Watermelon“ in den eigenen, stark beobachteten Benchmarks mit OpenAI GPT‑5.5 gleichauf sei. Gleichzeitig läuft Watermelon laut denselben Aussagen gerade in der Ausbildung („currently in training“). Entscheidend ist dabei weniger der PR-Aspekt als die Frage, ob Meta die behauptete Lücke wirklich entlang jener Fähigkeiten schließt, die Entwickler heute produktiv brauchen: zuverlässiges Coding, planendes „agentic“ Verhalten und stabile Qualität außerhalb idealer Testumgebungen.
Technisch liefert Wang dafür eine klare Richtung, auch wenn er keine konkreten Kennzahlen nennt. Er soll „Watermelon“ gegenüber dem vorherigen Muse‑Spark-Vorgänger (intern codiert als „Avocado“) als Modell „eine Größenordnung mehr Compute“ zuordnet. Das deutet auf eine deutlich größere Trainingsbudget- und Skalierungsstufe hin, typischerweise verbunden mit mehr Trainings-Token, längeren Trainingsläufen oder größeren Modellvarianten. Der Umstand, dass Meta auf aufeinanderfolgende Modellfamilien setzt, passt zur Logik moderner LLM-Entwicklung: erst eine solide Basislinie für Fähigkeiten wie Programmieraufgaben, dann iteratives Feintuning und Distillation für Domänenfertigkeit und Agentensteuerung. Wichtig bleibt aber die konkrete Umsetzung in der Infrastruktur und im Evaluationsdesign.
In diesem Kontext spielt Infrastruktur eine zentrale Rolle. Meta hat für das laufende Jahr Investitionen in Chips, Rechenzentren und weitere Infrastruktur in einer Spanne von 125 Milliarden bis 145 Milliarden US-Dollar angekündigt, zuvor lag die Erwartung bei 115 Milliarden bis 135 Milliarden US-Dollar. Solche Budgetanpassungen sind in der Praxis oft eine Antwort auf steigende Komponentenkosten, zusätzliche Kapazitätsanforderungen und längere Lieferzyklen. Aus Wettbewerbssicht ist das relevant, weil das Modellrennen nicht nur durch „bessere Daten“ gewonnen wird, sondern durch die Fähigkeit, Training effizient zu wiederholen und Evaluationszyklen zu beschleunigen. Im Vergleich zu OpenAI und auch zu Googles und Anthropic-getriebenen Iterationsgeschwindigkeiten wird damit klar, warum Meta gleichzeitig an Modellleistung und an Hardware-Engpässe denkt.
Marktseitig verschiebt sich dadurch die Positionierung gegenüber den führenden Wettbewerbern. OpenAI hat GPT‑5.5 bereits im April veröffentlicht und kurz darauf GPT‑5.6 vorgestellt, wobei ein breiter Rollout laut der Quelle noch aussteht. Anthropic wiederum wird häufig mit hochwertigen Coding- und Sicherheits-typischen Fähigkeiten assoziiert; in der Diskussion rund um Meta soll Wang sogar auf eine Anfrage reagiert haben, wann ein Coding-Modell „auf Augenhöhe“ mit Claude Opus liegen werde. Er antwortete dabei sinngemäß, das werde „ziemlich bald“ passieren. Dass Wang parallel öffentlich über eine bevorstehende Aktualisierung von Muse Spark spricht, zielt genau auf die Lücken, die Entwickler in der Realität spüren: bessere Code-Generierung, weniger Ausgaben ohne Nutzwert und ein agentenfähigerer Umgang mit mehrschrittigen Aufgaben.
Aus Expertensicht ist jedoch die Benchmark-Frage der Flaschenhals. Wang verweist auf „closely followed AI model benchmarks“, die konkrete Auswahl bleibt aber offen. Gerade bei Coding-Benchmarks gilt: Modelle können auf standardisierten Aufgaben stark aussehen, während sie in Integrationen mit Tools, in längeren Planungsschleifen oder bei unvollständigen Kontextdaten aus dem Tritt geraten. Außerdem unterscheiden sich Benchmarks in der Granularität, etwa ob sie reines Generieren bewerten oder auch Debugging, Tool-Nutzung und agentisches Replanen abbilden. Für Unternehmen ist daher weniger die Frage „Hat es GPT‑5.5 erreicht?“ entscheidend, sondern „Wie reproduzierbar ist die Leistung in unserem Use-Case?“ Dazu gehört auch, wie gut Meta seine Modelle für Enterprise-Workflows instrumentiert, etwa über Monitoring, Guardrails und verlässliche Inferenzlatenzen.
Regulatorik und Datenschutz rücken dabei zwangsläufig in den Vordergrund. Meta veröffentlicht keine Details dazu, wie Datenflüsse beim Training und bei der Auslieferung konkret abgesichert werden, doch gerade bei agentischen Systemen steigt das Risiko, dass Modelle mehr Kontext „abschleppen“ oder in mehr Interaktionen eingebunden werden als in klassischen Chat-Szenarien. In Unternehmen bedeutet das: zusätzliche Aufmerksamkeit für Datenminimierung, Verschlüsselung in Transit und at Rest, klare Mandate zur Protokollierung sowie ein sauberes Rechte- und Zugriffskonzept für Tool-Aufrufe. Wettbewerber wie OpenAI und Anthropic investieren ebenfalls stark in Governance-Mechanismen, aber die eigentliche Vergleichbarkeit entsteht erst, wenn Anbieter transparent machen, wie sie Evaluations- und Sicherheitsanforderungen in der Praxis operationalisieren.
Für die nächste Entwicklungsstufe zeichnet sich trotzdem ein plausibler Pfad ab. Wenn Muse Spark zeitnah ein Update erhält, das „major gains“ bei Coding und agentischer Capability verspricht, ist das meist ein typisches Muster: erst Leistungsverbesserungen durch Training-Iterationen, dann gezieltes Alignment und Tool- bzw. Agenten-spezifisches Fine-Tuning. Gegenüber Watermelon bedeutet das, dass Meta Parallelität aufbaut: nicht alles hängt an einem einzigen „Big Bang“-Release, sondern an einer Roadmap aus schnellen Zwischenversionen. Damit entsteht für Entwickler ein realer Vorteil, sofern Meta die Verbesserungen über mehrere Releases stabilisiert und nicht nur in einer einzelnen Modellnummer sichtbar macht. In den kommenden Monaten wird sich zeigen, ob die „Gleichzieh“-Behauptung in mehr als nur Laborevaluierungen Bestand hat.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "Meta: „Watermelon“-Modell soll GPT‑5.5 erreichen – genug für den Coding- und Agenten-Wettlauf?" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "Meta: „Watermelon“-Modell soll GPT‑5.5 erreichen – genug für den Coding- und Agenten-Wettlauf?" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »Meta: „Watermelon“-Modell soll GPT‑5.5 erreichen – genug für den Coding- und Agenten-Wettlauf?« bei Google Deutschland suchen, bei Bing oder Google News!