LONDON (IT BOLTWISE) – AMIs Weltmodell H-JEPA nutzt eine hierarchische JEPA-Architektur, die Planungsebenen über unterschiedliche Zeithorizonte koppelt. In Visual AntMaze erreicht das dreischichtige Modell eine Erfolgsrate von 73%, während ein einschichtiges Setup auf 18% kommt. Besonders relevant ist zudem, dass das Team Code und vortrainierte Gewichte vollständig offenlegt und damit Replikation und Weiterentwicklung erleichtert. Für KI-Entwicklungsteams rückt damit erneut die Frage in den Fokus, wie gut sich Vorhersage in Darstellungsräumen tatsächlich in Schritt-für-Schritt-Handlungen übersetzen lässt.

Dass Weltmodelle mehr sein müssen als „nur“ voraussagende Netze, zeigt sich aktuell an H-JEPA: AMI hat eine hierarchische Variante der JEPA-Idee (Joint Embedding Predictive Architecture) veröffentlicht, bei der Planung nicht als ein einziger Rechenblock stattfindet, sondern als strukturierter Ablauf über Ebenen. Der Kern liegt darin, dass jede Ebene Zustände in ihrem eigenen Darstellungsraum und über einen eigenen Zeithorizont vorhersagt. Aus Sicht der KI-Entwicklung ist das vor allem dann wichtig, wenn Langfristziele und unmittelbar auszuführende Aktionen nicht sauber zusammenpassen – etwa in visuellen Navigations- oder Roboter-ähnlichen Umgebungen, in denen Entscheidungen auf mehreren Granularitätsebenen gleichzeitig passieren.
Die erkennbarste Wirkung der Hierarchie misst AMI in einer Simulation: In der Labyrinthaufgabe Visual AntMaze erreicht das dreischichtige H-JEPA laut den veröffentlichten Resultaten 73% Erfolgsrate, während ein einschichtiges Modell lediglich 18% schafft. Dieser Abstand ist bemerkenswert, weil er plausibel macht, dass der Planungsgewinn nicht nur aus „mehr Kapazität“ resultiert, sondern aus der Aufteilung in grobe Zwischenziele und deren schrittweise Verfeinerung. Praktisch heißt das: Eine obere Ebene erstellt zunächst einen groben Plan, gibt vorhergesagte Zwischenzustände als Unterziele nach unten, und die darunterliegenden Ebenen transformieren diese Unterziele in konkrete, ausführbare Aktionen. Zusätzlich berichten die Autoren über bessere Ergebnisse bei geringerem Planungsaufwand in mehreren Simulationsaufgaben – ein Hinweis darauf, dass die Hierarchie die Suche nach Aktionen effizienter strukturieren kann.
Technisch wird H-JEPA so konfiguriert, dass pro Ebene drei Komponenten zusammenarbeiten: Ein Zustandskodierer extrahiert aus der Umgebung eine Darstellung, ein Aktionskodierer beschreibt, wie Aktionen die Zustände verändern, und ein Prädiktor sagt den zukünftigen Zustand voraus, indem er aktuellen Zustand und Aktion kombiniert. Die unterste Ebene arbeitet dabei direkt auf Bildern, während höhere Ebenen stärker abstrahierte Darstellungen der darunterliegenden Zeitskala weiterführen. Außerdem ist die Kopplung zwischen den Zeithorizonten explizit formuliert: In den beschriebenen Experimenten entspricht ein Schritt einer benachbarten oberen Ebene zwei Vorhersageschritten der unteren Ebene. Ein weiteres Detail ist das End-to-End-Lernen: Die Ebenen werden gemeinsam trainiert, wobei der von der oberen Ebene vorhergesagte Zwischenzustand zum Unterziel der unteren Ebene wird; der Abgleich passiert wiederum im jeweiligen Darstellungsraum.
Damit das Training nicht in einem bekannten Problem endet, adressiert H-JEPA den Darstellungs-Kollaps. Die Logik dahinter ist anschaulich: Wenn ein Kodierer alle Eingaben in denselben Vektor presst und der Prädiktor daraus nur diesen Vektor „immer wieder“ vorhersagt, kann der Vorhersagefehler zwar niedrig wirken, aber das Modell hat funktional nichts gelernt, weil die Darstellung keine nützlichen Unterschiede mehr enthält. Um das zu verhindern, greifen die Autoren auf SIGReg zurück, eine von LeCuns Team zuvor vorgeschlagene Methode, die die Darstellungsverteilung einschränkt. So entsteht eine Hierarchie, die nicht nur „korrekt“ rekonstruiert, sondern unterscheidbare Zustände in einer stabilen Einbettungsstruktur hält; genau diese Stabilität macht es realistischer, dass Unterziele von oben nach unten überhaupt als sinnvolle Steuergrößen nutzbar sind.
Dass dieses Vorgehen zur AMI-Strategie passt, liegt auch in der Geschichte: LeCun hat die Idee hierarchischer JEPA-Vorhersagen bereits 2022 als Konzept in den Mittelpunkt gestellt, als er noch Chef-Wissenschaftler für KI bei Meta war. Das Prinzip ist dort sehr nah an Alltagserfahrungen: Beim Planen einer Reise entscheidet man zuerst über grobe Ziele wie Flug und Zeitplan, danach zerlegt man das Vorhaben in konkrete Schritte, bis zur letzten Detailstufe, die auch wirklich Bewegung auslöst. Für Roboter ist das besonders schwierig, weil Informationen auf verschiedenen Zeitskalen unterschiedlich wichtig sind – ein Detail der „Körpersteuerung“ kann auf einer höheren Ebene irrelevant wirken, während auf der unteren Ebene genau dieses Detail den nächsten Schritt bestimmt. Die veröffentlichte Arbeit stützt diese Idee, indem sie zeigt, wie Informationen je Ebene selektiert werden: In der Labyrinthaufgabe schwächt die obere Ebene schrittweise die Darstellung der Beinhaltung ab, behält aber Positionsinformationen. Gleichzeitig finden die Forscher Grenzen der Skalierung: In der Push-T-Aufgabe zeigt das zweischichtige Modell gute Leistung, während eine Erweiterung auf drei oder vier Schichten die Ergebnisse verschlechtert. Als mögliche Erklärung nennen die Autoren, dass kürzere Aufgabentrajektorien den Trainingsdatenumfang für die obere Ebene reduzieren, wodurch die Hierarchie weniger robust lernt.
Für den Markt und die Community ist vor allem die Open-Source-Komponente relevant: AMI stellt Code und die Gewichte des vortrainierten Modells zur Verfügung, sodass andere Teams das Weltmodell direkt laden und Planungsexperimente replizieren können. Das senkt die Hürde für Forschung und Produktentwicklung gleichermaßen, weil Entwickler nicht bei „nachvollziehbar, aber nicht testbar“ stehen bleiben müssen. In den vergangenen Monaten standen viele Diskussionen um KI vor allem unter dem Vorzeichen von LLMs; LeCun positioniert sich dabei seit Jahren klar auf Weltmodell-Fähigkeiten wie Verstehen, Vorhersagen der Folgen von Handlungen und Planen. Innerhalb von AMI ist das damit zugleich Gründungsmission: H-JEPA wirkt wie ein konkreter Baustein, der diese langfristige Linie in eine überprüfbare Technik übersetzt – und zwar so, dass die Ergebnisse nicht nur präsentiert, sondern experimentell weiterverfolgt werden können. Für Unternehmens- und Forschungsteams bedeutet das: Wenn hierarchische Repräsentationsräume und action-gekoppelte Vorhersage tatsächlich so zuverlässig in Planung übergehen, werden sich KI-gestützte Simulations- und Steuerungsworkflows künftig stärker auf Multi-Ebene-Modelle stützen müssen.
Am Ende bleibt eine praktische Frage für die nächste Evaluationsrunde: Wie stark verallgemeinert sich der Hierarchieansatz über Aufgaben hinweg, und welche Rechen- oder Datenanforderungen entstehen, wenn Teams ihre eigenen Umgebungen abbilden? Die Arbeit liefert dafür erste Hinweise über mehrere Simulationsszenarien und über den Unterschied zwischen einschichtigen und dreischichtigen Setups. Außerdem macht sie deutlich, dass JEPA nicht als Alternative zu Sprachmodellen verstanden werden muss, sondern als anderes Fundament für die Modellierung der Welt: Während LLMs typischerweise Token vorhersagen, kodiert visuelles JEPA Zustände und sagt Ziel-Teil-Darstellungen voraus, ohne Pixel einzeln zu generieren. Genau diese Trennung von Repräsentation und Vorhersage, ergänzt durch die Kopplung an Aktionen, ist der Mechanismus, der in H-JEPA Planung in einer Form möglich macht, die über reine Mustererkennung hinausgeht.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "H-JEPA: AMIs quelloffenes Weltmodell mit 73% Erfolg bei Visual AntMaze" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "H-JEPA: AMIs quelloffenes Weltmodell mit 73% Erfolg bei Visual AntMaze" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »H-JEPA: AMIs quelloffenes Weltmodell mit 73% Erfolg bei Visual AntMaze« bei Google Deutschland suchen, bei Bing oder Google News!