LONDON (IT BOLTWISE) – NVIDIA stellt mit Agentic Variation Operators (AVO) eine Agentenarchitektur vor, die über lange Aufgabenhorizonte stabil arbeitet. In ARC-AGI-3 erreicht das System 100,00 RHAE und löst alle 183 Level im öffentlichen Set. Das gelingt, obwohl AVO von der GPU-Kernel-Optimierung auf eine interaktive Text-Grid-Umgebung mit anderer Feedbacklogik übertragen wird. Entscheidend sind dabei laut Darstellung persistent Memory, eine Supervisor-Schicht und ein über Iterationen getriebener Ausführungs-Loop.

Die Meldung wirkt auf den ersten Blick wie ein reiner Benchmark-Erfolg: NVIDIA nennt für seine Agentic Variation Operators (AVO) im ARC-AGI-3 öffentlichen Set eine 100,00 RHAE-Punktzahl über alle 25 Umwelten hinweg, inklusive vollständiger Bearbeitung von 183 Levels. Der spannendere Teil steckt jedoch nicht in der Zahl allein, sondern in der Behauptung, dass dieselbe Systemarchitektur aus einem völlig anderen Technikfeld kommt: aus der autonomen Optimierung von GPU-Kernels. Damit rückt ein oft unterschätztes Thema in den Vordergrund – dass „Frontier“-Sprachmodelle erst durch den Agenten-Stack wirklich zu langlaufender Autonomie werden.
AVO adressiert genau die Lücke zwischen Modellkompetenz und agentischer Verlässlichkeit. In agentischen Systemen entscheidet nicht nur das Modell, was als Nächstes folgt, sondern das Gesamtsystem, wie Kontext eingespeist wird, wie Tools bedient werden, wie Zustand erhalten bleibt, wie Feedback verarbeitet wird und wie das System aus Fehlannahmen wieder herausfindet. NVIDIA beschreibt AVO als general-purpose Coding-Agent, der Code inspiziert und editiert, Kommandos ausführt, Dokumentation konsultiert und seine Ergebnisse über Execution validiert. Der zentrale Unterschied zu einem klassischen „einmal ausführen“- oder „vorgegebene Variation“-Ansatz liegt in der autonomen Auswahl des nächsten Schritts: Was wird inspiziert, was wird geändert, welche Tests laufen, und was wird am Ende als Kandidat committed.
In der GPU-Kernel-Optimierung wird die Schwierigkeit besonders sichtbar, weil die Wirkung kleiner Änderungen auf Korrektheit, Speicherverhalten, Scheduling und Durchsatz ohne Ausführung schwer vorherzusagen ist. NVIDIA berichtet, dass AVO in einer Aufmerksamkeit-Kernel-Studie sieben Tage lang kontinuierlich lief, mehr als 500 Optimierungsrichtungen explorierte und daraus 40 Kernel-Versionen als committed Ergebnisse festhielt. Auf NVIDIA DGX B200-Systemen sollen die so entstandenen Multihead-Attention-Kernels in den evaluierten Konfigurationen cuDNN um bis zu 3,5% und FlashAttention-4 um bis zu 10,5% übertroffen haben. Zusätzlich habe das System die entwickelte Kernel-Variante für grouped-query attention in etwa 30 Minuten weiterer autonomer Arbeit adaptiert – ein Hinweis darauf, dass AVO nicht nur „ein guter Treffer“ ist, sondern dass der Loop über längere Zeit produktiv bleibt.
Von dieser Engineering-Welt führt NVIDIA denselben Agenten-Backbone in ARC-AGI-3, ein interaktives Reasoning-Benchmark, in dem Agenten ohne Anweisungen, explizite Regeln oder ein vorgegebenes Ziel in neue Umgebungen eintreten. AVO erhält dabei eine text-only Beobachtung: Jede Observation wird als exaktes 64×64 Textgrid bereitgestellt, ohne Bildtokens oder gerenderte 512×512 PNGs. Zudem bekommt der Agent die verfügbaren Aktionen ohne Beschreibung der Spielregeln oder Ziele. Das System muss daher über Interaktion die Dynamik und die Ziele der Umgebung erschließen, Aktionen effizient planen und über viele Schritte hinweg sinnvoll lernen. NVIDIA nutzt dafür den Metric Relative Human Action Efficiency (RHAE), der sowohl Aufgabenabschluss als auch die Aktions-Effizienz pro Level im Vergleich zu ersten menschlichen Baselines in eine Gesamtzahl aggregiert.
Die veröffentlichten Resultate werden dabei explizit als Agenten- statt Modellaussage gerahmt. NVIDIA stellt dem AVO-Lauf eine Referenz gegenüber: VISTA meldet für denselben ARC-AGI-3 public-set-Umfang mit Claude Opus 5 etwa 7.542 Environment-Actions, während AVO alle Level mit 6.624 Environment-Actions absolvierte – damit rund 12% weniger Aktionen in diesem Systemvergleich. Gleichzeitig betont NVIDIA, dass das keine kontrollierte Isolationsstudie ist: Agent-Backend, Beobachtungsdarstellung, Memory, Context-Management und weitere Implementierungsdetails unterscheiden sich. Gerade diese Einordnung ist für Entscheider wichtig, weil sie verdeutlicht, dass der „agentische Overhead“ und die Ausgestaltung des Loops die gemessene Effizienz deutlich beeinflussen können, nicht nur die reine Sprachmodellgüte.
Auch die technische Übertragung wird als Mechanik beschrieben, nicht als domänenspezifisches Wissen. In beiden Umgebungen – beim Kernel-Tuning wie beim interaktiven Grid-Reasoning – folgt AVO demselben Grundmuster: Hypothesen aus unvollständigen Hinweisen bilden, Aktionen über eine externe Schnittstelle ausführen, Konsequenzen beobachten, nützlichen Zustand bewahren, das Problemverständnis aktualisieren und aus falschen Annahmen „recovern“. NVIDIA macht zudem zwei zentrale Systemelemente für Langhorizontarbeit verantwortlich: persistentes Memory und eine Supervisor-Schicht. Persistentes Memory hält frühere Implementierungen, Evaluationsergebnisse sowie Compiler- und Profiler-Ausgaben fest, sodass der Agent an einem Suchzustand anknüpfen kann statt den Suchraum von vorn zu rekonstruieren. Der Supervisor überwacht die Gesamttrajektorie auf Stagnation oder wiederholte unproduktive Zyklen und lenkt den Hauptagenten bei Bedarf auf alternative Strategien um.
Für die Praxis lässt sich daraus eine klare Engineering-Linie ableiten: Langlaufende KI-Systeme werden nicht dadurch zuverlässig, dass das Modell „stärker“ wird, sondern indem man die Komponenten für Evidenzaufbau, Tool-Nutzung, Feedback-Übersetzung, Persistenz und Fehlererholung systematisch zusammenstellt. NVIDIA formuliert das sogar als Sicherheits- und Vertrauensfrage über den gesamten Stack hinweg – Leistung und Zuverlässigkeit sind demnach keine Eigenschaften „nur des Modells“, sondern müssen über den Agenten hinweg geplant werden. Wer AVO als Blaupause versteht, sollte daher bei der Umsetzung auf die Architektur des Loops achten: Wie werden Zustände gespeichert, wie wird Feedback in eine nächste Hypothese überführt, und wie wird ein Supervisor implementiert, der festgefahrene Suchpfade frühzeitig erkennt. Genau in dieser Kopplung aus persistentem Zustand und einer kontrollierten, ausführungsgetriebenen Iteration liegt die industrielle Anschlussfähigkeit für künftige General-Purpose-Agenten.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "NVIDIA AVO erreicht 100,00 RHAE bei ARC-AGI-3: Langhorizont-Agenten im Systemtest" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "NVIDIA AVO erreicht 100,00 RHAE bei ARC-AGI-3: Langhorizont-Agenten im Systemtest" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »NVIDIA AVO erreicht 100,00 RHAE bei ARC-AGI-3: Langhorizont-Agenten im Systemtest« bei Google Deutschland suchen, bei Bing oder Google News!