LONDON (IT BOLTWISE) – NVIDIA stellt mit DFlash ein neues Framework vor, das große Sprachmodelle auf Blackwell deutlich beschleunigen soll. Laut Angaben erreicht es bis zu 15-mal mehr Durchsatz bei der KI-Inferenz, ohne dass Entwickler ihre Codebasis grundsätzlich neu schreiben müssen. Die Open-Source-Software nutzt einen Block-Diffusion-Ansatz, um mehrere Token parallel vorherzusagen. Gleichzeitig rückt der Blick auf den EU AI Act die Frage in den Vordergrund, wie solche Performance-Sprünge in sichere, dokumentierte Prozesse eingebettet werden.

Mit DFlash liefert NVIDIA einen weiteren Baustein für das, was in Rechenzentren aktuell fast schon als Dauerproblem gilt: KI-Modelle sind zwar leistungsfähig, aber die Latenz und die Kosten pro Anfrage bleiben in vielen Produktionsumgebungen der Engpass. Das neue Framework zielt genau darauf ab und verspricht für die Blackwell-Architektur eine drastische Beschleunigung der KI-Inferenz – in den veröffentlichten Benchmarks bis zu 15-facher Durchsatz. Im Kern adressiert DFlash das bekannte Muster tokenweiser Vorhersage, das bei interaktiven Chat- und Agentensystemen den Takt bestimmt. Für Unternehmen ist damit weniger die reinen „TFLOPS“-Diskussion entscheidend, sondern ob sich Antwortzeiten bei gleichbleibender Qualität spürbar verbessern lassen.
Technisch setzt DFlash auf einen Block-Diffusion-Ansatz statt klassischer Autoregression. Während herkömmliche Inferenzverfahren häufig Schritt für Schritt jeweils ein Token nach dem anderen erzeugen, erlaubt DFlash die parallele Vorhersage mehrerer Tokens. Diese Parallelverarbeitung soll die Wartezeit zwischen den einzelnen Modellschritten reduzieren und den Inferenz-Flow so umstrukturieren, dass die Rechen- und Speicherressourcen moderner GPU-Stacks effizienter genutzt werden. Das ist kein reines „Kernel-Tuning“, sondern ein algorithmisch geprägter Inferenzpfad. Als Ergebnis nennt NVIDIA eine erwartbare Größenordnung von 500 bis 600 Tokens pro Sekunde in bestimmten Setups und bezieht sich dabei explizit auf die Blackwell-Hardware.
Die genannten Effekte sind dabei nicht auf ein einzelnes Modell beschränkt. Für gpt-oss-120b werden auf Blackwell laut Angaben etwa 15-mal mehr Durchsatz adressiert. Andere Modelle profitieren ebenfalls: Gemma 4 31B soll demnach 5,8-mal schneller laufen, der Qwen3 8B immerhin um den Faktor 5,1. Beim Vergleich mit dem bisherigen Standard EAGLE-3 wird DFlash als deutlich überlegend beschrieben, und bei Llama 3.1 8B liegt die Verbesserung je nach Konfiguration zwischen dem 2,3- und 2,8-fachen Tempo. Für die Praxis bedeutet das: Teams, die bereits in EAGLE-3-inspirierte Pipelines investieren, können den Schritt möglicherweise mit geringem Integrationsaufwand vollziehen und dennoch messbare Effekte auf Nutzerlatenz und Kosten pro Anfrage erzielen.
Ein wichtiger Hebel ist zudem die Integration in etablierte Inferenz-Frameworks. NVIDIA hat DFlash laut Ankündigung in TensorRT-LLM, vLLM und SGLang eingebettet. Das ist für Entwickler mehr als nur Komfort: Wenn sich ein Performance-Upgrade in bestehende Deployment-Stacks integrieren lässt, sinkt die Wahrscheinlichkeit, dass Teams aus Angst vor Migrationsrisiken monatelang warten. Das Framework ist zudem als Open Source beschrieben und geht demzufolge auch in Richtung Standardisierung, weil die Community gleiche Optimierungen prüfen und nachbauen kann. „Das ist die Art Optimierung, die sich nicht nur in einem Labor-Notebook zeigt, sondern im Produktionsbetrieb den größten Unterschied bei Latenz und Durchsatz macht“, wird sinngemäß aus Analystensicht betont. Wettbewerber reagieren hier traditionell mit eigenen Beschleunigungsroutinen auf alternativen GPU- oder TPU-Plattformen, etwa AMDs Inferenz-Optimierungen oder Cloud-nativen Beschleunigungs-Pipelines anderer Anbieter.
Auch die Art, wie NVIDIA den Software-Stack auslegt, ist strategisch: Es geht nicht ausschließlich um Blackwell, sondern um einen durchgängigen Pfad von Modelloptimierung bis zur Laufzeit. Bereits vortrainierte Modelle sollen über Hugging Face verfügbar sein, was die Einstiegshürde für Betreiber senkt, die schnelle Tests und Lastprofile fahren wollen. Gleichzeitig wird betont, dass besonders Blackwell Ultra- und GB200-Systeme von den Optimierungen profitieren sollen. In der historischen Entwicklung ist das bemerkenswert, weil sich der Fokus der letzten Jahre von reiner Modellgröße hin zu „Systems Engineering“ verlagert hat: Gute Modelle sind nicht automatisch auch gute Dienste. DFlash positioniert die Inferenz-Performance deshalb als Teil eines Gesamtansatzes, der auch durch KV-Cache-Strategien und weitere Laufzeitoptimierungen ergänzt wird.
Regulatorisch verschiebt sich mit solchen Performance-Sprüngen jedoch nicht die Notwendigkeit zu prüfen, sondern eher der Maßstab: Wenn Antworten schneller kommen, steigen oft auch die Nutzung und damit die Relevanz von Governance. Im Kontext der EU AI Act-Debatte wird häufig betont, dass Betreiber Pflichten zu Risikoklassen, Dokumentation und Nachweisen erfüllen müssen. Für Unternehmen heißt das konkret: Selbst wenn DFlash die technische Antwortzeit verbessert, bleibt die Frage bestehen, wie ein System im Betrieb überwacht wird, wie Trainings- oder Prompt-Daten eingeordnet werden und wie sich Transparenz- und Sicherheitsanforderungen praktisch dokumentieren lassen. In vielen Organisationen ist genau hier die Schnittstelle zwischen MLOps und Compliance am größten, weil neue Inferenzpfade auch neue Logging- und Evaluationsbedarfe erzeugen.
Parallel zur Inferenzbetonung verweist NVIDIA auf Trainingsergebnisse aus der MLPerf Training 6.0-Welt. Blackwell habe dabei in sieben Benchmarks neue Rekorde aufgestellt; das GB300 NVL72-System trainiere demnach bis zu 1,6-mal schneller als das vorherige GB200 NVL72. Solche Daten sind für Entscheider relevant, weil sie die Gesamtbetriebskalkulation beeinflussen: Wer sowohl Training als auch Inferenz beschleunigt, kann Modelliterationen schneller durchlaufen und damit Qualitätsverbesserungen eher in produktionsreife Releases überführen. Als Größenordnung nennt NVIDIA außerdem das Training des DeepSeek-V3 671B auf einem Cluster mit 8.192 GPUs. Das ist ein Fingerzeig darauf, dass sich Skalierung heute immer stärker in System- und Netzwerkdesign übersetzt, nicht nur in „größere GPUs“.
Ergänzend nennt NVIDIA weitere Effizienzmaßnahmen für den Betrieb von KI-Rechenzentren, darunter Tools wie NVFP4 und Beschleunigungen für den Dynamo KV-Cache. Der Stromanteil an den Gesamtkosten wird in diesem Zusammenhang mit bis zu 40 Prozent beziffert, weshalb Energieoptimierung in der Praxis zur strategischen Stellschraube wird. Dynamische Anpassungen der GPU-Geschwindigkeit könnten demnach den Energiebedarf beim Training um etwa 25 Prozent senken, ohne die Trainingszeit spürbar zu erhöhen. Für die Roadmap ist das ein deutliches Signal: Optimierung wird zunehmend „mehrdimensional“ – nicht nur Durchsatz, sondern auch Energie- und Betriebsprofile. Unterdessen erweitert NVIDIA zudem seine europäische Präsenz mit weiteren KI-Supercomputer-Projekten, die auf Blackwell und Hopper basieren, während in der Forschung BioNeMo-Toolkits wie Nemotron und OpenShell die wissenschaftliche Nutzung beschleunigen sollen. Für Entwickler bedeutet das: DFlash kann ein schnellerer Inferenzpfad für Agenten und Assistenzsysteme werden, aber der nächste Wettbewerbs- und Erfolgsfaktor wird sein, diese Performance in sichere, überwachte und regelkonforme Workflows zu integrieren – genau da entscheidet sich die industrielle Adoption.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- NIEDLICHER BEGLEITER: Eilik ist der ideale Begleiter für Kinder und Erwachsene, die Haustiere, Spiele und intelligente Roboter lieben. Mit vielen Emotionen, Bewegungen und interaktiven Funktionen.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "DFlash-Framework von NVIDIA: KI-Inferenz auf Blackwell bis zu 15-mal schneller" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "DFlash-Framework von NVIDIA: KI-Inferenz auf Blackwell bis zu 15-mal schneller" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »DFlash-Framework von NVIDIA: KI-Inferenz auf Blackwell bis zu 15-mal schneller« bei Google Deutschland suchen, bei Bing oder Google News!