SCOTLAND / LONDON (IT BOLTWISE) – NVIDIA stellt mit Vera Rubin eine neue Data-Center-Plattform vor, die Rubin-GPU, Vera-CPU und verbesserte Netzwerktechnik kombiniert. Laut den verfügbaren Angaben soll das System gegenüber einem äquivalenten Blackwell-Ultra-Setup bis zu 30-mal mehr Leistung liefern. Besonders im Betrieb wirkt es laut Quelle auf die Kosten: Inferenz-Token-Kosten sollen um bis zu 97% sinken. Vor diesem Hintergrund deutet CEO Jensen Huang darauf hin, dass NVIDIA im kommenden Jahr deutlich mehr Chips absetzen könnte als aktuell.

Für Rechenzentren ist die zentrale Frage im aktuellen KI-Zyklus weniger, ob große Sprach- und Bildmodelle „funktionieren“, sondern wie teuer ihre Ausführung im Tagesgeschäft wird. Genau an dieser Stelle setzt die neue Plattform Vera Rubin an: Sie bündelt mit der Rubin-GPU, einer Vera-CPU und aufgerüsteten Netzwerkkomponenten mehrere Engpässe, die in vielen Deployments zeitgleich auftreten. Die Quelle beschreibt Vera Rubin als Nachfolger-Generation zu Blackwell Ultra und stellt dabei nicht nur Rohleistungswerte in den Mittelpunkt, sondern auch die Wirtschaftlichkeit der Inferenz, also jener Phase, in der Modelle nach dem Prompt Antworten erzeugen.
Technisch wird Vera Rubin im Text als deutlich stärkeres System gegenüber einem „äquivalenten“ Blackwell-Ultra-Setup positioniert: Bis zu 30-mal mehr Performance sollen in entsprechenden Konfigurationen möglich sein. Gleichzeitig nennt die Meldung eine zweite, für den Betrieb oft noch wichtigere Kennzahl: Bis zu 97% weniger Inferenz-Token-Kosten. Inferenz-Token sind die Einheiten, mit denen ein KI-Modell textbasiert, bildbasiert oder auch in Form von Computer-Code auf Benutzereingaben reagiert. Wenn sich die Kosten pro erzeugtem Token so stark reduzieren lassen, verschiebt das die Kalkulation vieler KI-Use-Cases, etwa bei chatbasierten Assistants, Agenten-Workflows oder beim programmiernahen Copiloting, weil die Grenzkosten pro Anfrage sinken.
Der Leistungs- und Kostensprung wird in der Vorlage außerdem in die bekannte Entwicklungslinie von NVIDIA eingeordnet: Blackwell Ultra bildet laut Quelle die Grundlage der aktuellen GB300-GPU-Plattform und soll in bestimmten Konfigurationen bis zu 50-mal schneller als die 2022 eingeführte Hopper-basierte H100-Generation sein. Damit zeigt sich ein wiederkehrendes Muster der letzten Jahre: Architekturwechsel treffen selten nur einzelne Parameter, sondern erhöhen häufig die Taktung in mehreren Ebenen gleichzeitig – Rechenleistung, Speicherzugriff und besonders die für KI-Arbeitslasten entscheidenden Datenbewegungen. Dass Vera Rubin zusätzlich das Zusammenspiel von GPU und CPU sowie die Vernetzung adressiert, unterstreicht, dass Data-Center-Designs immer stärker zu „System-on-accelerated-technology“-Architekturen werden, statt nur aus einzelnen Chips zu bestehen.
Auch für die Marktseite liefert die Quelle konkrete Erwartungen aus CEO-Kommentaren: NVIDIA könnte demnach im kommenden Jahr die doppelte Anzahl an Chips verkaufen – im Vergleich zum aktuellen Jahr. Wie bei solchen Aussagen ist entscheidend, dass NVIDIA selbst keine jährlichen Stückzahlen offenlegt; stattdessen stützt sich der Text auf Umsatzpfade. Für das laufende Fiskaljahr bis zum 31. Januar 2027 werden rund 411 Milliarden US-Dollar Gesamtumsatz genannt, basierend auf einer durchschnittlichen Wall-Street-Schätzung. Zusätzlich verweist die Meldung auf eine Management-Erwartung von 70% Umsatzwachstum im Fiskaljahr 2028, was im Artikel als Größenordnung in Richtung fast 700 Milliarden US-Dollar interpretiert wird. Für Anleger und IT-Entscheider heißt das vor allem: Die Nachfragekurve scheint nicht nur kurzfristig durch Projekte getrieben, sondern wird als fortsetzbar betrachtet.
Bemerkenswert ist daneben die Aussage zur Vermarktungs- und Rollout-Dynamik der neuen Architektur. Der Text kontrastiert Vera Rubin mit Blackwell Ultra: Laut Quelle hatte es bei Blackwell Ultra nicht von Beginn an eine breite „Launch“-Adoption jedes „Frontier AI“-Unternehmens gegeben, während es bei Vera Rubin anders gewesen sein soll. Gerade in der KI-Landschaft ist der Umstieg oft ein koordinierter Kraftakt aus Modellportierungen, Softwareanpassungen, Observability-Setups und Kapazitätsplanung. Wenn neue Hardware schneller im produktiven Einsatz landet, verkürzt sich die Zeit, in der Unternehmen ihre Trainings- und Inferenzpipelines auf „R&D-Zulauf“ begrenzen müssen.
Für die Branche öffnet die Kombination aus massivem Performance-Plus und drastisch reduzierten Inferenz-Token-Kosten einen zweiten Hebel: mehr KI-Adoption bei gleichzeitig steigender Profitabilität in Rechenzentren. Die Quelle beschreibt genau diesen Mechanismus – niedrigere Kosten pro Anfrage erlauben entweder mehr Volumen bei gleichem Budget oder bessere Margen bei gleichbleibender Nachfrage. Das kann zu einem verstärkten Ausbau von Rechenzentrums-Kapazitäten führen, wodurch der Chipbedarf erneut nach oben gezogen wird. Gleichzeitig zeigt sich damit, wie stark KI-Infrastruktur inzwischen von Effizienzkennzahlen abhängt: Nicht nur der Trainingshype zählt, sondern auch die Frage, wie effizient sich Milliarden von Inferenzaufrufen pro Monat betreiben lassen.
Unterm Strich verbindet Vera Rubin mehrere aktuelle Trends, die in der KI-Infrastruktur spürbar zusammenlaufen: höhere Rechenleistung, engere Integration von CPU und GPU sowie eine verbesserte Netzwerkgrundlage als Voraussetzung für skalierende Arbeitslasten. In der Praxis bedeutet das für IT- und Infrastrukturteams weniger „nur“ eine neue Beschaffung, sondern eine neue Betriebslogik entlang von Inferenzkosten, Auslastung und Software-Latenz. Wenn sich die im Text genannten Ziele zu Leistung und Token-Kosten tatsächlich in Betriebsszenarien abbilden, könnte Vera Rubin genau die Art Architektur sein, die aus Pilotprojekten schneller belastbare, wirtschaftlich tragfähige Produktionssysteme macht.
Für die nächste Planungsetappe lohnt sich deshalb ein Blick über den Benchmark hinaus: Entscheider prüfen typischerweise nicht allein Spitzenwerte, sondern auch, wie schnell Workloads von Training zu Inferenz wechseln, wie stabil die Performance unter gemischter Auslastung bleibt und wie stark Netzwerk- und Speicherdesign den Durchsatz im Alltag beeinflussen. Der Artikel liefert dafür zumindest die Leitplanken – Vera Rubin als Systemlösung und die Kostenseite als Beschleuniger der Skalierung. In Kombination mit der Erwartung, dass NVIDIA im kommenden Jahr deutlich mehr Chips absetzen könnte, deutet das auf einen weiterhin intensiven Wettbewerb um KI-Infrastruktur hin, bei dem Effizienzvorteile zunehmend den Ton angeben.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "NVIDIA bringt Vera Rubin: 30x mehr Leistung und 97% weniger Inferenz-Token-Kosten" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "NVIDIA bringt Vera Rubin: 30x mehr Leistung und 97% weniger Inferenz-Token-Kosten" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »NVIDIA bringt Vera Rubin: 30x mehr Leistung und 97% weniger Inferenz-Token-Kosten« bei Google Deutschland suchen, bei Bing oder Google News!