LONDON (IT BOLTWISE) – DeepSeek V4 setzt laut veröffentlichten Benchmarks neue Maßstäbe bei Leistung pro Kostenpunkt für anspruchsvolle KI-Aufgaben. In Tests erreicht die V4 Flash genannte Variante 89,0 % auf ARC-AGI-1 bei nur 0,02 US-Dollar pro Aufgabe. Für ARC-AGI-2 werden 61,4 % bei 0,04 US-Dollar je Aufgabe genannt. Entscheidend für Unternehmen ist dabei der frühe Hardware-Support über CUDA-Umgebungen bis zu Ascend- und AMD-Setups.

Die Vorstellung von DeepSeek V4 am 6. August 2026 wird in der Branche vor allem deshalb als Wendepunkt diskutiert, weil sich Leistung und Betriebskosten gleichzeitig in die richtige Richtung bewegen. Was bisher in vielen Architektur-Entscheidungen gegeneinander abgewogen werden musste, rückt damit stärker zusammen: höhere Erfolgsraten bei komplexen Problemstellungen bei gleichzeitig deutlich geringeren Kosten pro Aufgabe. Gerade für Use Cases wie automatisierte Wissensarbeit oder Software-nahe Assistenz ist das relevant, weil hier nicht nur Token-Zahlen zählen, sondern die Wahrscheinlichkeit, dass ein Ergebnis in einem anspruchsvollen Szenario tatsächlich „durchgeht“.
Technisch verdichten sich diese Effekte in den genannten Performance-Benchmarks. Für die als „DeepSeek V4 Flash“ bezeichnete Variante werden 89,0 % Erfolgsquote auf ARC-AGI-1 genannt; die Kosten pro Aufgabe lägen demnach bei 0,02 US-Dollar. Bei ARC-AGI-2 sinkt die Quote erwartbar auf 61,4 %, gleichzeitig bleiben die Kosten mit 0,04 US-Dollar pro Aufgabe im Rahmen. In der Praxis heißt das: Wenn ein Modell häufiger die richtige Struktur findet oder weniger Versuche braucht, sinken nicht nur die reinen Inferenzkosten, sondern auch der „ökonomische“ Aufwand für mehrstufige Workflows, in denen Rückfragen, Korrekturen oder erneute Generierungsschleifen ansonsten schnell teuer werden.
Der Kostendruck zeigt sich zusätzlich in Vergleichen aus dem Softwareumfeld. In der Quelle wird die Version „V4 Flash 0728“ als aktuelle Grenze der Wirtschaftlichkeit im Verhältnis von Kosten und Leistung eingeordnet und für das Schreiben von Programmcode ein Einsparpotenzial genannt: Die Erstellung von Code mit V4 Flash sei demnach sechsmal günstiger als die Nutzung von GPT-5.6 Luna. Solche Relationen sind natürlich nur in dem konkret beschriebenen Rahmen aussagekräftig, aber sie illustrieren die Stoßrichtung: Unternehmen können mit kleineren „Cost-to-Solution“-Werten rechnen, ohne zwingend die Engineering-Kompetenz auszuhebeln, die für Tool-Integration, Prompting-Strategien und Qualitätssicherung ohnehin nötig bleibt. Selbst wenn die genauen Zahlen je nach Pipeline, Kontextfenster und Bewertungslogik variieren, ist der Verarbeitungshebel klar.
Damit die Rechnung in der Produktion aufgeht, entscheidet auch die Infrastruktur. DeepSeek V4 bietet laut Angaben einen „Day0“-Support für NVIDIA CUDA, umgesetzt über vLLM und SGLang, und zielt damit direkt auf Rechenzentren, die bereits GPU-gestützte Serving-Pipelines nutzen. Dazu passt, dass die Quelle neben NVIDIA auch spezialisierte Hardware nennt: Der Huawei Ascend 9550DT mit der CANN-Softwareumgebung soll DeepSeek V4 ebenfalls seit dem ersten Tag unterstützen. Interessant ist außerdem der Bericht zur Anbindung an AMD-Systeme: Für die AMD MI355X wird zunächst nur Unterstützung im FP8-Format erwähnt; nach 26 Tagen Optimierung mit SGLang sei eine hundertfache Leistungssteigerung erzielt worden. Genau solche Iterationen sind in der Realität oft der Unterschied zwischen „läuft bei Tests“ und „läuft dauerhaft mit planbarer Auslastung“, weil Kernel-Optimierungen, Operator-Fusion und Precision-Strategien das Serving direkt beeinflussen.
Auch auf Marktebene deutet die Quelle auf eine spürbare Dynamik hin. Auf OpenRouter sei der Anteil chinesischer Modelle an den Aufrufen aus den USA von 4,5 % Mitte 2025 auf zeitweise 46 % im Jahr 2026 gestiegen. Zudem werden Unternehmen wie Coinbase, DoorDash und Lindy genannt, die bereits auf DeepSeek oder das Modell Kimi setzen sollen. Solche Muster sind für CIOs und Produktverantwortliche ein Signal: Modellkosten sind zunehmend Bestandteil von Budgetplanungen und SLA-Berechnungen, nicht mehr nur ein technisches Detail der R&D. Gleichzeitig macht die Verfügbarkeit über verschiedene Serving-Stacks es wahrscheinlicher, dass auch neue Anbieter schneller in bestehenden Plattformen „andocken“ können.
Mit den neuen technischen Optionen steigen allerdings auch die Anforderungen, wie KI im Unternehmen dokumentiert und bewertet werden muss. Für den EU-Rahmen nennt die Quelle ausdrücklich Transparenzpflichten des EU AI Acts, die seit dem 2. August 2026 für KI-Modelle gelten. Damit rückt die Frage in den Vordergrund, welche Informationen über Funktionsweise und verwendete Trainingsdaten Anbieter offenlegen müssen, damit sich ein rechtssicherer Einsatz in der IT-Organisation realistisch planen lässt. Ergänzend verweist die Quelle auf den Stanford AI Index 2026, der den verbliebenen Leistungsabstand chinesischer Technologie zur US-Spitze auf 2,7 % beziffert. Für Entscheider bedeutet das: Der Wettbewerb findet nicht nur auf der Benchmark-Ebene statt, sondern auch in der Fähigkeit, Modelle in Enterprise-Umgebungen mit nachvollziehbaren Prozessen zu betreiben.
Unterm Strich verschiebt DeepSeek V4 den Fokus von „Ob KI funktioniert“ hin zu „wie effizient KI im Alltag skaliert“. Wenn Kosten pro Aufgabe auf die Größenordnung von 0,02 bis 0,04 US-Dollar sinken, verändert sich die Grenzlinie für Experimente, Automationsgrade und den Umfang, in dem Teams KI in kritische Backoffice- oder Entwicklungs-Workflows integrieren. Entscheidend bleibt dennoch die Umsetzung: Wer vLLM- und SGLang-basierte Deployments, Precision-Einstellungen sowie Hardware-Kompatibilität systematisch testet, kann die versprochenen Vorteile eher in stabile Betriebskennzahlen übersetzen. Genau dort entsteht aktuell der Engpass – weniger bei der Modellidee, mehr bei der Produktionsreife der gesamten KI-Pipeline.
Hinzu kommt, dass die Quelle ein formales Disclaimer-Statement ergänzt, wonach keine Anlageberatung und keine Kauf- oder Verkaufsempfehlungen beabsichtigt seien. Für Unternehmen folgt daraus vor allem ein praktischer Leitgedanke: Bewertungen zu Kosten und Leistung sollten immer in der eigenen Umgebung gespiegelt werden, inklusive Messung von Latenz, Durchsatz und Qualitätskennzahlen. Dann wird aus der „KI-Kostenkrise“ ein konkreter Vorteil – oder es zeigt sich schnell, wo im Workflow zusätzliche Qualitätssicherung oder erneute Generierungsschritte die Einsparung wieder relativieren.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "DeepSeek V4: KI-Kosten sinken drastisch, Leistung steigt – mit breitem Hardware-Support" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "DeepSeek V4: KI-Kosten sinken drastisch, Leistung steigt – mit breitem Hardware-Support" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »DeepSeek V4: KI-Kosten sinken drastisch, Leistung steigt – mit breitem Hardware-Support« bei Google Deutschland suchen, bei Bing oder Google News!