LONDON (IT BOLTWISE) – DeepSeek hat die öffentliche Beta-Phase für DeepSeek-V4-Flash eingeleitet und die Version DeepSeek-V4-Flash-0731 mit Post-Training deutlich verbessert. Im DeepSWE-Benchmark klettert das Modell von 7,3 auf 54,4 Punkte, was einem Anstieg um 645 % entspricht. Für den Betrieb nennt DeepSeek eine Architektur mit 284 Milliarden Parametern, von denen 13 Milliarden aktiv genutzt werden. Parallel dazu setzt das Unternehmen die API-Preise spürbar unter die Konkurrenz an.

DeepSeek startet eine öffentliche Beta-Phase für sein Sprachmodell DeepSeek-V4-Flash. Die konkret als DeepSeek-V4-Flash-0731 bezeichnete Version baut zwar strukturell auf einer bereits im April veröffentlichten Preview-Architektur auf, gewinnt aber laut Beschreibung vor allem durch deutlich stärkeres Post-Training. Damit verschiebt sich der Fokus in der Praxis von der reinen Basisskalierung hin zu Trainings- und Auswertungsphasen, die die Modellverwendung im Alltag messbar beeinflussen sollen. Für Unternehmen bedeutet das: Wenn ein kleinerer „aktiver“ Parameteranteil bessere Resultate liefert, kann sich der Betrieb bei gleichbleibender Latenz stärker auf reale Workloads statt auf Benchmarks konzentrieren.
Technisch nennt DeepSeek für das Flash-Modell insgesamt 284 Milliarden Parameter, während im laufenden Betrieb lediglich 13 Milliarden aktiv genutzt werden. Diese Differenz ist entscheidend, weil sie auf Effizienzmechanismen hindeutet, die Rechenbudget dort investieren, wo es für die jeweilige Aufgabe besonders nötig ist. In neun Agent-Benchmarks übertraf die Flash-Variante nach den veröffentlichten Tests die vorherige Preview-Version des größeren V4-Pro-Modells. Besonders auffällig ist der DeepSWE-Benchmark: DeepSeek-V4-Flash-0731 steigert dort den Wert von 7,3 auf 54,4 Punkte. Das entspricht einem Plus von 645 %, und genau solche Sprünge sind für Entwicklerteams oft relevanter als marginale Verbesserungen in breiten Standardaufgaben.
Im Kontext anderer Laborergebnisse reiht sich das Modell ebenfalls nah an Top-ähnliche Werte ein. Beim Terminal Bench 2.1 erreicht DeepSeek-V4-Flash-0731 82,7 Punkte und liegt damit direkt in der Nähe eines Modells, das dort mit 85,0 bewertet wird. Weitere dokumentierte Ergebnisse nennen 76,7 Punkte im CyberGym-Benchmark, 70,3 im Toolathlon Verified und 68,7 im DSBench-FullStack; auch spezialisierte Aufgaben wie NL2Repo (54,2) sowie DSBench-Hard (59,6) werden mit deutlich mehr als nur „durchschnittlicher“ Kompetenz beschrieben. Für die Technikseite ist außerdem relevant, dass DeepSeek die Flash-Variante für Codex-adaptierte Workflows positioniert und explizit eine Responses API unterstützt. Gerade bei Codierungs- und Tool-orientierten Agenten reduziert eine konsistente API-Schnittstelle den Integrationsaufwand, weil Teams weniger „Sonderwege“ zwischen Modell- und Tool-Call-Logik pflegen müssen.
Während die Flash-Variante ab sofort verfügbar sein soll, bleibt die Pro-Variante vorerst unverändert. DeepSeek beschreibt sie mit über 1,6 Billionen Gesamtparametern und 49 Milliarden aktiven Parametern, was im Vergleich zur Flash-Variante klar auf eine andere Effizienz-/Qualitäts-Trade-off-Klasse hinausläuft. Gleichzeitig heißt es, die Veröffentlichung der finalen V4-Pro-Version stehe unmittelbar bevor. Hier zeigt sich eine typische Dynamik im Modellmarkt: Hersteller halten mehrere Stufen parallel bereit, um sowohl Entwickler mit geringeren Kostenanforderungen als auch Teams mit besonders anspruchsvollen Zielmetriken bedienen zu können.
Der zweite Hebel ist der Preis. DeepSeek setzt die API-Kosten für das neue Modell auf 0,14 US-Dollar pro Million Input-Token und 0,28 US-Dollar pro Million Output-Token. Diese Staffelung zielt ausdrücklich auf ein günstigeres Kostenprofil im Vergleich zu Angeboten der US-amerikanischen Konkurrenz. Zusätzlich macht DeepSeek die Modellgewichte mit einem Umfang von etwa 167 Gigabyte unter der MIT-Lizenz über Hugging Face zugänglich. Genau diese Mischung aus Leistungsgewinn und Preisaggression erhöht den Druck auf Anbieter, die ihre Kostenstruktur bisher stärker über Margen statt über Effizienzvorteile abgesichert haben. Dass parallel auch andere Marktteilnehmer jüngst die Preise für ihre Modelle gesenkt haben, unterstreicht den Trend hin zu einem commoditisierten API-Markt, in dem sich Differenzierung über Tool-Integration, Latenz und robuste Agentenfähigkeiten verlagert.
Auch außerhalb des Preiswettbewerbs bleibt die Lage für Betreiber anspruchsvoll. In den veröffentlichten Angaben geht es zugleich um Trainings- und Beschaffungsrouten in der KI-Infrastruktur, was auch sicherheitstechnische und regulatorische Fragen indirekt betrifft. So stehen chinesische Entwickler der Darstellung zufolge zunehmend im Fokus internationaler Aufsichts- und Ermittlungsinteressen: Ein US-Beamter erhob Vorwürfe gegen Moonshot AI im Zusammenhang mit dem unrechtmäßigen Erwerb von Blackwell-Chips. Den Vorwürfen zufolge soll Moonshot AI dabei Ressourcen für das Training von Kimi K3 unter Nutzung von 20.000 Nvidia-Chips in der Cloud von Alibaba eingesetzt haben; unklar bleibt, wie stark der konkrete Chiptyp (in den Angaben wird u. a. H200 genannt) tatsächlich nachweisbar ist, da Alibaba die Kooperation grundsätzlich bestätigt, aber es widersprüchliche Aussagen zum verwendeten Hardwaretyp geben soll. Für Unternehmen heißt das praktisch: Bei der Auswahl von KI-Modellen und Dienstleistern reicht ein Blick auf Benchmarks und Tokenpreise nicht mehr aus; Teams sollten auch Lieferketten- und Datenfluss-Fragen in ihre Risikoanalyse aufnehmen, vor allem wenn Modelle in produktive Workflows eingebettet werden.
Unterm Strich verschiebt DeepSeek mit V4-Flash die Diskussion in Richtung „mehr Leistung pro aktiver Rechenressource“. Wenn sich ein Modell mit 13 Milliarden aktiven Parametern in mehreren Agenten-Tests gegenüber einer größeren Preview-Version absetzt, wird das für den Betrieb in agentengetriebenen Anwendungen wie Code-Assistenz, Terminal-Automation und Tool-Workflows besonders interessant. Gleichzeitig sorgt die aggressive Preisgestaltung für eine neue Vergleichsbasis: Budgets, die bisher für teurere APIs kalkuliert wurden, dürften zunehmend in Richtung effizienter Modelle umschichten. Für Produkt- und Engineering-Entscheider lohnt sich damit die Neubewertung bestehender Implementierungen, etwa über A/B-Tests mit identischen Prompts und Toolchains, statt nur die „headline metrics“ einzelner Benchmarks zu vergleichen.
💳 Amazon-Kreditkarte mit 2.000 Euro Limit bestellen!
🔥 Heutige Hot Deals bei Amazon: Bis zu 80% Rabatte!
🎉 Amazon Haul-Store für absolute Schnäppchenjäger!
- ★ 23-stufiges KI-Go-Training – Für Spieler mit Grundkenntnissen der Regeln – Entwickelt als intelligenter Trainingspartner passt sich die KI Spielern von 18K bis 9D an. Ideal für alle, die die Grundregeln bereits beherrschen und ihr Spiel verbessern möchten.
- IHR EMOTIONALER AI-BEGLEITER: Eiliko ist mehr als nur ein Anhänger, es ist ein charismatischer KI-Freund. Mit einem dynamischen LED-Bildschirm, der eine Vielzahl von animierten Gesichtern und Ausdrucksformen anzeigt, reagiert er auf Ihre Interaktionen mit einzigartiger Persönlichkeit und Charme.
- 【MEHR LEBEN FÜR DEINEN SCHREIBTISCH】 Lerne Eilik kennen – deinen kleinen Roboter-Freund mit Persönlichkeit. Mit liebevollen Animationen, ausdrucksstarken Reaktionen und spielerischen Interaktionen bringt Eilik mehr Freude in deinen Alltag. Ob auf dem Schreibtisch, im Büro oder am Nachttisch – Eilik wird schnell zu einem vertrauten Begleiter für besondere Momente.
- 【XL-Größe für gedeihende Pflanzen】Geben Sie Ihren Pflanzen den Raum, den sie verdienen! Unser verbessertes, großes 13,7 cm großes Design bietet Platz für Pflanzen mit einem Durchmesser von bis zu 8,9 cm und damit deutlich mehr Platz für Wurzelwachstum und Pflanzengesundheit im Vergleich zu kleineren, veralteten Modellen. Die Produktabmessungen betragen 13,6 x 13,6 x 13,2 cm und das Gerät wiegt nur 355 g.
- V28 Update - JETZT MIT NEUEN FUNKTIONEN! Als Reaktion auf das Ladeproblem von Loona haben wir das automatische Aufladen 2.0 verbessert. Diese Optimierung hilft Loona, die Ladewege in verschiedenen Szenarien zu erkennen und anzupassen, um die Erfolgsquote beim automatischen Aufladen zu erhöhen. Mobile Hotspots können sich mit Loona verbinden und überwinden WLAN-Einschränkungen, sodass Sie jederzeit und überall mit Loona interagieren können.
- Die besten Bücher rund um KI & Robotik!

- Die besten KI-News kostenlos per eMail erhalten!
- Zur Startseite von IT BOLTWISE® für aktuelle KI-News!
- IT BOLTWISE® kostenlos auf Patreon unterstützen!
- Aktuelle KI-Jobs auf StepStone finden und bewerben!
- Künstliche Intelligenz: Dem Menschen überlegen – wie KI uns rettet und bedroht | Der Neurowissenschaftler, Psychiater und SPIEGEL-Bestsellerautor von »Digitale Demenz«
Du hast einen wertvollen Beitrag oder Kommentar zum Artikel "DeepSeek-V4-Flash legt im DeepSWE-Benchmark um 645 % zu und verschärft den KI-Preiswettbewerb" für unsere Leser?


#Sophos
Es werden alle Kommentare moderiert!
Für eine offene Diskussion behalten wir uns vor, jeden Kommentar zu löschen, der nicht direkt auf das Thema abzielt oder nur den Zweck hat, Leser oder Autoren herabzuwürdigen.
Wir möchten, dass respektvoll miteinander kommuniziert wird, so als ob die Diskussion mit real anwesenden Personen geführt wird. Dies machen wir für den Großteil unserer Leser, der sachlich und konstruktiv über ein Thema sprechen möchte.
Du willst nichts verpassen?
Du möchtest über ähnliche News und Beiträge wie "DeepSeek-V4-Flash legt im DeepSWE-Benchmark um 645 % zu und verschärft den KI-Preiswettbewerb" informiert werden? Neben der E-Mail-Benachrichtigung habt ihr auch die Möglichkeit, den Feed dieses Beitrags zu abonnieren. Wer natürlich alles lesen möchte, der sollte den RSS-Hauptfeed oder IT BOLTWISE® bei Google News wie auch bei Bing News abonnieren.
Nutze die Google-Suchmaschine für eine weitere Themenrecherche: »DeepSeek-V4-Flash legt im DeepSWE-Benchmark um 645 % zu und verschärft den KI-Preiswettbewerb« bei Google Deutschland suchen, bei Bing oder Google News!