- Die offizielle Version der DeepSeek-V4-Flash API wurde am 31. Juli 2026 als Public Beta veröffentlicht und kann wie bisher genutzt werden, indem beim Aufruf lediglich der Modellname auf
deepseek-v4-flashgesetzt wird - Die Agentenleistung lag deutlich vor V4-Pro-Preview und erreichte unter anderem 82,7 Punkte im Terminal Bench 2.1 sowie 76,7 in Cybergym, 70,3 in Toolathlon verified und 68,7 in DSBench-FullStack
- Die Code-Agent-Benchmarks wurden im geplanten DeepSeek Harness Minimal Mode unter den Bedingungen max effort,
top_p=0.95undtemperature=1.0gemessen - Das offizielle V4-Flash unterstützt standardmäßig das Responses-API-Format und wurde für Codex angepasst; gegenüber der Preview wurden bei identischer Modellarchitektur und -größe nur Post-Training-Anpassungen vorgenommen
- Die Änderungen sind auf die V4-Flash API beschränkt; die V4-Pro API sowie die APP/WEB-Modelle bleiben unverändert, und die offizielle Version von V4-Pro soll bald erscheinen
Veröffentlichung der Public Beta und API-Nutzung
- Die offizielle Version der DeepSeek-V4-Flash API wurde am 31. Juli 2026 als Public Beta veröffentlicht
- Die bisherige Aufrufmethode bleibt unverändert; wer den Modellparameter auf
deepseek-v4-flashsetzt, kann die neueste Version verwenden - Die V4-Reihe wird unter derselben
base_urlwie bisher über die Schnittstellen OpenAI ChatCompletions und Anthropic angeboten- Für V4-Pro wird
deepseek-v4-pro, für V4-Flashdeepseek-v4-flashverwendet - Die bisherigen Modellnamen
deepseek-chatunddeepseek-reasonersollten ursprünglich am 24. Juli 2026 eingestellt werden - Während der Übergangsphase verwiesen die beiden Namen jeweils auf den Non-Thinking-Modus und den Thinking-Modus von V4-Flash
- Für V4-Pro wird
Ergebnisse der Agenten-Benchmarks
- Die offizielle Version von V4-Flash erzielte bei der Agentenleistung Ergebnisse, die deutlich über V4-Pro-Preview lagen
- Terminal Bench 2.1: 82.7
- NL2Repo: 54.2
- Cybergym: 76.7
- DeepSWE: 54.4
- Toolathlon verified: 70.3
- Agent Last Exam: 25.2
- Automation Bench Public: 25.1
- DSBench-FullStack: 68.7
- DSBench-Hard: 59.6
- Die Code-Agent-Aufgaben in den öffentlichen Benchmarks wurden im geplanten DeepSeek Harness Minimal Mode gemessen
- Das Effort-Level war max, mit
top_p=0.95undtemperature=1.0
- Das Effort-Level war max, mit
- DSBench-FullStack ist ein internes Full-Stack-Entwicklungs-Testset, DSBench-Hard ein internes Set besonders schwieriger Probleme für Coding Agents
Responses API und Codex-Integration
- Das offizielle V4-Flash unterstützt standardmäßig das Responses-API-Format und wurde für Codex angepasst
- Die für die Codex-Integration nötigen Einstellungen finden sich in der offiziellen Dokumentation
Umfang der Modelländerungen
DeepSeek-V4-Flash-0731behält dieselbe Modellarchitektur und -größe wie V4-Flash-Preview bei- Am Modell selbst wurden keine strukturellen Änderungen vorgenommen; angewendet wurden nur Post-Training-Anpassungen
- Das Update gilt nur für die DeepSeek-V4-Flash API
- Die DeepSeek-V4-Pro API bleibt unverändert
- Auch die in APP/WEB angebotenen Modelle bleiben unverändert
- Die offizielle Version von DeepSeek-V4-Pro soll bald veröffentlicht werden
1 Kommentare
Hacker-News-Kommentare
Persönlich bin ich noch gespannter darauf als auf K3. Das DSV4-Modell hat sehr niedrige Serving-Kosten, sodass es mit steigender Leistung bei immer mehr Aufgaben ein Modell werden könnte, das „gut genug“ ist
DeepSeek hat die Pro-Version lange sehr günstig angeboten und mit OpenCode usw. integriert, daher ist es gut möglich, dass sie auch viele echte Daten aus Entwicklungsaufgaben gesammelt haben. Wenn sie das für das Post-Training nutzen, sind weitere Verbesserungen möglich
Ich bin auch neugierig, wie viel besser K3 würde, wenn man es in DSV4 destilliert. Günstige und schnelle Modelle sind für die Community besonders nützlich, weil Anbieter sie nicht einfach nach Belieben verschwinden lassen und man die Leistung weiter nutzen kann. Zumindest Flash lässt sich auch zu Hause auf Hardware unter 10.000 Dollar betreiben, während große Modelle wie GLM oder K3 praktisch kaum realistisch sind
Ich erledige 90 % der Arbeit mit Flash. Warum, weiß ich nicht, aber es ist besser als Pro und zugleich sehr günstig und schnell
Wenn man Änderungen unter 1.000 Zeilen hält und Architekturentscheidungen selbst trifft, spürt man fast keinen Unterschied zu Spitzenmodellen. Die restlichen 10 % nutze ich, um Bugs oder Sicherheitsprobleme zu finden oder eine bessere Struktur prüfen zu lassen; Flash macht das auch ziemlich gut, aber ich validiere quer
Schnelle Iteration ist viel besser, als bei kleinen Änderungen jedes Mal 5–10 Minuten zu warten. Kimi und GLM haben zuletzt unnötig lange nachgedacht und waren langsam. Man kann viele Daten wie Abhängigkeiten, Logs oder Performance-Dumps ohne Sorgen um Limits hineingeben, und auch bei binärem Reverse Engineering greift keine Sicherheitsbeschränkung
Andererseits gibt es auch Berichte, dass sogar sicherheitsferne Prompts abgelehnt werden, daher frage ich mich, ob die Unterschiede je nach Plattform oder Nutzer wirklich so groß sind
Ich nutze hauptsächlich OpenCode, das weniger Tokens verbraucht als Claude Code, und hoffe auch auf ein eigenes Coding-Harness von DeepSeek
Meine letzten 30 Tage mit DeepSeek für den Großteil der alltäglichen Agentenarbeit im Privatbereich: 4,55 Dollar Kosten, 3.467 API-Anfragen und 323.183.886 Tokens
Als Engineer, der ein kleines Team leitet, habe ich hohe Qualitätsmaßstäbe und lege dieselben auch bei privaten Projekten an, aber bei Coding- und Review-Aufgaben war ich überhaupt nicht enttäuscht. Für andere Aufgaben nutze ich andere Modelle
Inzwischen lasse ich fast alle Aufgaben in pi mit Flash laufen. Mit den passenden MCP-Servern, Tools zur Kontextreduktion und Skills kann man jede Aufgabe umsetzen
Manche Sessions dauern über 30 Turns, sind aber schnell und billig, sodass selbst eine Stunde Arbeit nur etwa 0,5 Dollar kostet. In Workflows mit mehreren Unteragenten nutze ich für Planung, Review und die Orakel-Rolle aber auch teurere Modelle
Mein langsames Opus-Abo habe ich seit Wochen nicht mehr genutzt. Ich habe außerdem einen selbst gehosteten OpenWebUI-Chat aufgebaut, der auch auf dem Handy läuft und MCP sowie Skills unterstützt, womit Perplexity vollständig ersetzt wurde; Hosting- und Abo-Kosten liegen bei etwa 18 Dollar pro Monat
top_pundtemperaturesetztFalls Benchmarks die Leistung im Praxiseinsatz korrekt widerspiegeln, ist das ein erstaunliches Modell. Ein 300B-Modell übertrifft die Leistung des früheren DS4-Pro-Preview-Modells mit 1,8T Parametern und scheint sogar besser als GPT 5.6 Luna zu sein
Es ist immer noch günstiger als Luna nach der Preissenkung
Dass ein 200B-Modell mit GLM-5.2 konkurriert und nahe an Opus 4.8 herankommt, ist ziemlich beeindruckend
Wenn sich diese Werte auch in allgemeiner Leistung niederschlagen und dann noch das starke Caching von DeepSeek hinzukommt, dürfte die Nutzung sehr hoch werden
Ich frage mich, warum man es nicht einfach
v4.1-Flashgenannt hat, um es klarer abzugrenzenWenn es bei gleichbleibender Geschwindigkeit und niedrigem Preis sogar schon die Leistung von deepseek-v4-pro übertrifft, ist es sehr vielversprechend
deepseek-v4-flash war bereits das Modell mit dem besten Preis-Leistungs-Verhältnis, daher dürfte sich der Abstand bei der Kennzahl Intelligenz/Kosten noch weiter vergrößern. Allerdings sind die niedrigen Kosten der DeepSeek-API auch der Preis dafür, Informationen über die Codebasis nach China zu schicken
Ich frage mich, ob ein Setup sinnvoll ist, bei dem man für teure Aufgaben Kimi K3 statt Opus und für allgemeine Aufgaben DSV4 Flash statt Sonnet nutzt
Mich interessieren Anwendungsfälle, in denen DSv4 für Agenten außerhalb des Codings eingesetzt wird. Besonders würde ich gern wissen, wie Nutzer, die GPT-5.4 mini für Klassifizierung oder Kategorisierung verwendet haben, DSv4 einsetzen