- Mit maximaler Reasoning-Einstellung erreicht das Modell 50 Punkte im AAII und liegt damit hinter Kimi K3 (max) und GLM-5.2 (max) auf Platz 3
- Es ist ein MoE-Modell, das von insgesamt 284 Milliarden Parametern pro Token nur 13 Milliarden aktiviert und Texteingabe/-ausgabe sowie einen Kontext von 1 Million Tokens unterstützt
- Der API-Preis beträgt pro 1 Million Tokens 0,14 $ für Input, 0,28 $ für Output und 0,003 $ bei Cache-Hits; die Gesamtkosten der Intelligence-Index-Bewertung lagen bei 72,02 $
- In der Bewertung wurden 210 Millionen Output-Tokens verwendet, deutlich mehr als der Median vergleichbarer Modelle von 100 Millionen Tokens; die Ausgabegeschwindigkeit wurde noch nicht veröffentlicht
- Die Modellgewichte sind veröffentlicht und stehen unter der MIT-Lizenz, sodass Self-Hosting und kommerzielle Nutzung möglich sind; derzeit gibt es einen API-Anbieter
Modellaufbau und Veröffentlichungsform
- DeepSeek V4 Flash 0731 ist ein reasoning-orientiertes Open-Weights-Modell, das am 31. Juli 2026 veröffentlicht wurde
- Es hat insgesamt 284 Milliarden Parameter und nutzt eine Mixture-of-Experts(MoE)-Architektur, bei der während der Inferenz pro Token 13 Milliarden Parameter aktiviert werden
- Die Modellgewichte können heruntergeladen und selbst gehostet werden
- Durch die MIT-Lizenz ist kommerzielle Nutzung erlaubt
- Es handelt sich um eine Reasoning-Version mit maximalem Reasoning-Aufwand (Max Effort); es könnte eine separate Nicht-Reasoning-Version geben
Intelligenzbewertung
- Im Artificial Analysis Intelligence Index v4.1 erreicht das Modell 50 Punkte
- Platz 3 hinter Kimi K3 (max) und GLM-5.2 (max). Danach folgen Kimi K3 (low) und MiniMax-M3 auf Platz 4/5
- Der Median vergleichbarer großer Open-Weights-Modelle liegt bei 25 Punkten
- Artificial Analysis ordnet es damit der Spitzengruppe bei der Intelligenz zu
- Der Intelligence Index v4.1 kombiniert die folgenden 9 Bewertungen
- GDPval-AA v2: agentenartige reale Arbeitsaufgaben
- 𝜏³-Banking: agentenartige Tool-Nutzung
- Terminal-Bench v2.1: agentenartiges Coding/Terminal-Nutzung
- SciCode: Coding
- Humanity's Last Exam: Reasoning/Wissen
- GPQA Diamond: wissenschaftliches Reasoning
- CritPt: physikalisches Reasoning
- AA-Omniscience: Wissensgenauigkeit und Eindämmung von Halluzinationen
- AA-LCR: Long-Context-Reasoning
Umfang zusätzlicher Benchmarks
- Um detaillierte Einsatzbereiche je Modell vergleichen zu können, werden außerdem folgende Bewertungsergebnisse bereitgestellt
- AA-Briefcase: agentenartige Wissensarbeit
- AutomationBench-AA: SaaS-Arbeitsautomatisierung
- Harvey LAB-AA: juristische Agentenarbeit
- EnterpriseOps-Gym-AA: Aufgaben im Unternehmensbetrieb
- IFBench: Befolgung von Anweisungen
- APEX-Agents-AA: lang laufende Agentenaufgaben
- ITBench-AA: Ursachenanalyse von Kubernetes-Störungen
- MMMU-Pro: visuelles Reasoning
- DeepSeek V4 Flash 0731 unterstützt keine Bildeingabe und ist daher ein reines Textmodell, kein multimodales Modell
Wissenszuverlässigkeit und Halluzinationsbewertung
- Der AA-Omniscience Index vergibt Punkte für korrekte Antworten und bestraft Halluzinationen; Antwortverweigerungen werden nicht bestraft
- Die Punkteskala reicht von -100 bis 100
- 0 Punkte bedeuten, dass die Zahl richtiger und falscher Antworten gleich ist
- Negative Werte bedeuten, dass es mehr falsche als richtige Antworten gibt
Token-Nutzung und Antwortverhalten
- In der gesamten Intelligence-Index-Bewertung wurden 210 Millionen Output-Tokens erzeugt
- Der Median vergleichbarer Open-Weights-Modelle liegt bei 100 Millionen Tokens
- Artificial Analysis stuft dies als sehr ausführlich ein
- Die Zahl der Output-Tokens pro Aufgabe wird berechnet, indem die Ausgabemenge jedes Benchmarks mit der Intelligence-Index-Gewichtung gewichtet und durch die Anzahl der Aufgaben ohne Wiederholungsläufe geteilt wird
- Die Ausgabegeschwindigkeit wurde noch nicht gemessen; daher ist keine Zahl der Output-Tokens pro Sekunde veröffentlicht
API-Preise und Bewertungskosten
- Die Listenpreise der DeepSeek API sind wie folgt
- Input: 0,14 $ pro 1 Million Tokens
- Output: 0,28 $ pro 1 Million Tokens
- Cache-Hit: 0,003 $ pro 1 Million Tokens
- Mischt man Cache-Hit/Input/Output im Verhältnis 7:2:1, ergibt sich ein Preis von 0,06 $ pro 1 Million Tokens
- Die Gesamtkosten der Intelligence-Index-Bewertung lagen bei 72,02 $
- Der Zusammenfassungsbereich weist den Median der Vergleichsmodelle mit 0,43 $ für Input/1,20 $ für Output aus, der FAQ-Bereich mit 0,58 $ für Input/2,20 $ für Output
- Die Kosten pro Aufgabe werden berechnet, indem die Kosten für Input-, Cache-Hit-, Cache-Write-, Reasoning- und finale Antwort-Tokens durch die Zahl der Aufgaben geteilt und anschließend mit der Index-Gewichtung des jeweiligen Benchmarks gewichtet werden
- Kosten für Cache-Writes und Speicherung können je nach API-Anbieter separat berechnet werden
Kontext und Verfügbarkeit
- Das Kontextfenster umfasst 1 Million Tokens, was bei Arial 12 Punkt etwa 1.500 A4-Seiten entspricht
- Es kann für RAG-Workflows genutzt werden, die Suche und Reasoning über große Dokumentmengen erfordern
- Es unterstützt nur Texteingabe und Textausgabe
- Derzeit gibt es einen Anbieter für die API; Preise können je nach Anbieter variieren
1 Kommentare
Hacker-News-Kommentare
Die Modellgewichte wurden gerade veröffentlicht: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
llama-serverist auch eine gemischte Konfiguration möglich, bei der so viel wie möglich auf 32-GB-, 48-GB- oder 96-GB-GPUs geladen und der Rest im System-DRAM abgelegt wirdhttps://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
Das neue DeepSeek-Modell fühlt sich wie ein Weihnachtsgeschenk an. Günstige API-Modelle kann DeepSeek am besten, und bis die VRAM-Preise so weit fallen, dass lokales Ausführen möglich wird, ist das wohl der beste Ansatz
Abonnementmodelle, die von Subventionen abhängen, dürften nicht lange tragfähig sein, und API-Abrechnung wirkt näher an einem nachhaltigen Geschäftsmodell
Die bisherige Adresse liefert 404; die korrekte URL scheint diese zu sein: https://artificialanalysis.ai/models/deepseek-v4-flash
Ich habe den gestern veröffentlichten OpenAI-Chart um einen Datenpunkt für DeepSeek V4 Flash 0731 ergänzt; es liegt auf der Preis-Leistungs-Frontier
https://files.parasmittal.com/openai_aa_luna_dsflash.svg
Original: https://openai.com/index/advancing-the-price-performance-fro...
Für die Code-Agent-Aufgaben in den veröffentlichten Benchmarks wurde offenbar ein noch nicht veröffentlichtes DeepSeek-Harness im Minimalmodus verwendet; ich frage mich, ob auch ein optimiertes Coding-Agent-Harness angekündigt wird
Wenn man DSv4 Flash mit reasonix oder pi nutzt, kann man den ganzen Tag lang für ein paar Cent coden, ohne sich um Tokens zu sorgen. Nutzt man dasselbe Modell dagegen mit ZDR über Fireworks oder OpenRouter, steigen die Kosten ohne ersichtlichen Grund weiter. Es wirkt, als würden sie die Preise subventionieren, um Nutzungsdaten zu sammeln; ich warte auf den Tag, an dem lokales Ausführen möglich wird
temperature = 1.0undtop_p = 0.95evaluiert; das Harness soll später veröffentlicht werdenFür Nutzer einer einzelnen RTX PRO 6000 96GB oder eines DGX Spark 128GB ist das wenig bekannte vllm-moet eine sehr gute Engine. Es erzeugt automatisch symmetrische 2-Bit-Planes für die Inferenz, legt zusätzlich einen 4-Bit-Delta-Cache zur Wiederherstellung der Präzision an und unterstützt SSD-Streaming für Gewichte, die größer als der RAM sind
Man kann festlegen, wie viel VRAM jedem Bereich zugewiesen wird, um Geschwindigkeit und Präzision auszubalancieren, und mit DS V4 Flash wurden 170 Tokens pro Sekunde demonstriert. Das Originalmodell wird unverändert verwendet, ohne separates Konvertierungsmodell
Auf DGX Spark ist ein kleiner Workaround nötig, um den Unterschied zwischen
sm120undsm121zu ignorieren, aber da es auch aufsm121läuft, lohnt es sich, ein paar Stunden zu investieren0,28 US-Dollar pro 1 Million Output-Tokens für Intelligenz auf GLM-5.2-/Gemini-3.6-Niveau, und ein aktualisiertes Pro-Modell soll bald erscheinen
Unsloth lossless Q8 ist 162 GB groß, also tatsächlich eine Größe, die man auch zu Hause betreiben könnte
Wenn DeepSeek V4 Flash V4 Pro übertrifft, könnte man dann in ein paar Wochen auch ein V4 Pro auf Opus-5-Niveau erwarten? Noch besser wäre es, wenn es Opus überträfe
https://trysojourn.app
Der wirklich interessante Punkt ist, dass sie ohne Architekturänderungen allein durch zusätzliches Feintuning große Leistungssteigerungen erzielt haben. Das ist das Ergebnis von mehr Daten, mehr Compute und mehr Zeit
DS V4 Flash ist im Vergleich zu konkurrierenden Modellen relativ klein, daher scheint es gut möglich, dass sich ähnliche Verbesserungen auch bei anderen kleineren Modellen erzielen lassen, wenn man hochwertige Daten und die Trainingspipeline darauf anwendet
Beim Preis pro Aufgabe liegt es bereits etwa um den Faktor 2 vor Luna: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...
Fairerweise sollte man also sagen, dass Luna 2- bis 3-mal teurer ist, aber 2- bis 5-mal schneller beim Reasoning. Das günstigste OpenAI-Modell, das DeepSeek übertrifft, ist Luna mit maximalem Reasoning; bei ähnlicher Leistung ist es vor dem Runden etwa 3-mal teurer, aber fast 3-mal so schnell
Dass Artificial Analysis sowohl für DeepSeek als auch für OpenAI ein dunkles Blau verwendet hat, ist besonders an einem Tag wie heute eine sehr unpassende Farbwahl