1 Punkte von GN⁺ 2 시간 전 | 1 Kommentare | Auf WhatsApp teilen
  • Mit maximaler Reasoning-Einstellung erreicht das Modell 50 Punkte im AAII und liegt damit hinter Kimi K3 (max) und GLM-5.2 (max) auf Platz 3
  • Es ist ein MoE-Modell, das von insgesamt 284 Milliarden Parametern pro Token nur 13 Milliarden aktiviert und Texteingabe/-ausgabe sowie einen Kontext von 1 Million Tokens unterstützt
  • Der API-Preis beträgt pro 1 Million Tokens 0,14 $ für Input, 0,28 $ für Output und 0,003 $ bei Cache-Hits; die Gesamtkosten der Intelligence-Index-Bewertung lagen bei 72,02 $
  • In der Bewertung wurden 210 Millionen Output-Tokens verwendet, deutlich mehr als der Median vergleichbarer Modelle von 100 Millionen Tokens; die Ausgabegeschwindigkeit wurde noch nicht veröffentlicht
  • Die Modellgewichte sind veröffentlicht und stehen unter der MIT-Lizenz, sodass Self-Hosting und kommerzielle Nutzung möglich sind; derzeit gibt es einen API-Anbieter

Modellaufbau und Veröffentlichungsform

  • DeepSeek V4 Flash 0731 ist ein reasoning-orientiertes Open-Weights-Modell, das am 31. Juli 2026 veröffentlicht wurde
  • Es hat insgesamt 284 Milliarden Parameter und nutzt eine Mixture-of-Experts(MoE)-Architektur, bei der während der Inferenz pro Token 13 Milliarden Parameter aktiviert werden
  • Die Modellgewichte können heruntergeladen und selbst gehostet werden
  • Durch die MIT-Lizenz ist kommerzielle Nutzung erlaubt
  • Es handelt sich um eine Reasoning-Version mit maximalem Reasoning-Aufwand (Max Effort); es könnte eine separate Nicht-Reasoning-Version geben

Intelligenzbewertung

  • Im Artificial Analysis Intelligence Index v4.1 erreicht das Modell 50 Punkte
    • Platz 3 hinter Kimi K3 (max) und GLM-5.2 (max). Danach folgen Kimi K3 (low) und MiniMax-M3 auf Platz 4/5
    • Der Median vergleichbarer großer Open-Weights-Modelle liegt bei 25 Punkten
    • Artificial Analysis ordnet es damit der Spitzengruppe bei der Intelligenz zu
  • Der Intelligence Index v4.1 kombiniert die folgenden 9 Bewertungen
    • GDPval-AA v2: agentenartige reale Arbeitsaufgaben
    • 𝜏³-Banking: agentenartige Tool-Nutzung
    • Terminal-Bench v2.1: agentenartiges Coding/Terminal-Nutzung
    • SciCode: Coding
    • Humanity's Last Exam: Reasoning/Wissen
    • GPQA Diamond: wissenschaftliches Reasoning
    • CritPt: physikalisches Reasoning
    • AA-Omniscience: Wissensgenauigkeit und Eindämmung von Halluzinationen
    • AA-LCR: Long-Context-Reasoning

Umfang zusätzlicher Benchmarks

  • Um detaillierte Einsatzbereiche je Modell vergleichen zu können, werden außerdem folgende Bewertungsergebnisse bereitgestellt
    • AA-Briefcase: agentenartige Wissensarbeit
    • AutomationBench-AA: SaaS-Arbeitsautomatisierung
    • Harvey LAB-AA: juristische Agentenarbeit
    • EnterpriseOps-Gym-AA: Aufgaben im Unternehmensbetrieb
    • IFBench: Befolgung von Anweisungen
    • APEX-Agents-AA: lang laufende Agentenaufgaben
    • ITBench-AA: Ursachenanalyse von Kubernetes-Störungen
    • MMMU-Pro: visuelles Reasoning
  • DeepSeek V4 Flash 0731 unterstützt keine Bildeingabe und ist daher ein reines Textmodell, kein multimodales Modell

Wissenszuverlässigkeit und Halluzinationsbewertung

  • Der AA-Omniscience Index vergibt Punkte für korrekte Antworten und bestraft Halluzinationen; Antwortverweigerungen werden nicht bestraft
  • Die Punkteskala reicht von -100 bis 100
    • 0 Punkte bedeuten, dass die Zahl richtiger und falscher Antworten gleich ist
    • Negative Werte bedeuten, dass es mehr falsche als richtige Antworten gibt

Token-Nutzung und Antwortverhalten

  • In der gesamten Intelligence-Index-Bewertung wurden 210 Millionen Output-Tokens erzeugt
    • Der Median vergleichbarer Open-Weights-Modelle liegt bei 100 Millionen Tokens
    • Artificial Analysis stuft dies als sehr ausführlich ein
  • Die Zahl der Output-Tokens pro Aufgabe wird berechnet, indem die Ausgabemenge jedes Benchmarks mit der Intelligence-Index-Gewichtung gewichtet und durch die Anzahl der Aufgaben ohne Wiederholungsläufe geteilt wird
  • Die Ausgabegeschwindigkeit wurde noch nicht gemessen; daher ist keine Zahl der Output-Tokens pro Sekunde veröffentlicht

API-Preise und Bewertungskosten

  • Die Listenpreise der DeepSeek API sind wie folgt
    • Input: 0,14 $ pro 1 Million Tokens
    • Output: 0,28 $ pro 1 Million Tokens
    • Cache-Hit: 0,003 $ pro 1 Million Tokens
  • Mischt man Cache-Hit/Input/Output im Verhältnis 7:2:1, ergibt sich ein Preis von 0,06 $ pro 1 Million Tokens
  • Die Gesamtkosten der Intelligence-Index-Bewertung lagen bei 72,02 $
  • Der Zusammenfassungsbereich weist den Median der Vergleichsmodelle mit 0,43 $ für Input/1,20 $ für Output aus, der FAQ-Bereich mit 0,58 $ für Input/2,20 $ für Output
  • Die Kosten pro Aufgabe werden berechnet, indem die Kosten für Input-, Cache-Hit-, Cache-Write-, Reasoning- und finale Antwort-Tokens durch die Zahl der Aufgaben geteilt und anschließend mit der Index-Gewichtung des jeweiligen Benchmarks gewichtet werden
  • Kosten für Cache-Writes und Speicherung können je nach API-Anbieter separat berechnet werden

Kontext und Verfügbarkeit

  • Das Kontextfenster umfasst 1 Million Tokens, was bei Arial 12 Punkt etwa 1.500 A4-Seiten entspricht
  • Es kann für RAG-Workflows genutzt werden, die Suche und Reasoning über große Dokumentmengen erfordern
  • Es unterstützt nur Texteingabe und Textausgabe
  • Derzeit gibt es einen Anbieter für die API; Preise können je nach Anbieter variieren

1 Kommentare

 
GN⁺ 2 시간 전
Hacker-News-Kommentare
  • Die Modellgewichte wurden gerade veröffentlicht: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • Ich hoffe auf eine quantisierte DwarfStar-Version. Ich habe die DeepSeek-V4-Flash-Vorschau mehrere Monate lang auf einem 128-GB-MacBook-Pro als meinen primären Coding-Agent verwendet, und sie scheint in fast allen Metriken GLM 5.2 überlegen zu sein
    • Sie zielen auf Hardware-Beschleuniger mit 128×128-Matrixmultiplikations-Primitiven ab; ich frage mich, ob damit H100s Warp Group Matrix Multiply Accumulate gemeint ist
    • Wenn es ein Unsloth GGUF unter 165 GB ist, kann es auf den meisten reinen CPU-Systemen mit 256 GB RAM laufen. Mit llama-server ist auch eine gemischte Konfiguration möglich, bei der so viel wie möglich auf 32-GB-, 48-GB- oder 96-GB-GPUs geladen und der Rest im System-DRAM abgelegt wird
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • Das neue DeepSeek-Modell fühlt sich wie ein Weihnachtsgeschenk an. Günstige API-Modelle kann DeepSeek am besten, und bis die VRAM-Preise so weit fallen, dass lokales Ausführen möglich wird, ist das wohl der beste Ansatz
    Abonnementmodelle, die von Subventionen abhängen, dürften nicht lange tragfähig sein, und API-Abrechnung wirkt näher an einem nachhaltigen Geschäftsmodell

    • Ich nutze DeepSeek in einem Projekt, und es ist erstaunlich, dass man zig Millionen Tokens für nur ein paar Cent verwenden kann. Es passt nicht für jede Aufgabe, aber bestimmte Aufgaben erledigt es für praktisch fast nichts hervorragend
    • Ich freue mich auf den Tag, an dem China bei Speicher- und Compute-Hardware aufholt und US-Unternehmen bei Preis und Leistung zugleich übertrifft
    • Kollegen beschweren sich, dass sie ihre Claude-Tokens in einer Stunde aufbrauchen, aber ich nutze DS Flash den ganzen Tag. Wenn es sich mal irrt, kann man für schwierige Aufgaben dann Modelle wie Claude dazuschalten
    • Selbst pro Token gerechnet ist die DeepSeek API vermutlich kosteneffizienter als ein Abo. In meinen Tests hat sich Flash bei der Befolgung von Anweisungen stark verbessert und ist proaktiver geworden; bei der aktuellen Kosteneffizienz gibt es kaum vergleichbare Modelle
    • Wenn man sich die Preise direkt ansieht, braucht man für dieselben Ergebnisse wie mit GPT 5.6 Luna 5-mal so viele Tokens, und auch die Tokens pro Sekunde sind deutlich niedriger. Trotzdem sorgt der Druck von DeepSeek eindeutig dafür, dass etablierte Anbieter weiter optimieren
  • Die bisherige Adresse liefert 404; die korrekte URL scheint diese zu sein: https://artificialanalysis.ai/models/deepseek-v4-flash

  • Ich habe den gestern veröffentlichten OpenAI-Chart um einen Datenpunkt für DeepSeek V4 Flash 0731 ergänzt; es liegt auf der Preis-Leistungs-Frontier
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    Original: https://openai.com/index/advancing-the-price-performance-fro...

  • Für die Code-Agent-Aufgaben in den veröffentlichten Benchmarks wurde offenbar ein noch nicht veröffentlichtes DeepSeek-Harness im Minimalmodus verwendet; ich frage mich, ob auch ein optimiertes Coding-Agent-Harness angekündigt wird
    Wenn man DSv4 Flash mit reasonix oder pi nutzt, kann man den ganzen Tag lang für ein paar Cent coden, ohne sich um Tokens zu sorgen. Nutzt man dasselbe Modell dagegen mit ZDR über Fireworks oder OpenRouter, steigen die Kosten ohne ersichtlichen Grund weiter. Es wirkt, als würden sie die Preise subventionieren, um Nutzungsdaten zu sammeln; ich warte auf den Tag, an dem lokales Ausführen möglich wird

    • Mich würde interessieren, bei welchem Anbieter du kaufst, wenn nicht über OpenRouter. Wenn es ein bei OpenRouter gelisteter Anbieter ist, dachte ich, der Preis sei beim Direktkauf derselbe
    • Im technischen Bericht wurde DeepSeek Harness bereits angekündigt. Die Code-Agent-Aufgaben wurden im Minimalmodus, mit maximalem Reasoning-Aufwand, temperature = 1.0 und top_p = 0.95 evaluiert; das Harness soll später veröffentlicht werden
  • Für Nutzer einer einzelnen RTX PRO 6000 96GB oder eines DGX Spark 128GB ist das wenig bekannte vllm-moet eine sehr gute Engine. Es erzeugt automatisch symmetrische 2-Bit-Planes für die Inferenz, legt zusätzlich einen 4-Bit-Delta-Cache zur Wiederherstellung der Präzision an und unterstützt SSD-Streaming für Gewichte, die größer als der RAM sind
    Man kann festlegen, wie viel VRAM jedem Bereich zugewiesen wird, um Geschwindigkeit und Präzision auszubalancieren, und mit DS V4 Flash wurden 170 Tokens pro Sekunde demonstriert. Das Originalmodell wird unverändert verwendet, ohne separates Konvertierungsmodell
    Auf DGX Spark ist ein kleiner Workaround nötig, um den Unterschied zwischen sm120 und sm121 zu ignorieren, aber da es auch auf sm121 läuft, lohnt es sich, ein paar Stunden zu investieren

  • 0,28 US-Dollar pro 1 Million Output-Tokens für Intelligenz auf GLM-5.2-/Gemini-3.6-Niveau, und ein aktualisiertes Pro-Modell soll bald erscheinen
    Unsloth lossless Q8 ist 162 GB groß, also tatsächlich eine Größe, die man auch zu Hause betreiben könnte

    • Ich würde gern sehen, was für ein Zuhause das ist, in dem man so etwas laufen lässt
    • Die Q8-Größe liegt bei etwa 151 GB
  • Wenn DeepSeek V4 Flash V4 Pro übertrifft, könnte man dann in ein paar Wochen auch ein V4 Pro auf Opus-5-Niveau erwarten? Noch besser wäre es, wenn es Opus überträfe

    • Ich verwende V4 Flash in einer App, an der ich arbeite, und nachdem ich vorher nur GPT, Opus und Sonnet genutzt hatte, sind Kosteneffizienz und Leistung erstaunlich. Die Kosten sind so niedrig, dass ich sogar eine großzügige kostenlose Stufe für eine App anbieten kann, die nicht auf Profit ausgerichtet ist
      https://trysojourn.app
    • Opus-5-Leistung zum V4-Pro-Preis wäre kaum zu glauben gut, wirkt aber wohl eher wie ein Traum
    • Es wurde bereits angekündigt, dass die aktualisierte finale V4-Pro-Version bald veröffentlicht wird
  • Der wirklich interessante Punkt ist, dass sie ohne Architekturänderungen allein durch zusätzliches Feintuning große Leistungssteigerungen erzielt haben. Das ist das Ergebnis von mehr Daten, mehr Compute und mehr Zeit
    DS V4 Flash ist im Vergleich zu konkurrierenden Modellen relativ klein, daher scheint es gut möglich, dass sich ähnliche Verbesserungen auch bei anderen kleineren Modellen erzielen lassen, wenn man hochwertige Daten und die Trainingspipeline darauf anwendet

  • Beim Preis pro Aufgabe liegt es bereits etwa um den Faktor 2 vor Luna: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • Ich würde auch gern sehen, wie es sich im Vergleich zu Luna je nach Aufgabentyp schlägt
    • Da die Kosten auf der X-Achse liegen, ist es genauer zu sagen: DeepSeek V4 Flash 0731 mit maximalem Reasoning kostet pro Aufgabe etwa 0,03 US-Dollar bei einem Index von 50. OpenAI Luna liegt bei hohem Reasoning bei 0,03 US-Dollar und Index 46, bei sehr hohem Reasoning bei 0,04 US-Dollar und Index 49 und bei maximalem Reasoning bei 0,07 US-Dollar und Index 51
      Fairerweise sollte man also sagen, dass Luna 2- bis 3-mal teurer ist, aber 2- bis 5-mal schneller beim Reasoning. Das günstigste OpenAI-Modell, das DeepSeek übertrifft, ist Luna mit maximalem Reasoning; bei ähnlicher Leistung ist es vor dem Runden etwa 3-mal teurer, aber fast 3-mal so schnell
      Dass Artificial Analysis sowohl für DeepSeek als auch für OpenAI ein dunkles Blau verwendet hat, ist besonders an einem Tag wie heute eine sehr unpassende Farbwahl