DeepSeek V4 Flash: historische Modellreferenz
1M tokens · Text / Code · Prompt cache
DeepSeek V4 Flash wird auf Okou nicht mehr angeboten. GPT 6 Luna ist eine aktuell unterstützte Alternative. Diese Seite enthält historische Modellinformationen, keine aktuellen Okou-Preise.
GPT 6 Luna ansehenWas ist DeepSeek V4 Flash?
31. Juli 2026 (DeepSeek-V4-Flash-0731, Public Beta)
Das zeichnet DeepSeek V4 Flash aus
Architektur- und Funktionsmerkmale im Überblick.
V4 Flash ist ein spärliches Mixture-of-Experts-Modell: 284B Parameter insgesamt, 13B davon pro Token aktiviert. Jede MoE-Schicht enthält 1 Shared Expert und 256 geroutete Experten mit einer Zwischendimension von 2048, wobei pro Token 6 geroutete Experten feuern. Die ersten drei MoE-Schichten nutzen Hash-Routing, die Multi-Token-Prediction-Tiefe beträgt 1. Der veröffentlichte 0731-Checkpoint kommt auf 304B Parameter, weil er zusätzlich zum 284B-Basismodell ein Draft-Modul für spekulatives Decoding mitbringt. Unterstützt werden ein Kontextfenster von 1M Tokens mit bis zu 384K Ausgabe, Thinking- und Non-Thinking-Modus sowie ein Parameter reasoning_effort mit den Stufen low, high und max. Die Gewichte stehen unter MIT-Lizenz und sind frei zugänglich.
Technische Daten auf einen Blick
DeepSeek V4 Flash Benchmarks
Von DeepSeek berichtete Werte aus der Modellkarte zu DeepSeek-V4-Flash-0731, erhoben mit dem DeepSeek Harness im Minimal-Modus bei maximalem Reasoning-Aufwand (Temperatur 1,0, top_p 0,95). Der Harness ist nicht veröffentlicht, also wurde keiner dieser Werte unabhängig reproduziert; DSBench-FullStack und DSBench-Hard sind interne Testsets von DeepSeek.
Beste Agent-Aufgaben für DeepSeek V4 Flash
Terminal- und tool-getriebene Automatisierung
Die stärksten veröffentlichten Ergebnisse des 0731-Builds betreffen Terminalarbeit und Tool-Nutzung — genau das, was ein Build-Fix-, Deployment-Check- oder Log-Triage-Agent den ganzen Tag tut.
Repository-weites Lesen
Ein Fenster von 1M Tokens fasst ein mittelgroßes Repository, eine lange Incident-Chronologie oder einen kompletten Satz Design-Dokumente in einem Durchgang, sodass ein Migrations- oder Audit-Agent über das Ganze statt Stück für Stück nachdenken kann.
Die günstige Schicht unter einem Frontier-Orchestrator
Lass Claude Opus 5 oder GPT 5.6 Sol planen und prüfen und gib die vielen mechanischen Schritte — Dateien lesen, Befehle ausführen, Patches entwerfen — an V4 Flash. Den Frontier-Tarif zahlst du dann nur für die Schritte, die den Lauf entscheiden.
Häufig gestellte Fragen
Wie groß ist das Kontextfenster von DeepSeek V4 Flash?
1M Tokens Eingabe und bis zu 384K Tokens Ausgabe pro Antwort. DeepSeek empfiehlt die vollen 384K Ausgabe bei den Reasoning-Stufen high und max.
Unterstützt DeepSeek V4 Flash Vision?
Nein. Es nimmt nur Text und Code. Schritte mit Screenshots, Diagrammen oder PDFs gehören zu einem multimodalen Modell wie Claude Sonnet 4.6 oder GPT 5.6 Luna.
Alternativen
Verfügbarkeit von DeepSeek V4 Flash auf Okou
DeepSeek V4 Flash wird auf Okou nicht mehr angeboten. GPT 6 Luna ist eine aktuell unterstützte Alternative. Diese Seite enthält historische Modellinformationen, keine aktuellen Okou-Preise.

