DeepSeek V4 Flash: riferimento storico del modello
1M tokens · Text / Code · Prompt cache
DeepSeek V4 Flash non è più offerto su Okou. Consulta GPT 6 Luna per un’alternativa attualmente supportata. Questa pagina conserva informazioni storiche, non i prezzi attuali di Okou.
Vedi GPT 6 LunaCos'è DeepSeek V4 Flash?
31 luglio 2026 (DeepSeek-V4-Flash-0731, beta pubblica)
Cosa rende notevole DeepSeek V4 Flash
Caratteristiche principali di architettura e capacità.
V4 Flash è un modello Mixture-of-Experts sparso: 284 miliardi di parametri totali con 13 miliardi attivati per token, dove ogni livello MoE ha 1 esperto condiviso e 256 esperti instradati con dimensione intermedia 2048, e 6 esperti instradati si attivano per token. I primi tre livelli MoE usano routing per hash e la profondità di predizione multi-token è 1. Il checkpoint 0731 pubblicato arriva a 304 miliardi di parametri perché include un modulo draft per il decoding speculativo sopra la base da 284 miliardi. Supporta una finestra di contesto da un milione di token con output fino a 384 K, modalità con e senza ragionamento e un parametro reasoning_effort con i livelli low, high e max. I pesi sono sotto licenza MIT e liberamente accessibili.
Specifiche in breve
Benchmark di DeepSeek V4 Flash
Valori dichiarati da DeepSeek nella scheda del modello DeepSeek-V4-Flash-0731, ottenuti con il DeepSeek Harness in modalità minimal e sforzo di ragionamento massimo (temperatura 1,0, top_p 0,95). L'harness non è stato rilasciato, quindi nessuno di questi risultati è stato riprodotto in modo indipendente; DSBench-FullStack e DSBench-Hard sono set di test interni a DeepSeek.
I migliori task per agenti con DeepSeek V4 Flash
Agenti di coding ad alto volume
Revisione di PR in blocco, scrittura di test, passaggi di lint-e-fix e refactoring pianificati, dove lo stesso agente gira centinaia di volte al giorno. A 0,28 $ per milione di token in output il costo per esecuzione resta abbastanza basso da togliere al volume il ruolo di vincolo.
Automazione guidata da terminale e strumenti
I risultati pubblicati più forti della build 0731 riguardano il lavoro da terminale e l'uso di strumenti, cioè esattamente ciò che fa tutto il giorno un agente che corregge build, verifica deploy o smista log.
Lettura dell'intero repository
Una finestra da un milione di token accoglie un repository di medie dimensioni per intero, una lunga cronologia di incidenti o un set completo di documenti di progettazione in un solo passaggio, così un agente di migrazione o audit può ragionare sull'insieme anziché pezzo per pezzo.
Lo strato economico sotto un orchestratore di frontiera
Lascia pianificare e rivedere a Claude Opus 5 o GPT 5.6 Sol e affida a V4 Flash i molti passaggi meccanici: leggere file, eseguire comandi, abbozzare patch. La tariffa di frontiera la paghi solo sui passaggi che decidono l'esito.
Domande frequenti
Qual è la finestra di contesto di DeepSeek V4 Flash?
Un milione di token in ingresso e fino a 384 K token di output per risposta. DeepSeek consiglia il tetto pieno di 384 K in output ai livelli di sforzo high e max.
DeepSeek V4 Flash supporta la vision?
No. Accetta solo testo e codice. Instrada i passaggi basati su screenshot, grafici o PDF verso un modello multimodale come Claude Sonnet 4.6 o GPT 5.6 Luna.
Alternative
Disponibilità di DeepSeek V4 Flash su Okou
DeepSeek V4 Flash non è più offerto su Okou. Consulta GPT 6 Luna per un’alternativa attualmente supportata. Questa pagina conserva informazioni storiche, non i prezzi attuali di Okou.

