Torna al blog
17 agosto 2026Sergei Solod12 min di lettura

DeepSeek ha aumentato i prezzi — ho trovato lo stesso V4 Flash a meno della vecchia tariffa

Il 17 agosto la mia spesa per la DeepSeek API è salita improvvisamente a circa cinque volte il livello abituale. Ho poi trovato e testato un altro provider che offre lo stesso checkpoint DeepSeek-V4-Flash-0731 a prezzi circa il 45% inferiori persino alle vecchie tariffe di DeepSeek.

DeepSeekRunwareAPI LLMInfrastruttura AIModelli open-weight

La mattina del 17 agosto ho aperto le statistiche di utilizzo dell’API e inizialmente ho pensato di aver sbagliato qualcosa.

DeepSeek stava consumando denaro circa cinque volte più velocemente del solito.

Sapevo che sarebbe arrivata una modifica dei prezzi. DeepSeek l’aveva annunciata alcuni giorni prima, ma l’avevo mentalmente classificata come un normale aumento: forse 20%, 50%, magari il doppio.

Non così tanto.

Non c’era alcun bug di billing. Le nuove tariffe erano effettivamente entrate in vigore. DeepSeek ha spostato ufficialmente V4 Flash e V4 Pro su un sistema peak/off-peak dalle 16:00 UTC del 16 agosto, quando in Cina era già il 17 agosto. Reuters aveva riferito prima della modifica che gli aumenti, a seconda di modello, tipo di token e fascia oraria, sarebbero andati dal 50% al 1,100%. La tempistica è riportata nel change log della DeepSeek API.

È stato allora che un’altra notizia su DeepSeek è diventata improvvisamente molto più interessante: i pesi del modello sono pubblici. Se altre aziende possono eseguire lo stesso modello in autonomia, perché dovrei acquistare necessariamente l’inference direttamente da DeepSeek?

Quanto costava DeepSeek prima e quanto costa ora

Prima della modifica, DeepSeek V4 Flash costava:

DeepSeek V4 FlashVecchio prezzo per 1M token
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

Questi valori sono ancora visibili in una vecchia pagina dei prezzi DeepSeek, e Reuters citava le stesse tariffe il 3 agosto.

L’attuale deepseek-v4-flash ufficiale, corrispondente a DeepSeek-V4-Flash-0731, costa:

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

Le fasce peak vanno dalle 01:00 alle 04:00 UTC e dalle 06:00 alle 10:00 UTC secondo la pagina prezzi attuale di DeepSeek.

Quindi la mia osservazione di una spesa circa cinque volte superiore non significa che ogni categoria di token sia aumentata esattamente di cinque volte. Rispetto al vecchio prezzo:

  • l’input cache miss in peak è passato da $0.14 a $0.44, cioè 3.14×;
  • l’output è passato da $0.28 a $1.32, cioè 4.71×;
  • il cache hit è passato da $0.0028 a $0.014, esattamente .

Per un workload che genera molto output, un aumento reale della spesa vicino a cinque volte è quindi del tutto plausibile.

Ho cercato prima un altro venditore dello stesso modello

Avrei potuto semplicemente abbandonare DeepSeek. Il mercato offre Qwen, GLM, Kimi, MiniMax, Mistral e molti altri LLM.

Ma cambiare modello introduce un’altra variabile. Bisogna ricontrollare risposte, compatibilità dei prompt, lunghezza della generazione, comportamento sui contesti lunghi, parametri di sampling e altro.

Volevo provare prima un’opzione più semplice.

Posso continuare a usare DeepSeek V4 Flash smettendo però di comprare l’inference da DeepSeek?

Qui è importante usare i termini corretti. DeepSeek non ha semplicemente pubblicato il “codice sorgente della rete neurale” come uno sviluppatore pubblica il codice di un’applicazione. È più preciso dire che ha pubblicato i pesi del modello e il materiale necessario per eseguirli.

Il repository ufficiale deepseek-ai/DeepSeek-V4-Flash-0731 è pubblicamente disponibile su Hugging Face. Repository e pesi usano la MIT License e DeepSeek fornisce perfino un esempio di esecuzione con vLLM su un nodo dotato di quattro GB300.

Questo cambia completamente l’economia. Un provider terzo non deve necessariamente acquistare token da DeepSeek e rivenderli con un margine. Può eseguire i pesi aperti sulla propria infrastruttura e vendere calcolo effettuato sul proprio hardware.

Naturalmente dire “esegui DeepSeek in locale” fa sembrare il lavoro molto più semplice di quanto sia. Il repository 0731 pesa circa 167 GB e l’esempio ufficiale di deployment usa quattro GB300. Non è un docker compose up su un VPS da $20. I file sono visibili nella pagina dei file del modello.

Per una società di inference con un GPU cluster, però, il problema è diverso. La licenza non è più il principale ostacolo; restano hardware, elettricità, GPU utilization, batching, software stack ed efficienza dell’inference.

Ho trovato Runware

Dopo una ricerca abbastanza lunga, Runware è risultata una delle opzioni più interessanti.

Come ho trovato Runware? Con il mio metodo di ricerca preferito. Per prima cosa ho chiesto a un’IA di scrivere un prompt dettagliato per cercare il provider di inference più economico ma credibile per questo modello preciso. Poi ho eseguito circa 15–20 ricerche separate con quel prompt, raccolto tutti i risultati, li ho inseriti in un unico chat finale e ho chiesto di confrontare i candidati e individuare il migliore. Solo a quel punto ho controllato manualmente il vincitore: pagina del modello, prezzi, documentazione e API.

L’IA mi ha aiutato ad ampliare la ricerca, ma non ha preso la decisione finale al posto mio. Runware ha superato la mia verifica manuale, l’ho collegato personalmente e la raccomandazione in questo articolo nasce da quel test.

Oggi offre esattamente il checkpoint DeepSeek-V4-Flash-0731 con context 1M, non un generico modello “DeepSeek-compatible”. La sua pagina del modello indica:

RunwarePrezzo per 1M token
Input$0.076
Cached input$0.014
Output$0.153

All’inizio pensavo di aver letto male la posizione del decimale.

Ma il confronto più utile non è con i nuovi prezzi elevati di DeepSeek. È con i prezzi vecchi, che sembravano già molto bassi.

Il vecchio input DeepSeek costava $0.14. Runware costa $0.076. Runware è quindi circa il 45.7% più economico, mentre il vecchio DeepSeek era circa 1.84× più caro.

Il vecchio output costava $0.28. Runware costa $0.153. Runware è circa il 45.4% più economico, mentre il vecchio DeepSeek era circa 1.83× più caro.

Dopo un forte aumento dei prezzi ho trovato un’API di terze parti per lo stesso checkpoint V4 Flash 0731 che non è soltanto più economica del nuovo DeepSeek: costa quasi la metà del vecchio DeepSeek economico.

Rispetto alle tariffe ufficiali di oggi, la differenza è ancora maggiore. In off-peak Runware è circa 2.9× più economico per l’input cache miss e 4.3× più economico per l’output. In peak i rapporti salgono a circa 5.8× e 8.6×.

C’è un’eccezione importante: i cache hit economici. DeepSeek oggi chiede $0.007/M per il cached input in off-peak, mentre Runware chiede $0.014/M. Un workload dominato dai cache hit non può quindi essere confrontato usando solo i prezzi standard di input e output.

Un prezzo basso non serve se l’API non funziona

Una tabella dei prezzi non mi basta. Una LLM API da $0.000001 per request è inutile se metà delle richieste fallisce.

Quindi ho collegato Runware e ho iniziato a inviare richieste reali.

Ho conservato due snapshot del usage dashboard. Il primo mostrava:

790 requests
56 success
734 errors

Preso da solo, sembra pessimo. Più tardi il dashboard mostrava:

1,570 requests
836 success
734 errors

Tra le due misurazioni i contatori sono cambiati esattamente di:

+780 requests
+780 successful
+0 new errors

Non considero questo un test che dimostri uptime al 99.999%. Non dimostra nulla del genere, e i due snapshot non spiegano neppure la causa dei primi 734 errori.

Posso fare un’affermazione più limitata: nei 780 request successivi, il contatore dei successi è aumentato di 780 mentre quello degli errori è rimasto fermo.

L’API è stata anche veloce durante quella finestra di test. Nella parte visibile del log, la maggior parte delle chiamate riuscite si completava in frazioni di secondo fino a circa 1.5 secondi. Le richieste brevi visibili costavano spesso circa $0.000005–$0.000018. Dopo centinaia di chiamate riuscite, il dashboard mostrava ancora una spesa totale di circa un centesimo.

Da quel momento Runware non è stata più per me una semplice riga in una tabella comparativa. Avevo davvero collegato l’API, generava risposte e il mio traffico di test costava praticamente nulla.

Non è pubblicità — e sto testando Runware soltanto da un giorno

Voglio dirlo esplicitamente perché un passaggio positivo dedicato a un singolo provider può sembrare facilmente sponsorizzato. Non lo è. Runware non mi ha contattato e io non ho contattato Runware. Nessuno dell’azienda mi ha chiesto di scrivere questo articolo.

Inoltre uso il servizio soltanto da un giorno. Tra una settimana o un mese potrei tranquillamente abbandonarlo se emergessero problemi di affidabilità, qualità delle risposte, prezzi o altro. Non è un giudizio di lungo periodo.

Ho lasciato subito la costosa API ufficiale di DeepSeek perché non volevo continuare a bruciare denaro con le nuove tariffe mentre valutavo alternative. Ho spostato il traffico e ho iniziato immediatamente a testare Runware.

Finora sono molto soddisfatto della decisione. Quando stavo terminando questo articolo, Runware aveva già gestito 1.000 richieste AI con successo per me. Questo non dimostra l’uptime futuro né garantisce prestazioni a qualsiasi scala, ma basta a chiarire che non è un provider visto soltanto su un listino: lo sto usando davvero.

La mia raccomandazione è quindi volutamente limitata: ho verificato Runware personalmente, oggi funziona bene per me e al momento consiglio di provarlo. Se il servizio cambierà, potrà cambiare anche la mia opinione.

DeepSeek potrebbe essersi creato da solo un concorrente sul prezzo

Da qui in poi si entra nella mia interpretazione, non in un fatto osservato direttamente.

DeepSeek si è messo in una posizione commerciale insolita. Ha fatto due cose: ha pubblicato un modello molto competitivo e ha permesso al mercato di eseguirlo in autonomia.

Finché l’API ufficiale era estremamente economica, questa tensione si vedeva poco. Perché cercare il GPU cluster di qualcun altro se DeepSeek vendeva inference a $0.14/$0.28?

Dopo l’aumento, il calcolo cambia. Se l’API ufficiale arriva a $0.44 input e $1.32 output in peak, mentre un provider indipendente serve lo stesso checkpoint pubblico per $0.076/$0.153, l’incentivo economico a provare l’alternativa diventa molto forte.

Non è un loophole accidentale. La MIT License dei pesi pubblicati consente un uso ampio, incluso quello commerciale, e il repository ufficiale contiene istruzioni per il self-hosting.

Per questo non descriverei Runware semplicemente come un “rivenditore di token DeepSeek”. Una rappresentazione più corretta è:

DeepSeek
    │
    ├── API ufficiale DeepSeek
    │
    └── pesi aperti DeepSeek V4 Flash
                   │
                   ├── infrastruttura Runware
                   ├── altri provider di inference
                   └── il proprio GPU cluster

Lo stesso modello non è più legato a un unico venditore di inference.

Aprire i pesi è stato un errore commerciale?

Non lo affermerei come fatto.

Sarebbe troppo semplice dire che DeepSeek ha aperto il modello, i concorrenti possono venderlo a meno e quindi DeepSeek perderà necessariamente denaro. Non conosciamo l’economia interna dell’azienda.

Una strategia open-weight può portare altri vantaggi:

  • maggiore diffusione del modello;
  • più integrazioni;
  • maggiore influenza sull’ecosistema;
  • la possibilità di diventare uno standard di fatto nei prodotti di terzi;
  • più sviluppatori;
  • enterprise adoption;
  • popolarità nella ricerca;
  • pressione sui concorrenti.

Reuters ha inoltre sottolineato l’attenzione dei produttori cinesi di modelli verso approcci open-weight per ottenere un’ampia adozione da parte degli sviluppatori nella sua copertura del mercato AI cinese.

Per questo per me è troppo presto parlare di errore commerciale. Mi sento più sicuro con una conclusione più circoscritta:

Aprendo i pesi, DeepSeek ha rinunciato volontariamente al monopolio sull’inference del proprio modello.

Quando l’API ufficiale diventa molto più costosa, le conseguenze di questa scelta diventano più evidenti. DeepSeek non compete più soltanto con Qwen, OpenAI, Anthropic o Moonshot. In un certo senso compete anche con aziende che vendono inference per lo stesso modello aperto di DeepSeek.

Per chi compra API è ottimo. Per la strategia di monetizzazione, molto meno semplice.

Perché non faccio self-hosting di DeepSeek

Il pensiero successivo è ovvio: se aziende esterne possono eseguire DeepSeek e vendere inference, perché non farlo da solo?

Perché esiste una differenza enorme tra “il modello si può scaricare gratis” e “l’inference è gratis”.

I pesi si possono scaricare. Le GPU no.

Serve acquistare o noleggiare hardware costoso, avere abbastanza VRAM, caricare un checkpoint enorme, configurare inference engine, batching, KV cache, monitoring, scaling e redundancy, e infine generare abbastanza traffico da non lasciare le GPU inattive per gran parte del tempo.

L’esempio ufficiale di DeepSeek per V4 Flash 0731 usa un nodo con quattro GB300.

Per un provider specializzato, l’investimento può avere senso perché il costo dell’infrastruttura viene distribuito tra molti clienti. Per un singolo sviluppatore, pagare $0.076 per milione di input token può essere molto più razionale che investire una grossa somma in GPU e poi cercare di mantenerle occupate.

Per ora preferisco acquistare l’inference. Ma ho una comprensione molto più chiara di ciò che sto acquistando.

La lezione principale che mi sono portato via da quella mattina

All’inizio della giornata vedevo DeepSeek come una normale SaaS API: esiste un modello DeepSeek, quindi DeepSeek decide quanto costa usarlo.

A fine giornata il mio modello mentale era cambiato: esiste un checkpoint DeepSeek e un mercato competitivo di aziende pronte a eseguirlo per me.

Sono due mercati fondamentalmente diversi.

Con un modello chiuso, il prezzo dell’API è in gran parte controllato dal proprietario del modello. Con pesi aperti e una licenza permissiva, il prezzo dell’inference è influenzato anche dalla concorrenza tra provider di infrastruttura.

Il 17 agosto questa differenza è diventata molto concreta per me. Il vecchio DeepSeek V4 Flash costava $0.14 input e $0.28 output. Il nuovo prezzo ufficiale arriva a $0.44/$1.32 in peak. Runware offre attualmente DeepSeek-V4-Flash-0731 per $0.076/$0.153.

Ho testato personalmente questa API e ha funzionato per il traffico che le ho inviato.

Questi prezzi saranno ancora gli stessi tra un mese? Non lo so. Lo stesso provider reggerà qualsiasi scala e qualsiasi profilo di traffico? Non l’ho dimostrato.

Ma una cosa è cambiata: dopo questo aumento non considero più automaticamente l’API ufficiale del creatore di un modello open-weight come il posto migliore in cui acquistare inference.

Ora il mio primo passo è verificare chi altro può eseguire gli stessi pesi e quanto chiede per farlo.