Voltar ao blog
17 de agosto de 2026Sergei Solod12 min de leitura

A DeepSeek aumentou os preços — encontrei o mesmo V4 Flash mais barato que a tarifa antiga

Em 17 de agosto, meus gastos com a DeepSeek API subiram de repente para cerca de cinco vezes o normal. Depois encontrei e testei outro provedor com o mesmo checkpoint DeepSeek-V4-Flash-0731, cobrando aproximadamente 45% menos que as antigas tarifas da DeepSeek.

DeepSeekRunwareAPI de LLMInfraestrutura de IAModelos open-weight

Na manhã de 17 de agosto, abri as estatísticas de uso da API e, a princípio, achei que tivesse cometido algum erro.

A DeepSeek estava consumindo dinheiro cerca de cinco vezes mais rápido do que eu estava acostumado.

Eu sabia que uma mudança de preços viria. A DeepSeek havia anunciado alguns dias antes, mas eu a tinha classificado mentalmente como um aumento normal: talvez 20%, 50%, quem sabe o dobro.

Não desse tamanho.

Não havia bug de billing. As novas tarifas realmente haviam entrado em vigor. A DeepSeek migrou oficialmente V4 Flash e V4 Pro para preços peak/off-peak a partir de 16 de agosto, 16:00 UTC, quando na China já era 17 de agosto. A Reuters havia informado antes da mudança que, dependendo do modelo, do tipo de token e do horário, os aumentos iriam de 50% a 1,100%. O momento está documentado no change log da DeepSeek API.

Foi aí que outra notícia sobre a DeepSeek ficou de repente muito mais interessante: os model weights são públicos. Se outras empresas podem executar o mesmo modelo por conta própria, por que eu necessariamente preciso comprar inference diretamente da DeepSeek?

Quanto a DeepSeek custava antes e quanto custa agora

Antes da mudança, o DeepSeek V4 Flash custava:

DeepSeek V4 FlashPreço antigo por 1M de tokens
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

Esses valores ainda aparecem em uma página antiga de preços da DeepSeek, e a Reuters citou os mesmos valores em 3 de agosto.

O deepseek-v4-flash oficial, correspondente ao DeepSeek-V4-Flash-0731, agora custa:

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

Os períodos peak vão de 01:00 a 04:00 UTC e de 06:00 a 10:00 UTC segundo a página atual de preços da DeepSeek.

Portanto, minha observação de que a conta ficou aproximadamente cinco vezes maior não significa que cada categoria de token tenha aumentado exatamente cinco vezes. Em relação ao preço antigo:

  • o peak cache-miss input passou de $0.14 para $0.44, ou 3.14×;
  • o output passou de $0.28 para $1.32, ou 4.71×;
  • o cache hit passou de $0.0028 para $0.014, exatamente .

Para um workload que gera muito output, um aumento real próximo de cinco vezes é perfeitamente plausível.

Primeiro procurei outro vendedor do mesmo modelo

Eu poderia simplesmente abandonar a DeepSeek. Hoje existem Qwen, GLM, Kimi, MiniMax, Mistral e muitos outros LLMs.

Mas trocar de modelo adiciona outra variável. Respostas, compatibilidade de prompts, tamanho das gerações, comportamento em contexto longo, sampling parameters e outras características precisam ser testadas novamente.

Eu queria verificar uma alternativa mais simples primeiro.

Posso continuar usando o DeepSeek V4 Flash, mas deixar de comprar a inference da DeepSeek?

Aqui é importante ser preciso com os termos. A DeepSeek não publicou simplesmente o “código-fonte da rede neural” como um desenvolvedor publica a árvore de código de uma aplicação. O mais correto é dizer que ela publicou os pesos do modelo e os materiais necessários para executá-los.

O repositório oficial deepseek-ai/DeepSeek-V4-Flash-0731 está disponível publicamente no Hugging Face. Repositório e weights usam a MIT License, e a DeepSeek fornece até um exemplo de execução com vLLM em um node com quatro GB300.

Isso muda completamente a economia. Um provider terceirizado não precisa necessariamente comprar tokens da DeepSeek e revendê-los com margem. Ele pode executar os open weights em sua própria infraestrutura e vender compute no próprio hardware.

Claro que dizer “rode o DeepSeek localmente” faz a tarefa parecer muito mais simples do que é. O repositório 0731 tem cerca de 167 GB e o exemplo oficial de deployment usa quatro GB300. Isso não é docker compose up em um VPS de $20. Os arquivos podem ser vistos na página de arquivos do modelo.

Para uma empresa de inference com um GPU cluster, porém, o problema é diferente. A licença deixa de ser a barreira principal; restam hardware, eletricidade, GPU utilization, batching, software stack e eficiência de inference.

Encontrei a Runware

Depois de procurar bastante, a Runware foi uma das opções mais interessantes que encontrei.

Como encontrei a Runware? Com meu método favorito de pesquisa. Primeiro pedi a uma IA que escrevesse um prompt detalhado para procurar o provider de inference mais barato, mas ainda confiável, para esse modelo exato. Depois executei cerca de 15–20 pesquisas separadas com esse prompt, reuni todos os resultados, coloquei tudo em um único chat final e pedi uma comparação dos candidatos para identificar o melhor. Só então verifiquei o vencedor manualmente: página do modelo, preços, documentação e a própria API.

A IA me ajudou a ampliar a busca, mas não tomou a decisão final por mim. A Runware passou pela minha verificação manual, eu mesmo conectei o serviço e a recomendação deste artigo se baseia nesse teste.

Ela oferece atualmente o checkpoint exato DeepSeek-V4-Flash-0731 com contexto de 1M, não um modelo anônimo “DeepSeek-compatible”. A página do modelo lista:

RunwarePreço por 1M de tokens
Input$0.076
Cached input$0.014
Output$0.153

No início achei que tivesse lido a casa decimal errada.

Mas a comparação mais útil não é com os novos preços caros da DeepSeek. É com os preços antigos, que já pareciam muito baixos.

O input antigo da DeepSeek custava $0.14. Na Runware custa $0.076. A Runware é aproximadamente 45.7% mais barata, enquanto o preço antigo da DeepSeek era cerca de 1.84× maior.

O output antigo custava $0.28. Na Runware custa $0.153. A Runware é cerca de 45.4% mais barata, e a DeepSeek antiga era aproximadamente 1.83× mais cara.

Depois de um grande aumento de preços, encontrei uma API de terceiro servindo o mesmo checkpoint V4 Flash 0731 que não é apenas mais barata que a nova DeepSeek: custa quase metade do antigo DeepSeek barato.

Em relação à tarifa oficial atual, a diferença é ainda maior. No off-peak, a Runware é aproximadamente 2.9× mais barata em cache-miss input e 4.3× mais barata em output. No peak, as diferenças são cerca de 5.8× e 8.6×.

Há uma exceção importante: cache hits baratos. A DeepSeek cobra atualmente $0.007/M por cached input em off-peak, enquanto a Runware cobra $0.014/M. Um workload dominado por cache hits não pode ser comparado apenas pelos preços normais de input e output.

Preço baixo não vale nada se a API não funcionar

Uma tabela de preços não é suficiente para mim. Uma LLM API a $0.000001 por request é inútil se metade das solicitações falhar.

Então conectei a Runware e comecei a enviar requests reais.

Guardei dois snapshots do usage dashboard. O primeiro mostrava:

790 requests
56 success
734 errors

Isoladamente, isso parece péssimo. Mais tarde, o dashboard mostrava:

1,570 requests
836 success
734 errors

Entre as duas medições, os contadores mudaram exatamente em:

+780 requests
+780 successful
+0 new errors

Não considero isso uma prova de 99.999% de uptime. Esses dados não demonstram nada do tipo, e os dois snapshots também não explicam a causa dos 734 erros iniciais.

O que posso afirmar é mais limitado: nos 780 requests seguintes, o contador de successful aumentou em 780 e o contador de errors não mudou.

A API também foi rápida durante essa janela de teste. Na parte visível do log, a maioria das chamadas bem-sucedidas terminou em frações de segundo até aproximadamente 1.5 segundo. Requests curtos que eu conseguia ver custavam frequentemente cerca de $0.000005–$0.000018. Depois de centenas de chamadas bem-sucedidas, o dashboard ainda mostrava gasto total de aproximadamente um centavo.

Foi aí que a Runware deixou de ser apenas uma linha em uma tabela comparativa. Eu realmente havia conectado a API, ela gerava respostas e meu tráfego de teste custava praticamente nada.

Isso não é publicidade — e estou testando a Runware há apenas um dia

Quero deixar isso explícito porque uma seção positiva sobre um único provider pode facilmente parecer conteúdo patrocinado. Não é. A Runware não entrou em contato comigo, e eu também não entrei em contato com a Runware. Ninguém da empresa me pediu para escrever este artigo.

Além disso, uso o serviço há apenas um dia. Daqui a uma semana ou um mês posso perfeitamente sair se aparecerem problemas de confiabilidade, qualidade das respostas, preços ou qualquer outra coisa. Isto não é um veredito de longo prazo.

Saí imediatamente da API oficial e cara da DeepSeek porque não queria continuar queimando dinheiro nas novas tarifas enquanto avaliava alternativas. Simplesmente movi o tráfego e comecei a testar a Runware na hora.

Até agora estou muito satisfeito com a decisão. Quando eu estava terminando este artigo, a Runware já havia processado 1.000 solicitações de IA com sucesso para mim. Isso ainda não prova uptime futuro nem desempenho em qualquer escala, mas é suficiente para dizer que não é um provider que eu apenas encontrei numa tabela de preços: estou realmente usando o serviço.

Por isso minha recomendação é propositalmente limitada: eu mesmo verifiquei a Runware, hoje ela funciona bem para mim e, neste momento, recomendo testá-la. Se o serviço mudar, minha opinião também pode mudar.

A DeepSeek talvez tenha criado seu próprio concorrente de preço

Daqui em diante, trata-se da minha interpretação, não de um fato observado diretamente.

A DeepSeek se colocou em uma posição empresarial incomum. Ela fez duas coisas: lançou um modelo muito competitivo e deu ao mercado a capacidade de executá-lo independentemente.

Enquanto a API oficial da DeepSeek era extremamente barata, essa tensão quase não aparecia. Por que procurar o GPU cluster de outra empresa se a própria DeepSeek vendia inference a $0.14/$0.28?

Depois do aumento, a conta muda. Se a API oficial chega a $0.44 de input e $1.32 de output no peak, enquanto um provider independente oferece o mesmo checkpoint público por $0.076/$0.153, o incentivo econômico para experimentar a alternativa fica muito forte.

Isso não é um loophole acidental. A MIT License dos weights publicados permite uso amplo, inclusive comercial, e o repositório oficial traz instruções para self-hosting.

Por isso eu não descreveria a Runware simplesmente como uma “revendedora de tokens DeepSeek”. Uma representação mais precisa é:

DeepSeek
    │
    ├── API oficial da DeepSeek
    │
    └── open weights do DeepSeek V4 Flash
                   │
                   ├── infraestrutura da Runware
                   ├── outros providers de inference
                   └── seu próprio GPU cluster

O mesmo modelo deixa de estar vinculado a um único vendedor de inference.

Abrir os weights foi um erro de negócio?

Eu não afirmaria isso como fato.

Seria simplista demais dizer que a DeepSeek abriu o modelo, concorrentes agora podem vendê-lo mais barato e, portanto, a DeepSeek necessariamente perderá dinheiro. Não conhecemos a economia interna da empresa.

Uma estratégia open-weight pode trazer outras vantagens:

  • maior distribuição do modelo;
  • mais integrações;
  • mais influência no ecossistema;
  • chance de se tornar padrão de fato em produtos de terceiros;
  • mais developers;
  • enterprise adoption;
  • popularidade em pesquisa;
  • pressão sobre concorrentes.

A Reuters também observou o foco de desenvolvedores chineses em abordagens open-weight para obter ampla adoção entre developers em sua cobertura do mercado chinês de IA.

Por isso, para mim ainda é cedo para chamar essa decisão de erro empresarial. Uma conclusão mais limitada me parece defensável:

Ao abrir os weights, a DeepSeek abriu mão voluntariamente do monopólio sobre a inference de seu próprio modelo.

Quando a API oficial fica muito mais cara, as consequências dessa escolha ficam mais visíveis. A DeepSeek não compete apenas com Qwen, OpenAI, Anthropic ou Moonshot. De certa forma, também passa a competir com empresas que vendem inference para o próprio modelo aberto da DeepSeek.

Para quem compra API, isso é excelente. Para a estratégia de monetização, é bem mais complicado.

Por que não faço self-hosting do DeepSeek

O próximo pensamento é óbvio: se empresas terceirizadas podem executar DeepSeek e vender inference, por que não fazer isso por conta própria?

Porque há uma diferença enorme entre “o modelo pode ser baixado de graça” e “a inference é gratuita”.

Os weights podem ser baixados. GPUs não.

É necessário comprar ou alugar hardware caro, ter VRAM suficiente, carregar um checkpoint enorme, configurar inference engine, batching, KV cache, monitoring, scaling e redundancy, além de gerar tráfego suficiente para que as GPUs não fiquem ociosas na maior parte do tempo.

O exemplo oficial da DeepSeek para V4 Flash 0731 usa um node com quatro GB300.

Para um provider especializado, esse investimento pode fazer sentido porque o custo de infraestrutura é dividido entre muitos clientes. Para um único developer, pagar $0.076 por milhão de input tokens pode ser muito mais racional do que investir uma grande quantia em GPUs e depois tentar manter alta utilization.

Por enquanto, prefiro comprar inference. Mas hoje entendo muito melhor o que estou realmente comprando.

A principal lição daquela manhã

No início do dia, eu via a DeepSeek como uma SaaS API comum: existe um modelo DeepSeek, então a DeepSeek determina quanto custa usá-lo.

No fim do dia, meu modelo mental era diferente: existe um checkpoint DeepSeek e existe um mercado competitivo de empresas dispostas a executar esse checkpoint para mim.

São mercados fundamentalmente diferentes.

Com um modelo fechado, o preço da API é em grande parte controlado pelo dono do modelo. Com open weights sob licença permissiva, o preço da inference também é moldado pela concorrência entre providers de infraestrutura.

Em 17 de agosto, essa diferença ficou muito concreta para mim. O antigo DeepSeek V4 Flash custava $0.14 de input e $0.28 de output. O novo preço oficial chega a $0.44/$1.32 no peak. A Runware atualmente oferece DeepSeek-V4-Flash-0731 por $0.076/$0.153.

Eu mesmo testei essa API, e ela funcionou para o tráfego que enviei.

Esses preços continuarão iguais daqui a um mês? Não sei. O mesmo provider suporta qualquer escala e qualquer perfil de tráfego? Também não provei isso.

Mas uma coisa mudou para mim: depois deste aumento, não presumo mais que a API oficial do criador de um modelo open-weight seja automaticamente o melhor lugar para comprar inference.

Agora meu primeiro passo é verificar quem mais consegue executar os mesmos weights e quanto cobra por isso.