Volver al blog
17 de agosto de 2026Sergei Solod12 min de lectura

DeepSeek subió sus precios — encontré el mismo V4 Flash más barato que su tarifa antigua

El 17 de agosto vi que mi gasto en la API de DeepSeek había subido a aproximadamente cinco veces lo habitual. Después encontré y probé otro proveedor que ofrece el mismo checkpoint DeepSeek-V4-Flash-0731 a precios cerca de un 45% inferiores incluso a las antiguas tarifas de DeepSeek.

DeepSeekRunwareAPI de LLMInfraestructura de IAModelos open-weight

La mañana del 17 de agosto abrí las estadísticas de uso de mi API y, al principio, pensé que me había equivocado en algo.

DeepSeek estaba consumiendo dinero aproximadamente cinco veces más rápido de lo habitual.

Sabía que iba a haber un cambio de precios. DeepSeek lo había anunciado unos días antes, pero mentalmente lo había archivado como una subida normal: quizá un 20%, un 50%, tal vez el doble.

No esperaba algo así.

No había ningún error de facturación. Las nuevas tarifas habían entrado en vigor. DeepSeek pasó oficialmente V4 Flash y V4 Pro a un esquema peak/off-peak desde las 16:00 UTC del 16 de agosto, que ya era 17 de agosto en China. Reuters había informado antes del cambio de que, según el modelo, el tipo de token y la hora, los aumentos irían del 50% al 1.100%. El momento exacto aparece en el registro de cambios de la API de DeepSeek.

Fue entonces cuando otra noticia sobre DeepSeek se volvió de repente mucho más interesante: los pesos del modelo son públicos. Si otras empresas pueden ejecutar el mismo modelo por su cuenta, ¿por qué tengo que comprar necesariamente la inferencia directamente a DeepSeek?

Cuánto costaba DeepSeek antes y cuánto cuesta ahora

Antes del cambio, DeepSeek V4 Flash costaba:

DeepSeek V4 FlashPrecio antiguo por 1M de tokens
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

Esas cifras siguen visibles en una versión anterior de la página de precios de DeepSeek, y Reuters citó las mismas tarifas el 3 de agosto.

El deepseek-v4-flash oficial, correspondiente a DeepSeek-V4-Flash-0731, cuesta ahora:

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

Los periodos peak son de 01:00 a 04:00 UTC y de 06:00 a 10:00 UTC, según la página actual de precios de DeepSeek.

Por tanto, mi observación de que el gasto era aproximadamente cinco veces mayor no significa que cada categoría de tokens haya subido exactamente cinco veces. Frente al precio antiguo:

  • el input con cache miss en peak pasó de $0.14 a $0.44, es decir, 3.14×;
  • el output pasó de $0.28 a $1.32, es decir, 4.71×;
  • el cache hit pasó de $0.0028 a $0.014, exactamente .

En un workload que genera mucho output, un aumento real de la factura cercano a cinco veces es perfectamente plausible.

Primero busqué otro vendedor del mismo modelo, no otro modelo

Podía haber abandonado DeepSeek sin más. Hoy existen Qwen, GLM, Kimi, MiniMax, Mistral y muchos otros LLM.

Pero cambiar de modelo introduce otra variable. Hay que volver a comprobar respuestas, compatibilidad de prompts, longitud de generación, comportamiento con contextos largos, parámetros de sampling y más.

Quería probar primero una idea más sencilla.

¿Puedo conservar DeepSeek V4 Flash y dejar de comprar la inferencia a DeepSeek?

Aquí conviene precisar la terminología. DeepSeek no publicó simplemente el «código fuente de la red neuronal» como un desarrollador publica el árbol de fuentes de una aplicación. Es más exacto decir que publicó los pesos del modelo y los materiales necesarios para ejecutarlos.

El repositorio oficial deepseek-ai/DeepSeek-V4-Flash-0731 está disponible públicamente en Hugging Face. El repositorio y los pesos usan la licencia MIT, y DeepSeek incluso muestra un ejemplo de ejecución con vLLM en un nodo con cuatro GB300.

Eso cambia por completo la economía. Un proveedor externo no necesita necesariamente comprar tokens a DeepSeek y revenderlos con margen. Puede ejecutar los pesos abiertos en su propia infraestructura y vender cómputo sobre su propio hardware.

Por supuesto, decir «ejecuta DeepSeek localmente» hace que la tarea parezca mucho más fácil de lo que es. El repositorio 0731 ocupa unos 167 GB y el ejemplo oficial de deployment utiliza cuatro GB300. Esto no es un docker compose up en un VPS de $20. Los archivos están disponibles en la página de archivos del modelo.

Para una empresa de inferencia con un clúster de GPU, sin embargo, el problema es distinto. La licencia deja de ser la barrera principal; quedan el hardware, la electricidad, la utilización de GPU, batching, el software stack y la eficiencia de inferencia.

Encontré Runware

Después de buscar bastante, Runware fue una de las opciones más interesantes que encontré.

¿Cómo encontré Runware? Con mi forma favorita de investigar. Primero pedí a una IA que escribiera un prompt detallado para buscar el proveedor de inferencia más barato y razonable para este modelo exacto. Después ejecuté aproximadamente 15–20 búsquedas separadas con ese prompt, reuní todos los resultados, los volqué en un único chat final y pedí que comparara los candidatos y señalara el más fuerte. Solo entonces revisé manualmente al ganador: página del modelo, precios, documentación y la propia API.

La IA me ayudó a ampliar la búsqueda, pero no tomó la decisión final por mí. Runware pasó mi revisión manual, lo conecté personalmente y la recomendación de este artículo se basa en esa prueba.

Ofrece actualmente el checkpoint exacto DeepSeek-V4-Flash-0731 con contexto de 1M, no un modelo anónimo «compatible con DeepSeek». Su página del modelo muestra estos precios:

RunwarePrecio por 1M de tokens
Input$0.076
Cached input$0.014
Output$0.153

Al principio pensé que estaba leyendo mal el decimal.

Pero la comparación más útil no es con los nuevos precios caros de DeepSeek, sino con los antiguos, que ya parecían muy bajos.

El input antiguo de DeepSeek costaba $0.14. Runware cobra $0.076. Runware es aproximadamente un 45.7% más barato, mientras que el precio antiguo de DeepSeek era unas 1.84× mayor.

El output antiguo costaba $0.28. Runware cobra $0.153. Runware es aproximadamente un 45.4% más barato, y el antiguo DeepSeek era unas 1.83× más caro.

Después de una gran subida de precios encontré una API de un tercero que sirve el mismo checkpoint V4 Flash 0731 y que no solo es más barata que el nuevo DeepSeek: cuesta casi la mitad que el antiguo DeepSeek barato.

Frente a la tarifa oficial actual, la diferencia es todavía mayor. En off-peak, Runware es aproximadamente 2.9× más barato en input con cache miss y 4.3× más barato en output. En peak, las diferencias son de aproximadamente 5.8× y 8.6×.

Hay una excepción importante: los cache hits baratos. DeepSeek cobra actualmente $0.007/M por cached input en off-peak, mientras Runware cobra $0.014/M. Un workload dominado por cache hits no puede compararse solo con las tarifas normales de input y output.

Un precio bajo no sirve de nada si la API no funciona

Una tabla de precios no me basta. Una LLM API a $0.000001 por request es inútil si falla la mitad de las solicitudes.

Así que conecté Runware y empecé a enviar requests reales.

Conservé dos snapshots del usage dashboard. El primero mostraba:

790 requests
56 success
734 errors

Por sí solo, eso se ve fatal. Más tarde, el dashboard mostraba:

1,570 requests
836 success
734 errors

Entre ambas mediciones, los contadores cambiaron exactamente así:

+780 requests
+780 successful
+0 new errors

No considero esto una prueba de 99.999% de uptime. No demuestra nada parecido, y esos dos snapshots tampoco explican la causa de los 734 errores iniciales.

Lo que sí puedo afirmar es más limitado: durante los siguientes 780 requests, el contador de éxitos aumentó en 780 mientras el de errores no cambió.

La API también fue rápida en esa ventana de prueba. En la parte visible del log, la mayoría de las llamadas exitosas terminó en fracciones de segundo o alrededor de 1.5 segundos. Los requests cortos que podía ver costaban a menudo entre $0.000005 y $0.000018. Tras cientos de llamadas exitosas, el dashboard seguía mostrando un gasto total de aproximadamente un centavo.

Ahí Runware dejó de ser para mí una simple fila de una tabla comparativa. Había conectado la API de verdad, generaba respuestas y el tráfico de prueba costaba prácticamente nada.

Esto no es publicidad — y solo llevo un día probando Runware

Quiero dejarlo explícito porque una sección positiva sobre un único proveedor puede parecer fácilmente contenido patrocinado. No lo es. Runware no se puso en contacto conmigo y yo tampoco me puse en contacto con Runware. Nadie de la empresa me pidió que escribiera este artículo.

Además, solo llevo un día usando el servicio. Dentro de una semana o un mes podría abandonarlo si aparecen problemas de fiabilidad, calidad de respuesta, precios o cualquier otro aspecto. Esto no es un veredicto a largo plazo.

Me fui inmediatamente de la API oficial y cara de DeepSeek porque no quería seguir quemando dinero con las nuevas tarifas mientras evaluaba alternativas. Simplemente moví el tráfico y empecé a probar Runware de inmediato.

Por ahora estoy muy satisfecho con la decisión. Cuando estaba terminando este artículo, Runware ya había procesado 1.000 solicitudes de IA con éxito para mí. Eso sigue sin demostrar el uptime futuro ni que funcione a cualquier escala, pero sí basta para afirmar que no es un proveedor que solo vi en una tabla de precios: lo estoy usando de verdad.

Por eso mi recomendación es deliberadamente limitada: he comprobado Runware personalmente, hoy me funciona bien y, por el momento, sí recomiendo probarlo. Si el servicio cambia, mi opinión también puede cambiar.

DeepSeek quizá creó su propio competidor de precios

A partir de aquí hablo de interpretación, no de un hecho observado directamente.

DeepSeek se ha colocado en una posición empresarial inusual. Hizo dos cosas: lanzó un modelo muy competitivo y permitió que el mercado pudiera ejecutarlo de forma independiente.

Mientras la API oficial era extremadamente barata, el conflicto apenas se notaba. ¿Para qué buscar el clúster de GPU de otra empresa si DeepSeek vendía inferencia a $0.14/$0.28?

Después de la subida de precios, la cuenta cambia. Si la API oficial cuesta $0.44 de input y $1.32 de output en peak, mientras un proveedor independiente ofrece el mismo checkpoint público a $0.076/$0.153, el incentivo económico para probar la alternativa se vuelve muy fuerte.

No se trata de un loophole accidental. La licencia MIT de los pesos publicados permite un uso amplio, incluido el comercial, y el repositorio oficial contiene instrucciones para ejecutar el modelo por cuenta propia.

Por eso no describiría Runware simplemente como un «revendedor de tokens de DeepSeek». Una imagen más precisa es:

DeepSeek
    │
    ├── API oficial de DeepSeek
    │
    └── pesos abiertos de DeepSeek V4 Flash
                   │
                   ├── infraestructura de Runware
                   ├── otros proveedores de inferencia
                   └── tu propio clúster de GPU

El mismo modelo ya no está ligado a un único vendedor de inferencia.

¿Fue un error empresarial publicar los pesos?

No lo afirmaría como un hecho.

Sería demasiado simplista decir que DeepSeek abrió el modelo, los competidores pueden venderlo más barato y, por tanto, DeepSeek necesariamente perderá dinero. No conocemos la economía interna de la empresa.

Una estrategia open-weight puede aportar otras ventajas:

  • mayor distribución del modelo;
  • más integraciones;
  • más influencia sobre el ecosistema;
  • la posibilidad de convertirse en estándar de facto en productos de terceros;
  • más desarrolladores;
  • adopción empresarial;
  • popularidad en investigación;
  • presión sobre los competidores.

Reuters también señaló el énfasis de los desarrolladores chinos en enfoques open-weight para conseguir una amplia adopción entre desarrolladores en su cobertura del mercado chino de IA.

Por eso me parece demasiado pronto llamar a la decisión un error empresarial. Sí me parece razonable una conclusión más acotada:

Al abrir los pesos, DeepSeek renunció voluntariamente al monopolio sobre la inferencia de su propio modelo.

Cuando la API oficial se encarece mucho, las consecuencias de esa decisión se vuelven más visibles. DeepSeek ya no compite solo con Qwen, OpenAI, Anthropic o Moonshot. En cierto modo también compite con empresas que venden inferencia de su propio modelo abierto.

Para quien compra APIs, esto es excelente. Para la estrategia de monetización, es mucho más complejo.

Por qué no alojo DeepSeek por mi cuenta

La siguiente idea es obvia: si otras empresas pueden ejecutar DeepSeek y vender inferencia, ¿por qué no hacerlo yo mismo?

Porque hay una enorme diferencia entre «el modelo se puede descargar gratis» y «la inferencia es gratis».

Los pesos se descargan. Las GPU no.

Hay que comprar o alquilar hardware caro, disponer de suficiente VRAM, cargar un checkpoint enorme, configurar el motor de inferencia, batching, KV cache, monitoring, scaling y redundancy, y además tener tráfico suficiente para que las GPU no estén ociosas la mayor parte del tiempo.

El ejemplo oficial de DeepSeek para V4 Flash 0731 utiliza un nodo con cuatro GB300.

Para un proveedor especializado, esa inversión puede tener sentido porque reparte el coste de la infraestructura entre muchos clientes. Para un solo desarrollador, pagar $0.076 por cada millón de tokens de input puede ser mucho más racional que invertir una gran cantidad en GPU y luego intentar mantenerlas ocupadas.

Por ahora prefiero comprar inferencia. Pero entiendo mucho mejor qué es exactamente lo que estoy comprando.

La principal lección que me dejó aquella mañana

Al comenzar el día veía DeepSeek como una API SaaS normal: existe un modelo DeepSeek, así que DeepSeek decide cuánto cuesta usarlo.

Al terminar el día, mi modelo mental era distinto: existe un checkpoint de DeepSeek y existe un mercado competitivo de empresas dispuestas a ejecutar ese checkpoint por mí.

Son mercados fundamentalmente distintos.

Con un modelo cerrado, el precio de la API está controlado en gran medida por el propietario del modelo. Con pesos abiertos bajo una licencia permisiva, el precio de la inferencia también queda determinado por la competencia entre proveedores de infraestructura.

El 17 de agosto esa diferencia se volvió muy concreta para mí. El antiguo DeepSeek V4 Flash costaba $0.14 de input y $0.28 de output. El nuevo precio oficial alcanza $0.44/$1.32 en peak. Runware ofrece actualmente DeepSeek-V4-Flash-0731 por $0.076/$0.153.

He probado esa API personalmente y funcionó con el tráfico que le envié.

¿Seguirán iguales esos precios dentro de un mes? No lo sé. ¿Aguantará el mismo proveedor cualquier escala y cualquier perfil de tráfico? Tampoco lo he demostrado.

Pero una cosa sí cambió para mí: después de esta subida ya no doy por hecho que la API oficial del creador de un modelo open-weight sea automáticamente el mejor lugar para comprar inferencia.

Ahora mi primer paso es comprobar quién más puede ejecutar los mismos pesos y cuánto cobra por hacerlo.