Назад в блог
17 августа 2026 г.Sergei Solod10 мин чтения

DeepSeek поднял цены — тот же V4 Flash я нашёл дешевле старого тарифа

17 августа мои расходы на DeepSeek API внезапно выросли примерно в пять раз. После этого я нашёл и протестировал другого провайдера с тем же checkpoint DeepSeek-V4-Flash-0731, где текущие цены примерно на 45% ниже даже старых тарифов DeepSeek.

DeepSeekRunwareLLM APIAI-инфраструктураOpen-weight модели

Утром 17 августа я открыл статистику использования API и сначала подумал, что где-то ошибся.

DeepSeek начал расходовать деньги примерно в пять раз быстрее, чем обычно.

Я знал, что цены изменятся. DeepSeek предупредил об этом за несколько дней, но я мысленно отнёс новость к обычному повышению: 20%, 50%, может быть, в два раза.

Но не настолько.

Ошибки в биллинге не было. Новые тарифы действительно вступили в силу. DeepSeek официально перевёл V4 Flash и V4 Pro на peak/off-peak pricing с 16:00 UTC 16 августа — в Китае это уже было 17 августа. Reuters до изменения сообщал, что в зависимости от модели, типа токена и времени суток рост составит от 50% до 1,100%. Время изменения указано в change log DeepSeek API.

Именно тогда другая новость про DeepSeek внезапно стала гораздо интереснее: веса модели доступны публично. Если другие компании могут самостоятельно запускать ту же модель, почему inference обязательно покупать непосредственно у DeepSeek?

Сколько DeepSeek стоил раньше и сколько стоит сейчас

До изменения тарифов DeepSeek V4 Flash стоил:

DeepSeek V4 FlashСтарая цена за 1M токенов
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

Эти цифры сохранились на старой странице тарифов DeepSeek, а Reuters приводил те же цены 3 августа.

Теперь официальный deepseek-v4-flash, соответствующий DeepSeek-V4-Flash-0731, стоит:

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

Peak действует с 01:00 до 04:00 UTC и с 06:00 до 10:00 UTC согласно текущей странице цен DeepSeek.

Поэтому моё наблюдение «расходы выросли примерно в пять раз» не означает, что каждая категория токенов подорожала ровно в пять раз. По сравнению со старой ценой:

  • peak cache-miss input вырос с $0.14 до $0.44, то есть в 3.14×;
  • output — с $0.28 до $1.32, то есть в 4.71×;
  • cache hit — с $0.0028 до $0.014, ровно в .

Для workload с большим объёмом генерации почти пятикратный рост реального счёта вполне возможен.

Сначала я искал не другую модель, а другого продавца той же модели

Я мог просто отказаться от DeepSeek. Сейчас есть Qwen, GLM, Kimi, MiniMax, Mistral и много других LLM.

Но смена модели добавляет новую переменную. Нужно заново проверять ответы, prompt compatibility, длину генерации, поведение на длинном контексте, sampling parameters и другие детали.

Сначала мне хотелось проверить более простой вариант.

Можно ли оставить DeepSeek V4 Flash, но перестать покупать inference у DeepSeek?

Здесь важна точная терминология. DeepSeek не просто «выложил исходники нейросети» в том смысле, как разработчик публикует source tree приложения. Точнее сказать, что компания опубликовала веса модели и материалы, необходимые для их запуска.

Официальный репозиторий deepseek-ai/DeepSeek-V4-Flash-0731 доступен публично на Hugging Face. Репозиторий и веса используют MIT License, а DeepSeek даже показывает пример запуска модели через vLLM на одном node с четырьмя GB300.

Это полностью меняет экономику. Стороннему провайдеру не обязательно покупать токены у DeepSeek и перепродавать их с наценкой. Он может запустить открытые веса на собственной инфраструктуре и продавать вычисления на собственном железе.

Конечно, фраза «просто подними DeepSeek локально» сильно упрощает задачу. Репозиторий 0731 весит около 167 GB, а официальный deployment-пример использует четыре GB300. Это не docker compose up на VPS за $20. Файлы доступны на странице файлов модели.

Для inference-компании с GPU cluster ситуация другая. Лицензия перестаёт быть главным барьером; остаются hardware, электричество, GPU utilization, batching, software stack и эффективность inference.

Я нашёл Runware

После довольно долгого поиска одним из самых интересных вариантов оказался Runware.

А нашёл я Runware своим любимым способом. Сначала попросил ИИ написать подробный промпт для поиска самого дешёвого, но нормального inference-провайдера именно для этой модели. Затем запустил примерно 15–20 отдельных поисков с этим промптом, собрал все результаты, закинул их в один финальный чат и попросил сравнить кандидатов и выбрать сильнейший вариант. И только после этого начал проверять победителя руками: страницу модели, цены, документацию и сам API.

ИИ здесь помог расширить поиск, но финальное решение за меня не принимал. Runware прошёл мою ручную проверку, я сам его подключил, и рекомендация в этой статье основана уже на моём собственном тесте.

Сейчас у него доступен именно checkpoint DeepSeek-V4-Flash-0731 с контекстом 1M, а не безымянная «DeepSeek-compatible» модель. На странице модели указаны цены:

RunwareЦена за 1M токенов
Input$0.076
Cached input$0.014
Output$0.153

Сначала я решил, что неправильно прочитал десятичную точку.

Но самое интересное сравнение — не с новыми дорогими ценами DeepSeek, а со старыми, которые и так казались очень низкими.

Старый input у DeepSeek стоил $0.14. У Runware — $0.076. То есть Runware примерно на 45.7% дешевле, а старый DeepSeek был примерно в 1.84× дороже.

Старый output стоил $0.28. У Runware — $0.153. Runware примерно на 45.4% дешевле, а старый DeepSeek был примерно в 1.83× дороже.

После большого повышения цен я нашёл сторонний API с тем же checkpoint V4 Flash 0731, который не просто дешевле нового DeepSeek, а почти вдвое дешевле старого дешёвого DeepSeek.

По сравнению с сегодняшним официальным тарифом разрыв ещё больше. В off-peak Runware примерно в 2.9× дешевле по cache-miss input и в 4.3× дешевле по output. В peak разница составляет примерно 5.8× и 8.6×.

Есть важное исключение: дешёвый cache hit. DeepSeek сейчас берёт $0.007/M за cached input в off-peak, тогда как Runware — $0.014/M. Поэтому workload с очень высокой долей cache hits нельзя сравнивать только по обычным ценам input/output.

Низкая цена ничего не значит, если API не работает

Одной таблицы с ценами мне недостаточно. LLM API по $0.000001 за request бесполезен, если половина запросов падает.

Поэтому я подключил Runware и начал отправлять реальные requests.

У меня сохранились два snapshot usage dashboard. Первый показывал:

790 requests
56 success
734 errors

Само по себе это выглядит ужасно. Позже dashboard показывал:

1,570 requests
836 success
734 errors

То есть между двумя замерами счётчики изменились ровно на:

+780 requests
+780 successful
+0 new errors

Я не считаю это доказательством 99.999% uptime. Эти данные ничего подобного не доказывают, и по двум snapshot нельзя установить причину первых 734 ошибок.

Я могу утверждать только более узкую вещь: на следующих 780 requests счётчик successful вырос на 780, а счётчик errors вообще не изменился.

В этом тестовом окне API был ещё и быстрым. В видимой части log большинство успешных calls занимали от долей секунды до примерно 1.5 секунды. Стоимость коротких requests, которые я видел, часто составляла около $0.000005–$0.000018. После сотен успешных вызовов dashboard по-прежнему показывал всего около одного цента расходов.

После этого Runware перестал быть для меня просто строкой в сравнительной таблице. Я действительно подключил API, он генерировал ответы, а тестовый трафик стоил практически ничего.

Это не реклама — и Runware я тестирую всего один день

Хочу отдельно это зафиксировать, потому что позитивный рассказ об одном провайдере легко принять за рекламную интеграцию. Это не она. Runware мне не писал, я Runware тоже не писал, и никто оттуда не просил меня делать эту статью.

Кроме того, я пользуюсь сервисом всего один день. Через неделю или месяц я вполне могу от него уйти, если вылезут проблемы с надёжностью, качеством ответов, ценами или чем-то ещё. Это не долгосрочный вердикт.

С официального дорогого DeepSeek я ушёл сразу, потому что не хотел продолжать сливать деньги по новым тарифам, пока ищу альтернативу. Я просто перевёл трафик и начал тестировать Runware сразу же.

Пока я этим решением очень доволен. К моменту, когда я дописывал статью, через Runware уже прошло 1,000 успешных AI-запросов. Это по-прежнему не доказывает будущий uptime и не гарантирует работу на любом масштабе, но для меня этого достаточно, чтобы сказать: это не провайдер, которого я просто увидел в прайс-листе, — я реально им пользуюсь.

Поэтому и рекомендация у меня ограниченная и честная: я сам проверил Runware, сегодня он у меня работает хорошо, и сейчас я действительно советую его попробовать. Если сервис изменится, моё мнение тоже может измениться.

Возможно, DeepSeek сам создал себе ценового конкурента

Отсюда начинается уже моя интерпретация, а не непосредственно наблюдаемый факт.

DeepSeek оказался в необычной бизнес-позиции. Компания выпустила очень конкурентоспособную модель и одновременно дала рынку возможность запускать её независимо.

Пока официальный DeepSeek API был очень дешёвым, этот конфликт почти не замечался. Зачем искать чужой GPU cluster, если сам DeepSeek продавал inference по $0.14/$0.28?

После повышения цен расчёт меняется. Если официальный API в peak стоит $0.44 input и $1.32 output, а независимый провайдер предлагает тот же публичный checkpoint по $0.076/$0.153, экономический стимул попробовать альтернативу становится очень сильным.

Это не случайный loophole. MIT License опубликованных weights разрешает широкое использование, включая коммерческое, а официальный репозиторий содержит инструкции для self-hosting.

Поэтому я бы не называл Runware просто «перепродавцом токенов DeepSeek». Точнее представить рынок так:

DeepSeek
    │
    ├── официальный DeepSeek API
    │
    └── открытые веса DeepSeek V4 Flash
                   │
                   ├── инфраструктура Runware
                   ├── другие inference-провайдеры
                   └── собственный GPU cluster

Одна и та же модель больше не привязана к одному продавцу inference.

Было ли открытие весов бизнес-ошибкой?

Я бы не утверждал это как факт.

Слишком просто сказать: DeepSeek открыл модель, конкуренты теперь могут продавать её дешевле, значит DeepSeek обязательно потеряет деньги. Мы не знаем внутреннюю экономику компании.

У open-weight стратегии есть и другие возможные преимущества:

  • более широкое распространение модели;
  • больше интеграций;
  • большее влияние на экосистему;
  • шанс стать de facto standard в сторонних продуктах;
  • больше разработчиков;
  • enterprise adoption;
  • исследовательская популярность;
  • давление на конкурентов.

Reuters также отмечал ориентацию китайских разработчиков моделей на open-weight подход ради широкого распространения среди разработчиков в своём материале о китайском AI-рынке.

Поэтому называть решение бизнес-ошибкой пока рано. Но более узкий вывод мне кажется обоснованным:

Открывая веса, DeepSeek добровольно отказался от монополии на inference собственной модели.

Когда официальный API резко дорожает, последствия этого решения становятся заметнее. DeepSeek начинает конкурировать не только с Qwen, OpenAI, Anthropic или Moonshot, но в определённом смысле и с компаниями, которые продают inference его же открытой модели.

Для покупателей API это отлично. Для стратегии монетизации — гораздо сложнее.

Почему я не поднимаю DeepSeek самостоятельно

Следующая мысль очевидна: если сторонние компании могут запускать DeepSeek и продавать inference, почему бы не сделать то же самое самому?

Потому что между «модель можно скачать бесплатно» и «inference бесплатен» огромная разница.

Weights можно скачать. GPU — нет.

Нужно покупать или арендовать дорогое hardware, иметь достаточно VRAM, загрузить огромный checkpoint, настроить inference engine, batching, KV cache, monitoring, scaling и redundancy, а затем обеспечить достаточно трафика, чтобы GPU не простаивали большую часть времени.

Официальный пример DeepSeek для V4 Flash 0731 использует один node с четырьмя GB300.

Для специализированного inference-провайдера такая инвестиция может быть оправдана, потому что стоимость инфраструктуры распределяется между большим количеством клиентов. Для одного разработчика платить $0.076 за миллион input tokens может быть гораздо рациональнее, чем вкладывать большую сумму в GPU, а затем пытаться поддерживать высокую utilization.

Пока я предпочитаю покупать inference. Но теперь намного лучше понимаю, что именно покупаю.

Главный вывод из того утра

В начале дня я смотрел на DeepSeek как на обычный SaaS API: есть модель DeepSeek, значит DeepSeek определяет, сколько стоит её использование.

К вечеру моя модель рынка изменилась: есть checkpoint DeepSeek, и есть конкурентный рынок компаний, готовых запускать этот checkpoint для меня.

Это принципиально разные рынки.

У закрытой модели цена API во многом контролируется владельцем модели. При открытых weights с permissive license цена inference формируется ещё и конкуренцией инфраструктурных провайдеров.

17 августа эта разница стала для меня очень конкретной. Старый DeepSeek V4 Flash стоил $0.14 input и $0.28 output. Новый официальный DeepSeek доходит до $0.44/$1.32 в peak. Runware сейчас предлагает DeepSeek-V4-Flash-0731 по $0.076/$0.153.

Я сам протестировал этот API, и он работал на том трафике, который я отправил.

Останутся ли эти цены такими же через месяц? Не знаю. Выдержит ли тот же provider любой масштаб и любой профиль трафика? Этого я тоже не доказал.

Но одно для меня изменилось: после этого повышения цен я больше не считаю официальный API создателя open-weight модели автоматически лучшим местом для покупки inference.

Теперь первым делом я проверяю, кто ещё умеет запускать те же weights и сколько он за это просит.