Утром 17 августа я открыл статистику использования API и сначала подумал, что где-то ошибся.
DeepSeek начал расходовать деньги примерно в пять раз быстрее, чем обычно.
Я знал, что цены изменятся. DeepSeek предупредил об этом за несколько дней, но я мысленно отнёс новость к обычному повышению: 20%, 50%, может быть, в два раза.
Но не настолько.
Ошибки в биллинге не было. Новые тарифы действительно вступили в силу. DeepSeek официально перевёл V4 Flash и V4 Pro на peak/off-peak pricing с 16:00 UTC 16 августа — в Китае это уже было 17 августа. Reuters до изменения сообщал, что в зависимости от модели, типа токена и времени суток рост составит от 50% до 1,100%. Время изменения указано в change log DeepSeek API.
Именно тогда другая новость про DeepSeek внезапно стала гораздо интереснее: веса модели доступны публично. Если другие компании могут самостоятельно запускать ту же модель, почему inference обязательно покупать непосредственно у DeepSeek?
Сколько DeepSeek стоил раньше и сколько стоит сейчас
До изменения тарифов DeepSeek V4 Flash стоил:
| DeepSeek V4 Flash | Старая цена за 1M токенов |
|---|---|
| Input, cache miss | $0.14 |
| Cached input | $0.0028 |
| Output | $0.28 |
Эти цифры сохранились на старой странице тарифов DeepSeek, а Reuters приводил те же цены 3 августа.
Теперь официальный deepseek-v4-flash, соответствующий DeepSeek-V4-Flash-0731, стоит:
| Off-peak | Peak | |
|---|---|---|
| Input, cache miss | $0.22 | $0.44 |
| Cached input | $0.007 | $0.014 |
| Output | $0.66 | $1.32 |
Peak действует с 01:00 до 04:00 UTC и с 06:00 до 10:00 UTC согласно текущей странице цен DeepSeek.
Поэтому моё наблюдение «расходы выросли примерно в пять раз» не означает, что каждая категория токенов подорожала ровно в пять раз. По сравнению со старой ценой:
- peak cache-miss input вырос с $0.14 до $0.44, то есть в 3.14×;
- output — с $0.28 до $1.32, то есть в 4.71×;
- cache hit — с $0.0028 до $0.014, ровно в 5×.
Для workload с большим объёмом генерации почти пятикратный рост реального счёта вполне возможен.
Сначала я искал не другую модель, а другого продавца той же модели
Я мог просто отказаться от DeepSeek. Сейчас есть Qwen, GLM, Kimi, MiniMax, Mistral и много других LLM.
Но смена модели добавляет новую переменную. Нужно заново проверять ответы, prompt compatibility, длину генерации, поведение на длинном контексте, sampling parameters и другие детали.
Сначала мне хотелось проверить более простой вариант.
Можно ли оставить DeepSeek V4 Flash, но перестать покупать inference у DeepSeek?
Здесь важна точная терминология. DeepSeek не просто «выложил исходники нейросети» в том смысле, как разработчик публикует source tree приложения. Точнее сказать, что компания опубликовала веса модели и материалы, необходимые для их запуска.
Официальный репозиторий deepseek-ai/DeepSeek-V4-Flash-0731 доступен публично на Hugging Face. Репозиторий и веса используют MIT License, а DeepSeek даже показывает пример запуска модели через vLLM на одном node с четырьмя GB300.
Это полностью меняет экономику. Стороннему провайдеру не обязательно покупать токены у DeepSeek и перепродавать их с наценкой. Он может запустить открытые веса на собственной инфраструктуре и продавать вычисления на собственном железе.
Конечно, фраза «просто подними DeepSeek локально» сильно упрощает задачу. Репозиторий 0731 весит около 167 GB, а официальный deployment-пример использует четыре GB300. Это не docker compose up на VPS за $20. Файлы доступны на странице файлов модели.
Для inference-компании с GPU cluster ситуация другая. Лицензия перестаёт быть главным барьером; остаются hardware, электричество, GPU utilization, batching, software stack и эффективность inference.
Я нашёл Runware
После довольно долгого поиска одним из самых интересных вариантов оказался Runware.
А нашёл я Runware своим любимым способом. Сначала попросил ИИ написать подробный промпт для поиска самого дешёвого, но нормального inference-провайдера именно для этой модели. Затем запустил примерно 15–20 отдельных поисков с этим промптом, собрал все результаты, закинул их в один финальный чат и попросил сравнить кандидатов и выбрать сильнейший вариант. И только после этого начал проверять победителя руками: страницу модели, цены, документацию и сам API.
ИИ здесь помог расширить поиск, но финальное решение за меня не принимал. Runware прошёл мою ручную проверку, я сам его подключил, и рекомендация в этой статье основана уже на моём собственном тесте.
Сейчас у него доступен именно checkpoint DeepSeek-V4-Flash-0731 с контекстом 1M, а не безымянная «DeepSeek-compatible» модель. На странице модели указаны цены:
| Runware | Цена за 1M токенов |
|---|---|
| Input | $0.076 |
| Cached input | $0.014 |
| Output | $0.153 |
Сначала я решил, что неправильно прочитал десятичную точку.
Но самое интересное сравнение — не с новыми дорогими ценами DeepSeek, а со старыми, которые и так казались очень низкими.
Старый input у DeepSeek стоил $0.14. У Runware — $0.076. То есть Runware примерно на 45.7% дешевле, а старый DeepSeek был примерно в 1.84× дороже.
Старый output стоил $0.28. У Runware — $0.153. Runware примерно на 45.4% дешевле, а старый DeepSeek был примерно в 1.83× дороже.
После большого повышения цен я нашёл сторонний API с тем же checkpoint V4 Flash 0731, который не просто дешевле нового DeepSeek, а почти вдвое дешевле старого дешёвого DeepSeek.
По сравнению с сегодняшним официальным тарифом разрыв ещё больше. В off-peak Runware примерно в 2.9× дешевле по cache-miss input и в 4.3× дешевле по output. В peak разница составляет примерно 5.8× и 8.6×.
Есть важное исключение: дешёвый cache hit. DeepSeek сейчас берёт $0.007/M за cached input в off-peak, тогда как Runware — $0.014/M. Поэтому workload с очень высокой долей cache hits нельзя сравнивать только по обычным ценам input/output.
Низкая цена ничего не значит, если API не работает
Одной таблицы с ценами мне недостаточно. LLM API по $0.000001 за request бесполезен, если половина запросов падает.
Поэтому я подключил Runware и начал отправлять реальные requests.
У меня сохранились два snapshot usage dashboard. Первый показывал:
790 requests
56 success
734 errors
Само по себе это выглядит ужасно. Позже dashboard показывал:
1,570 requests
836 success
734 errors
То есть между двумя замерами счётчики изменились ровно на:
+780 requests
+780 successful
+0 new errors
Я не считаю это доказательством 99.999% uptime. Эти данные ничего подобного не доказывают, и по двум snapshot нельзя установить причину первых 734 ошибок.
Я могу утверждать только более узкую вещь: на следующих 780 requests счётчик successful вырос на 780, а счётчик errors вообще не изменился.
В этом тестовом окне API был ещё и быстрым. В видимой части log большинство успешных calls занимали от долей секунды до примерно 1.5 секунды. Стоимость коротких requests, которые я видел, часто составляла около $0.000005–$0.000018. После сотен успешных вызовов dashboard по-прежнему показывал всего около одного цента расходов.
После этого Runware перестал быть для меня просто строкой в сравнительной таблице. Я действительно подключил API, он генерировал ответы, а тестовый трафик стоил практически ничего.
Это не реклама — и Runware я тестирую всего один день
Хочу отдельно это зафиксировать, потому что позитивный рассказ об одном провайдере легко принять за рекламную интеграцию. Это не она. Runware мне не писал, я Runware тоже не писал, и никто оттуда не просил меня делать эту статью.
Кроме того, я пользуюсь сервисом всего один день. Через неделю или месяц я вполне могу от него уйти, если вылезут проблемы с надёжностью, качеством ответов, ценами или чем-то ещё. Это не долгосрочный вердикт.
С официального дорогого DeepSeek я ушёл сразу, потому что не хотел продолжать сливать деньги по новым тарифам, пока ищу альтернативу. Я просто перевёл трафик и начал тестировать Runware сразу же.
Пока я этим решением очень доволен. К моменту, когда я дописывал статью, через Runware уже прошло 1,000 успешных AI-запросов. Это по-прежнему не доказывает будущий uptime и не гарантирует работу на любом масштабе, но для меня этого достаточно, чтобы сказать: это не провайдер, которого я просто увидел в прайс-листе, — я реально им пользуюсь.
Поэтому и рекомендация у меня ограниченная и честная: я сам проверил Runware, сегодня он у меня работает хорошо, и сейчас я действительно советую его попробовать. Если сервис изменится, моё мнение тоже может измениться.
Возможно, DeepSeek сам создал себе ценового конкурента
Отсюда начинается уже моя интерпретация, а не непосредственно наблюдаемый факт.
DeepSeek оказался в необычной бизнес-позиции. Компания выпустила очень конкурентоспособную модель и одновременно дала рынку возможность запускать её независимо.
Пока официальный DeepSeek API был очень дешёвым, этот конфликт почти не замечался. Зачем искать чужой GPU cluster, если сам DeepSeek продавал inference по $0.14/$0.28?
После повышения цен расчёт меняется. Если официальный API в peak стоит $0.44 input и $1.32 output, а независимый провайдер предлагает тот же публичный checkpoint по $0.076/$0.153, экономический стимул попробовать альтернативу становится очень сильным.
Это не случайный loophole. MIT License опубликованных weights разрешает широкое использование, включая коммерческое, а официальный репозиторий содержит инструкции для self-hosting.
Поэтому я бы не называл Runware просто «перепродавцом токенов DeepSeek». Точнее представить рынок так:
DeepSeek
│
├── официальный DeepSeek API
│
└── открытые веса DeepSeek V4 Flash
│
├── инфраструктура Runware
├── другие inference-провайдеры
└── собственный GPU clusterОдна и та же модель больше не привязана к одному продавцу inference.
Было ли открытие весов бизнес-ошибкой?
Я бы не утверждал это как факт.
Слишком просто сказать: DeepSeek открыл модель, конкуренты теперь могут продавать её дешевле, значит DeepSeek обязательно потеряет деньги. Мы не знаем внутреннюю экономику компании.
У open-weight стратегии есть и другие возможные преимущества:
- более широкое распространение модели;
- больше интеграций;
- большее влияние на экосистему;
- шанс стать de facto standard в сторонних продуктах;
- больше разработчиков;
- enterprise adoption;
- исследовательская популярность;
- давление на конкурентов.
Reuters также отмечал ориентацию китайских разработчиков моделей на open-weight подход ради широкого распространения среди разработчиков в своём материале о китайском AI-рынке.
Поэтому называть решение бизнес-ошибкой пока рано. Но более узкий вывод мне кажется обоснованным:
Открывая веса, DeepSeek добровольно отказался от монополии на inference собственной модели.
Когда официальный API резко дорожает, последствия этого решения становятся заметнее. DeepSeek начинает конкурировать не только с Qwen, OpenAI, Anthropic или Moonshot, но в определённом смысле и с компаниями, которые продают inference его же открытой модели.
Для покупателей API это отлично. Для стратегии монетизации — гораздо сложнее.
Почему я не поднимаю DeepSeek самостоятельно
Следующая мысль очевидна: если сторонние компании могут запускать DeepSeek и продавать inference, почему бы не сделать то же самое самому?
Потому что между «модель можно скачать бесплатно» и «inference бесплатен» огромная разница.
Weights можно скачать. GPU — нет.
Нужно покупать или арендовать дорогое hardware, иметь достаточно VRAM, загрузить огромный checkpoint, настроить inference engine, batching, KV cache, monitoring, scaling и redundancy, а затем обеспечить достаточно трафика, чтобы GPU не простаивали большую часть времени.
Официальный пример DeepSeek для V4 Flash 0731 использует один node с четырьмя GB300.
Для специализированного inference-провайдера такая инвестиция может быть оправдана, потому что стоимость инфраструктуры распределяется между большим количеством клиентов. Для одного разработчика платить $0.076 за миллион input tokens может быть гораздо рациональнее, чем вкладывать большую сумму в GPU, а затем пытаться поддерживать высокую utilization.
Пока я предпочитаю покупать inference. Но теперь намного лучше понимаю, что именно покупаю.
Главный вывод из того утра
В начале дня я смотрел на DeepSeek как на обычный SaaS API: есть модель DeepSeek, значит DeepSeek определяет, сколько стоит её использование.
К вечеру моя модель рынка изменилась: есть checkpoint DeepSeek, и есть конкурентный рынок компаний, готовых запускать этот checkpoint для меня.
Это принципиально разные рынки.
У закрытой модели цена API во многом контролируется владельцем модели. При открытых weights с permissive license цена inference формируется ещё и конкуренцией инфраструктурных провайдеров.
17 августа эта разница стала для меня очень конкретной. Старый DeepSeek V4 Flash стоил $0.14 input и $0.28 output. Новый официальный DeepSeek доходит до $0.44/$1.32 в peak. Runware сейчас предлагает DeepSeek-V4-Flash-0731 по $0.076/$0.153.
Я сам протестировал этот API, и он работал на том трафике, который я отправил.
Останутся ли эти цены такими же через месяц? Не знаю. Выдержит ли тот же provider любой масштаб и любой профиль трафика? Этого я тоже не доказал.
Но одно для меня изменилось: после этого повышения цен я больше не считаю официальный API создателя open-weight модели автоматически лучшим местом для покупки inference.
Теперь первым делом я проверяю, кто ещё умеет запускать те же weights и сколько он за это просит.