返回博客
2026年8月17日Sergei Solod10 分钟阅读

DeepSeek 涨价后,我找到了比旧价还便宜的同款 V4 Flash

8 月 17 日早上,我发现 DeepSeek API 的实际支出突然变成平时的大约五倍。随后我找到并实测了另一家提供同一 DeepSeek-V4-Flash-0731 checkpoint 的服务商,其当前价格甚至比 DeepSeek 的旧价格低约 45%。

DeepSeekRunwareLLM APIAI 基础设施开放权重模型

8 月 17 日早上,我打开 API 使用统计时,第一反应是自己哪里配置错了。

DeepSeek 花钱的速度大约变成了平时的五倍

我知道价格要调整。DeepSeek 几天前已经发过通知,但我一直把它当成一次普通涨价:20%、50%,最多也许翻倍。

结果远不止如此。

这并不是 billing bug。新价格确实已经生效。DeepSeek 从 8 月 16 日 16:00 UTC 起正式把 V4 Flash 和 V4 Pro 切换到 peak/off-peak pricing,当时中国时间已经是 8 月 17 日。Reuters 在调价前报道称,具体涨幅会根据 model、token 类型和使用时段不同,从 50% 到 1,100% 不等。生效时间可以在 DeepSeek API change log 中确认。

就在这时,DeepSeek 的另一条消息突然变得重要起来:model weights 是公开的。如果其他公司也能自行运行同一个 model,我为什么一定要直接向 DeepSeek 购买 inference?

DeepSeek 以前多少钱,现在多少钱

调价前,DeepSeek V4 Flash 的价格是:

DeepSeek V4 Flash旧价格 / 1M tokens
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

这些数字仍能在 DeepSeek 的旧版价格页面中看到,Reuters 在 8 月 3 日也引用过相同的价格。

现在,官方 deepseek-v4-flash,也就是对应 DeepSeek-V4-Flash-0731 的模型,价格变成:

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

根据 DeepSeek 当前价格页面,peak 时段为 01:00–04:00 UTC 和 06:00–10:00 UTC。

因此,我看到“实际支出大约变成五倍”,并不意味着每一种 token 都正好涨了五倍。与旧价相比:

  • peak cache-miss input 从 $0.14 涨到 $0.44,即 3.14×
  • output 从 $0.28 涨到 $1.32,即 4.71×
  • cache hit 从 $0.0028 涨到 $0.014,正好

对于 output 很多的 workload,实际账单接近五倍完全可能。

我先找的不是另一个 model,而是同一个 model 的另一个卖家

我当然可以直接放弃 DeepSeek。现在有 Qwen、GLM、Kimi、MiniMax、Mistral 等大量 LLM 可选。

但换 model 会引入新的变量。Responses、prompt compatibility、generation length、long-context behavior、sampling parameters 等都要重新验证。

所以我先想测试一个更简单的方案。

能不能继续使用 DeepSeek V4 Flash,只是不再从 DeepSeek 购买 inference?

这里需要把术语说准确。DeepSeek 并不是像开发者公开应用 source tree 那样,简单“公开了神经网络源码”。更准确的说法是,它公开了model weights 以及运行这些 weights 所需的相关材料

官方 deepseek-ai/DeepSeek-V4-Flash-0731 repository 已公开在 Hugging Face。Repository 和 weights 使用 MIT License,DeepSeek 甚至给出了通过 vLLM 在一个包含四块 GB300 的 node 上运行模型的示例。

这会彻底改变成本结构。第三方 provider 不一定需要先向 DeepSeek 购买 token 再加价转售。它可以把 open weights 部署到自己的 infrastructure 上,然后出售自己 hardware 上的 compute

当然,“本地跑一下 DeepSeek”听起来比现实简单得多。0731 repository 大约 167 GB,官方 deployment 示例使用四块 GB300。这不是在 $20 VPS 上执行一次 docker compose up。文件可以在 model file 页面查看。

但对有 GPU cluster 的 inference 公司来说,问题完全不同。License 不再是主要障碍,剩下的是 hardware、电力、GPU utilization、batching、software stack 和 inference efficiency。

我找到了 Runware

找了很久以后,Runware 成了最有意思的选项之一。

我是怎么找到 Runware 的?用的是我最喜欢的一套 research 方法。先让 AI 帮我写一个足够详细的检索 prompt,目标是找到能运行这个确切 model、价格最低但又相对靠谱的 inference provider。然后我用同一个 prompt 分别做了大约 15–20 次独立搜索,把所有结果汇总起来,再全部丢进一个最终 chat,让它比较候选项并找出最强的方案。最后一步才是我自己手动检查:model page、价格、documentation,以及 API 本身。

所以 AI 的作用是扩大搜索范围,并不是替我做最后决定。Runware 通过了我的人工检查,我自己完成了接入,这篇文章里的推荐也来自我自己的实际测试。

它目前提供的就是准确的 DeepSeek-V4-Flash-0731 checkpoint,context 为 1M,而不是一个没有明确来源的“DeepSeek-compatible”模型。Model page显示:

Runware每 1M tokens
Input$0.076
Cached input$0.014
Output$0.153

我一开始甚至以为自己看错了小数点。

但更有意义的比较并不是和 DeepSeek 的新高价相比,而是和旧价格相比,因为旧价格本身已经很便宜。

DeepSeek 旧 input 是 $0.14,Runware 是 $0.076。也就是说 Runware 约便宜 45.7%,而旧 DeepSeek 约贵 1.84×

DeepSeek 旧 output 是 $0.28,Runware 是 $0.153。Runware 约便宜 45.4%,旧 DeepSeek 约贵 1.83×

在一次大幅涨价之后,我找到了一个提供同一 V4 Flash 0731 checkpoint 的第三方 API。它不仅比新的 DeepSeek 便宜,甚至几乎只有旧版低价 DeepSeek的一半。

如果和今天的官方价格相比,差距更大。Off-peak 时 Runware 的 cache-miss input 约便宜 2.9×,output 约便宜 4.3×。Peak 时差距约为5.8×8.6×

有一个重要例外:便宜的 cache hit。DeepSeek 目前 off-peak cached input 是 $0.007/M,而 Runware 是 $0.014/M。因此 cache hit 占比极高的 workload 不能只按普通 input/output 价格比较。

如果 API 不稳定,便宜没有意义

对我来说,价格表远远不够。一个 request 只要 $0.000001 的 LLM API,如果一半请求失败,依然没有价值。

所以我接入 Runware,开始发送真实 request。

我保留了两次 usage dashboard snapshot。第一次显示:

790 requests
56 success
734 errors

单看这个结果非常糟糕。但之后 dashboard 显示:

1,570 requests
836 success
734 errors

也就是说,两次测量之间计数器精确增加了:

+780 requests
+780 successful
+0 new errors

我不会把这当成 99.999% uptime 的证明。它完全证明不了这种结论,这两个 snapshot 也无法解释最初 734 errors 的原因。

我能确认的范围更小:接下来的 780 requests 中,successful counter 增加了 780,而 error counter 完全没有变化。

这个 test window 里的 API 速度也不错。在可见日志中,大部分 successful call 用时从不到一秒到约 1.5 秒。可见的短 request 成本常见于 $0.000005–$0.000018。几百次成功调用后,dashboard 显示的总支出仍只有大约一美分。

从这里开始,Runware 对我不再只是比较表里的一行。我确实接入了 API,它确实生成了 response,而且测试流量几乎不花钱。

这不是广告,而且我只测试了 Runware 一天

我想把这一点说清楚,因为一篇文章如果对某一家 provider 写得很正面,很容易看起来像赞助内容。这里不是。Runware 没有联系过我,我也没有联系过 Runware,更没有人要求我写这篇文章。

另外,我使用这个服务只有一天。如果一周或一个月后发现 reliability、回答质量、价格或其他方面有问题,我完全可能换掉它。这不是长期结论。

DeepSeek 官方 API 涨价以后,我立刻离开了,因为我不想在评估替代方案的同时继续按新价格烧钱。我直接迁移了 traffic,并马上开始实测 Runware。

截至目前,我对这个决定非常满意。在我完成这篇文章时,Runware 已经为我处理了 1,000 次成功的 AI request。这当然仍然不能证明未来 uptime,也不能保证任何规模下都一样稳定,但至少足以说明:这不是一家我只在价格表里看到的 provider,我确实正在使用它。

所以我的推荐刻意保持在有限范围内:Runware 是我自己查过、自己接过、今天实际用起来不错的服务,目前我愿意推荐大家试一试。如果以后服务发生变化,我的看法也可能改变。

DeepSeek 也许给自己创造了价格竞争对手

从这里开始是我的 interpretation,而不是直接观察到的 fact。

DeepSeek 把自己放在了一个很特别的 business position。它一方面发布了非常有竞争力的 model,另一方面又允许市场独立运行这个 model。

当官方 DeepSeek API 极其便宜时,这种矛盾几乎看不出来。既然 DeepSeek 自己就以 $0.14/$0.28 卖 inference,为什么还要找别人的 GPU cluster?

涨价后,计算方式变了。如果官方 API 在 peak 时要 $0.44 input 和 $1.32 output,而独立 provider 对同一个 public checkpoint 只收 $0.076/$0.153,那么尝试替代方案的经济动力会非常强。

这不是意外 loophole。公开 weights 的 MIT License 允许广泛使用,包括商业使用,官方 repository 也提供 self-hosting 说明。

因此,把 Runware 简单称为“DeepSeek token 转售商”并不准确。更合理的结构是:

DeepSeek
    │
    ├── official DeepSeek API
    │
    └── open DeepSeek V4 Flash weights
                   │
                   ├── Runware infrastructure
                   ├── other inference providers
                   └── your own GPU cluster

同一个 model 不再绑定唯一一家 inference 卖家。

开放 weights 是不是 business mistake?

我不会把这个判断当作事实。

如果简单地说“DeepSeek 开放了 model,竞争对手可以卖得更便宜,所以 DeepSeek 一定会亏钱”,结论太粗糙。我们并不知道公司的 internal economics。

Open-weight strategy 还可能带来其他好处:

  • model 分发更广;
  • 更多 integrations;
  • 对 ecosystem 的影响力更大;
  • 有机会成为第三方产品中的 de facto standard;
  • 更多 developers;
  • enterprise adoption;
  • 研究领域的热度;
  • 给竞争对手施加压力。

Reuters 在关于中国 AI 市场的报道中也提到,中国模型开发商正在重视 open-weight 路线,以获得更广泛的 developer adoption。

所以我认为现在就称它为 business mistake 还太早。但一个更窄的结论是成立的:

通过开放 weights,DeepSeek 主动放弃了对自己模型 inference 的垄断。

当官方 API 大幅变贵,这个选择的影响就会更明显。DeepSeek 不再只和 Qwen、OpenAI、Anthropic、Moonshot 竞争。某种意义上,它还在和那些出售 DeepSeek 自己 open model inference 的公司竞争。

对 API 买家来说,这是好事。对 monetization strategy 来说,则复杂得多。

为什么我不自己部署 DeepSeek

接下来的想法很自然:既然第三方公司能跑 DeepSeek 并出售 inference,我为什么不自己做?

因为“model 可以免费下载”和“inference 免费”之间有巨大差别。

Weights 可以下载。GPU 不行。

你需要购买或租用昂贵 hardware,准备足够 VRAM,加载巨大的 checkpoint,配置 inference engine、batching、KV cache、monitoring、scaling、redundancy,并且要有足够 traffic,避免 GPU 大部分时间 idle。

DeepSeek 官方的 V4 Flash 0731 示例使用一个 node 和四块 GB300

对专业 inference provider 来说,这种投入可能合理,因为 infrastructure cost 可以分摊给大量客户。对单个 developer 来说,支付 $0.076 / 1M input tokens,可能比先投入巨资购买 GPU,再想办法维持高 utilization 更理性。

目前我仍然更愿意购买 inference。但现在我更清楚自己实际买的是什么。

那天早上带给我的最大变化

一天开始时,我把 DeepSeek 当作普通 SaaS API:既然是 DeepSeek model,那么使用价格自然由 DeepSeek 决定。

到晚上,我的 mental model 已经变了:市场上有一个 DeepSeek checkpoint,也有一群互相竞争、愿意替我运行这个 checkpoint 的公司。

这是两种本质不同的市场。

Closed model 的 API pricing 很大程度上由 model owner 控制。对于采用 permissive license 的 open weights,inference pricing 还会受到 infrastructure provider 之间竞争的影响。

8 月 17 日,这个区别对我变得非常具体。旧 DeepSeek V4 Flash 是 $0.14 input 和 $0.28 output。新的官方 DeepSeek 在 peak 时最高到 $0.44/$1.32。Runware 当前提供 DeepSeek-V4-Flash-0731,价格是 $0.076/$0.153。

我亲自测试过这个 API,在我发送的 traffic 下它可以正常工作。

一个月后价格还会一样吗?我不知道。同一个 provider 能不能承受任何 scale 和任何 traffic profile?我也没有证明。

但有一件事已经改变:这次涨价之后,我不会再默认认为 open-weight model 开发者自己的官方 API 就是购买 inference 的最佳选择。

现在我的第一步,是先看看还有谁能运行同一套 weights,以及他们愿意以什么价格提供服务。