Quay lại blog
17 tháng 8, 2026Sergei Solod13 phút đọc

DeepSeek tăng giá — tôi tìm được cùng V4 Flash rẻ hơn cả mức giá cũ

Sáng 17 tháng 8, tôi nhận ra chi phí DeepSeek API tăng lên khoảng năm lần so với bình thường. Sau đó tôi tìm và thử một provider khác chạy đúng checkpoint DeepSeek-V4-Flash-0731 với giá hiện tại thấp hơn khoảng 45% so với mức giá cũ của DeepSeek.

DeepSeekRunwareLLM APIHạ tầng AIMô hình open-weight

Sáng 17 tháng 8, tôi mở thống kê sử dụng API và ban đầu nghĩ rằng mình đã cấu hình sai ở đâu đó.

DeepSeek đang tiêu tiền nhanh hơn bình thường khoảng năm lần.

Tôi biết giá sắp thay đổi. DeepSeek đã thông báo vài ngày trước, nhưng tôi chỉ nghĩ đó là một đợt tăng giá thông thường: có thể 20%, 50%, cùng lắm gấp đôi.

Không ngờ lại lớn đến vậy.

Không có lỗi billing. Mức giá mới thực sự đã có hiệu lực. DeepSeek chính thức chuyển V4 Flash và V4 Pro sang peak/off-peak pricing từ 16:00 UTC ngày 16 tháng 8, khi ở Trung Quốc đã là ngày 17. Reuters trước đó cho biết mức tăng sẽ từ 50% đến 1,100% tùy model, loại token và thời điểm sử dụng. Mốc thời gian có trong DeepSeek API change log.

Lúc đó một tin khác về DeepSeek bỗng trở nên đáng chú ý hơn nhiều: model weights được công khai. Nếu công ty khác có thể tự chạy cùng model, tại sao tôi nhất thiết phải mua inference trực tiếp từ DeepSeek?

DeepSeek từng có giá bao nhiêu và hiện tại bao nhiêu

Trước khi thay đổi giá, DeepSeek V4 Flash có mức:

DeepSeek V4 FlashGiá cũ mỗi 1M token
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

Các con số này vẫn xuất hiện trên trang giá cũ của DeepSeek, và Reuters cũng trích đúng mức giá đó vào ngày 3 tháng 8.

deepseek-v4-flash chính thức, tương ứng với DeepSeek-V4-Flash-0731, hiện có giá:

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

Khoảng peak là 01:00–04:00 UTC và 06:00–10:00 UTC theo trang giá hiện tại của DeepSeek.

Vì vậy việc tôi thấy tổng chi phí tăng khoảng năm lần không có nghĩa mọi loại token đều tăng chính xác năm lần. So với giá cũ:

  • peak cache-miss input tăng từ $0.14 lên $0.44, tức 3.14×;
  • output tăng từ $0.28 lên $1.32, tức 4.71×;
  • cache hit tăng từ $0.0028 lên $0.014, đúng .

Với workload tạo nhiều output, chi phí thực tế tăng gần năm lần là điều hoàn toàn có thể xảy ra.

Tôi tìm người bán khác cho cùng model trước khi đổi model

Tôi có thể bỏ DeepSeek và chuyển sang Qwen, GLM, Kimi, MiniMax, Mistral hoặc nhiều LLM khác.

Nhưng đổi model đồng nghĩa thêm một biến mới. Responses, prompt compatibility, generation length, long-context behavior, sampling parameters và nhiều đặc tính khác phải được kiểm tra lại.

Tôi muốn thử một phương án đơn giản hơn trước.

Tôi có thể giữ DeepSeek V4 Flash nhưng không mua inference từ DeepSeek nữa không?

Ở đây cần dùng thuật ngữ chính xác. DeepSeek không đơn giản là công bố “source code của neural network” như developer công khai source tree của một ứng dụng. Cách nói chính xác hơn là DeepSeek đã công bố model weights và các tài liệu cần thiết để chạy chúng.

Repository chính thức deepseek-ai/DeepSeek-V4-Flash-0731 được công khai trên Hugging Face. Repository và weights dùng MIT License, và DeepSeek thậm chí cung cấp ví dụ chạy model bằng vLLM trên một node có bốn GB300.

Điều này thay đổi hoàn toàn bài toán kinh tế. Provider bên thứ ba không nhất thiết phải mua token từ DeepSeek rồi bán lại với markup. Họ có thể chạy open weights trên infrastructure riêng và bán compute trên hardware của chính mình.

Tất nhiên, câu “tự chạy DeepSeek local” khiến công việc nghe dễ hơn thực tế. Repository 0731 khoảng 167 GB và ví dụ deployment chính thức dùng bốn GB300. Đây không phải docker compose up trên VPS $20. Các file có thể xem tại trang file của model.

Nhưng với một công ty inference sở hữu GPU cluster, bài toán rất khác. License không còn là rào cản chính; phần còn lại là hardware, điện, GPU utilization, batching, software stack và hiệu quả inference.

Tôi tìm thấy Runware

Sau khi tìm khá lâu, Runware là một trong những lựa chọn đáng chú ý nhất.

Tôi tìm Runware bằng cách nào? Bằng quy trình research tôi thích nhất. Trước tiên tôi nhờ AI viết một prompt chi tiết để tìm provider inference rẻ nhất nhưng vẫn đáng tin cậy cho đúng model này. Sau đó tôi chạy khoảng 15–20 lượt tìm kiếm riêng với prompt đó, gom toàn bộ kết quả, đưa tất cả vào một chat cuối cùng và yêu cầu so sánh các ứng viên để chọn ra phương án mạnh nhất. Chỉ sau đó tôi mới tự kiểm tra người thắng: trang model, giá, documentation và chính API.

AI giúp tôi mở rộng phạm vi tìm kiếm, nhưng không đưa ra quyết định cuối cùng thay tôi. Runware vượt qua phần kiểm tra thủ công, tôi tự kết nối nó, và lời khuyên trong bài này dựa trên chính thử nghiệm đó.

Hiện tại họ cung cấp chính xác checkpoint DeepSeek-V4-Flash-0731 với context 1M, không phải model vô danh chỉ gắn nhãn “DeepSeek-compatible”. Trang model ghi:

RunwareGiá mỗi 1M token
Input$0.076
Cached input$0.014
Output$0.153

Ban đầu tôi nghĩ mình nhìn nhầm dấu thập phân.

Nhưng phép so sánh thú vị hơn không phải với mức giá mới đắt đỏ của DeepSeek, mà với mức giá vốn đã rất rẻ.

Input cũ của DeepSeek là $0.14. Runware là $0.076. Runware rẻ hơn khoảng 45.7%, còn DeepSeek cũ đắt hơn khoảng 1.84×.

Output cũ là $0.28. Runware là $0.153. Runware rẻ hơn khoảng 45.4%, còn DeepSeek cũ đắt hơn khoảng 1.83×.

Sau một đợt tăng giá lớn, tôi tìm được API bên thứ ba chạy cùng checkpoint V4 Flash 0731, không chỉ rẻ hơn DeepSeek mới mà còn gần như bằng một nửa DeepSeek cũ vốn đã rẻ.

So với giá chính thức hiện tại, khoảng cách còn lớn hơn. Trong off-peak, Runware rẻ hơn khoảng 2.9× cho cache-miss input và 4.3× cho output. Trong peak, mức chênh là khoảng 5.8×8.6×.

Có một ngoại lệ quan trọng: cache hit rẻ. DeepSeek hiện tính $0.007/M cho cached input ở off-peak, còn Runware là $0.014/M. Vì vậy workload có tỷ lệ cache hit rất cao không thể chỉ so bằng giá input/output thông thường.

Giá thấp vô nghĩa nếu API không hoạt động

Bảng giá thôi chưa đủ với tôi. LLM API giá $0.000001 mỗi request vẫn vô dụng nếu một nửa request thất bại.

Vì vậy tôi kết nối Runware và bắt đầu gửi request thật.

Tôi giữ lại hai snapshot của usage dashboard. Snapshot đầu:

790 requests
56 success
734 errors

Nhìn riêng thì rất tệ. Sau đó dashboard hiển thị:

1,570 requests
836 success
734 errors

Giữa hai lần đo, counter thay đổi chính xác:

+780 requests
+780 successful
+0 new errors

Tôi không coi đây là bằng chứng về uptime 99.999%. Dữ liệu này không chứng minh điều đó, và hai snapshot cũng không cho biết nguyên nhân của 734 errors đầu tiên.

Điều tôi có thể nói hẹp hơn là: trong 780 request tiếp theo, successful counter tăng 780 còn error counter không thay đổi.

API cũng nhanh trong khoảng thử nghiệm đó. Trong phần log nhìn thấy, phần lớn successful call hoàn tất từ chưa đến một giây đến khoảng 1.5 giây. Các request ngắn tôi thấy thường có giá khoảng $0.000005–$0.000018. Sau hàng trăm call thành công, dashboard vẫn chỉ hiển thị tổng chi phí khoảng một cent.

Từ đó Runware không còn chỉ là một dòng trong bảng so sánh. Tôi đã thực sự kết nối API, nó tạo được response, và test traffic gần như không tốn tiền.

Đây không phải quảng cáo — và tôi mới thử Runware được một ngày

Tôi muốn nói rõ điều này vì một phần viết tích cực về một provider rất dễ trông giống nội dung tài trợ. Không phải. Runware không liên hệ với tôi và tôi cũng không liên hệ với Runware. Không ai ở đó yêu cầu tôi viết bài này.

Tôi cũng mới dùng dịch vụ được một ngày. Một tuần hoặc một tháng nữa tôi hoàn toàn có thể rời đi nếu xuất hiện vấn đề về reliability, chất lượng phản hồi, giá hoặc bất kỳ yếu tố nào khác. Đây không phải kết luận dài hạn.

Tôi rời API chính thức của DeepSeek ngay khi nó trở nên đắt, vì không muốn tiếp tục đốt tiền theo giá mới trong lúc đánh giá lựa chọn khác. Tôi chuyển traffic và bắt đầu thử Runware ngay lập tức.

Cho đến lúc này tôi rất hài lòng với quyết định đó. Khi hoàn thiện bài viết, Runware đã xử lý 1.000 request AI thành công cho tôi. Điều này vẫn không chứng minh uptime trong tương lai hay hiệu năng ở mọi quy mô, nhưng đủ để nói rằng đây không phải provider tôi chỉ nhìn thấy trong bảng giá: tôi đang thực sự sử dụng nó.

Vì vậy lời khuyên của tôi cố ý có giới hạn: tôi tự kiểm tra Runware, hôm nay nó hoạt động tốt với tôi và hiện tại tôi thực sự khuyên nên thử. Nếu dịch vụ thay đổi, quan điểm của tôi cũng có thể thay đổi.

DeepSeek có thể đã tự tạo ra đối thủ về giá

Từ đây là cách tôi diễn giải, không phải fact quan sát trực tiếp.

DeepSeek đã tự đặt mình vào một business position khá đặc biệt. Họ phát hành một model rất cạnh tranh, đồng thời cho thị trường khả năng tự chạy model đó.

Khi official DeepSeek API cực rẻ, mâu thuẫn này gần như không đáng chú ý. Tại sao phải tìm GPU cluster của bên khác khi DeepSeek tự bán inference ở $0.14/$0.28?

Sau khi tăng giá, phép tính thay đổi. Nếu official API trong peak là $0.44 input và $1.32 output, trong khi một provider độc lập cung cấp cùng public checkpoint ở $0.076/$0.153, động lực kinh tế để thử lựa chọn khác trở nên rất lớn.

Đây không phải loophole vô tình. MIT License của weights công khai cho phép sử dụng rộng rãi, kể cả thương mại, và repository chính thức có hướng dẫn self-hosting.

Vì vậy tôi sẽ không gọi Runware đơn giản là “reseller token DeepSeek”. Cách hình dung chính xác hơn là:

DeepSeek
    │
    ├── official DeepSeek API
    │
    └── open DeepSeek V4 Flash weights
                   │
                   ├── Runware infrastructure
                   ├── other inference providers
                   └── your own GPU cluster

Cùng một model không còn gắn với một người bán inference duy nhất.

Mở weights có phải sai lầm kinh doanh?

Tôi sẽ không khẳng định như một fact.

Nói rằng DeepSeek mở model, đối thủ có thể bán rẻ hơn và vì thế DeepSeek chắc chắn mất tiền là quá đơn giản. Chúng ta không biết internal economics của công ty.

Chiến lược open-weight có thể mang lại lợi ích khác:

  • phân phối model rộng hơn;
  • nhiều integration hơn;
  • ảnh hưởng lớn hơn tới ecosystem;
  • cơ hội trở thành de facto standard trong sản phẩm bên thứ ba;
  • nhiều developer hơn;
  • enterprise adoption;
  • độ phổ biến trong nghiên cứu;
  • gây áp lực lên đối thủ.

Reuters cũng đề cập việc các nhà phát triển model Trung Quốc chú trọng open-weight để đạt mức developer adoption rộng trong bài viết về thị trường AI Trung Quốc.

Vì vậy tôi cho rằng còn quá sớm để gọi quyết định này là sai lầm kinh doanh. Một kết luận hẹp hơn thì hợp lý:

Bằng cách mở weights, DeepSeek tự nguyện từ bỏ độc quyền inference đối với model của chính mình.

Khi official API đắt hơn nhiều, hệ quả của lựa chọn này trở nên rõ hơn. DeepSeek không chỉ cạnh tranh với Qwen, OpenAI, Anthropic hay Moonshot, mà theo một nghĩa nào đó còn cạnh tranh với các công ty bán inference cho chính open model của DeepSeek.

Điều này rất tốt cho người mua API. Với monetization strategy, nó phức tạp hơn nhiều.

Vì sao tôi không tự host DeepSeek

Suy nghĩ tiếp theo rất tự nhiên: nếu công ty bên thứ ba có thể chạy DeepSeek và bán inference, tại sao tôi không tự làm?

Vì có khoảng cách rất lớn giữa “model tải miễn phí” và “inference miễn phí”.

Weights có thể tải. GPU thì không.

Bạn phải mua hoặc thuê hardware đắt tiền, có đủ VRAM, load checkpoint lớn, cấu hình inference engine, batching, KV cache, monitoring, scaling, redundancy và có đủ traffic để GPU không nhàn rỗi phần lớn thời gian.

Ví dụ chính thức của DeepSeek cho V4 Flash 0731 dùng một node với bốn GB300.

Với provider inference chuyên nghiệp, khoản đầu tư đó có thể hợp lý vì chi phí infrastructure được chia cho nhiều khách hàng. Với một developer, trả $0.076 cho một triệu input tokens có thể hợp lý hơn nhiều so với đầu tư lớn vào GPU rồi cố duy trì utilization cao.

Hiện tại tôi vẫn chọn mua inference. Nhưng tôi hiểu rõ hơn rất nhiều mình đang mua thứ gì.

Bài học quan trọng nhất từ buổi sáng đó

Đầu ngày, tôi nhìn DeepSeek như một SaaS API bình thường: có model DeepSeek, nên DeepSeek quyết định chi phí sử dụng.

Đến cuối ngày, mental model của tôi khác đi: có một DeepSeek checkpoint và có một thị trường cạnh tranh của các công ty sẵn sàng chạy checkpoint đó cho tôi.

Đó là hai thị trường khác nhau về bản chất.

Với closed model, API pricing phần lớn do model owner kiểm soát. Với open weights dưới permissive license, inference pricing còn được định hình bởi cạnh tranh giữa infrastructure providers.

Ngày 17 tháng 8, khác biệt này trở nên rất cụ thể với tôi. DeepSeek V4 Flash cũ là $0.14 input và $0.28 output. Giá official mới lên đến $0.44/$1.32 trong peak. Runware hiện cung cấp DeepSeek-V4-Flash-0731 ở mức $0.076/$0.153.

Tôi đã tự test API này, và nó hoạt động với traffic tôi gửi.

Một tháng nữa giá có còn vậy không? Tôi không biết. Cùng provider có chịu được mọi scale và mọi traffic profile không? Tôi cũng chưa chứng minh điều đó.

Nhưng một điều đã thay đổi với tôi: sau lần tăng giá này, tôi không còn mặc định official API của người tạo open-weight model là nơi tốt nhất để mua inference.

Bây giờ bước đầu tiên của tôi là xem ai khác có thể chạy cùng weights và họ tính bao nhiêu tiền.