ब्लॉग पर वापस जाएं
17 अगस्त 2026Sergei Solod11 मिनट पढ़ें

DeepSeek ने कीमतें बढ़ाईं — वही V4 Flash मुझे पुराने रेट से भी सस्ता मिल गया

17 अगस्त की सुबह मैंने देखा कि DeepSeek API पर मेरा खर्च सामान्य से लगभग पाँच गुना हो गया था। इसके बाद मैंने वही DeepSeek-V4-Flash-0731 checkpoint दूसरे provider पर पाया और टेस्ट किया, जिसकी मौजूदा कीमत DeepSeek के पुराने रेट से भी लगभग 45% कम है।

DeepSeekRunwareLLM APIAI इंफ्रास्ट्रक्चरOpen-weight मॉडल

17 अगस्त की सुबह मैंने API usage statistics खोले और पहले लगा कि शायद मैंने कहीं गलती कर दी है।

DeepSeek मेरे पैसे लगभग पाँच गुना तेजी से खर्च कर रहा था

मुझे पता था कि pricing बदलने वाली है। DeepSeek ने कुछ दिन पहले इसकी घोषणा की थी, लेकिन मैंने इसे सामान्य बढ़ोतरी समझा था: शायद 20%, 50%, बहुत हुआ तो दोगुना।

इतना नहीं।

Billing bug नहीं था। नई कीमतें सचमुच लागू हो चुकी थीं। DeepSeek ने 16 अगस्त 16:00 UTC से V4 Flash और V4 Pro को peak/off-peak pricing पर शिफ्ट किया, जो चीन में 17 अगस्त था। Reuters ने बदलाव से पहले लिखा था कि model, token type और समय के आधार पर बढ़ोतरी 50% से 1,100% तक हो सकती है। समय DeepSeek API change log में दर्ज है।

उसी समय DeepSeek की एक दूसरी खबर अचानक ज्यादा महत्वपूर्ण लगने लगी: model weights सार्वजनिक हैं। अगर दूसरी कंपनियाँ वही model खुद चला सकती हैं, तो inference सीधे DeepSeek से ही क्यों खरीदूँ?

DeepSeek पहले कितना सस्ता था और अब कितना महँगा है

Pricing बदलने से पहले DeepSeek V4 Flash की कीमत थी:

DeepSeek V4 Flashपुरानी कीमत प्रति 1M tokens
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

ये आँकड़े DeepSeek की पुरानी pricing page पर मौजूद हैं, और Reuters ने 3 अगस्त को भी यही रेट लिखे थे।

अब official deepseek-v4-flash, जो DeepSeek-V4-Flash-0731 के अनुरूप है, इस कीमत पर है:

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

मौजूदा DeepSeek pricing page के अनुसार peak समय 01:00–04:00 UTC और 06:00–10:00 UTC है।

इसलिए मेरा “लगभग पाँच गुना ज्यादा खर्च” देखना यह नहीं बताता कि हर token category ठीक पाँच गुना महँगी हुई। पुरानी कीमत की तुलना में:

  • peak cache-miss input $0.14 से $0.44 हुआ, यानी 3.14×;
  • output $0.28 से $1.32 हुआ, यानी 4.71×;
  • cache hit $0.0028 से $0.014 हुआ, यानी बिल्कुल

ऐसे workload में जो बहुत output generate करता है, वास्तविक खर्च का लगभग पाँच गुना हो जाना पूरी तरह संभव है।

मैंने पहले दूसरा model नहीं, उसी model का दूसरा seller खोजा

मैं DeepSeek छोड़ सकता था। आज Qwen, GLM, Kimi, MiniMax, Mistral और कई दूसरे LLM उपलब्ध हैं।

लेकिन model बदलने का मतलब एक और variable जोड़ना है। Responses, prompt compatibility, generation length, long-context behavior, sampling parameters और बाकी चीजें फिर से जाँचनी पड़ती हैं।

मैं पहले एक आसान विकल्प आज़माना चाहता था।

क्या मैं DeepSeek V4 Flash को ही रखकर inference DeepSeek से खरीदना बंद कर सकता हूँ?

यहाँ terminology महत्वपूर्ण है। DeepSeek ने किसी application की तरह सिर्फ “neural network का source code” प्रकाशित नहीं किया। ज्यादा सही बात यह है कि उसने model weights और उन्हें चलाने के लिए जरूरी सामग्री प्रकाशित की।

Official deepseek-ai/DeepSeek-V4-Flash-0731 repository Hugging Face पर सार्वजनिक है। Repository और weights MIT License के तहत हैं, और DeepSeek vLLM के साथ एक node पर चार GB300 में model चलाने का उदाहरण भी देता है।

इससे economics बदल जाती है। Third-party provider को DeepSeek से token खरीदकर markup लगाकर resell करना जरूरी नहीं। वह open weights अपने infrastructure पर चला सकता है और अपने hardware की compute बेच सकता है।

बेशक, “DeepSeek local चला लो” कहना काम को वास्तविकता से बहुत आसान दिखाता है। 0731 repository लगभग 167 GB है और official deployment example चार GB300 इस्तेमाल करता है। यह $20 VPS पर docker compose up नहीं है। फाइलें model file page पर देखी जा सकती हैं।

GPU cluster वाली inference company के लिए समस्या अलग होती है। License मुख्य बाधा नहीं रहता; hardware, electricity, GPU utilization, batching, software stack और inference efficiency बाकी रहते हैं।

मुझे Runware मिला

काफी खोजने के बाद Runware सबसे दिलचस्प विकल्पों में से एक लगा।

मुझे Runware कैसे मिला? मेरे पसंदीदा research workflow से। पहले मैंने AI से एक detailed prompt लिखवाया, जिसका काम इसी exact model के लिए सबसे सस्ता लेकिन भरोसेमंद inference provider खोजना था। फिर उसी prompt के साथ लगभग 15–20 अलग searches चलाए, सारे results इकट्ठे किए, उन्हें एक final chat में डाला और candidates को compare करके सबसे मजबूत option निकालने को कहा। उसके बाद winner को मैंने खुद manually जाँचा: model page, pricing, documentation और actual API।

AI ने search को व्यापक बनाने में मदद की, लेकिन final decision मेरे लिए नहीं लिया। Runware मेरी manual checking से गुज़रा, मैंने खुद उसे connect किया, और इस article की recommendation उसी वास्तविक test पर आधारित है।

यह अभी exact DeepSeek-V4-Flash-0731 checkpoint को 1M context के साथ देता है, कोई बिना नाम वाला “DeepSeek-compatible” model नहीं। इसकी model page पर कीमत है:

Runwareप्रति 1M tokens
Input$0.076
Cached input$0.014
Output$0.153

पहले मुझे लगा decimal point गलत पढ़ रहा हूँ।

लेकिन असली comparison नए महँगे DeepSeek से नहीं, बल्कि पुराने DeepSeek से है, जो पहले से बहुत सस्ता लगता था।

पुराना DeepSeek input $0.14 था। Runware $0.076 है। यानी Runware लगभग 45.7% सस्ता है और पुराना DeepSeek लगभग 1.84× महँगा था।

पुराना output $0.28 था। Runware $0.153 है। Runware लगभग 45.4% सस्ता है और पुराना DeepSeek लगभग 1.83× महँगा था।

एक बड़ी price hike के बाद मुझे उसी V4 Flash 0731 checkpoint का third-party API मिला जो सिर्फ नए DeepSeek से सस्ता नहीं था; वह पुराने सस्ते DeepSeek से भी लगभग आधा था।

आज के official DeepSeek rate से अंतर और बड़ा है। Off-peak में Runware cache-miss input पर लगभग 2.9× और output पर 4.3× सस्ता है। Peak में अंतर लगभग 5.8× और 8.6× है।

एक महत्वपूर्ण exception है: सस्ता cache hit। DeepSeek off-peak cached input के लिए $0.007/M लेता है, जबकि Runware $0.014/M। इसलिए cache-hit-heavy workload को केवल सामान्य input/output rate से compare नहीं किया जा सकता।

API काम न करे तो कम कीमत का कोई मतलब नहीं

मेरे लिए pricing table काफी नहीं है। प्रति request $0.000001 वाला LLM API बेकार है अगर आधी requests fail हों।

इसलिए मैंने Runware connect किया और वास्तविक requests भेजीं।

Usage dashboard के दो snapshots मेरे पास रहे। पहले में था:

790 requests
56 success
734 errors

अकेले देखने पर यह बहुत खराब है। बाद में dashboard में था:

1,570 requests
836 success
734 errors

दोनों measurements के बीच counters में ठीक यह बदलाव हुआ:

+780 requests
+780 successful
+0 new errors

मैं इसे 99.999% uptime का proof नहीं मानता। इससे ऐसा कुछ साबित नहीं होता, और इन दो snapshots से शुरुआती 734 errors का कारण भी पता नहीं चलता।

मैं सिर्फ इतना कह सकता हूँ: अगले 780 requests में successful counter 780 बढ़ा और error counter बिल्कुल नहीं बढ़ा।

उस test window में API तेज भी था। Visible log में अधिकांश successful calls fraction of a second से लगभग 1.5 seconds में पूरी हुईं। दिखाई देने वाली short requests की cost अक्सर $0.000005–$0.000018 के आसपास थी। Hundreds of successful calls के बाद भी dashboard कुल खर्च लगभग एक cent दिखा रहा था।

यहीं Runware मेरे लिए सिर्फ comparison table की एक row नहीं रहा। मैंने API वास्तव में connect किया, उसने responses generate किए और test traffic की लागत लगभग कुछ भी नहीं थी।

यह विज्ञापन नहीं है — और मैं Runware को सिर्फ एक दिन से test कर रहा हूँ

इसे साफ कहना जरूरी है, क्योंकि किसी एक provider के बारे में सकारात्मक लिखना आसानी से sponsored content जैसा लग सकता है। यह sponsored नहीं है। Runware ने मुझसे संपर्क नहीं किया, और मैंने भी Runware से संपर्क नहीं किया। वहाँ से किसी ने यह article लिखने को नहीं कहा।

मैं service को सिर्फ एक दिन से इस्तेमाल कर रहा हूँ। एक हफ्ते या एक महीने बाद reliability, response quality, pricing या किसी दूसरी चीज़ में समस्या निकली तो मैं इसे छोड़ भी सकता हूँ। यह long-term verdict नहीं है।

Official DeepSeek API महँगा होते ही मैं तुरंत वहाँ से हट गया, क्योंकि alternative evaluate करते समय नए rates पर लगातार पैसा जलाना नहीं चाहता था। मैंने traffic move किया और Runware को तुरंत test करना शुरू कर दिया।

अभी तक मैं इस फैसले से बहुत खुश हूँ। Article पूरा करते समय Runware से 1,000 AI requests सफल हो चुकी थीं। यह future uptime या हर scale पर performance साबित नहीं करता, लेकिन इतना जरूर बताता है कि यह सिर्फ pricing table में मिला provider नहीं है: मैं वास्तव में इसे इस्तेमाल कर रहा हूँ।

इसलिए मेरी recommendation जानबूझकर सीमित है: मैंने Runware खुद check किया, आज मेरे लिए यह अच्छी तरह काम कर रहा है, और फिलहाल मैं इसे try करने की सलाह देता हूँ। Service बदलेगी तो मेरा opinion भी बदल सकता है।

DeepSeek ने शायद अपना price competitor खुद बना दिया

यहाँ से आगे मेरी interpretation है, direct observation नहीं।

DeepSeek ने खुद को एक असामान्य business position में रखा है। उसने एक बहुत competitive model जारी किया और market को उसे स्वतंत्र रूप से चलाने की क्षमता भी दी।

जब official DeepSeek API बहुत सस्ता था, conflict लगभग दिखता नहीं था। अगर DeepSeek खुद inference $0.14/$0.28 में बेच रहा है तो किसी और GPU cluster की जरूरत क्यों पड़े?

Price hike के बाद हिसाब बदलता है। अगर official API peak में $0.44 input और $1.32 output है, जबकि independent provider वही public checkpoint $0.076/$0.153 में देता है, तो alternative आज़माने का आर्थिक कारण बहुत मजबूत हो जाता है।

यह accidental loophole नहीं है। Published weights की MIT License व्यापक उपयोग, commercial use सहित, अनुमति देती है और official repository में self-hosting instructions भी हैं।

इसीलिए Runware को सिर्फ “DeepSeek token reseller” कहना सही नहीं होगा। बेहतर चित्र यह है:

DeepSeek
    │
    ├── official DeepSeek API
    │
    └── open DeepSeek V4 Flash weights
                   │
                   ├── Runware infrastructure
                   ├── other inference providers
                   └── your own GPU cluster

एक ही model अब एक inference seller से बँधा नहीं है।

क्या weights खोलना business mistake था?

मैं इसे fact के रूप में नहीं कहूँगा।

यह कहना बहुत सरल होगा कि DeepSeek ने model खोल दिया, competitor इसे सस्ता बेचेंगे और इसलिए DeepSeek पैसा खो देगा। हमें कंपनी की internal economics नहीं पता।

Open-weight strategy के दूसरे फायदे हो सकते हैं:

  • model का व्यापक distribution;
  • ज्यादा integrations;
  • ecosystem में अधिक influence;
  • third-party products में de facto standard बनने का मौका;
  • ज्यादा developers;
  • enterprise adoption;
  • research popularity;
  • competitors पर दबाव।

Reuters ने भी चीनी AI market की coverage में developers तक व्यापक पहुँच के लिए Chinese model developers के open-weight approach पर जोर का उल्लेख किया है।

इसलिए इसे business mistake कहना अभी जल्दी है। एक छोटा निष्कर्ष मुझे ज्यादा उचित लगता है:

Weights खोलकर DeepSeek ने अपने ही model की inference पर monopoly स्वेच्छा से छोड़ दी।

जब official API काफी महँगा हो जाता है, इस फैसले के परिणाम ज्यादा साफ दिखते हैं। DeepSeek अब सिर्फ Qwen, OpenAI, Anthropic या Moonshot से नहीं, बल्कि एक अर्थ में उन कंपनियों से भी compete करता है जो DeepSeek के अपने open model की inference बेचती हैं।

API खरीदार के लिए यह शानदार है। Monetization strategy के लिए यह ज्यादा जटिल है।

मैं DeepSeek खुद host क्यों नहीं कर रहा

अगला सवाल स्वाभाविक है: अगर third-party कंपनियाँ DeepSeek चला सकती हैं और inference बेच सकती हैं, तो मैं खुद क्यों नहीं?

क्योंकि “model free download है” और “inference free है” के बीच बहुत बड़ा अंतर है।

Weights download किए जा सकते हैं। GPU नहीं।

महँगा hardware खरीदना या rent करना होगा, पर्याप्त VRAM चाहिए, बड़ा checkpoint load करना होगा, inference engine, batching, KV cache, monitoring, scaling और redundancy configure करनी होगी, और इतना traffic चाहिए कि GPUs ज्यादातर समय idle न रहें।

DeepSeek V4 Flash 0731 का official example चार GB300 वाला एक node उपयोग करता है।

Specialized inference provider के लिए यह investment ठीक हो सकती है क्योंकि infrastructure cost बहुत से customers में बाँटी जाती है। एक developer के लिए $0.076 प्रति million input tokens देना, बड़ी GPU investment करके utilization बनाए रखने से कहीं अधिक उचित हो सकता है।

फिलहाल मैं inference खरीदना पसंद करता हूँ। लेकिन अब मुझे ज्यादा स्पष्ट है कि मैं वास्तव में क्या खरीद रहा हूँ।

उस सुबह से मेरी सबसे बड़ी सीख

दिन की शुरुआत में मैं DeepSeek को सामान्य SaaS API की तरह देखता था: DeepSeek model है, इसलिए DeepSeek तय करता है कि उसे इस्तेमाल करने की कीमत क्या होगी।

दिन के अंत तक मेरा mental model बदल गया: DeepSeek checkpoint है, और कंपनियों का competitive market है जो वही checkpoint मेरे लिए चला सकती हैं।

ये मूल रूप से अलग markets हैं।

Closed model में API pricing पर model owner का बड़ा नियंत्रण होता है। Permissive license वाले open weights में infrastructure providers की competition भी inference price को तय करती है।

17 अगस्त को यह फर्क मेरे लिए बहुत वास्तविक हो गया। पुराना DeepSeek V4 Flash $0.14 input और $0.28 output था। नया official DeepSeek peak में $0.44/$1.32 तक पहुँचता है। Runware अभी DeepSeek-V4-Flash-0731 $0.076/$0.153 में देता है।

मैंने API को खुद test किया है और मेरे भेजे traffic पर यह काम किया।

क्या एक महीने बाद भी यही कीमत होगी? नहीं जानता। क्या वही provider हर scale और traffic profile संभालेगा? यह भी मैंने साबित नहीं किया।

लेकिन एक बात बदल गई: इस price increase के बाद मैं open-weight model creator की official API को automatically inference खरीदने की सबसे अच्छी जगह नहीं मानता।

अब मेरी पहली जाँच यही होती है कि वही weights और कौन चला सकता है और उसके लिए कितना charge करता है।