17 اگست کی صبح میں نے API usage statistics کھولے تو پہلے خیال آیا کہ شاید مجھ سے کہیں کوئی غلطی ہوئی ہے۔
DeepSeek معمول کے مقابلے میں تقریباً پانچ گنا تیزی سے پیسے خرچ کر رہا تھا۔
مجھے معلوم تھا کہ قیمتیں بدلنے والی ہیں۔ DeepSeek نے چند دن پہلے اعلان کیا تھا، مگر میں نے اسے عام سا اضافہ سمجھا تھا: شاید 20%، 50%، زیادہ ہوا تو دوگنا۔
اتنا نہیں۔
Billing bug نہیں تھا۔ نئی قیمتیں واقعی نافذ ہو چکی تھیں۔ DeepSeek نے 16 اگست 16:00 UTC سے V4 Flash اور V4 Pro کو peak/off-peak pricing پر منتقل کیا، جب چین میں 17 اگست ہو چکا تھا۔ Reuters نے تبدیلی سے پہلے بتایا تھا کہ model، token type اور وقت کے لحاظ سے اضافہ 50% سے 1,100% تک ہو سکتا ہے۔ وقت DeepSeek API change log میں درج ہے۔
اسی وقت DeepSeek کی ایک اور خبر اچانک بہت اہم لگنے لگی: model weights عوامی طور پر دستیاب ہیں۔ اگر دوسری کمپنیاں وہی model خود چلا سکتی ہیں، تو inference لازماً DeepSeek ہی سے کیوں خریدا جائے؟
DeepSeek پہلے کتنا سستا تھا اور اب کتنا ہے
قیمت بدلنے سے پہلے DeepSeek V4 Flash کے ریٹس یہ تھے:
| DeepSeek V4 Flash | پرانا ریٹ فی 1M tokens |
|---|---|
| Input, cache miss | $0.14 |
| Cached input | $0.0028 |
| Output | $0.28 |
یہ اعداد DeepSeek کی پرانی pricing page پر موجود ہیں، اور Reuters نے 3 اگست کو یہی ریٹس بیان کیے تھے۔
اب official deepseek-v4-flash، جو DeepSeek-V4-Flash-0731 کے مطابق ہے، کی قیمت:
| Off-peak | Peak | |
|---|---|---|
| Input, cache miss | $0.22 | $0.44 |
| Cached input | $0.007 | $0.014 |
| Output | $0.66 | $1.32 |
موجودہ DeepSeek pricing page کے مطابق peak وقت 01:00–04:00 UTC اور 06:00–10:00 UTC ہے۔
اس لیے میرا یہ مشاہدہ کہ خرچ تقریباً پانچ گنا ہو گیا تھا، یہ نہیں بتاتا کہ ہر token category ٹھیک پانچ گنا مہنگی ہوئی۔ پرانے ریٹ کے مقابلے میں:
- peak cache-miss input $0.14 سے $0.44 ہوا، یعنی 3.14×؛
- output $0.28 سے $1.32 ہوا، یعنی 4.71×؛
- cache hit $0.0028 سے $0.014 ہوا، یعنی ٹھیک 5×۔
ایسے workload میں جو بہت output بناتا ہے، حقیقی خرچ کا تقریباً پانچ گنا ہو جانا بالکل ممکن ہے۔
میں نے پہلے دوسرا model نہیں، اسی model کا دوسرا seller ڈھونڈا
میں DeepSeek چھوڑ سکتا تھا۔ آج Qwen، GLM، Kimi، MiniMax، Mistral اور بہت سے دوسرے LLM موجود ہیں۔
لیکن model بدلنے سے ایک نئی variable آ جاتی ہے۔ Responses، prompt compatibility، generation length، long-context behavior، sampling parameters اور دوسری چیزیں دوبارہ جانچنی پڑتی ہیں۔
میں پہلے ایک آسان راستہ آزمانا چاہتا تھا۔
کیا میں DeepSeek V4 Flash ہی رکھ کر inference کسی اور سے خرید سکتا ہوں؟
یہاں اصطلاح درست رکھنا ضروری ہے۔ DeepSeek نے کسی application کے source tree کی طرح صرف “neural network کا source code” جاری نہیں کیا۔ زیادہ درست بات یہ ہے کہ اس نے model weights اور انہیں چلانے کے لیے ضروری مواد جاری کیا۔
Official deepseek-ai/DeepSeek-V4-Flash-0731 repository Hugging Face پر public ہے۔ Repository اور weights MIT License استعمال کرتے ہیں، اور DeepSeek ایک node پر چار GB300 کے ساتھ vLLM کے ذریعے model چلانے کی مثال بھی دیتا ہے۔
اس سے economics بدل جاتی ہے۔ Third-party provider کو لازماً DeepSeek سے tokens خرید کر markup کے ساتھ دوبارہ فروخت نہیں کرنا پڑتا۔ وہ open weights اپنی infrastructure پر چلا کر اپنے hardware کی compute فروخت کر سکتا ہے۔
البتہ “DeepSeek local چلا لیں” کہنا کام کو حقیقت سے بہت آسان دکھاتا ہے۔ 0731 repository تقریباً 167 GB ہے اور official deployment example میں چار GB300 استعمال ہوتے ہیں۔ یہ $20 VPS پر docker compose up نہیں ہے۔ فائلیں model file page پر دیکھی جا سکتی ہیں۔
GPU cluster رکھنے والی inference company کے لیے مسئلہ مختلف ہے۔ License بڑی رکاوٹ نہیں رہتا؛ پھر hardware، بجلی، GPU utilization، batching، software stack اور inference efficiency اہم ہوتے ہیں۔
مجھے Runware ملا
کافی تلاش کے بعد Runware سب سے دلچسپ options میں سے ایک نکلا۔
مجھے Runware کیسے ملا؟ اپنے پسندیدہ research طریقے سے۔ پہلے میں نے AI سے ایک تفصیلی prompt لکھوایا جس کا مقصد عین اسی model کے لیے سب سے سستا مگر قابلِ اعتماد inference provider تلاش کرنا تھا۔ پھر اسی prompt کے ساتھ تقریباً 15–20 الگ searches چلائیں، تمام results جمع کیے، انہیں ایک final chat میں ڈال دیا اور candidates کا موازنہ کر کے مضبوط ترین option نکالنے کو کہا۔ اس کے بعد winner کو میں نے خود manually check کیا: model page، prices، documentation اور actual API۔
AI نے search کا دائرہ بڑھانے میں مدد کی، مگر final decision میری جگہ نہیں کیا۔ Runware میری manual checking سے گزرا، میں نے خود اسے connect کیا، اور اس article میں recommendation اسی حقیقی test پر مبنی ہے۔
یہ اس وقت عین DeepSeek-V4-Flash-0731 checkpoint کو 1M context کے ساتھ دیتا ہے، کوئی بے نام “DeepSeek-compatible” model نہیں۔ Model page پر قیمتیں:
| Runware | فی 1M tokens |
|---|---|
| Input | $0.076 |
| Cached input | $0.014 |
| Output | $0.153 |
پہلے مجھے لگا decimal point غلط پڑھ رہا ہوں۔
لیکن اصل دلچسپ comparison نئے مہنگے DeepSeek سے نہیں، بلکہ پرانے ریٹس سے ہے جو پہلے ہی بہت سستے لگتے تھے۔
پرانا DeepSeek input $0.14 تھا۔ Runware $0.076 ہے۔ یعنی Runware تقریباً 45.7% سستا ہے، اور پرانا DeepSeek تقریباً 1.84× مہنگا تھا۔
پرانا output $0.28 تھا۔ Runware $0.153 ہے۔ Runware تقریباً 45.4% سستا ہے، اور پرانا DeepSeek تقریباً 1.83× مہنگا تھا۔
بڑی price increase کے بعد مجھے وہی V4 Flash 0731 checkpoint دینے والا third-party API ملا جو صرف نئے DeepSeek سے سستا نہیں بلکہ پرانے سستے DeepSeek سے بھی تقریباً آدھی قیمت کا ہے۔
آج کے official DeepSeek rate سے فرق اور بھی بڑا ہے۔ Off-peak میں Runware cache-miss input پر تقریباً 2.9× اور output پر 4.3× سستا ہے۔ Peak میں فرق تقریباً 5.8× اور 8.6× ہے۔
ایک اہم exception ہے: سستا cache hit۔ DeepSeek off-peak cached input کے لیے $0.007/M لیتا ہے، Runware $0.014/M۔ اس لیے cache-hit-heavy workload کو صرف عام input/output rate سے compare نہیں کرنا چاہیے۔
API نہ چلے تو کم قیمت بے معنی ہے
میرے لیے pricing table کافی نہیں۔ $0.000001 فی request والی LLM API بھی بے کار ہے اگر آدھی requests fail ہوں۔
اس لیے میں نے Runware connect کیا اور اصل requests بھیجنا شروع کیں۔
Usage dashboard کے دو snapshots میرے پاس ہیں۔ پہلے میں:
790 requests
56 success
734 errors
اکیلا یہ نتیجہ بہت خراب دکھائی دیتا ہے۔ بعد میں dashboard میں:
1,570 requests
836 success
734 errors
تھے۔ یعنی دونوں measurements کے درمیان counters میں عین یہ تبدیلی ہوئی:
+780 requests
+780 successful
+0 new errors
میں اسے 99.999% uptime کا ثبوت نہیں سمجھتا۔ یہ ایسا کچھ ثابت نہیں کرتا، اور ان دو snapshots سے پہلے 734 errors کی وجہ بھی معلوم نہیں ہوتی۔
میں صرف اتنا کہہ سکتا ہوں: اگلی 780 requests میں successful counter 780 بڑھا، جبکہ error counter بالکل نہیں بڑھا۔
اسی test window میں API تیز بھی تھی۔ Visible log میں زیادہ تر successful calls چند لمحوں سے تقریباً 1.5 seconds میں مکمل ہوئیں۔ نظر آنے والی مختصر requests کی cost اکثر $0.000005–$0.000018 کے آس پاس تھی۔ سینکڑوں کامیاب calls کے بعد بھی dashboard کل خرچ تقریباً ایک cent دکھا رہا تھا۔
اس مقام پر Runware میرے لیے comparison table کی صرف ایک row نہیں رہا۔ میں نے API واقعی connect کی، responses بنے، اور test traffic تقریباً مفت کے برابر تھا۔
یہ اشتہار نہیں — اور میں Runware صرف ایک دن سے test کر رہا ہوں
یہ بات صاف کہنا چاہتا ہوں، کیونکہ ایک provider کے بارے میں مثبت لکھنا sponsored content جیسا لگ سکتا ہے۔ ایسا نہیں ہے۔ Runware نے مجھ سے رابطہ نہیں کیا، اور میں نے بھی Runware سے رابطہ نہیں کیا۔ وہاں سے کسی نے مجھ سے یہ article لکھنے کو نہیں کہا۔
اس کے علاوہ میں service صرف ایک دن سے استعمال کر رہا ہوں۔ ایک ہفتے یا ایک ماہ بعد reliability، response quality، pricing یا کسی اور مسئلے کی وجہ سے میں اسے چھوڑ بھی سکتا ہوں۔ یہ long-term verdict نہیں۔
Official DeepSeek API مہنگا ہوتے ہی میں فوراً وہاں سے ہٹ گیا، کیونکہ alternatives دیکھتے ہوئے نئے rates پر مسلسل پیسہ جلانا نہیں چاہتا تھا۔ میں نے traffic منتقل کیا اور فوراً Runware کو test کرنا شروع کر دیا۔
ابھی تک میں اس فیصلے سے بہت خوش ہوں۔ Article مکمل کرتے وقت Runware پر میرے 1,000 AI requests کامیاب ہو چکے تھے۔ یہ مستقبل کے uptime یا ہر scale پر performance ثابت نہیں کرتا، مگر اتنا ضرور بتاتا ہے کہ یہ صرف pricing table میں دیکھا ہوا provider نہیں: میں حقیقت میں اسے استعمال کر رہا ہوں۔
اسی لیے میری recommendation جان بوجھ کر محدود ہے: میں نے Runware خود check کیا، آج میرے لیے اچھی طرح کام کر رہا ہے، اور فی الحال میں اسے try کرنے کا مشورہ دیتا ہوں۔ Service بدلے گی تو میری رائے بھی بدل سکتی ہے۔
ممکن ہے DeepSeek نے اپنا price competitor خود بنا دیا ہو
یہاں سے آگے میری interpretation ہے، direct observation نہیں۔
DeepSeek نے خود کو ایک غیر معمولی business position میں رکھا ہے۔ اس نے ایک انتہائی competitive model جاری کیا، اور ساتھ ہی market کو اسے independently چلانے کی صلاحیت بھی دے دی۔
جب official DeepSeek API بہت سستا تھا، یہ tension تقریباً نظر نہیں آتی تھی۔ جب DeepSeek خود inference $0.14/$0.28 میں دے رہا ہو تو کسی اور GPU cluster کی کیا ضرورت؟
Price increase کے بعد حساب بدل جاتا ہے۔ اگر official API peak میں $0.44 input اور $1.32 output ہو، جبکہ independent provider وہی public checkpoint $0.076/$0.153 میں دے، تو alternative آزمانے کی economic motivation بہت بڑھ جاتی ہے۔
یہ accidental loophole نہیں ہے۔ Published weights کی MIT License وسیع استعمال، commercial use سمیت، کی اجازت دیتی ہے اور official repository میں self-hosting instructions موجود ہیں۔
اسی لیے Runware کو صرف “DeepSeek token reseller” کہنا درست نہیں۔ زیادہ درست تصویر یہ ہے:
DeepSeek
│
├── official DeepSeek API
│
└── open DeepSeek V4 Flash weights
│
├── Runware infrastructure
├── other inference providers
└── your own GPU clusterایک ہی model اب صرف ایک inference seller سے بندھا ہوا نہیں۔
کیا weights کھولنا business mistake تھا؟
میں اسے fact کے طور پر نہیں کہوں گا۔
یہ کہنا بہت سادہ ہوگا کہ DeepSeek نے model کھولا، competitor سستا بیچ سکتے ہیں، لہٰذا DeepSeek ضرور پیسہ کھوئے گا۔ ہمیں کمپنی کی internal economics معلوم نہیں۔
Open-weight strategy کے دوسرے فائدے بھی ہو سکتے ہیں:
- model کی وسیع distribution؛
- زیادہ integrations؛
- ecosystem میں زیادہ اثر؛
- third-party products میں de facto standard بننے کا امکان؛
- زیادہ developers؛
- enterprise adoption؛
- research popularity؛
- competitors پر دباؤ۔
Reuters نے بھی چینی AI market کی coverage میں وسیع developer adoption کے لیے چینی model developers کی open-weight approach پر توجہ کا ذکر کیا ہے۔
اس لیے اسے ابھی business mistake کہنا میرے لیے قبل از وقت ہے۔ ایک محدود نتیجہ زیادہ مناسب لگتا ہے:
Weights کھول کر DeepSeek نے اپنے ہی model کی inference پر monopoly رضاکارانہ طور پر چھوڑ دی۔
جب official API بہت مہنگی ہو جاتی ہے تو اس فیصلے کے نتائج زیادہ واضح ہوتے ہیں۔ DeepSeek اب صرف Qwen، OpenAI، Anthropic یا Moonshot سے مقابلہ نہیں کرتا؛ ایک معنی میں وہ ان کمپنیوں سے بھی مقابلہ کرتا ہے جو DeepSeek کے اپنے open model کی inference فروخت کرتی ہیں۔
API buyers کے لیے یہ بہترین صورت ہے۔ Monetization strategy کے لیے معاملہ زیادہ پیچیدہ ہے۔
میں DeepSeek خود host کیوں نہیں کرتا
اگلا خیال واضح ہے: اگر third-party کمپنیاں DeepSeek چلا کر inference بیچ سکتی ہیں، تو میں خود کیوں نہ کروں؟
کیونکہ “model مفت download ہو سکتا ہے” اور “inference مفت ہے” کے درمیان بہت بڑا فرق ہے۔
Weights download ہو سکتے ہیں۔ GPUs نہیں۔
مہنگا hardware خریدنا یا rent کرنا ہوگا، کافی VRAM دینی ہوگی، بڑا checkpoint load کرنا ہوگا، inference engine، batching، KV cache، monitoring، scaling اور redundancy configure کرنا ہوگا، اور اتنا traffic چاہیے کہ GPUs زیادہ وقت idle نہ رہیں۔
DeepSeek V4 Flash 0731 کی official مثال چار GB300 والے ایک node پر چلتی ہے۔
Specialized inference provider کے لیے یہ investment مناسب ہو سکتی ہے کیونکہ infrastructure cost بہت سے customers میں تقسیم ہو جاتی ہے۔ ایک developer کے لیے $0.076 فی million input tokens دینا، GPU پر بڑی سرمایہ کاری کر کے پھر utilization برقرار رکھنے سے زیادہ معقول ہو سکتا ہے۔
فی الحال میں inference خریدنا پسند کرتا ہوں۔ مگر اب مجھے بہتر سمجھ آتی ہے کہ میں اصل میں کس چیز کی قیمت دے رہا ہوں۔
اس صبح سے حاصل ہونے والا اہم سبق
دن کے آغاز میں میں DeepSeek کو عام SaaS API کی طرح دیکھتا تھا: DeepSeek model ہے، اس لیے اس کے استعمال کی قیمت DeepSeek طے کرتا ہے۔
شام تک میرا mental model بدل گیا: ایک DeepSeek checkpoint ہے، اور کمپنیوں کی competitive market ہے جو وہ checkpoint میرے لیے چلا سکتی ہیں۔
یہ بنیادی طور پر دو مختلف markets ہیں۔
Closed model میں API pricing پر model owner کا بڑا اختیار ہوتا ہے۔ Permissive license والے open weights میں infrastructure providers کی competition بھی inference price کو طے کرتی ہے۔
17 اگست کو یہ فرق میرے لیے بہت واضح ہو گیا۔ پرانا DeepSeek V4 Flash $0.14 input اور $0.28 output تھا۔ نیا official DeepSeek peak میں $0.44/$1.32 تک جاتا ہے۔ Runware اس وقت DeepSeek-V4-Flash-0731 $0.076/$0.153 میں دے رہا ہے۔
میں نے اس API کو خود test کیا ہے، اور میرے بھیجے ہوئے traffic پر یہ کام کرتی رہی۔
کیا ایک ماہ بعد بھی یہی قیمت ہوگی؟ معلوم نہیں۔ کیا وہی provider ہر scale اور ہر traffic profile سنبھال لے گا؟ یہ بھی ثابت نہیں کیا۔
لیکن ایک چیز بدل گئی ہے: اس price increase کے بعد میں open-weight model creator کی official API کو خودکار طور پر inference خریدنے کی بہترین جگہ نہیں سمجھتا۔
اب میرا پہلا قدم یہ دیکھنا ہے کہ وہی weights اور کون چلا سکتا ہے اور اس کے لیے کتنی قیمت لیتا ہے۔