صبح ۱۷ اوت آمار مصرف API را باز کردم و اول فکر کردم جایی اشتباه کردهام.
DeepSeek تقریباً پنج برابر سریعتر از چیزی که عادت داشتم پول مصرف میکرد.
میدانستم تغییر قیمت در راه است. DeepSeek چند روز قبل خبرش را داده بود، اما در ذهنم آن را یک افزایش معمولی تصور کرده بودم: شاید 20%، شاید 50%، نهایتاً دو برابر.
نه تا این حد.
مشکلی در billing وجود نداشت. قیمتهای جدید واقعاً فعال شده بودند. DeepSeek از ساعت 16:00 UTC روز 16 اوت، V4 Flash و V4 Pro را رسماً وارد مدل peak/off-peak pricing کرد؛ زمانی که در چین ۱۷ اوت بود. Reuters نیز پیش از تغییر گزارش داده بود که بسته به مدل، نوع توکن و ساعت روز، افزایشها بین 50% تا 1,100% خواهد بود. زمانبندی در change log رسمی DeepSeek API آمده است.
همانجا خبر دیگری درباره DeepSeek ناگهان برایم خیلی مهمتر شد: وزنهای مدل عمومی هستند. اگر شرکتهای دیگر میتوانند همان مدل را خودشان اجرا کنند، چرا باید inference را حتماً مستقیم از DeepSeek بخرم؟
DeepSeek قبلاً چقدر قیمت داشت و حالا چقدر است
قبل از تغییر تعرفه، DeepSeek V4 Flash این قیمتها را داشت:
| DeepSeek V4 Flash | قیمت قدیمی به ازای 1M توکن |
|---|---|
| Input، cache miss | $0.14 |
| Cached input | $0.0028 |
| Output | $0.28 |
این ارقام در یک نسخه قدیمی صفحه قیمتگذاری DeepSeek باقی ماندهاند و Reuters هم در ۳ اوت همین نرخها را نقل کرده بود.
حالا deepseek-v4-flash رسمی که با DeepSeek-V4-Flash-0731 متناظر است، این قیمتها را دارد:
| Off-peak | Peak | |
|---|---|---|
| Input، cache miss | $0.22 | $0.44 |
| Cached input | $0.007 | $0.014 |
| Output | $0.66 | $1.32 |
طبق صفحه فعلی قیمتگذاری DeepSeek، بازههای peak از 01:00 تا 04:00 UTC و از 06:00 تا 10:00 UTC هستند.
پس مشاهده من که هزینه تقریباً پنج برابر شده بود به این معنا نیست که هر دسته از توکنها دقیقاً پنج برابر گران شدهاند. نسبت به قیمت قدیمی:
- قیمت cache-miss input در peak از $0.14 به $0.44 رسید، یعنی 3.14×؛
- output از $0.28 به $1.32 رسید، یعنی 4.71×؛
- cache hit از $0.0028 به $0.014 رسید، یعنی دقیقاً 5×.
برای workloadای که output زیادی تولید میکند، افزایش واقعی هزینه تا نزدیک پنج برابر کاملاً قابل انتظار است.
اول دنبال مدل دیگری نرفتم؛ دنبال فروشنده دیگری برای همان مدل گشتم
میتوانستم DeepSeek را کنار بگذارم. بازار امروز پر از LLMهایی مثل Qwen، GLM، Kimi، MiniMax، Mistral و گزینههای دیگر است.
اما عوض کردن مدل یک متغیر تازه وارد سیستم میکند. پاسخها، سازگاری prompt، طول generation، رفتار در context طولانی، sampling parameters و موارد دیگر باید دوباره بررسی شوند.
اول میخواستم یک گزینه سادهتر را امتحان کنم.
آیا میتوانم خود DeepSeek V4 Flash را نگه دارم، اما inference را دیگر از DeepSeek نخرم؟
اینجا اصطلاحات مهماند. DeepSeek صرفاً «سورسکد شبکه عصبی» را مثل سورس یک اپلیکیشن منتشر نکرده است. توصیف دقیقتر این است که وزنهای مدل و مواد لازم برای اجرای آنها منتشر شدهاند.
repository رسمی deepseek-ai/DeepSeek-V4-Flash-0731 بهصورت عمومی روی Hugging Face قرار دارد. repository و وزنها تحت MIT License هستند و DeepSeek حتی نمونه اجرای مدل با vLLM روی یک node مجهز به چهار GB300 را نشان میدهد.
این موضوع اقتصاد کار را کاملاً تغییر میدهد. یک ارائهدهنده ثالث الزاماً مجبور نیست توکنهای DeepSeek را بخرد و با markup دوباره بفروشد. میتواند وزنهای باز را روی زیرساخت خودش اجرا کند و توان محاسباتی سختافزار خودش را بفروشد.
البته عبارت «DeepSeek را local بالا بیاور» کار را خیلی سادهتر از واقعیت نشان میدهد. repository نسخه 0731 حدود 167 GB است و نمونه رسمی deployment از چهار GB300 استفاده میکند. این docker compose up روی یک VPS با قیمت $20 نیست. فایلها در صفحه فایلهای مدل قابل مشاهدهاند.
اما برای یک شرکت inference با GPU cluster، مسئله متفاوت است. دیگر license مانع اصلی نیست؛ سختافزار، برق، GPU utilization، batching، software stack و بازده inference باقی میمانند.
Runware را پیدا کردم
بعد از جستوجوی نسبتاً طولانی، Runware یکی از جذابترین گزینهها بود.
Runware را چطور پیدا کردم؟ با روش تحقیق مورد علاقهام. اول از یک AI خواستم prompt مفصلی بنویسد که دقیقاً برای همین model، ارزانترین provider قابلاعتماد inference را پیدا کند. بعد با همان prompt حدود 15–20 جستوجوی جدا اجرا کردم، همه نتایج را جمع کردم، داخل یک chat نهایی ریختم و خواستم کاندیداها را مقایسه کند و قویترین گزینه را بیرون بکشد. فقط بعد از آن خودم winner را دستی بررسی کردم: صفحه model، قیمتها، documentation و خود API.
AI دامنه جستوجو را بزرگتر کرد، اما تصمیم نهایی را بهجای من نگرفت. Runware بررسی دستی من را با موفقیت پشت سر گذاشت، خودم آن را وصل کردم و توصیه این مقاله بر اساس همان test واقعی است.
در حال حاضر دقیقاً checkpoint DeepSeek-V4-Flash-0731 را با context 1M ارائه میکند، نه یک مدل بینام با برچسب «DeepSeek-compatible». صفحه مدل این قیمتها را نشان میدهد:
| Runware | قیمت به ازای 1M توکن |
|---|---|
| Input | $0.076 |
| Cached input | $0.014 |
| Output | $0.153 |
اول فکر کردم جای اعشار را اشتباه خواندهام.
اما مقایسه مهمتر با قیمتهای جدید و گران DeepSeek نیست؛ با قیمتهای قدیمی است که همان موقع هم خیلی ارزان به نظر میرسیدند.
input قدیمی DeepSeek برابر $0.14 بود. Runware برابر $0.076 است. یعنی Runware حدود 45.7% ارزانتر است و قیمت قدیمی DeepSeek حدود 1.84× بیشتر بود.
output قدیمی $0.28 بود و Runware $0.153 است. یعنی Runware حدود 45.4% ارزانتر و DeepSeek قدیمی حدود 1.83× گرانتر بود.
بعد از یک افزایش بزرگ قیمت، API یک شرکت دیگر را برای همان checkpoint V4 Flash 0731 پیدا کردم که نهتنها از DeepSeek جدید ارزانتر است، بلکه تقریباً نصف DeepSeek قدیمی و ارزان قیمت دارد.
در مقایسه با قیمت رسمی امروز، فاصله حتی بیشتر میشود. در off-peak، Runware برای cache-miss input حدود 2.9× و برای output حدود 4.3× ارزانتر است. در peak این اختلافها حدود 5.8× و 8.6× میشوند.
یک استثنای مهم وجود دارد: cache hit ارزان. DeepSeek در off-peak برای cached input مبلغ $0.007/M میگیرد، در حالی که Runware $0.014/M است. بنابراین workloadی که عمدتاً cache hit دارد را نمیتوان فقط با قیمت معمول input/output مقایسه کرد.
اگر API کار نکند، قیمت پایین هیچ ارزشی ندارد
برای من جدول قیمت بهتنهایی کافی نیست. LLM API با قیمت $0.000001 برای هر request بیفایده است اگر نیمی از requestها fail شوند.
پس Runware را متصل کردم و request واقعی فرستادم.
دو snapshot از usage dashboard نگه داشتم. اولی این بود:
790 requests
56 success
734 errors
این عدد بهتنهایی افتضاح به نظر میرسد. اما بعداً dashboard این ارقام را نشان داد:
1,570 requests
836 success
734 errors
یعنی بین دو اندازهگیری دقیقاً این تغییر رخ داد:
+780 requests
+780 successful
+0 new errors
این را مدرک uptime 99.999% نمیدانم. چنین چیزی را ثابت نمیکند و از روی این دو snapshot هم نمیتوانم علت 734 خطای اولیه را مشخص کنم.
تنها چیزی که میتوانم با اطمینان محدودتر بگویم این است: در 780 request بعدی، شمارنده successful دقیقاً 780 افزایش یافت و شمارنده errors اصلاً تغییر نکرد.
API در همان بازه سریع هم بود. در بخش قابل مشاهده log، بیشتر callهای موفق از کسری از ثانیه تا حدود 1.5 ثانیه طول کشیدند. هزینه requestهای کوتاهی که میدیدم اغلب حدود $0.000005–$0.000018 بود. بعد از صدها call موفق، dashboard هنوز مجموع هزینه را فقط حدود یک سنت نشان میداد.
از آن نقطه Runware برای من دیگر فقط یک ردیف در جدول مقایسه نبود. API را واقعاً وصل کرده بودم، جواب تولید میکرد و ترافیک آزمایشی تقریباً هیچ هزینهای نداشت.
این تبلیغ نیست — و فقط یک روز است Runware را آزمایش میکنم
میخواهم این نکته را صریح بگویم، چون نوشته مثبت درباره یک provider بهراحتی شبیه محتوای اسپانسری دیده میشود. اینطور نیست. Runware با من تماس نگرفته و من هم با Runware تماس نگرفتهام. هیچکس آنجا از من نخواسته این مقاله را بنویسم.
ضمن اینکه فقط یک روز است از سرویس استفاده میکنم. یک هفته یا یک ماه دیگر اگر مشکل reliability، کیفیت پاسخ، قیمت یا مورد دیگری پیدا شود، ممکن است کاملاً از آن خارج شوم. این حکم بلندمدت نیست.
بهمحض گران شدن API رسمی DeepSeek از آن خارج شدم، چون نمیخواستم هنگام بررسی جایگزینها با نرخ جدید همچنان پول بسوزانم. Traffic را منتقل کردم و بلافاصله تست Runware را شروع کردم.
تا اینجا از تصمیمم خیلی راضیام. وقتی مقاله را تمام میکردم، Runware برای من 1,000 درخواست AI موفق پردازش کرده بود. این هنوز uptime آینده یا عملکرد در هر scale را ثابت نمیکند، اما برای من کافی است که بگویم فقط اسم یک provider در جدول قیمت نیست: واقعاً دارم از آن استفاده میکنم.
پس توصیه من عمداً محدود است: خودم Runware را بررسی کردهام، امروز برای من خوب کار میکند و فعلاً امتحان کردنش را توصیه میکنم. اگر سرویس تغییر کند، نظر من هم ممکن است تغییر کند.
شاید DeepSeek رقیب قیمتی خودش را ساخته باشد
از اینجا به بعد، صحبت من interpretation است، نه یک واقعیت مستقیماً مشاهدهشده.
DeepSeek خودش را در موقعیت تجاری عجیبی قرار داده است. هم یک مدل بسیار رقابتی عرضه کرده و هم به بازار اجازه داده همان مدل را مستقل اجرا کند.
تا وقتی API رسمی DeepSeek بسیار ارزان بود، این تضاد تقریباً دیده نمیشد. وقتی خود DeepSeek inference را با $0.14/$0.28 میفروشد، چرا دنبال GPU cluster شرکت دیگری بروم؟
بعد از افزایش قیمت، محاسبه عوض میشود. اگر API رسمی در peak به $0.44 input و $1.32 output برسد، در حالی که یک provider مستقل همان checkpoint عمومی را با $0.076/$0.153 ارائه کند، انگیزه اقتصادی برای امتحان گزینه دوم بسیار قوی میشود.
این یک loophole تصادفی نیست. MIT License وزنهای منتشرشده استفاده گسترده، از جمله تجاری را مجاز میکند و repository رسمی شامل راهنمای self-hosting است.
به همین دلیل Runware را صرفاً «فروشنده مجدد توکن DeepSeek» نمینامم. تصویر دقیقتر این است:
DeepSeek
│
├── DeepSeek API رسمی
│
└── وزنهای باز DeepSeek V4 Flash
│
├── زیرساخت Runware
├── ارائهدهندگان inference دیگر
└── GPU cluster شخصیهمان مدل دیگر به یک فروشنده inference محدود نیست.
آیا انتشار وزنها یک اشتباه تجاری بود؟
من این را بهعنوان واقعیت بیان نمیکنم.
اینکه بگوییم DeepSeek مدل را باز کرده، رقبا حالا ارزانتر میفروشند و بنابراین DeepSeek حتماً ضرر میکند، بیش از حد ساده است. ما اقتصاد داخلی شرکت را نمیدانیم.
استراتژی open-weight میتواند مزایای دیگری داشته باشد:
- گسترش بیشتر مدل؛
- integrationهای بیشتر؛
- نفوذ بیشتر در ecosystem؛
- شانس تبدیل شدن به de facto standard در محصولات ثالث؛
- توسعهدهندگان بیشتر؛
- enterprise adoption؛
- محبوبیت پژوهشی؛
- فشار بر رقبا.
Reuters نیز در گزارش خود درباره بازار AI چین به تأکید توسعهدهندگان چینی بر رویکرد open-weight برای گسترش پذیرش میان توسعهدهندگان اشاره کرده است.
بنابراین برای من زود است که این تصمیم را اشتباه تجاری بنامم. اما با یک نتیجه محدودتر راحتترم:
DeepSeek با باز کردن وزنها، داوطلبانه انحصار inference مدل خودش را کنار گذاشت.
وقتی API رسمی بسیار گرانتر میشود، نتیجه این انتخاب واضحتر دیده میشود. DeepSeek دیگر فقط با Qwen، OpenAI، Anthropic یا Moonshot رقابت نمیکند؛ بهنوعی با شرکتهایی هم رقابت دارد که inference مدل باز خود DeepSeek را میفروشند.
برای خریدار API این عالی است. برای monetization strategy بسیار پیچیدهتر است.
چرا DeepSeek را خودم host نمیکنم
فکر بعدی واضح است: اگر شرکتهای دیگر میتوانند DeepSeek را اجرا کنند و inference بفروشند، چرا خودم این کار را نکنم؟
چون بین «مدل رایگان قابل دانلود است» و «inference رایگان است» فاصله بسیار زیادی وجود دارد.
وزنها را میشود دانلود کرد. GPU را نه.
باید سختافزار گران بخرید یا اجاره کنید، VRAM کافی داشته باشید، checkpoint عظیم را load کنید، inference engine، batching، KV cache، monitoring، scaling و redundancy را تنظیم کنید و بعد هم آنقدر traffic داشته باشید که GPUها بیشتر زمان idle نباشند.
نمونه رسمی DeepSeek برای V4 Flash 0731 از یک node با چهار GB300 استفاده میکند.
برای یک ارائهدهنده تخصصی inference، چنین سرمایهگذاریای میتواند منطقی باشد چون هزینه زیرساخت بین مشتریان زیادی تقسیم میشود. برای یک توسعهدهنده، پرداخت $0.076 به ازای هر یک میلیون input token ممکن است بسیار منطقیتر از سرمایهگذاری بزرگ روی GPU و بعد تلاش برای بالا نگه داشتن utilization باشد.
فعلاً ترجیح میدهم inference بخرم. اما حالا خیلی بهتر میفهمم دقیقاً چه چیزی میخرم.
مهمترین چیزی که از آن صبح یاد گرفتم
ابتدای روز DeepSeek را مثل یک SaaS API عادی میدیدم: یک مدل DeepSeek وجود دارد، پس DeepSeek تعیین میکند استفاده از آن چقدر هزینه دارد.
تا عصر مدل ذهنی من عوض شد: یک checkpoint از DeepSeek وجود دارد و یک بازار رقابتی از شرکتهایی که حاضرند همان checkpoint را برای من اجرا کنند.
این دو بازار اساساً متفاوتاند.
در مدل بسته، قیمت API تا حد زیادی توسط مالک مدل کنترل میشود. وقتی وزنها تحت یک license permissive باز هستند، رقابت بین زیرساختها هم قیمت inference را تعیین میکند.
در ۱۷ اوت این تفاوت برایم کاملاً ملموس شد. DeepSeek V4 Flash قدیمی $0.14 input و $0.28 output بود. قیمت رسمی جدید در peak تا $0.44/$1.32 میرسد. Runware در حال حاضر DeepSeek-V4-Flash-0731 را با $0.076/$0.153 ارائه میدهد.
خودم این API را آزمایش کردهام و برای ترافیکی که فرستادم کار کرد.
یک ماه دیگر قیمتها همین هستند؟ نمیدانم. همان provider هر مقیاس و هر traffic profile را تحمل میکند؟ آن را هم ثابت نکردهام.
اما یک چیز برایم عوض شده است: بعد از این افزایش قیمت دیگر فرض نمیکنم API رسمی سازنده یک مدل open-weight بهطور خودکار بهترین محل خرید inference است.
حالا قدم اول من این است که ببینم چه کسی دیگر میتواند همان وزنها را اجرا کند و برای این کار چقدر پول میگیرد.