بازگشت به بلاگ
۲۶ مرداد ۱۴۰۵Sergei Solod11 دقیقه مطالعه

DeepSeek قیمت‌ها را بالا برد — همان V4 Flash را ارزان‌تر از تعرفه قدیمی پیدا کردم

صبح ۱۷ اوت دیدم هزینه DeepSeek API من تقریباً پنج برابر حالت عادی شده است. بعد همان checkpoint ‏DeepSeek-V4-Flash-0731 را نزد یک ارائه‌دهنده دیگر پیدا و آزمایش کردم که قیمت فعلی‌اش حدود 45% پایین‌تر از تعرفه قدیمی DeepSeek است.

DeepSeekRunwareLLM APIزیرساخت هوش مصنوعیمدل‌های Open-weight

صبح ۱۷ اوت آمار مصرف API را باز کردم و اول فکر کردم جایی اشتباه کرده‌ام.

DeepSeek تقریباً پنج برابر سریع‌تر از چیزی که عادت داشتم پول مصرف می‌کرد.

می‌دانستم تغییر قیمت در راه است. DeepSeek چند روز قبل خبرش را داده بود، اما در ذهنم آن را یک افزایش معمولی تصور کرده بودم: شاید 20%، شاید 50%، نهایتاً دو برابر.

نه تا این حد.

مشکلی در billing وجود نداشت. قیمت‌های جدید واقعاً فعال شده بودند. DeepSeek از ساعت 16:00 UTC روز 16 اوت، V4 Flash و V4 Pro را رسماً وارد مدل peak/off-peak pricing کرد؛ زمانی که در چین ۱۷ اوت بود. Reuters نیز پیش از تغییر گزارش داده بود که بسته به مدل، نوع توکن و ساعت روز، افزایش‌ها بین 50% تا 1,100% خواهد بود. زمان‌بندی در change log رسمی DeepSeek API آمده است.

همان‌جا خبر دیگری درباره DeepSeek ناگهان برایم خیلی مهم‌تر شد: وزن‌های مدل عمومی هستند. اگر شرکت‌های دیگر می‌توانند همان مدل را خودشان اجرا کنند، چرا باید inference را حتماً مستقیم از DeepSeek بخرم؟

DeepSeek قبلاً چقدر قیمت داشت و حالا چقدر است

قبل از تغییر تعرفه، DeepSeek V4 Flash این قیمت‌ها را داشت:

DeepSeek V4 Flashقیمت قدیمی به ازای 1M توکن
Input، cache miss$0.14
Cached input$0.0028
Output$0.28

این ارقام در یک نسخه قدیمی صفحه قیمت‌گذاری DeepSeek باقی مانده‌اند و Reuters هم در ۳ اوت همین نرخ‌ها را نقل کرده بود.

حالا deepseek-v4-flash رسمی که با DeepSeek-V4-Flash-0731 متناظر است، این قیمت‌ها را دارد:

Off-peakPeak
Input، cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

طبق صفحه فعلی قیمت‌گذاری DeepSeek، بازه‌های peak از 01:00 تا 04:00 UTC و از 06:00 تا 10:00 UTC هستند.

پس مشاهده من که هزینه تقریباً پنج برابر شده بود به این معنا نیست که هر دسته از توکن‌ها دقیقاً پنج برابر گران شده‌اند. نسبت به قیمت قدیمی:

  • قیمت cache-miss input در peak از $0.14 به $0.44 رسید، یعنی 3.14×؛
  • output از $0.28 به $1.32 رسید، یعنی 4.71×؛
  • cache hit از $0.0028 به $0.014 رسید، یعنی دقیقاً .

برای workloadای که output زیادی تولید می‌کند، افزایش واقعی هزینه تا نزدیک پنج برابر کاملاً قابل انتظار است.

اول دنبال مدل دیگری نرفتم؛ دنبال فروشنده دیگری برای همان مدل گشتم

می‌توانستم DeepSeek را کنار بگذارم. بازار امروز پر از LLMهایی مثل Qwen، GLM، Kimi، MiniMax، Mistral و گزینه‌های دیگر است.

اما عوض کردن مدل یک متغیر تازه وارد سیستم می‌کند. پاسخ‌ها، سازگاری prompt، طول generation، رفتار در context طولانی، sampling parameters و موارد دیگر باید دوباره بررسی شوند.

اول می‌خواستم یک گزینه ساده‌تر را امتحان کنم.

آیا می‌توانم خود DeepSeek V4 Flash را نگه دارم، اما inference را دیگر از DeepSeek نخرم؟

اینجا اصطلاحات مهم‌اند. DeepSeek صرفاً «سورس‌کد شبکه عصبی» را مثل سورس یک اپلیکیشن منتشر نکرده است. توصیف دقیق‌تر این است که وزن‌های مدل و مواد لازم برای اجرای آن‌ها منتشر شده‌اند.

repository رسمی deepseek-ai/DeepSeek-V4-Flash-0731 به‌صورت عمومی روی Hugging Face قرار دارد. repository و وزن‌ها تحت MIT License هستند و DeepSeek حتی نمونه اجرای مدل با vLLM روی یک node مجهز به چهار GB300 را نشان می‌دهد.

این موضوع اقتصاد کار را کاملاً تغییر می‌دهد. یک ارائه‌دهنده ثالث الزاماً مجبور نیست توکن‌های DeepSeek را بخرد و با markup دوباره بفروشد. می‌تواند وزن‌های باز را روی زیرساخت خودش اجرا کند و توان محاسباتی سخت‌افزار خودش را بفروشد.

البته عبارت «DeepSeek را local بالا بیاور» کار را خیلی ساده‌تر از واقعیت نشان می‌دهد. repository نسخه 0731 حدود 167 GB است و نمونه رسمی deployment از چهار GB300 استفاده می‌کند. این docker compose up روی یک VPS با قیمت $20 نیست. فایل‌ها در صفحه فایل‌های مدل قابل مشاهده‌اند.

اما برای یک شرکت inference با GPU cluster، مسئله متفاوت است. دیگر license مانع اصلی نیست؛ سخت‌افزار، برق، GPU utilization، batching، software stack و بازده inference باقی می‌مانند.

Runware را پیدا کردم

بعد از جست‌وجوی نسبتاً طولانی، Runware یکی از جذاب‌ترین گزینه‌ها بود.

Runware را چطور پیدا کردم؟ با روش تحقیق مورد علاقه‌ام. اول از یک AI خواستم prompt مفصلی بنویسد که دقیقاً برای همین model، ارزان‌ترین provider قابل‌اعتماد inference را پیدا کند. بعد با همان prompt حدود 15–20 جست‌وجوی جدا اجرا کردم، همه نتایج را جمع کردم، داخل یک chat نهایی ریختم و خواستم کاندیداها را مقایسه کند و قوی‌ترین گزینه را بیرون بکشد. فقط بعد از آن خودم winner را دستی بررسی کردم: صفحه model، قیمت‌ها، documentation و خود API.

AI دامنه جست‌وجو را بزرگ‌تر کرد، اما تصمیم نهایی را به‌جای من نگرفت. Runware بررسی دستی من را با موفقیت پشت سر گذاشت، خودم آن را وصل کردم و توصیه این مقاله بر اساس همان test واقعی است.

در حال حاضر دقیقاً checkpoint ‏DeepSeek-V4-Flash-0731 را با context ‏1M ارائه می‌کند، نه یک مدل بی‌نام با برچسب «DeepSeek-compatible». صفحه مدل این قیمت‌ها را نشان می‌دهد:

Runwareقیمت به ازای 1M توکن
Input$0.076
Cached input$0.014
Output$0.153

اول فکر کردم جای اعشار را اشتباه خوانده‌ام.

اما مقایسه مهم‌تر با قیمت‌های جدید و گران DeepSeek نیست؛ با قیمت‌های قدیمی است که همان موقع هم خیلی ارزان به نظر می‌رسیدند.

input قدیمی DeepSeek برابر $0.14 بود. Runware برابر $0.076 است. یعنی Runware حدود 45.7% ارزان‌تر است و قیمت قدیمی DeepSeek حدود 1.84× بیشتر بود.

output قدیمی $0.28 بود و Runware $0.153 است. یعنی Runware حدود 45.4% ارزان‌تر و DeepSeek قدیمی حدود 1.83× گران‌تر بود.

بعد از یک افزایش بزرگ قیمت، API یک شرکت دیگر را برای همان checkpoint ‏V4 Flash 0731 پیدا کردم که نه‌تنها از DeepSeek جدید ارزان‌تر است، بلکه تقریباً نصف DeepSeek قدیمی و ارزان قیمت دارد.

در مقایسه با قیمت رسمی امروز، فاصله حتی بیشتر می‌شود. در off-peak، Runware برای cache-miss input حدود 2.9× و برای output حدود 4.3× ارزان‌تر است. در peak این اختلاف‌ها حدود 5.8× و 8.6× می‌شوند.

یک استثنای مهم وجود دارد: cache hit ارزان. DeepSeek در off-peak برای cached input مبلغ $0.007/M می‌گیرد، در حالی که Runware $0.014/M است. بنابراین workloadی که عمدتاً cache hit دارد را نمی‌توان فقط با قیمت معمول input/output مقایسه کرد.

اگر API کار نکند، قیمت پایین هیچ ارزشی ندارد

برای من جدول قیمت به‌تنهایی کافی نیست. LLM API با قیمت $0.000001 برای هر request بی‌فایده است اگر نیمی از requestها fail شوند.

پس Runware را متصل کردم و request واقعی فرستادم.

دو snapshot از usage dashboard نگه داشتم. اولی این بود:

790 requests
56 success
734 errors

این عدد به‌تنهایی افتضاح به نظر می‌رسد. اما بعداً dashboard این ارقام را نشان داد:

1,570 requests
836 success
734 errors

یعنی بین دو اندازه‌گیری دقیقاً این تغییر رخ داد:

+780 requests
+780 successful
+0 new errors

این را مدرک uptime ‏99.999% نمی‌دانم. چنین چیزی را ثابت نمی‌کند و از روی این دو snapshot هم نمی‌توانم علت 734 خطای اولیه را مشخص کنم.

تنها چیزی که می‌توانم با اطمینان محدودتر بگویم این است: در 780 request بعدی، شمارنده successful دقیقاً 780 افزایش یافت و شمارنده errors اصلاً تغییر نکرد.

API در همان بازه سریع هم بود. در بخش قابل مشاهده log، بیشتر callهای موفق از کسری از ثانیه تا حدود 1.5 ثانیه طول کشیدند. هزینه requestهای کوتاهی که می‌دیدم اغلب حدود $0.000005–$0.000018 بود. بعد از صدها call موفق، dashboard هنوز مجموع هزینه را فقط حدود یک سنت نشان می‌داد.

از آن نقطه Runware برای من دیگر فقط یک ردیف در جدول مقایسه نبود. API را واقعاً وصل کرده بودم، جواب تولید می‌کرد و ترافیک آزمایشی تقریباً هیچ هزینه‌ای نداشت.

این تبلیغ نیست — و فقط یک روز است Runware را آزمایش می‌کنم

می‌خواهم این نکته را صریح بگویم، چون نوشته مثبت درباره یک provider به‌راحتی شبیه محتوای اسپانسری دیده می‌شود. این‌طور نیست. Runware با من تماس نگرفته و من هم با Runware تماس نگرفته‌ام. هیچ‌کس آنجا از من نخواسته این مقاله را بنویسم.

ضمن اینکه فقط یک روز است از سرویس استفاده می‌کنم. یک هفته یا یک ماه دیگر اگر مشکل reliability، کیفیت پاسخ، قیمت یا مورد دیگری پیدا شود، ممکن است کاملاً از آن خارج شوم. این حکم بلندمدت نیست.

به‌محض گران شدن API رسمی DeepSeek از آن خارج شدم، چون نمی‌خواستم هنگام بررسی جایگزین‌ها با نرخ جدید همچنان پول بسوزانم. Traffic را منتقل کردم و بلافاصله تست Runware را شروع کردم.

تا اینجا از تصمیمم خیلی راضی‌ام. وقتی مقاله را تمام می‌کردم، Runware برای من 1,000 درخواست AI موفق پردازش کرده بود. این هنوز uptime آینده یا عملکرد در هر scale را ثابت نمی‌کند، اما برای من کافی است که بگویم فقط اسم یک provider در جدول قیمت نیست: واقعاً دارم از آن استفاده می‌کنم.

پس توصیه من عمداً محدود است: خودم Runware را بررسی کرده‌ام، امروز برای من خوب کار می‌کند و فعلاً امتحان کردنش را توصیه می‌کنم. اگر سرویس تغییر کند، نظر من هم ممکن است تغییر کند.

شاید DeepSeek رقیب قیمتی خودش را ساخته باشد

از اینجا به بعد، صحبت من interpretation است، نه یک واقعیت مستقیماً مشاهده‌شده.

DeepSeek خودش را در موقعیت تجاری عجیبی قرار داده است. هم یک مدل بسیار رقابتی عرضه کرده و هم به بازار اجازه داده همان مدل را مستقل اجرا کند.

تا وقتی API رسمی DeepSeek بسیار ارزان بود، این تضاد تقریباً دیده نمی‌شد. وقتی خود DeepSeek inference را با $0.14/$0.28 می‌فروشد، چرا دنبال GPU cluster شرکت دیگری بروم؟

بعد از افزایش قیمت، محاسبه عوض می‌شود. اگر API رسمی در peak به $0.44 input و $1.32 output برسد، در حالی که یک provider مستقل همان checkpoint عمومی را با $0.076/$0.153 ارائه کند، انگیزه اقتصادی برای امتحان گزینه دوم بسیار قوی می‌شود.

این یک loophole تصادفی نیست. MIT License وزن‌های منتشرشده استفاده گسترده، از جمله تجاری را مجاز می‌کند و repository رسمی شامل راهنمای self-hosting است.

به همین دلیل Runware را صرفاً «فروشنده مجدد توکن DeepSeek» نمی‌نامم. تصویر دقیق‌تر این است:

DeepSeek
    │
    ├── DeepSeek API رسمی
    │
    └── وزن‌های باز DeepSeek V4 Flash
                   │
                   ├── زیرساخت Runware
                   ├── ارائه‌دهندگان inference دیگر
                   └── GPU cluster شخصی

همان مدل دیگر به یک فروشنده inference محدود نیست.

آیا انتشار وزن‌ها یک اشتباه تجاری بود؟

من این را به‌عنوان واقعیت بیان نمی‌کنم.

این‌که بگوییم DeepSeek مدل را باز کرده، رقبا حالا ارزان‌تر می‌فروشند و بنابراین DeepSeek حتماً ضرر می‌کند، بیش از حد ساده است. ما اقتصاد داخلی شرکت را نمی‌دانیم.

استراتژی open-weight می‌تواند مزایای دیگری داشته باشد:

  • گسترش بیشتر مدل؛
  • integrationهای بیشتر؛
  • نفوذ بیشتر در ecosystem؛
  • شانس تبدیل شدن به de facto standard در محصولات ثالث؛
  • توسعه‌دهندگان بیشتر؛
  • enterprise adoption؛
  • محبوبیت پژوهشی؛
  • فشار بر رقبا.

Reuters نیز در گزارش خود درباره بازار AI چین به تأکید توسعه‌دهندگان چینی بر رویکرد open-weight برای گسترش پذیرش میان توسعه‌دهندگان اشاره کرده است.

بنابراین برای من زود است که این تصمیم را اشتباه تجاری بنامم. اما با یک نتیجه محدودتر راحت‌ترم:

DeepSeek با باز کردن وزن‌ها، داوطلبانه انحصار inference مدل خودش را کنار گذاشت.

وقتی API رسمی بسیار گران‌تر می‌شود، نتیجه این انتخاب واضح‌تر دیده می‌شود. DeepSeek دیگر فقط با Qwen، OpenAI، Anthropic یا Moonshot رقابت نمی‌کند؛ به‌نوعی با شرکت‌هایی هم رقابت دارد که inference مدل باز خود DeepSeek را می‌فروشند.

برای خریدار API این عالی است. برای monetization strategy بسیار پیچیده‌تر است.

چرا DeepSeek را خودم host نمی‌کنم

فکر بعدی واضح است: اگر شرکت‌های دیگر می‌توانند DeepSeek را اجرا کنند و inference بفروشند، چرا خودم این کار را نکنم؟

چون بین «مدل رایگان قابل دانلود است» و «inference رایگان است» فاصله بسیار زیادی وجود دارد.

وزن‌ها را می‌شود دانلود کرد. GPU را نه.

باید سخت‌افزار گران بخرید یا اجاره کنید، VRAM کافی داشته باشید، checkpoint عظیم را load کنید، inference engine، batching، KV cache، monitoring، scaling و redundancy را تنظیم کنید و بعد هم آن‌قدر traffic داشته باشید که GPUها بیشتر زمان idle نباشند.

نمونه رسمی DeepSeek برای V4 Flash 0731 از یک node با چهار GB300 استفاده می‌کند.

برای یک ارائه‌دهنده تخصصی inference، چنین سرمایه‌گذاری‌ای می‌تواند منطقی باشد چون هزینه زیرساخت بین مشتریان زیادی تقسیم می‌شود. برای یک توسعه‌دهنده، پرداخت $0.076 به ازای هر یک میلیون input token ممکن است بسیار منطقی‌تر از سرمایه‌گذاری بزرگ روی GPU و بعد تلاش برای بالا نگه داشتن utilization باشد.

فعلاً ترجیح می‌دهم inference بخرم. اما حالا خیلی بهتر می‌فهمم دقیقاً چه چیزی می‌خرم.

مهم‌ترین چیزی که از آن صبح یاد گرفتم

ابتدای روز DeepSeek را مثل یک SaaS API عادی می‌دیدم: یک مدل DeepSeek وجود دارد، پس DeepSeek تعیین می‌کند استفاده از آن چقدر هزینه دارد.

تا عصر مدل ذهنی من عوض شد: یک checkpoint از DeepSeek وجود دارد و یک بازار رقابتی از شرکت‌هایی که حاضرند همان checkpoint را برای من اجرا کنند.

این دو بازار اساساً متفاوت‌اند.

در مدل بسته، قیمت API تا حد زیادی توسط مالک مدل کنترل می‌شود. وقتی وزن‌ها تحت یک license permissive باز هستند، رقابت بین زیرساخت‌ها هم قیمت inference را تعیین می‌کند.

در ۱۷ اوت این تفاوت برایم کاملاً ملموس شد. DeepSeek V4 Flash قدیمی $0.14 input و $0.28 output بود. قیمت رسمی جدید در peak تا $0.44/$1.32 می‌رسد. Runware در حال حاضر DeepSeek-V4-Flash-0731 را با $0.076/$0.153 ارائه می‌دهد.

خودم این API را آزمایش کرده‌ام و برای ترافیکی که فرستادم کار کرد.

یک ماه دیگر قیمت‌ها همین هستند؟ نمی‌دانم. همان provider هر مقیاس و هر traffic profile را تحمل می‌کند؟ آن را هم ثابت نکرده‌ام.

اما یک چیز برایم عوض شده است: بعد از این افزایش قیمت دیگر فرض نمی‌کنم API رسمی سازنده یک مدل open-weight به‌طور خودکار بهترین محل خرید inference است.

حالا قدم اول من این است که ببینم چه کسی دیگر می‌تواند همان وزن‌ها را اجرا کند و برای این کار چقدر پول می‌گیرد.