ব্লগে ফিরে যান
১৭ আগস্ট, ২০২৬Sergei Solod9 মিনিট পড়া

DeepSeek দাম বাড়াল — একই V4 Flash পুরোনো দামের চেয়েও কমে পেলাম অন্য হোস্টে

১৭ আগস্ট সকালে দেখি DeepSeek API-তে আমার খরচ স্বাভাবিকের প্রায় পাঁচ গুণ হয়ে গেছে। পরে একই DeepSeek-V4-Flash-0731 checkpoint অন্য এক provider-এর কাছে পাই এবং পরীক্ষা করি, যার বর্তমান দাম DeepSeek-এর পুরোনো দামের চেয়েও প্রায় 45% কম।

DeepSeekRunwareLLM APIAI অবকাঠামোওপেন-ওয়েট মডেল

১৭ আগস্ট সকালে API usage statistics খুলে প্রথমে আমার মনে হয়েছিল কোথাও আমি ভুল করেছি।

DeepSeek স্বাভাবিকের তুলনায় প্রায় পাঁচ গুণ দ্রুত টাকা খরচ করছিল

আমি জানতাম দাম বদলাবে। DeepSeek কয়েক দিন আগেই ঘোষণা করেছিল। কিন্তু আমি সেটাকে সাধারণ মূল্যবৃদ্ধি হিসেবেই ধরেছিলাম: 20%, 50%, খুব বেশি হলে দ্বিগুণ।

এতটা নয়।

Billing bug ছিল না। নতুন দাম সত্যিই কার্যকর হয়েছে। DeepSeek ১৬ আগস্ট 16:00 UTC থেকে V4 Flash এবং V4 Pro-কে peak/off-peak pricing-এ নিয়েছে, যা চীনে তখন ১৭ আগস্ট। Reuters আগেই লিখেছিল যে model, token type এবং সময়ের ওপর নির্ভর করে মূল্যবৃদ্ধি 50% থেকে 1,100% পর্যন্ত হতে পারে। সময়সূচি DeepSeek API change log-এ আছে।

তখন DeepSeek-এর আরেকটি খবর হঠাৎ অনেক বেশি গুরুত্বপূর্ণ হয়ে উঠল: model weights সবার জন্য উপলভ্য। অন্য কোম্পানি যদি একই model নিজে চালাতে পারে, তাহলে inference সরাসরি DeepSeek-এর কাছ থেকেই কেন কিনতে হবে?

আগে DeepSeek-এর দাম কত ছিল, এখন কত

দাম পরিবর্তনের আগে DeepSeek V4 Flash-এর মূল্য ছিল:

DeepSeek V4 Flashপ্রতি 1M token-এর পুরোনো দাম
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

এই সংখ্যাগুলো DeepSeek-এর পুরোনো pricing page-এ দেখা যায়, আর Reuters ৩ আগস্ট একই দাম উল্লেখ করেছিল।

এখন official deepseek-v4-flash, যা DeepSeek-V4-Flash-0731-এর সঙ্গে মিলে, এর দাম:

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

বর্তমান DeepSeek pricing page অনুযায়ী peak সময় 01:00–04:00 UTC এবং 06:00–10:00 UTC।

তাই আমার “প্রায় পাঁচ গুণ বেশি খরচ” পর্যবেক্ষণটির মানে এই নয় যে প্রতিটি token category ঠিক পাঁচ গুণ বেড়েছে। পুরোনো দামের তুলনায়:

  • peak cache-miss input $0.14 থেকে $0.44 হয়েছে, অর্থাৎ 3.14×;
  • output $0.28 থেকে $1.32 হয়েছে, অর্থাৎ 4.71×;
  • cache hit $0.0028 থেকে $0.014 হয়েছে, ঠিক

যে workload অনেক output তৈরি করে, সেখানে বাস্তব বিল প্রায় পাঁচ গুণ হওয়া তাই মোটেই অস্বাভাবিক নয়।

আমি আগে অন্য model নয়, একই model-এর অন্য seller খুঁজেছি

আমি চাইলে DeepSeek ছেড়েই দিতে পারতাম। বাজারে এখন Qwen, GLM, Kimi, MiniMax, Mistral এবং আরও অনেক LLM আছে।

কিন্তু model বদলানো মানে আরেকটি variable যোগ করা। Responses, prompt compatibility, generation length, long-context behavior, sampling parameters—সব আবার যাচাই করতে হয়।

আমি আগে সহজ একটি প্রশ্ন পরীক্ষা করতে চেয়েছিলাম।

DeepSeek V4 Flash-ই রেখে inference কি DeepSeek-এর বদলে অন্য কারও কাছ থেকে কেনা যায়?

এখানে terminology গুরুত্বপূর্ণ। DeepSeek কোনো app-এর source tree-এর মতো করে শুধু “neural network-এর source code” প্রকাশ করেনি। বেশি সঠিকভাবে বললে তারা model weights এবং সেগুলো চালানোর প্রয়োজনীয় material প্রকাশ করেছে।

Official deepseek-ai/DeepSeek-V4-Flash-0731 repository Hugging Face-এ public। Repository এবং weights MIT License ব্যবহার করে, আর DeepSeek চারটি GB300-সহ একটি node-এ vLLM দিয়ে model চালানোর উদাহরণও দিয়েছে।

এতে economics পুরো বদলে যায়। Third-party provider-কে DeepSeek-এর token কিনে markup দিয়ে resell করতেই হবে এমন নয়। তারা open weights নিজেদের infrastructure-এ চালিয়ে নিজেদের hardware-এর compute বিক্রি করতে পারে।

অবশ্য “DeepSeek local-এ চালিয়ে নাও” বলা বাস্তব কাজটাকে অনেক সহজ শোনায়। 0731 repository প্রায় 167 GB, আর official deployment example-এ চারটি GB300 লাগে। এটি $20 VPS-এ docker compose up নয়। ফাইলগুলো model file page-এ দেখা যায়।

কিন্তু GPU cluster-সহ inference company-এর জন্য সমস্যা আলাদা। License আর প্রধান বাধা নয়; তখন hardware, electricity, GPU utilization, batching, software stack এবং inference efficiency গুরুত্বপূর্ণ।

আমি Runware পেলাম

অনেক খোঁজার পর Runware সবচেয়ে আকর্ষণীয় বিকল্পগুলোর একটি মনে হলো।

Runware কীভাবে পেলাম? আমার পছন্দের research পদ্ধতিতে। প্রথমে AI-কে বললাম, ঠিক এই model-এর জন্য সবচেয়ে সস্তা কিন্তু বাস্তবে ব্যবহারযোগ্য inference provider খুঁজতে একটি বিস্তারিত prompt লিখতে। তারপর সেই prompt দিয়ে প্রায় 15–20টি আলাদা search চালালাম, সব result একত্র করলাম, শেষে এক chat-এ সব ঢুকিয়ে candidates compare করে সবচেয়ে শক্তিশালী option বের করতে বললাম। এরপর winner-কে আমি নিজে হাতে যাচাই করেছি: model page, pricing, documentation এবং API।

AI আমাকে search-এর পরিধি বাড়াতে সাহায্য করেছে, কিন্তু final decision আমার হয়ে নেয়নি। Runware আমার manual check পেরিয়েছে, আমি নিজে connect করেছি, আর এই article-এর recommendation সেই বাস্তব test-এর ওপর ভিত্তি করে।

তারা বর্তমানে ঠিক DeepSeek-V4-Flash-0731 checkpoint-টাই 1M context-সহ দেয়, কোনো নামহীন “DeepSeek-compatible” model নয়। তাদের model page-এ দাম:

Runwareপ্রতি 1M token
Input$0.076
Cached input$0.014
Output$0.153

প্রথমে মনে হয়েছিল decimal point ভুল পড়ছি।

কিন্তু আসল comparison নতুন DeepSeek-এর উচ্চ দামের সঙ্গে নয়; বরং পুরোনো দামের সঙ্গে, যেটা তখনই খুব সস্তা মনে হতো।

পুরোনো DeepSeek input ছিল $0.14, Runware $0.076। অর্থাৎ Runware প্রায় 45.7% সস্তা, আর পুরোনো DeepSeek ছিল প্রায় 1.84× বেশি

পুরোনো output ছিল $0.28, Runware $0.153। Runware এখানে প্রায় 45.4% সস্তা, আর পুরোনো DeepSeek ছিল প্রায় 1.83× বেশি

বড় মূল্যবৃদ্ধির পর আমি একই V4 Flash 0731 checkpoint-এর এমন third-party API পেলাম, যা শুধু নতুন DeepSeek-এর চেয়ে সস্তা নয়; পুরোনো সস্তা DeepSeek-এর তুলনায়ও প্রায় অর্ধেক।

আজকের official DeepSeek rate-এর সঙ্গে gap আরও বড়। Off-peak-এ Runware cache-miss input-এ প্রায় 2.9× এবং output-এ 4.3× সস্তা। Peak-এ পার্থক্য প্রায় 5.8× এবং 8.6×

একটি গুরুত্বপূর্ণ exception আছে: cheap cache hit। DeepSeek off-peak cached input-এর জন্য $0.007/M নেয়, Runware $0.014/M। তাই cache hit-প্রধান workload শুধু সাধারণ input/output price দিয়ে তুলনা করা যাবে না।

API না চললে কম দাম অর্থহীন

শুধু pricing table আমার কাছে যথেষ্ট নয়। প্রতি request $0.000001 হলেও অর্ধেক request fail করলে সেই API মূল্যহীন।

তাই Runware connect করে real request পাঠাতে শুরু করি।

Usage dashboard-এর দুটি snapshot রেখেছিলাম। প্রথমটিতে ছিল:

790 requests
56 success
734 errors

এটা একা দেখলে খুব খারাপ। পরে dashboard-এ ছিল:

1,570 requests
836 success
734 errors

অর্থাৎ দুই measurement-এর মধ্যে পরিবর্তন:

+780 requests
+780 successful
+0 new errors

আমি এটাকে 99.999% uptime-এর প্রমাণ বলছি না। দুটি snapshot দিয়ে তা প্রমাণ করা যায় না, আর প্রথম 734 error কেন হয়েছিল তাও এগুলো বলে না।

আমি শুধু এটুকু বলতে পারি: পরের 780 request-এ successful counter 780 বেড়েছে, error counter একটুও বাড়েনি।

সেই test window-এ API দ্রুতও ছিল। Visible log-এ বেশিরভাগ successful call কয়েক দশমিক সেকেন্ড থেকে প্রায় 1.5 সেকেন্ডে শেষ হয়েছে। ছোট request-এর visible cost প্রায়ই $0.000005–$0.000018 ছিল। শত শত সফল call-এর পরও dashboard মোট খরচ প্রায় এক cent দেখাচ্ছিল।

এই পর্যায়ে Runware আর শুধু comparison table-এর একটি row ছিল না। API বাস্তবে connect করেছি, response পেয়েছি, আর test traffic-এর খরচ ছিল প্রায় কিছুই না।

এটি বিজ্ঞাপন নয় — আর আমি Runware মাত্র এক দিন ধরে test করছি

একটি provider নিয়ে ইতিবাচকভাবে লিখলে sponsored content মনে হতে পারে, তাই বিষয়টি স্পষ্ট করে বলছি। এটি বিজ্ঞাপন নয়। Runware আমার সঙ্গে যোগাযোগ করেনি, আমিও Runware-এর সঙ্গে যোগাযোগ করিনি। এই article লিখতে সেখান থেকে কেউ আমাকে বলেনি।

এছাড়া service-টি আমি মাত্র এক দিন ব্যবহার করছি। এক সপ্তাহ বা এক মাস পরে reliability, response quality, price বা অন্য কোনো সমস্যা বের হলে আমি চলে যেতেও পারি। এটি long-term verdict নয়।

Official DeepSeek API দামি হয়ে যাওয়ার সঙ্গে সঙ্গেই আমি সেখান থেকে সরে এসেছি, কারণ alternative পরীক্ষা করার সময় নতুন rate-এ টাকা পোড়াতে চাইনি। Traffic সরিয়ে সঙ্গে সঙ্গে Runware test করা শুরু করেছি।

এখন পর্যন্ত সিদ্ধান্তে আমি খুব সন্তুষ্ট। Article শেষ করার সময় Runware দিয়ে ইতিমধ্যে 1,000টি AI request সফল হয়েছে। এটি ভবিষ্যৎ uptime বা সব scale-এ performance প্রমাণ করে না, কিন্তু এটুকু প্রমাণ করে যে এটি শুধু pricing page-এ দেখা কোনো provider নয়: আমি সত্যিই ব্যবহার করছি।

তাই আমার recommendation-ও সীমিত ও সৎ: Runware আমি নিজে যাচাই করেছি, আজ আমার ক্ষেত্রে ভালো কাজ করছে, এবং এখন আমি এটি try করতে বলব। Service বদলালে আমার মতও বদলাতে পারে।

DeepSeek হয়তো নিজেরই price competitor তৈরি করেছে

এখান থেকে যা বলছি, তা observation নয়; আমার interpretation।

DeepSeek নিজেকে একটি অস্বাভাবিক business position-এ রেখেছে। তারা একদিকে খুব competitive model প্রকাশ করেছে, অন্যদিকে market-কে সেটি স্বাধীনভাবে চালানোর সুযোগ দিয়েছে।

Official DeepSeek API যখন খুব সস্তা ছিল, তখন conflict প্রায় দেখা যেত না। DeepSeek নিজেই যদি $0.14/$0.28-এ inference বিক্রি করে, অন্য GPU cluster খুঁজব কেন?

মূল্যবৃদ্ধির পর হিসাব বদলে যায়। Official peak rate যদি $0.44 input এবং $1.32 output হয়, আর independent provider একই public checkpoint $0.076/$0.153-এ দেয়, তখন alternative চেষ্টা করার economic incentive খুব শক্তিশালী হয়।

এটি কোনো accidental loophole নয়। Published weights-এর MIT License broad commercial use অনুমতি দেয়, আর official repository-তে self-hosting instructions আছে।

তাই Runware-কে শুধু “DeepSeek token reseller” বলা ঠিক হবে না। বেশি সঠিক চিত্র:

DeepSeek
    │
    ├── official DeepSeek API
    │
    └── open DeepSeek V4 Flash weights
                   │
                   ├── Runware infrastructure
                   ├── other inference providers
                   └── your own GPU cluster

একই model আর এক inference seller-এর সঙ্গে বাঁধা নেই।

Weights খোলা কি business mistake ছিল?

আমি এটাকে fact হিসেবে বলব না।

“DeepSeek model খুলেছে, competitor সস্তায় বিক্রি করবে, তাই DeepSeek টাকা হারাবে”—এভাবে বলা অতিরিক্ত সরলীকরণ। কোম্পানির internal economics আমরা জানি না।

Open-weight strategy-এর অন্য সুবিধা থাকতে পারে:

  • model-এর বিস্তৃত distribution;
  • আরও integrations;
  • ecosystem-এ বেশি influence;
  • third-party product-এ de facto standard হওয়ার সুযোগ;
  • আরও developers;
  • enterprise adoption;
  • research popularity;
  • competitor-দের ওপর চাপ।

Reuters-ও চীনা AI market নিয়ে তাদের coverage-এ developer adoption বাড়াতে Chinese model developers-এর open-weight approach-এর ওপর জোর দেওয়ার কথা লিখেছে।

তাই এখনই এটাকে business mistake বলব না। আমার সীমিত conclusion হলো:

Weights খুলে দিয়ে DeepSeek নিজের model-এর inference-এর ওপর একচেটিয়া নিয়ন্ত্রণ স্বেচ্ছায় ছেড়ে দিয়েছে।

Official API যখন অনেক বেশি দামি হয়, তখন এই সিদ্ধান্তের ফল আরও স্পষ্ট হয়। DeepSeek আর শুধু Qwen, OpenAI, Anthropic বা Moonshot-এর সঙ্গে প্রতিযোগিতা করছে না; এক অর্থে তারা এমন কোম্পানির সঙ্গেও প্রতিযোগিতা করছে যারা DeepSeek-এর নিজের open model-এর inference বিক্রি করছে।

API buyer-এর জন্য এটি দারুণ। Monetization strategy-এর জন্য বিষয়টি অনেক জটিল।

আমি কেন নিজে DeepSeek host করছি না

পরের প্রশ্ন স্বাভাবিক: third-party company যদি DeepSeek চালিয়ে inference বিক্রি করতে পারে, আমি নিজে কেন করব না?

কারণ “model download করা free” আর “inference free”—এই দুটির মধ্যে বিশাল ফারাক।

Weights download করা যায়। GPU download করা যায় না।

দামি hardware কিনতে বা rent নিতে হবে, যথেষ্ট VRAM দিতে হবে, বড় checkpoint load করতে হবে, inference engine, batching, KV cache, monitoring, scaling, redundancy configure করতে হবে এবং GPU ব্যস্ত রাখার মতো traffic থাকতে হবে।

DeepSeek V4 Flash 0731-এর official example-এ চারটি GB300-সহ একটি node ব্যবহৃত হয়েছে।

Specialized inference provider অনেক customer-এর মধ্যে infrastructure cost ভাগ করতে পারে, তাই তার জন্য investment যুক্তিযুক্ত হতে পারে। একজন developer-এর জন্য $0.076 প্রতি million input token দেওয়া, বিশাল GPU investment করে high utilization বজায় রাখার চেয়ে অনেক বেশি যুক্তিযুক্ত হতে পারে।

এখন আমি inference কিনতেই পছন্দ করি। তবে এখন অন্তত বুঝি, আমি আসলে কী কিনছি।

সেই সকাল থেকে সবচেয়ে গুরুত্বপূর্ণ শিক্ষা

দিনের শুরুতে DeepSeek-কে সাধারণ SaaS API হিসেবেই দেখেছিলাম: DeepSeek model আছে, তাই এর ব্যবহারমূল্য DeepSeek নির্ধারণ করে।

দিন শেষে আমার mental model বদলে গেল: একটি DeepSeek checkpoint আছে, আর সেটি আমার জন্য চালাতে প্রস্তুত কোম্পানির competitive market আছে।

দুটি জিনিস মৌলিকভাবে আলাদা।

Closed model হলে API pricing অনেকটাই model owner নিয়ন্ত্রণ করে। Permissive license-এর open weights হলে infrastructure provider-দের competition-ও inference price নির্ধারণ করে।

১৭ আগস্ট এই পার্থক্য আমার কাছে খুব বাস্তব হয়ে যায়। পুরোনো DeepSeek V4 Flash ছিল $0.14 input এবং $0.28 output। নতুন official DeepSeek peak-এ $0.44/$1.32 পর্যন্ত যায়। Runware এখন DeepSeek-V4-Flash-0731 $0.076/$0.153-এ দেয়।

আমি API-টি নিজে test করেছি, এবং আমার পাঠানো traffic-এ এটি কাজ করেছে।

এক মাস পরও কি দাম একই থাকবে? জানি না। একই provider কি যেকোনো scale এবং traffic profile সামলাবে? সেটাও প্রমাণ করিনি।

তবে একটি জিনিস বদলেছে: এই মূল্যবৃদ্ধির পর open-weight model creator-এর official API-কে আর স্বয়ংক্রিয়ভাবে inference কেনার সেরা জায়গা ধরে নিই না।

এখন প্রথমেই দেখি একই weights আর কে চালাতে পারে, এবং তার জন্য কত দাম চায়।