17 Ağustos sabahı API kullanım istatistiklerini açtığımda önce bir yerde hata yaptığımı düşündüm.
DeepSeek alıştığımın yaklaşık beş katı hızla para tüketiyordu.
Fiyat değişikliği geleceğini biliyordum. DeepSeek birkaç gün önce duyurmuştu ama zihnimde bunu normal bir zam olarak tutmuştum: belki %20, %50, en fazla iki kat.
Bu kadar değil.
Billing hatası yoktu. Yeni tarifeler gerçekten devreye girmişti. DeepSeek, V4 Flash ve V4 Pro'yu 16 Ağustos 16:00 UTC'den itibaren resmi olarak peak/off-peak fiyatlandırmaya geçirdi; Çin'de tarih zaten 17 Ağustos'tu. Reuters değişiklikten önce model, token türü ve saate göre artışların %50 ile %1,100 arasında olacağını yazmıştı. Zamanlama DeepSeek API change log içinde yer alıyor.
Tam o sırada DeepSeek hakkındaki başka bir haber çok daha ilginç hale geldi: model weights herkese açık. Başka şirketler aynı modeli kendileri çalıştırabiliyorsa, inference'ı neden mutlaka DeepSeek'ten almak zorundayım?
DeepSeek eskiden ne kadardı, şimdi ne kadar?
Fiyat değişikliğinden önce DeepSeek V4 Flash:
| DeepSeek V4 Flash | Eski fiyat / 1M token |
|---|---|
| Input, cache miss | $0.14 |
| Cached input | $0.0028 |
| Output | $0.28 |
Bu rakamlar eski bir DeepSeek fiyat sayfasında hâlâ görülebiliyor; Reuters da 3 Ağustos'ta aynı fiyatları aktarmıştı.
DeepSeek-V4-Flash-0731 ile eşleşen resmi deepseek-v4-flash artık:
| Off-peak | Peak | |
|---|---|---|
| Input, cache miss | $0.22 | $0.44 |
| Cached input | $0.007 | $0.014 |
| Output | $0.66 | $1.32 |
Peak dönemleri güncel DeepSeek fiyat sayfasına göre 01:00–04:00 UTC ve 06:00–10:00 UTC.
Bu nedenle faturanın yaklaşık beş kat yükseldiğini görmem, her token kategorisinin tam beş kat pahalandığı anlamına gelmiyor. Eski fiyatla kıyaslandığında:
- peak cache-miss input $0.14'ten $0.44'e çıktı: 3.14×;
- output $0.28'den $1.32'ye çıktı: 4.71×;
- cache hit $0.0028'den $0.014'e çıktı: tam 5×.
Çok output üreten bir workload için gerçek harcamanın beş kata yaklaşması dolayısıyla oldukça makul.
Önce başka model değil, aynı modelin başka satıcısını aradım
DeepSeek'i bırakabilirdim. Bugün Qwen, GLM, Kimi, MiniMax, Mistral ve pek çok başka LLM var.
Ancak model değiştirmek yeni bir değişken ekliyor. Responses, prompt compatibility, generation length, long-context davranışı, sampling parameters ve diğer özellikleri yeniden test etmek gerekiyor.
Önce daha basit bir seçeneği denemek istedim.
DeepSeek V4 Flash'ı kullanmaya devam edip inference'ı DeepSeek'ten almayı bırakabilir miyim?
Burada terminoloji önemli. DeepSeek bir geliştiricinin uygulama source tree'sini yayımlaması gibi basitçe “sinir ağının kaynak kodunu” yayımlamadı. Daha doğru ifade, model weights ve bunları çalıştırmak için gereken materyallerin yayımlanmış olmasıdır.
Resmi deepseek-ai/DeepSeek-V4-Flash-0731 repository'si Hugging Face üzerinde herkese açık. Repository ve weights MIT License kullanıyor; DeepSeek ayrıca dört GB300 bulunan tek bir node üzerinde vLLM ile çalıştırma örneği veriyor.
Bu, ekonomiyi tamamen değiştiriyor. Third-party bir provider, DeepSeek token satın alıp üzerine kâr koyarak yeniden satmak zorunda değil. Open weights'i kendi infrastructure'ında çalıştırıp kendi hardware'ındaki compute'u satabilir.
Elbette “DeepSeek'i lokal çalıştır” demek işi olduğundan çok kolay gösteriyor. 0731 repository'si yaklaşık 167 GB ve resmi deployment örneği dört GB300 kullanıyor. Bu, $20'lık VPS'te docker compose up değil. Dosyalar model file sayfasında görülebilir.
GPU cluster'a sahip bir inference şirketi içinse problem farklı. Lisans ana engel olmaktan çıkıyor; hardware, elektrik, GPU utilization, batching, software stack ve inference verimliliği kalıyor.
Runware'i buldum
Uzunca bir aramadan sonra Runware en ilginç seçeneklerden biri oldu.
Runware'i nasıl buldum? En sevdiğim araştırma yöntemiyle. Önce bir AI'dan tam olarak bu model için en ucuz ama güvenilir inference provider'ını arayacak ayrıntılı bir prompt yazmasını istedim. Ardından aynı prompt'la yaklaşık 15–20 ayrı arama yaptım, tüm sonuçları topladım, tek bir final chat'e koydum ve adayları karşılaştırıp en güçlü seçeneği çıkarmasını istedim. Ancak bundan sonra kazananı kendim kontrol ettim: model sayfası, fiyatlar, dokümantasyon ve API.
AI aramayı genişletmeme yardım etti, ama son kararı benim yerime vermedi. Runware manuel kontrolümden geçti, bağlantıyı kendim yaptım ve bu yazıdaki tavsiyem o gerçek teste dayanıyor.
Şu anda isimsiz bir “DeepSeek-compatible” model yerine tam olarak DeepSeek-V4-Flash-0731 checkpoint'ini 1M context ile sunuyor. Model sayfasındaki fiyatlar:
| Runware | 1M token başına |
|---|---|
| Input | $0.076 |
| Cached input | $0.014 |
| Output | $0.153 |
İlk başta ondalık noktayı yanlış okuduğumu düşündüm.
Fakat daha anlamlı kıyas yeni pahalı DeepSeek fiyatlarıyla değil, zaten çok ucuz görünen eski fiyatlarla.
Eski DeepSeek input $0.14'tü. Runware $0.076. Yani Runware yaklaşık %45.7 daha ucuz; eski DeepSeek yaklaşık 1.84× daha pahalıydı.
Eski output $0.28'di. Runware $0.153. Runware yaklaşık %45.4 daha ucuz; eski DeepSeek yaklaşık 1.83× daha pahalıydı.
Büyük bir fiyat artışından sonra aynı V4 Flash 0731 checkpoint'ini sunan bir third-party API buldum. Sadece yeni DeepSeek'ten daha ucuz değil; eski, ucuz DeepSeek'in neredeyse yarı fiyatına.
Bugünkü resmi fiyatlarla kıyaslanınca fark daha da büyüyor. Off-peak'te Runware cache-miss input için yaklaşık 2.9×, output için 4.3× daha ucuz. Peak'te farklar yaklaşık 5.8× ve 8.6×.
Önemli bir istisna var: ucuz cache hit. DeepSeek off-peak cached input için şu anda $0.007/M alıyor, Runware ise $0.014/M. Cache hit ağırlıklı bir workload bu yüzden sadece normal input/output fiyatlarıyla kıyaslanmamalı.
API çalışmıyorsa düşük fiyatın anlamı yok
Benim için fiyat tablosu yeterli değil. Request başına $0.000001 maliyetli bir LLM API, isteklerin yarısı başarısız oluyorsa işe yaramaz.
Bu yüzden Runware'i bağladım ve gerçek request'ler göndermeye başladım.
Usage dashboard'dan iki snapshot sakladım. İlki:
790 requests
56 success
734 errors
Tek başına korkunç görünüyor. Daha sonra dashboard:
1,570 requests
836 success
734 errors
gösterdi. İki ölçüm arasında sayaçlar tam olarak:
+780 requests
+780 successful
+0 new errors
değişti.
Bunu %99.999 uptime kanıtı olarak görmüyorum. Böyle bir şeyi kanıtlamıyor ve ilk 734 error'ın sebebini de bu iki snapshot'tan çıkaramıyorum.
Söyleyebileceğim daha dar bir şey var: sonraki 780 request sırasında successful counter 780 arttı, error counter hiç değişmedi.
API o test penceresinde hızlıydı da. Görünen log'da başarılı call'ların çoğu saniyenin küçük bir bölümünden yaklaşık 1.5 saniyeye kadar sürüyordu. Görebildiğim kısa request'lerin maliyeti çoğunlukla $0.000005–$0.000018 civarındaydı. Yüzlerce başarılı call sonrasında dashboard hâlâ toplam harcamayı yaklaşık bir cent gösteriyordu.
O noktada Runware benim için karşılaştırma tablosundaki bir satır olmaktan çıktı. API'yi gerçekten bağlamıştım, response üretiyordu ve test trafiği neredeyse hiçbir şey tutmuyordu.
Bu reklam değil — Runware'i sadece bir gündür test ediyorum
Bunu özellikle belirtmek istiyorum; çünkü tek bir provider hakkında olumlu bir bölüm kolayca sponsorlu içerik gibi görünebilir. Değil. Runware benimle iletişime geçmedi, ben de Runware ile iletişime geçmedim. Oradan hiç kimse bu yazıyı yazmamı istemedi.
Ayrıca servisi yalnızca bir gündür kullanıyorum. Bir hafta ya da bir ay sonra reliability, response quality, fiyatlar veya başka bir konuda sorun çıkarsa rahatlıkla ayrılabilirim. Bu uzun vadeli bir hüküm değil.
Pahalı hale gelen resmi DeepSeek API'den hemen çıktım; alternatif değerlendirirken yeni tarifeler üzerinden para yakmaya devam etmek istemedim. Trafiği taşıdım ve Runware'i doğrudan test etmeye başladım.
Şimdilik bu karardan çok memnunum. Yazıyı bitirdiğim sırada Runware üzerinden 1.000 başarılı AI request geçmişti. Bu hâlâ gelecekteki uptime'ı veya her ölçekteki performansı kanıtlamaz, ama bunun sadece bir fiyat sayfasında gördüğüm provider olmadığını söylemek için yeterli: gerçekten kullanıyorum.
Bu yüzden tavsiyem bilinçli olarak sınırlı: Runware'i kendim kontrol ettim, bugün benim için iyi çalışıyor ve şu anda denemenizi gerçekten tavsiye ederim. Servis değişirse fikrim de değişebilir.
DeepSeek kendi fiyat rakibini yaratmış olabilir
Buradan sonrası gözlem değil, benim yorumum.
DeepSeek kendisini alışılmadık bir business position'a koydu. Çok rekabetçi bir model çıkardı ve aynı zamanda pazarın bu modeli bağımsız çalıştırmasına izin verdi.
Resmi DeepSeek API çok ucuzken bu gerilim pek görünmüyordu. DeepSeek inference'ı $0.14/$0.28'e satıyorsa neden başka bir GPU cluster arayayım?
Fiyat artışından sonra hesap değişiyor. Resmi API peak'te $0.44 input ve $1.32 output ise, bağımsız bir provider aynı public checkpoint'i $0.076/$0.153'e sunuyorsa, alternatifi denemenin ekonomik motivasyonu çok güçleniyor.
Bu tesadüfi bir loophole değil. Yayımlanan weights'in MIT License'ı ticari kullanım dahil geniş kullanıma izin veriyor ve resmi repository self-hosting talimatları içeriyor.
Bu nedenle Runware'i basitçe “DeepSeek token reseller” diye tanımlamam. Daha doğru resim şu:
DeepSeek
│
├── resmi DeepSeek API
│
└── açık DeepSeek V4 Flash weights
│
├── Runware infrastructure
├── diğer inference provider'ları
└── kendi GPU cluster'ınızAynı model artık tek bir inference satıcısına bağlı değil.
Weights'i açmak business mistake miydi?
Bunu bir gerçek olarak söylemem.
“DeepSeek modeli açtı, rakipler daha ucuza satabilir, dolayısıyla DeepSeek kesin para kaybeder” demek fazla basit. Şirketin internal economics'ini bilmiyoruz.
Open-weight strategy başka faydalar sağlayabilir:
- modelin daha geniş yayılması;
- daha fazla integration;
- ecosystem üzerinde daha fazla etki;
- third-party ürünlerde de facto standard olma şansı;
- daha fazla developer;
- enterprise adoption;
- araştırma popülerliği;
- rakiplere baskı.
Reuters da Çin AI pazarı haberinde Çinli model geliştiricilerin geniş developer adoption için open-weight yaklaşımlara verdiği önemi vurguladı.
Bu yüzden kararı şimdiden business mistake olarak adlandırmak bana erken geliyor. Daha dar bir sonuç ise savunulabilir:
Weights'i açarak DeepSeek kendi modelinin inference'ı üzerindeki tekeli gönüllü olarak bıraktı.
Resmi API çok daha pahalı olduğunda bu kararın sonuçları daha görünür hale geliyor. DeepSeek artık yalnızca Qwen, OpenAI, Anthropic veya Moonshot ile değil, bir bakıma DeepSeek'in kendi açık modelinin inference'ını satan şirketlerle de rekabet ediyor.
API satın alanlar için bu harika. Monetization strategy için çok daha karmaşık.
Neden DeepSeek'i kendim host etmiyorum
Sonraki düşünce doğal: Third-party şirketler DeepSeek'i çalıştırıp inference satabiliyorsa ben neden yapmayayım?
Çünkü “model ücretsiz indirilebiliyor” ile “inference ücretsiz” arasında büyük fark var.
Weights indirilebilir. GPU indirilemez.
Pahalı hardware satın almak veya kiralamak, yeterli VRAM sağlamak, dev checkpoint'i yüklemek, inference engine, batching, KV cache, monitoring, scaling ve redundancy kurmak, ardından GPU'ları çoğu zaman boş bırakmayacak kadar trafik üretmek gerekiyor.
DeepSeek'in V4 Flash 0731 için resmi örneği dört GB300 bulunan tek bir node kullanıyor.
Uzmanlaşmış bir inference provider için bu yatırım mantıklı olabilir çünkü altyapı maliyeti çok sayıda müşteriye dağıtılır. Tek bir developer için 1M input token başına $0.076 ödemek, GPU'lara büyük yatırım yapıp sonra yüksek utilization sağlamaya çalışmaktan çok daha mantıklı olabilir.
Şimdilik inference satın almayı tercih ediyorum. Ama artık tam olarak ne satın aldığımı çok daha iyi anlıyorum.
O sabahtan çıkardığım en önemli ders
Günün başında DeepSeek'e normal bir SaaS API gibi bakıyordum: DeepSeek modeli var, dolayısıyla onu kullanmanın fiyatını DeepSeek belirler.
Akşama geldiğimde zihinsel modelim değişmişti: bir DeepSeek checkpoint var ve onu benim için çalıştırmaya hazır şirketlerden oluşan rekabetçi bir pazar var.
Bunlar temelden farklı pazarlar.
Closed model'de API fiyatını büyük ölçüde model sahibi kontrol eder. Permissive license altındaki open weights'te inference fiyatını infrastructure provider'ları arasındaki rekabet de şekillendirir.
17 Ağustos'ta bu fark benim için çok somut hale geldi. Eski DeepSeek V4 Flash $0.14 input ve $0.28 output'tu. Yeni resmi DeepSeek peak'te $0.44/$1.32'ye kadar çıkıyor. Runware şu anda DeepSeek-V4-Flash-0731 için $0.076/$0.153 istiyor.
Bu API'yi kendim test ettim ve gönderdiğim trafikte çalıştı.
Bir ay sonra fiyatlar aynı kalır mı? Bilmiyorum. Aynı provider her ölçeği ve her trafik profilini kaldırır mı? Bunu da kanıtlamadım.
Ama benim için bir şey değişti: bu fiyat artışından sonra open-weight model üreticisinin resmi API'sini inference satın almak için otomatik olarak en iyi yer kabul etmiyorum.
Artık ilk işim aynı weights'i başka kimin çalıştırabildiğine ve bunun için ne kadar istediğine bakmak.