Kembali ke blog
17 Agustus 2026Sergei Solod10 mnt baca

DeepSeek menaikkan harga — saya menemukan V4 Flash yang sama lebih murah dari tarif lamanya

Pada 17 Agustus, pengeluaran saya untuk DeepSeek API tiba-tiba menjadi sekitar lima kali lipat dari biasanya. Setelah itu saya menemukan dan menguji provider lain yang menjalankan checkpoint DeepSeek-V4-Flash-0731 yang sama dengan harga sekitar 45% lebih murah daripada tarif lama DeepSeek.

DeepSeekRunwareLLM APIInfrastruktur AIModel open-weight

Pagi 17 Agustus saya membuka statistik penggunaan API dan awalnya mengira ada kesalahan di pihak saya.

DeepSeek menghabiskan uang sekitar lima kali lebih cepat dari biasanya.

Saya tahu perubahan harga akan datang. DeepSeek sudah mengumumkannya beberapa hari sebelumnya, tetapi saya menganggapnya sebagai kenaikan biasa: mungkin 20%, 50%, paling jauh dua kali lipat.

Ternyata jauh lebih besar.

Tidak ada bug billing. Harga baru memang sudah berlaku. DeepSeek secara resmi memindahkan V4 Flash dan V4 Pro ke skema peak/off-peak mulai 16 Agustus pukul 16:00 UTC, yang sudah menjadi 17 Agustus di China. Reuters sebelumnya melaporkan bahwa, tergantung model, jenis token, dan waktu, kenaikannya akan berkisar 50% sampai 1,100%. Waktunya tercantum di change log DeepSeek API.

Saat itu berita DeepSeek lainnya tiba-tiba menjadi jauh lebih menarik: model weights tersedia untuk publik. Jika perusahaan lain bisa menjalankan model yang sama sendiri, mengapa saya harus membeli inference langsung dari DeepSeek?

Berapa harga DeepSeek dulu dan sekarang

Sebelum perubahan harga, DeepSeek V4 Flash dikenakan tarif:

DeepSeek V4 FlashHarga lama per 1M token
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

Angka ini masih terlihat di halaman harga lama DeepSeek, dan Reuters juga menyebut tarif yang sama pada 3 Agustus.

deepseek-v4-flash resmi, yang sesuai dengan DeepSeek-V4-Flash-0731, sekarang dihargai:

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

Periode peak berlangsung 01:00–04:00 UTC dan 06:00–10:00 UTC menurut halaman harga DeepSeek saat ini.

Jadi observasi saya bahwa pengeluaran menjadi kira-kira lima kali lipat tidak berarti setiap kategori token naik tepat lima kali. Dibandingkan harga lama:

  • peak cache-miss input naik dari $0.14 menjadi $0.44, atau 3.14×;
  • output naik dari $0.28 menjadi $1.32, atau 4.71×;
  • cache hit naik dari $0.0028 menjadi $0.014, tepat .

Untuk workload yang menghasilkan banyak output, kenaikan tagihan nyata hingga hampir lima kali lipat sangat masuk akal.

Saya lebih dulu mencari penjual lain untuk model yang sama

Saya bisa saja meninggalkan DeepSeek. Sekarang ada Qwen, GLM, Kimi, MiniMax, Mistral, dan banyak LLM lain.

Tetapi mengganti model menambah satu variabel lagi. Respons, kompatibilitas prompt, panjang generasi, perilaku long context, sampling parameters, dan hal lain harus diuji ulang.

Saya ingin mencoba opsi yang lebih sederhana terlebih dahulu.

Bisakah saya tetap memakai DeepSeek V4 Flash, tetapi berhenti membeli inference dari DeepSeek?

Di sini istilahnya penting. DeepSeek tidak sekadar merilis “source code neural network” seperti developer memublikasikan source tree aplikasi. Lebih tepatnya, DeepSeek merilis model weights dan material yang diperlukan untuk menjalankannya.

Repository resmi deepseek-ai/DeepSeek-V4-Flash-0731 tersedia publik di Hugging Face. Repository dan weights menggunakan MIT License, dan DeepSeek bahkan memberikan contoh menjalankan model melalui vLLM pada satu node dengan empat GB300.

Itu mengubah ekonominya. Provider pihak ketiga tidak harus membeli token dari DeepSeek lalu menjual ulang dengan markup. Mereka bisa menjalankan open weights di infrastructure sendiri dan menjual compute dari hardware mereka sendiri.

Tentu saja, kalimat “jalankan DeepSeek secara lokal” membuat prosesnya terdengar jauh lebih mudah daripada kenyataannya. Repository 0731 sekitar 167 GB, dan contoh deployment resmi menggunakan empat GB300. Ini bukan docker compose up pada VPS $20. File model dapat dilihat di halaman file model.

Namun bagi perusahaan inference dengan GPU cluster, masalahnya berbeda. Lisensi bukan lagi hambatan utama; yang tersisa adalah hardware, listrik, GPU utilization, batching, software stack, dan efisiensi inference.

Saya menemukan Runware

Setelah mencari cukup lama, Runware menjadi salah satu opsi paling menarik.

Bagaimana saya menemukan Runware? Dengan cara riset favorit saya. Pertama saya meminta AI menulis prompt yang rinci untuk mencari provider inference termurah tetapi tetap kredibel untuk model yang persis sama. Lalu saya menjalankan sekitar 15–20 pencarian terpisah dengan prompt tersebut, mengumpulkan semua hasil, memasukkannya ke satu chat terakhir, lalu meminta AI membandingkan kandidat dan memilih opsi terkuat. Baru setelah itu saya memeriksa pemenangnya secara manual: halaman model, harga, dokumentasi, dan API-nya sendiri.

AI membantu memperluas pencarian, tetapi keputusan akhir tetap saya buat sendiri. Runware lolos pemeriksaan manual saya, saya menghubungkannya sendiri, dan rekomendasi dalam artikel ini berasal dari pengujian itu.

Mereka saat ini menawarkan checkpoint tepat DeepSeek-V4-Flash-0731 dengan context 1M, bukan model anonim yang hanya disebut “DeepSeek-compatible”. Halaman modelnya menampilkan:

RunwareHarga per 1M token
Input$0.076
Cached input$0.014
Output$0.153

Awalnya saya mengira salah membaca posisi desimal.

Tetapi perbandingan yang lebih berguna bukan dengan harga baru DeepSeek yang mahal. Bandingkan dengan harga lama yang sebelumnya sudah terasa murah.

Input lama DeepSeek adalah $0.14. Runware $0.076. Artinya Runware sekitar 45.7% lebih murah, sementara harga lama DeepSeek sekitar 1.84× lebih tinggi.

Output lama DeepSeek $0.28. Runware $0.153. Runware sekitar 45.4% lebih murah, sedangkan DeepSeek lama sekitar 1.83× lebih mahal.

Setelah kenaikan harga besar, saya menemukan API pihak ketiga yang menjalankan checkpoint V4 Flash 0731 yang sama. Harganya bukan sekadar lebih murah dari DeepSeek baru, tetapi hampir separuh dari DeepSeek lama yang sudah murah.

Dibandingkan tarif resmi saat ini, selisihnya lebih besar lagi. Saat off-peak, Runware sekitar 2.9× lebih murah untuk cache-miss input dan 4.3× lebih murah untuk output. Saat peak, selisihnya sekitar 5.8× dan 8.6×.

Ada satu pengecualian penting: cache hit murah. DeepSeek saat ini mengenakan $0.007/M untuk cached input off-peak, sedangkan Runware $0.014/M. Workload yang didominasi cache hit tidak bisa dibandingkan hanya dari tarif input/output biasa.

Harga murah tidak berarti apa-apa jika API tidak bekerja

Tabel harga saja tidak cukup bagi saya. LLM API dengan harga $0.000001 per request tetap tidak berguna jika setengah request gagal.

Jadi saya menghubungkan Runware dan mulai mengirim request nyata.

Saya menyimpan dua snapshot usage dashboard. Snapshot pertama:

790 requests
56 success
734 errors

Jika dilihat sendiri, hasil ini sangat buruk. Tetapi kemudian dashboard menunjukkan:

1,570 requests
836 success
734 errors

Artinya, di antara dua pengukuran, counter berubah persis:

+780 requests
+780 successful
+0 new errors

Saya tidak menganggap ini bukti uptime 99.999%. Data ini sama sekali tidak membuktikan hal itu, dan dua snapshot tersebut juga tidak menjelaskan penyebab 734 error awal.

Hal yang bisa saya katakan lebih sempit: dalam 780 request berikutnya, counter successful naik 780 dan counter error tidak berubah sama sekali.

API juga cepat dalam jendela pengujian itu. Pada bagian log yang terlihat, sebagian besar call sukses selesai dalam pecahan detik hingga sekitar 1.5 detik. Request pendek yang terlihat sering berharga sekitar $0.000005–$0.000018. Setelah ratusan call sukses, dashboard masih menunjukkan total pengeluaran sekitar satu sen.

Di titik itu Runware tidak lagi sekadar satu baris dalam tabel perbandingan. Saya benar-benar sudah menghubungkan API, API menghasilkan respons, dan traffic pengujian hampir tidak menghabiskan biaya.

Ini bukan iklan — dan saya baru menguji Runware selama satu hari

Saya ingin menegaskan ini karena bagian yang positif tentang satu provider mudah terlihat seperti konten sponsor. Bukan. Runware tidak pernah menghubungi saya, dan saya juga tidak menghubungi Runware. Tidak ada orang dari sana yang meminta saya menulis artikel ini.

Saya juga baru menggunakan layanan ini selama satu hari. Seminggu atau sebulan lagi saya bisa saja pindah jika ternyata ada masalah pada reliability, kualitas respons, harga, atau hal lain. Ini bukan penilaian jangka panjang.

Saya langsung meninggalkan API resmi DeepSeek yang mahal karena tidak ingin terus membakar uang dengan tarif baru sambil mengevaluasi alternatif. Saya memindahkan traffic dan langsung mulai menguji Runware.

Sejauh ini saya sangat puas dengan keputusan itu. Saat saya menyelesaikan artikel ini, Runware sudah menangani 1.000 request AI yang berhasil untuk saya. Itu tetap tidak membuktikan uptime masa depan atau performa pada semua skala, tetapi cukup untuk menunjukkan bahwa ini bukan provider yang sekadar saya temukan di tabel harga: saya benar-benar menggunakannya.

Karena itu rekomendasi saya sengaja terbatas: saya memeriksa Runware sendiri, hari ini bekerja dengan baik untuk saya, dan saat ini saya memang menyarankan untuk mencobanya. Jika layanannya berubah, pendapat saya juga bisa berubah.

DeepSeek mungkin menciptakan pesaing harga bagi dirinya sendiri

Mulai bagian ini, saya berbicara tentang interpretasi, bukan fakta yang saya observasi langsung.

DeepSeek menempatkan dirinya dalam posisi bisnis yang tidak biasa. Mereka merilis model yang sangat kompetitif sekaligus memberi pasar kemampuan untuk menjalankannya secara independen.

Selama API resmi DeepSeek sangat murah, konflik ini hampir tidak terlihat. Mengapa mencari GPU cluster milik pihak lain jika DeepSeek sendiri menjual inference seharga $0.14/$0.28?

Setelah kenaikan harga, perhitungannya berubah. Jika API resmi mencapai $0.44 input dan $1.32 output saat peak, sementara provider independen menjual checkpoint publik yang sama seharga $0.076/$0.153, insentif ekonomi untuk mencoba alternatif menjadi sangat kuat.

Ini bukan loophole yang tidak disengaja. MIT License pada weights yang dipublikasikan mengizinkan penggunaan luas, termasuk komersial, dan repository resmi memuat petunjuk self-hosting.

Karena itu, saya tidak akan menyebut Runware sekadar “reseller token DeepSeek”. Gambaran yang lebih tepat adalah:

DeepSeek
    │
    ├── official DeepSeek API
    │
    └── open DeepSeek V4 Flash weights
                   │
                   ├── Runware infrastructure
                   ├── other inference providers
                   └── your own GPU cluster

Model yang sama tidak lagi terikat pada satu penjual inference.

Apakah membuka weights merupakan kesalahan bisnis?

Saya tidak akan menyatakannya sebagai fakta.

Terlalu sederhana jika mengatakan DeepSeek membuka model, kompetitor bisa menjual lebih murah, sehingga DeepSeek pasti kehilangan uang. Kita tidak mengetahui ekonomi internal perusahaan.

Strategi open-weight juga dapat memberikan manfaat lain:

  • distribusi model lebih luas;
  • lebih banyak integrasi;
  • pengaruh lebih besar pada ecosystem;
  • peluang menjadi de facto standard di produk pihak ketiga;
  • lebih banyak developer;
  • enterprise adoption;
  • popularitas riset;
  • tekanan pada kompetitor.

Reuters juga menyoroti fokus developer model China pada pendekatan open-weight untuk mencapai adopsi developer yang luas dalam liputannya tentang pasar AI China.

Karena itu saya belum mau menyebut keputusan ini sebagai kesalahan bisnis. Kesimpulan yang lebih sempit terasa lebih aman:

Dengan membuka weights, DeepSeek secara sukarela melepaskan monopoli atas inference modelnya sendiri.

Ketika API resmi menjadi jauh lebih mahal, konsekuensi dari pilihan itu menjadi lebih terlihat. DeepSeek tidak hanya bersaing dengan Qwen, OpenAI, Anthropic, atau Moonshot. Dalam arti tertentu, ia juga bersaing dengan perusahaan yang menjual inference untuk model terbuka milik DeepSeek sendiri.

Bagi pembeli API, ini sangat bagus. Bagi strategi monetisasi, ini jauh lebih rumit.

Mengapa saya tidak self-host DeepSeek

Pikiran berikutnya jelas: jika perusahaan lain bisa menjalankan DeepSeek dan menjual inference, mengapa saya tidak melakukannya sendiri?

Karena ada jarak sangat besar antara “model dapat diunduh gratis” dan “inference gratis”.

Weights bisa diunduh. GPU tidak.

Anda perlu membeli atau menyewa hardware mahal, menyediakan VRAM yang cukup, memuat checkpoint besar, mengatur inference engine, batching, KV cache, monitoring, scaling, redundancy, lalu menghasilkan traffic yang cukup agar GPU tidak menganggur sebagian besar waktu.

Contoh resmi DeepSeek untuk V4 Flash 0731 menggunakan satu node dengan empat GB300.

Bagi provider inference khusus, investasi ini bisa masuk akal karena biaya infrastructure dibagi ke banyak pelanggan. Bagi satu developer, membayar $0.076 per satu juta input token mungkin jauh lebih rasional daripada menginvestasikan banyak uang ke GPU lalu berusaha menjaga utilization tetap tinggi.

Untuk sekarang saya lebih memilih membeli inference. Tetapi kini saya jauh lebih memahami apa sebenarnya yang saya beli.

Pelajaran terpenting dari pagi itu

Di awal hari, saya melihat DeepSeek seperti SaaS API biasa: ada model DeepSeek, jadi DeepSeek menentukan berapa biaya untuk menggunakannya.

Menjelang malam, model mental saya berubah: ada checkpoint DeepSeek, dan ada pasar kompetitif perusahaan yang bersedia menjalankan checkpoint itu untuk saya.

Keduanya adalah pasar yang secara fundamental berbeda.

Pada model tertutup, harga API sebagian besar dikendalikan pemilik model. Pada open weights dengan lisensi permisif, harga inference juga dibentuk oleh persaingan antarpemasok infrastructure.

Pada 17 Agustus, perbedaan itu menjadi sangat nyata bagi saya. DeepSeek V4 Flash lama berharga $0.14 input dan $0.28 output. Harga resmi baru mencapai $0.44/$1.32 saat peak. Runware saat ini menawarkan DeepSeek-V4-Flash-0731 seharga $0.076/$0.153.

Saya sudah menguji API ini sendiri, dan API tersebut bekerja untuk traffic yang saya kirim.

Apakah harga ini tetap sama sebulan lagi? Saya tidak tahu. Apakah provider yang sama mampu menangani semua skala dan semua pola traffic? Itu juga belum saya buktikan.

Tetapi satu hal berubah bagi saya: setelah kenaikan harga ini, saya tidak lagi menganggap API resmi dari pembuat model open-weight sebagai tempat yang otomatis paling tepat untuk membeli inference.

Sekarang langkah pertama saya adalah melihat siapa lagi yang bisa menjalankan weights yang sama, dan berapa biaya yang mereka minta.