블로그로 돌아가기
2026년 8월 17일Sergei Solod12 분 읽기

DeepSeek가 가격을 올렸다 — 같은 V4 Flash를 예전 요금보다 더 싸게 찾았다

8월 17일 아침 DeepSeek API 지출이 평소의 약 5배로 늘어난 것을 확인했다. 이후 동일한 DeepSeek-V4-Flash-0731 checkpoint를 제공하는 다른 provider를 찾아 직접 테스트했는데, 현재 가격은 DeepSeek의 예전 요금보다도 약 45% 낮았다.

DeepSeekRunwareLLM APIAI 인프라Open-weight 모델

8월 17일 아침 API 사용 통계를 열었을 때 처음에는 내가 어디선가 실수한 줄 알았다.

DeepSeek가 평소보다 약 5배 빠른 속도로 비용을 소모하고 있었기 때문이다.

가격이 바뀐다는 사실은 알고 있었다. DeepSeek가 며칠 전에 공지했지만, 머릿속에서는 일반적인 인상 정도로 생각했다. 20%, 50%, 많아도 두 배 정도일 거라고 봤다.

실제 변화는 훨씬 컸다.

Billing bug는 아니었다. 새 가격이 실제로 적용된 것이었다. DeepSeek는 8월 16일 16:00 UTC부터 V4 Flash와 V4 Pro를 peak/off-peak pricing으로 전환했다. 중국 시간으로는 이미 8월 17일이었다. Reuters는 변경 전에 model, token type, 시간대에 따라 인상 폭이 50%에서 1,100%까지라고 보도했다. 적용 시점은 DeepSeek API change log에서 확인할 수 있다.

그때 DeepSeek의 다른 소식이 갑자기 훨씬 중요해졌다. 모델 weights가 공개되어 있다는 점이다. 다른 회사도 같은 model을 직접 실행할 수 있다면, inference를 꼭 DeepSeek에서 직접 살 이유가 있을까?

DeepSeek는 예전에 얼마였고 지금은 얼마인가

가격 변경 전 DeepSeek V4 Flash는 다음과 같았다.

DeepSeek V4 Flash예전 가격 / 1M tokens
Input, cache miss$0.14
Cached input$0.0028
Output$0.28

이 숫자는 예전 DeepSeek pricing page에 남아 있고, Reuters도 8월 3일 같은 가격을 인용했다.

DeepSeek-V4-Flash-0731에 해당하는 공식 deepseek-v4-flash의 현재 가격은 다음과 같다.

Off-peakPeak
Input, cache miss$0.22$0.44
Cached input$0.007$0.014
Output$0.66$1.32

현재 DeepSeek pricing page에 따르면 peak 시간은 01:00–04:00 UTC와 06:00–10:00 UTC다.

따라서 내가 “비용이 약 5배가 됐다”고 본 것이 모든 token category가 정확히 5배 올랐다는 뜻은 아니다. 예전 가격과 비교하면:

  • peak cache-miss input은 $0.14에서 $0.44로 올라 3.14×;
  • output은 $0.28에서 $1.32로 올라 4.71×;
  • cache hit은 $0.0028에서 $0.014로 올라 정확히 다.

output 생성량이 많은 workload라면 실제 지출이 5배 가까이 증가하는 것은 충분히 가능한 결과다.

다른 모델이 아니라 같은 모델을 파는 다른 회사를 먼저 찾았다

DeepSeek를 버리고 다른 모델로 갈 수도 있었다. Qwen, GLM, Kimi, MiniMax, Mistral 등 선택지는 많다.

하지만 모델을 바꾸면 변수가 하나 더 생긴다. Responses, prompt compatibility, generation length, long-context behavior, sampling parameters 등을 다시 검증해야 한다.

그래서 먼저 더 단순한 질문을 확인하고 싶었다.

DeepSeek V4 Flash는 그대로 쓰면서 inference만 DeepSeek가 아닌 곳에서 살 수 있을까?

여기서는 용어를 정확히 할 필요가 있다. DeepSeek가 애플리케이션의 source tree처럼 단순히 “신경망 소스 코드”를 공개한 것은 아니다. 더 정확하게는 모델 weights와 이를 실행하는 데 필요한 자료를 공개했다.

공식 deepseek-ai/DeepSeek-V4-Flash-0731 repository는 Hugging Face에 공개되어 있다. Repository와 weights는 MIT License를 사용하며, DeepSeek는 4개의 GB300이 있는 한 node에서 vLLM으로 model을 실행하는 예시도 제공한다.

이것은 economics를 바꾼다. Third-party provider가 DeepSeek token을 사서 markup을 붙여 재판매할 필요는 없다. Open weights를 자체 infrastructure에서 실행한 뒤 자기 hardware의 compute를 판매할 수 있다.

물론 “DeepSeek를 로컬에서 돌리면 된다”는 표현은 실제 난이도를 지나치게 단순화한다. 0731 repository는 약 167 GB이고, 공식 deployment 예시는 4개의 GB300을 사용한다. $20 VPS에서 docker compose up으로 끝나는 일이 아니다. 파일은 model file page에서 볼 수 있다.

하지만 GPU cluster를 가진 inference 회사라면 이야기가 다르다. License가 주요 장벽이 아니게 되고, hardware, 전력, GPU utilization, batching, software stack, inference efficiency가 남는다.

Runware를 찾았다

꽤 오래 찾아본 끝에 Runware가 가장 흥미로운 선택지 중 하나였다.

Runware를 어떻게 찾았냐면, 내가 가장 좋아하는 research 방식으로 찾았다. 먼저 AI에게 이 정확한 model을 실행하면서도 가격이 가장 낮고 현실적으로 쓸 만한 inference provider를 찾기 위한 상세 prompt를 작성하게 했다. 그 prompt로 약 15–20번 별도의 검색을 돌리고, 모든 결과를 모아 마지막 하나의 chat에 넣은 뒤 후보를 비교해 가장 강한 선택지를 추리게 했다. 그다음부터는 내가 직접 model page, 가격, documentation, 실제 API를 확인했다.

AI는 검색 범위를 넓히는 데 도움을 줬을 뿐, 최종 결정을 대신 내린 것은 아니다. Runware는 내 수동 검증을 통과했고, 직접 연결해 테스트했으며, 이 글의 추천은 그 결과에 기반한다.

현재 1M context의 정확한 DeepSeek-V4-Flash-0731 checkpoint를 제공한다. 이름 없는 “DeepSeek-compatible” 모델이 아니다. model page에 표시된 가격은 다음과 같다.

Runware1M tokens당 가격
Input$0.076
Cached input$0.014
Output$0.153

처음에는 소수점 위치를 잘못 본 줄 알았다.

하지만 더 의미 있는 비교 대상은 새로 비싸진 DeepSeek가 아니라, 이미 충분히 싸다고 느꼈던 예전 가격이다.

예전 DeepSeek input은 $0.14였다. Runware는 $0.076이다. Runware가 약 45.7% 저렴하고, 예전 DeepSeek는 약 1.84× 더 비쌌다.

예전 output은 $0.28였다. Runware는 $0.153이다. Runware가 약 45.4% 저렴하고, 예전 DeepSeek는 약 1.83× 더 비쌌다.

큰 가격 인상 뒤에 동일한 V4 Flash 0731 checkpoint를 제공하는 third-party API를 찾았는데, 새 DeepSeek보다 싼 정도가 아니라 예전의 저렴한 DeepSeek보다도 거의 절반 수준이었다.

현재 공식 가격과 비교하면 차이는 더 커진다. Off-peak에서 Runware는 cache-miss input 기준 약 2.9×, output 기준 약 4.3× 저렴하다. Peak에서는 약 5.8×, 8.6×다.

중요한 예외는 저렴한 cache hit이다. DeepSeek의 off-peak cached input은 현재 $0.007/M이고 Runware는 $0.014/M이다. 따라서 cache hit 비중이 매우 높은 workload는 일반 input/output 가격만으로 비교하면 안 된다.

API가 작동하지 않으면 낮은 가격은 의미가 없다

가격표만으로는 충분하지 않다. Request당 $0.000001이라도 절반이 실패하는 LLM API는 쓸모가 없다.

그래서 Runware를 연결하고 실제 request를 보내기 시작했다.

Usage dashboard snapshot 두 개를 저장해 뒀다. 첫 번째는:

790 requests
56 success
734 errors

이 숫자만 보면 끔찍하다. 이후 dashboard는:

1,570 requests
836 success
734 errors

였다. 두 측정 사이의 변화는 정확히:

+780 requests
+780 successful
+0 new errors

이다.

이것을 99.999% uptime의 증거로 사용하지는 않는다. 그런 것을 증명하는 데이터가 아니며, 처음 734 errors가 왜 발생했는지도 이 두 snapshot으로는 알 수 없다.

내가 말할 수 있는 것은 더 좁다. 다음 780 requests 동안 successful counter는 780 늘었고 error counter는 전혀 증가하지 않았다.

그 test window에서 API도 빨랐다. Visible log에서 대부분의 successful call은 1초 미만에서 약 1.5초 사이에 끝났다. 보였던 짧은 request의 비용은 대개 $0.000005–$0.000018 수준이었다. 수백 건 성공 후에도 dashboard의 총 지출은 약 1센트였다.

그 시점부터 Runware는 단순한 비교표의 한 줄이 아니었다. 실제로 API를 연결했고, response가 생성됐으며, test traffic 비용은 거의 없었다.

이 글은 광고가 아니다 — 그리고 Runware를 테스트한 지 아직 하루뿐이다

한 provider를 긍정적으로 쓰면 협찬 글처럼 보일 수 있어서 분명히 말해 둔다. 광고가 아니다. Runware가 나에게 연락한 적도 없고, 나도 Runware에 연락한 적이 없다. 이 글을 써 달라는 요청을 받은 것도 아니다.

또한 서비스 사용 기간은 아직 하루다. 일주일이나 한 달 뒤 reliability, 답변 품질, 가격 또는 다른 문제를 발견하면 충분히 다른 곳으로 옮길 수 있다. 장기 평가가 아니다.

비싸진 공식 DeepSeek API에서는 바로 빠져나왔다. 대안을 찾는 동안에도 새 요금으로 계속 돈을 태우고 싶지 않았기 때문이다. Traffic을 옮기고 곧바로 Runware를 테스트하기 시작했다.

현재까지는 그 결정에 매우 만족하고 있다. 이 글을 마무리할 무렵 Runware를 통해 1,000건의 AI request가 성공했다. 물론 이것이 미래 uptime이나 모든 scale에서의 성능을 증명하지는 않는다. 하지만 적어도 가격표에서만 발견한 provider가 아니라 실제로 사용 중인 서비스라고 말할 수는 있다.

그래서 내 추천도 범위를 분명히 한다. 내가 직접 Runware를 확인했고 오늘은 잘 작동하며, 현재로서는 직접 시험해 볼 만하다고 권한다. 서비스가 바뀌면 내 의견도 바뀔 수 있다.

DeepSeek가 자기 가격 경쟁자를 만든 것일 수도 있다

여기부터는 직접 관찰한 사실이 아니라 내 해석이다.

DeepSeek는 꽤 독특한 business position에 있다. 매우 경쟁력 있는 모델을 출시하면서 동시에 시장이 그 모델을 독립적으로 실행할 수 있게 했다.

공식 DeepSeek API가 매우 쌌을 때는 이 긴장이 거의 보이지 않았다. DeepSeek가 직접 $0.14/$0.28에 inference를 파는데 굳이 다른 GPU cluster를 찾을 이유가 없었다.

가격 인상 뒤에는 계산이 달라진다. 공식 API가 peak에서 $0.44 input, $1.32 output인데 독립 provider가 같은 public checkpoint를 $0.076/$0.153에 제공한다면, 대안을 시험할 경제적 유인이 매우 강해진다.

이것은 우연한 loophole이 아니다. 공개 weights의 MIT License는 commercial use를 포함한 광범위한 사용을 허용하고, 공식 repository에는 self-hosting instructions가 있다.

그래서 Runware를 단순히 “DeepSeek token reseller”라고 부르는 것은 정확하지 않다. 더 맞는 그림은 다음과 같다.

DeepSeek
    │
    ├── official DeepSeek API
    │
    └── open DeepSeek V4 Flash weights
                   │
                   ├── Runware infrastructure
                   ├── other inference providers
                   └── your own GPU cluster

같은 모델이 더 이상 한 inference 판매자에게만 묶여 있지 않다.

Weights 공개는 business mistake였을까

나는 그것을 사실이라고 단정하지 않는다.

DeepSeek가 모델을 열었고 경쟁사가 더 싸게 팔 수 있으니 DeepSeek가 돈을 잃을 것이라고 말하는 것은 너무 단순하다. 회사 내부 economics를 모르기 때문이다.

Open-weight 전략에는 다른 이점이 있을 수 있다.

  • 더 넓은 모델 배포;
  • 더 많은 integration;
  • ecosystem 영향력 확대;
  • third-party product에서 de facto standard가 될 가능성;
  • 더 많은 developer;
  • enterprise adoption;
  • 연구 분야의 인지도;
  • 경쟁사에 대한 압박.

Reuters도 중국 AI 시장 기사에서 폭넓은 developer adoption을 위해 중국 모델 개발사들이 open-weight approach를 강조한다고 설명했다.

따라서 지금 business mistake라고 부르는 것은 이르다고 본다. 대신 더 좁은 결론은 말할 수 있다.

Weights를 공개함으로써 DeepSeek는 자기 모델의 inference에 대한 독점을 자발적으로 포기했다.

공식 API가 크게 비싸지면 이 선택의 결과가 더 분명해진다. DeepSeek는 Qwen, OpenAI, Anthropic, Moonshot뿐 아니라 어떤 의미에서는 자기 open model의 inference를 파는 회사들과도 경쟁하게 된다.

API 구매자에게는 좋은 일이다. Monetization strategy에는 훨씬 복잡한 문제다.

왜 직접 DeepSeek를 host하지 않는가

다음 생각은 자연스럽다. Third-party 회사가 DeepSeek를 돌리고 inference를 팔 수 있다면 내가 직접 하면 되지 않을까?

하지만 “모델은 무료로 download 가능”과 “inference가 무료” 사이에는 큰 차이가 있다.

Weights는 download할 수 있다. GPU는 그렇지 않다.

비싼 hardware를 사거나 빌리고, 충분한 VRAM을 확보하고, 거대한 checkpoint를 load하고, inference engine, batching, KV cache, monitoring, scaling, redundancy를 구성해야 한다. 그리고 GPU가 대부분의 시간 idle하지 않도록 충분한 traffic도 필요하다.

DeepSeek V4 Flash 0731의 공식 예시는 4개의 GB300이 있는 한 node를 사용한다.

전문 inference provider라면 infrastructure cost를 많은 고객에게 나눌 수 있어 이 투자가 합리적일 수 있다. 한 명의 developer라면 GPU에 큰돈을 넣고 utilization을 유지하려는 것보다 1M input tokens당 $0.076을 내는 편이 훨씬 합리적일 수 있다.

지금은 inference를 사는 쪽을 택한다. 다만 이제는 내가 무엇에 돈을 내는지 훨씬 잘 이해하게 됐다.

그날 아침에서 얻은 가장 큰 교훈

하루를 시작할 때는 DeepSeek를 평범한 SaaS API로 생각했다. DeepSeek model이 있으니, 사용 가격도 DeepSeek가 정한다고 봤다.

저녁이 되자 mental model이 달라졌다. DeepSeek checkpoint가 있고, 그 checkpoint를 대신 실행해 주는 회사들의 경쟁 시장이 있다.

둘은 근본적으로 다른 시장이다.

Closed model에서는 model owner가 API 가격을 상당 부분 통제한다. Permissive license의 open weights에서는 infrastructure provider 사이의 경쟁도 inference price를 결정한다.

8월 17일 이 차이가 매우 구체적으로 다가왔다. 예전 DeepSeek V4 Flash는 $0.14 input, $0.28 output이었다. 새 공식 DeepSeek는 peak에서 $0.44/$1.32까지 올라간다. Runware는 현재 DeepSeek-V4-Flash-0731을 $0.076/$0.153에 제공한다.

나는 이 API를 직접 테스트했고, 내가 보낸 traffic에서는 작동했다.

한 달 뒤에도 가격이 같을까? 모른다. 같은 provider가 어떤 scale과 어떤 traffic profile도 처리할까? 그것도 증명하지 않았다.

하지만 한 가지는 바뀌었다. 이번 가격 인상 이후, open-weight model 제작사의 공식 API를 inference를 사기 위한 자동적인 최선의 선택이라고 생각하지 않게 됐다.

이제는 먼저 같은 weights를 누가 또 실행할 수 있는지, 그리고 얼마를 받는지 확인한다.