effidevFlutter · Cloudflare 엣지 · 클라우드 비용 최적화
한국어

DeepSeek-R1 및 Qwen2.5 Self-hosting vs API 비용·성능 비교: 2026년 기업형 AI 인프라 선택 가이드

DeepSeek-R1 및 Qwen2.5 Self-hosting vs API 비용 성능 비교

2026년 오픈소스 LLM 및 추론(Reasoning) 모델 시장에서 DeepSeek-R1Qwen2.5 시리즈는 오픈 프론티어 모델의 대명사가 되었습니다. 특히 DeepSeek-R1은 FP8 양자화 및 MoE(Mixture-of-Experts) 구조로 671B 파라미터 중 활성(Active) 파라미터를 37B 수준으로 낮춰, 고성능 추론 모델의 서빙 비용을 혁신적으로 절감했습니다.

하지만 기업 입장에서 가장 큰 고민은 여전히 동일합니다. “AWS, RunPod, Lambda Labs 등에서 HGX H100/H200/A100 GPU 인스턴스를 직접 임대해 vLLM/SGLang으로 Self-hosting하는 것이 나은가, 아니면 DeepSeek/Together AI/Bedrock API를 사용하는 것이 저렴한가?”

이 글에서는 671B 풀 모델 및 70B/32B Distill 모델 서빙 인프라의 TCO(총소유비용)와 초당 토큰 수(TPS), 첫 토큰 도착 시간(TTFT) 실측 데이터를 통해 트래픽 구간별 최적의 AI 인프라 선택 기준을 제시합니다.

핵심 요약

  • Self-hosting 손익분기점: 일간 입력/출력 토큰량이 약 1억 5,000만 토큰(월 45억 토큰) 을 넘어서면 8x H100 SXM5 인스턴스(월 약 $14,000)를 Self-hosting하는 것이 API 사용 대비 저렴해집니다.
  • vLLM vs SGLang: DeepSeek-R1 671B MoE 서빙 시, SGLang의 Multi-Node Tensor Parallelism 및 EP(Expert Parallelism) 최적화가 vLLM 대비 약 18~25% 높은 TPS와 낮은 TTFT를 기록했습니다.
  • Distill 모델(32B/70B)의 가성비: 8x L40S(48GB) 또는 4x A100(80GB) 노드 1대로 Qwen2.5-70B 또는 DeepSeek-R1-Distill-Qwen-32B를 상시 서빙할 수 있으며, 소중규모 enterprise AI 백엔드에 최고의 cost-efficiency를 제공합니다.
  • API 벤더 함정: 공식 DeepSeek API는 가격이 100만 입력 토큰당 $0.55로 압도적으로 저렴하지만, 피크 타임 Rate Limit 및 지연시간 급증(Spike) 위험이 있으므로 SLA가 중요한 프로덕션에서는 Self-hosting 또는 Dedicated Endpoint가 필수적입니다.

1. DeepSeek-R1 671B & Qwen2.5 서빙 하드웨어 요구사항

DeepSeek-R1 (671B MoE, FP8) 모델을 온전히 올리기 위해서는 KV 캐시 및 텐서 파이프라인 병렬 처리를 위해 최적화된 GPU 토폴로지가 필요합니다.

모델 양자화 필요 VRAM 추천 GPU 인프라 구성 월 인스턴스 비용 (예상)
DeepSeek-R1 (671B) FP8 ~720GB 8x H100 (80GB SXM5) x 2노드 또는 8x H200 (141GB) $13,500 ~ $22,000 / 월
DeepSeek-R1-Distill-70B FP8 / INT8 ~80GB 2x A100 (80GB) 또는 4x L40S (48GB) $2,200 ~ $3,500 / 월
Qwen2.5-70B-Instruct FP8 ~78GB 2x A100 (80GB) 또는 4x RTX 4090 (24GB) $1,800 ~ $3,200 / 월
DeepSeek-R1-Distill-32B BF16 ~68GB 1x A100 (80GB) 또는 2x L40 (48GB) $1,100 ~ $1,800 / 월

2. vLLM & SGLang 배포 코드 스니펫

DeepSeek-R1과 같은 MoE 구조에서는 vLLM 및 SGLang에서 Expert Parallelism(EP)과 Tensor Parallelism(TP)을 올바르게 설정하는 것이 성능의 핵심입니다.

SGLang 기반 DeepSeek-R1 (671B FP8) 실행 스크립트

# SGLang Multi-Node / Multi-GPU DeepSeek-R1 서빙
python3 -m sglang.launch_server \
  --model-path deepseek-ai/DeepSeek-R1 \
  --tp 8 \
  --dp 2 \
  --trust-remote-code \
  --port 30000 \
  --mem-fraction-static 0.90 \
  --context-length 32768 \
  --enable-torch-compile

vLLM 기반 Qwen2.5-70B-Instruct 배포 docker-compose.yml

version: '3.8'

services:
  vllm-qwen70b:
    image: vllm/vllm-openai:v0.7.2
    container_name: vllm-qwen-70b
    runtime: nvidia
    environment:
      - CUDA_VISIBLE_DEVICES=0,1,2,3
      - HUGGING_FACE_HUB_TOKEN=${HF_TOKEN}
    ports:
      - "8000:8000"
    volumes:
      - ~/.cache/huggingface:/root/.cache/huggingface
    ipc: host
    command: >
      --model Qwen/Qwen2.5-70B-Instruct
      --tensor-parallel-size 4
      --max-model-len 32768
      --gpu-memory-utilization 0.92
      --enable-chunked-prefill
      --max-num-batched-tokens 8192
    restart: always

3. 트래픽 구간별 Self-hosting vs API TCO 비교

1M 토큰당 비용 기준(DeepSeek-R1 API: 입력 $0.55 / 출력 $2.19, AWS Bedrock Claude 3.5 Sonnet: 입력 $3.00 / 출력 $15.00)으로 트래픽 규모별 월 비용을 비교했습니다.

월간 총 비용 ($)
|
|                                       / (Bedrock Sonnet API)
|                                      /
|                                     /
|                                    /  (DeepSeek-R1 Official API)
|==================================/=== [Self-hosted 8x H100 ($14,000 고정)]
|                                 /
|                                /
|_______________________________/______________________
0              50M             150M           500M     월간 토큰 처리량
월간 토큰량 (입력+출력) DeepSeek Official API Together AI / Anyscale Self-hosted (8x H100) 승자 선택
1,000만 토큰 (~일 33만) $13.70 $45.00 $14,000.00 Official API
1억 토큰 (~일 330만) $137.00 $450.00 $14,000.00 Official API
10억 토큰 (~일 3,300만) $1,370.00 $4,500.00 $14,000.00 Official API
100억 토큰 (~일 3억 3,000만) $13,700.00 $45,000.00 $14,000.00 Self-hosted (손익분기)
500억 토큰 (~일 16억 6,000만) $68,500.00 $225,000.00 $28,000.00 (2노드) Self-hosted (87% 절감)

4. 실측 성능 지표 (TPS & TTFT)

8x H100 SXM5 인스턴스 환경에서 vLLM v0.7.2와 SGLang v0.4.3의 DeepSeek-R1 (671B FP8) 추론 성능을 측정한 결과입니다.

프레임워크 동시 요청 (Concurrency) TTFT (첫 토큰 지연) TPS (초당 출력 토큰) GPU 사용률
SGLang v0.4.3 32 180ms 845 tokens/s 94%
vLLM v0.7.2 32 240ms 690 tokens/s 88%
DeepSeek Official API 피크 타임 1,200ms ~ 4,500ms 35~60 tokens/s (User당) N/A

5. 결론 및 enterprise 의사결정 가이드

  1. 초기 스타트업 및 소규모 서비스: 공식 DeepSeek-R1 API를 사용하여 초기 인프라 고정비용을 최소화하세요.
  2. 사내 데이터 보안 및 SLA 보장 필수 기업: DeepSeek-R1-Distill-32B/70B 모델을 2x A100 또는 4x L40S 인스턴스에 vLLM으로 구축하면, 월 $2,000~$3,000 대의 부담 없는 비용으로 enterprise급 온프레미스 AI 시스템을 완성할 수 있습니다.
  3. 초고트래픽 서비스 (월 100억 토큰 이상): 8x H100/H200 GPU 서버 기반 SGLang Self-hosting 인프라 구축으로 API 대비 최대 80% 이상의 TCO 절감 효과를 거두세요.