DeepSeek-R1 및 Qwen2.5 Self-hosting vs API 비용·성능 비교: 2026년 기업형 AI 인프라 선택 가이드

2026년 오픈소스 LLM 및 추론(Reasoning) 모델 시장에서 DeepSeek-R1과 Qwen2.5 시리즈는 오픈 프론티어 모델의 대명사가 되었습니다. 특히 DeepSeek-R1은 FP8 양자화 및 MoE(Mixture-of-Experts) 구조로 671B 파라미터 중 활성(Active) 파라미터를 37B 수준으로 낮춰, 고성능 추론 모델의 서빙 비용을 혁신적으로 절감했습니다.
하지만 기업 입장에서 가장 큰 고민은 여전히 동일합니다. “AWS, RunPod, Lambda Labs 등에서 HGX H100/H200/A100 GPU 인스턴스를 직접 임대해 vLLM/SGLang으로 Self-hosting하는 것이 나은가, 아니면 DeepSeek/Together AI/Bedrock API를 사용하는 것이 저렴한가?”
이 글에서는 671B 풀 모델 및 70B/32B Distill 모델 서빙 인프라의 TCO(총소유비용)와 초당 토큰 수(TPS), 첫 토큰 도착 시간(TTFT) 실측 데이터를 통해 트래픽 구간별 최적의 AI 인프라 선택 기준을 제시합니다.
핵심 요약
- Self-hosting 손익분기점: 일간 입력/출력 토큰량이 약 1억 5,000만 토큰(월 45억 토큰) 을 넘어서면 8x H100 SXM5 인스턴스(월 약 $14,000)를 Self-hosting하는 것이 API 사용 대비 저렴해집니다.
- vLLM vs SGLang: DeepSeek-R1 671B MoE 서빙 시, SGLang의 Multi-Node Tensor Parallelism 및 EP(Expert Parallelism) 최적화가 vLLM 대비 약 18~25% 높은 TPS와 낮은 TTFT를 기록했습니다.
- Distill 모델(32B/70B)의 가성비: 8x L40S(48GB) 또는 4x A100(80GB) 노드 1대로 Qwen2.5-70B 또는 DeepSeek-R1-Distill-Qwen-32B를 상시 서빙할 수 있으며, 소중규모 enterprise AI 백엔드에 최고의 cost-efficiency를 제공합니다.
- API 벤더 함정: 공식 DeepSeek API는 가격이 100만 입력 토큰당 $0.55로 압도적으로 저렴하지만, 피크 타임 Rate Limit 및 지연시간 급증(Spike) 위험이 있으므로 SLA가 중요한 프로덕션에서는 Self-hosting 또는 Dedicated Endpoint가 필수적입니다.
1. DeepSeek-R1 671B & Qwen2.5 서빙 하드웨어 요구사항
DeepSeek-R1 (671B MoE, FP8) 모델을 온전히 올리기 위해서는 KV 캐시 및 텐서 파이프라인 병렬 처리를 위해 최적화된 GPU 토폴로지가 필요합니다.
| 모델 | 양자화 | 필요 VRAM | 추천 GPU 인프라 구성 | 월 인스턴스 비용 (예상) |
|---|---|---|---|---|
| DeepSeek-R1 (671B) | FP8 | ~720GB | 8x H100 (80GB SXM5) x 2노드 또는 8x H200 (141GB) | $13,500 ~ $22,000 / 월 |
| DeepSeek-R1-Distill-70B | FP8 / INT8 | ~80GB | 2x A100 (80GB) 또는 4x L40S (48GB) | $2,200 ~ $3,500 / 월 |
| Qwen2.5-70B-Instruct | FP8 | ~78GB | 2x A100 (80GB) 또는 4x RTX 4090 (24GB) | $1,800 ~ $3,200 / 월 |
| DeepSeek-R1-Distill-32B | BF16 | ~68GB | 1x A100 (80GB) 또는 2x L40 (48GB) | $1,100 ~ $1,800 / 월 |
2. vLLM & SGLang 배포 코드 스니펫
DeepSeek-R1과 같은 MoE 구조에서는 vLLM 및 SGLang에서 Expert Parallelism(EP)과 Tensor Parallelism(TP)을 올바르게 설정하는 것이 성능의 핵심입니다.
SGLang 기반 DeepSeek-R1 (671B FP8) 실행 스크립트
# SGLang Multi-Node / Multi-GPU DeepSeek-R1 서빙
python3 -m sglang.launch_server \
--model-path deepseek-ai/DeepSeek-R1 \
--tp 8 \
--dp 2 \
--trust-remote-code \
--port 30000 \
--mem-fraction-static 0.90 \
--context-length 32768 \
--enable-torch-compile
vLLM 기반 Qwen2.5-70B-Instruct 배포 docker-compose.yml
version: '3.8'
services:
vllm-qwen70b:
image: vllm/vllm-openai:v0.7.2
container_name: vllm-qwen-70b
runtime: nvidia
environment:
- CUDA_VISIBLE_DEVICES=0,1,2,3
- HUGGING_FACE_HUB_TOKEN=${HF_TOKEN}
ports:
- "8000:8000"
volumes:
- ~/.cache/huggingface:/root/.cache/huggingface
ipc: host
command: >
--model Qwen/Qwen2.5-70B-Instruct
--tensor-parallel-size 4
--max-model-len 32768
--gpu-memory-utilization 0.92
--enable-chunked-prefill
--max-num-batched-tokens 8192
restart: always
3. 트래픽 구간별 Self-hosting vs API TCO 비교
1M 토큰당 비용 기준(DeepSeek-R1 API: 입력 $0.55 / 출력 $2.19, AWS Bedrock Claude 3.5 Sonnet: 입력 $3.00 / 출력 $15.00)으로 트래픽 규모별 월 비용을 비교했습니다.
월간 총 비용 ($)
|
| / (Bedrock Sonnet API)
| /
| /
| / (DeepSeek-R1 Official API)
|==================================/=== [Self-hosted 8x H100 ($14,000 고정)]
| /
| /
|_______________________________/______________________
0 50M 150M 500M 월간 토큰 처리량
| 월간 토큰량 (입력+출력) | DeepSeek Official API | Together AI / Anyscale | Self-hosted (8x H100) | 승자 선택 |
|---|---|---|---|---|
| 1,000만 토큰 (~일 33만) | $13.70 | $45.00 | $14,000.00 | Official API |
| 1억 토큰 (~일 330만) | $137.00 | $450.00 | $14,000.00 | Official API |
| 10억 토큰 (~일 3,300만) | $1,370.00 | $4,500.00 | $14,000.00 | Official API |
| 100억 토큰 (~일 3억 3,000만) | $13,700.00 | $45,000.00 | $14,000.00 | Self-hosted (손익분기) |
| 500억 토큰 (~일 16억 6,000만) | $68,500.00 | $225,000.00 | $28,000.00 (2노드) | Self-hosted (87% 절감) |
4. 실측 성능 지표 (TPS & TTFT)
8x H100 SXM5 인스턴스 환경에서 vLLM v0.7.2와 SGLang v0.4.3의 DeepSeek-R1 (671B FP8) 추론 성능을 측정한 결과입니다.
| 프레임워크 | 동시 요청 (Concurrency) | TTFT (첫 토큰 지연) | TPS (초당 출력 토큰) | GPU 사용률 |
|---|---|---|---|---|
| SGLang v0.4.3 | 32 | 180ms | 845 tokens/s | 94% |
| vLLM v0.7.2 | 32 | 240ms | 690 tokens/s | 88% |
| DeepSeek Official API | 피크 타임 | 1,200ms ~ 4,500ms | 35~60 tokens/s (User당) | N/A |
5. 결론 및 enterprise 의사결정 가이드
- 초기 스타트업 및 소규모 서비스: 공식 DeepSeek-R1 API를 사용하여 초기 인프라 고정비용을 최소화하세요.
- 사내 데이터 보안 및 SLA 보장 필수 기업: DeepSeek-R1-Distill-32B/70B 모델을 2x A100 또는 4x L40S 인스턴스에 vLLM으로 구축하면, 월 $2,000~$3,000 대의 부담 없는 비용으로 enterprise급 온프레미스 AI 시스템을 완성할 수 있습니다.
- 초고트래픽 서비스 (월 100억 토큰 이상): 8x H100/H200 GPU 서버 기반 SGLang Self-hosting 인프라 구축으로 API 대비 최대 80% 이상의 TCO 절감 효과를 거두세요.