DeepSeek-R1 & Qwen2.5 Self-hosting vs API コスト・性能比較 2026

2026年のオープンソースLLM市場において、DeepSeek-R1 と Qwen2.5 シリーズはフロンティアモデルの代表格です。特に DeepSeek-R1 は 671B MoE 構成でありながら、トークンあたり 37B のアクティブパラメータのみを駆動させることで推論コストを大幅に削減しました。
本記事では、8x H100 GPU インスタンス等での Self-hosting とマネージド API 利用時の TCO(総保有コスト)、TPS、TTFT を実測データに基づき比較します。
要約
- 損益分岐点: 月間トークン消費量が 45億トークン(日1.5億トークン) を超えると、8x H100 ノード(月額約 $14,000)の Self-hosting が API 利用より安価になります。
- vLLM vs. SGLang: DeepSeek-R1 671B の場合、SGLang の Expert Parallelism 最適化により vLLM 比で約 18〜25% 高い TPS を達成。
- 蒸留モデルの活用: 32B / 70B 蒸留モデルは 2x A100 や 4x L40S で運用可能で、中規模企業バックエンドに最適なコスパを提供します。
TCO比較表 (Self-hosting vs API)
| 月間トークン量 | DeepSeek 公式 API | Together AI | Self-hosted (8x H100) | コスト評価 |
|---|---|---|---|---|
| 1,000万 | $13.70 | $45.00 | $14,000.00 | 公式 API 勝利 |
| 1億 | $137.00 | $450.00 | $14,000.00 | 公式 API 勝利 |
| 10億 | $1,370.00 | $4,500.00 | $14,000.00 | 公式 API 勝利 |
| 100億 | $13,700.00 | $45,000.00 | $14,000.00 | Self-hosting 逆転 |
| 500億 | $68,500.00 | $225,000.00 | $28,000.00 (2ノード) | Self-hosting 87%削減 |
結論
- 低〜中トラフィック:DeepSeek 公式 API の活用を推奨。
- セキュリティ・SLA 重視:DeepSeek-R1-Distill-32B / 70B を vLLM でオンプレミス運用。
- 大規模トラフィック(月100億トークン超):SGLang + 8x H100 Self-hosting で大幅な TCO 削減を実現。