DeepSeek-R1 & Qwen2.5 Self-Hosting vs. API Kosten- & Performance-Guide 2026

Im Jahr 2026 setzen DeepSeek-R1 und Qwen2.5 neue Maßstäbe für Open-Weight-Modelle. DeepSeek-R1 nutzt eine 671B MoE-Architektur, bei der pro Token nur 37B Parameter aktiv sind, was die Inferenzkosten drastisch senkt.
Dieser Leitfaden vergleicht die Gesamtkosten (TCO), Tokens pro Sekunde (TPS) und Time-To-First-Token (TTFT) von Self-Hosting (8x H100) gegenüber Cloud-APIs.
Kernerkenntnisse
- Break-Even-Punkt: Ab einem monatlichen Volumen von 4,5 Milliarden Tokens ist Self-Hosting auf 8x H100 Nodes (~14.000 $/Monat) günstiger als Cloud-APIs.
- vLLM vs. SGLang: SGLang erzielt bei DeepSeek-R1 671B durch Expert Parallelism 18-25 % höhere TPS als vLLM.
- Destillierte Modelle (32B/70B): Bieten auf 2x A100 oder 4x L40S das beste Preis-Leistungs-Verhältnis für mittlere Unternehmen.
TCO-Vergleich (Monatliche Kosten)
| Monatliche Tokens | DeepSeek Offizielle API | Together AI | Self-Hosted (8x H100) | Gewinner |
|---|---|---|---|---|
| 10 Millionen | 13,70 $ | 45,00 $ | 14.000,00 $ | Offizielle API |
| 100 Millionen | 137,00 $ | 450,00 $ | 14.000,00 $ | Offizielle API |
| 1 Milliarde | 1.370,00 $ | 4.500,00 $ | 14.000,00 $ | Offizielle API |
| 10 Milliarden | 13.700,00 $ | 45.000,00 $ | 14.000,00 $ | Self-Hosted (Break-Even) |
| 50 Milliarden | 68.500,00 $ | 225.000,00 $ | 28.000,00 $ (2 Nodes) | Self-Hosted (87% Ersparnis) |
Fazit
Nutzen Sie die offizielle API für kleine Volumina, destillierte 32B/70B Modelle für Datenschutz und Self-Hosting bei mehr als 10 Milliarden Tokens pro Monat.