effidevFlutter · Cloudflare-Edge · Cloud-Kostenoptimierung
Deutsch

DeepSeek-R1 & Qwen2.5 Self-Hosting vs. API Kosten- & Performance-Guide 2026

DeepSeek-R1 Kostenvergleich Self-Hosting vs API

Im Jahr 2026 setzen DeepSeek-R1 und Qwen2.5 neue Maßstäbe für Open-Weight-Modelle. DeepSeek-R1 nutzt eine 671B MoE-Architektur, bei der pro Token nur 37B Parameter aktiv sind, was die Inferenzkosten drastisch senkt.

Dieser Leitfaden vergleicht die Gesamtkosten (TCO), Tokens pro Sekunde (TPS) und Time-To-First-Token (TTFT) von Self-Hosting (8x H100) gegenüber Cloud-APIs.

Kernerkenntnisse

  • Break-Even-Punkt: Ab einem monatlichen Volumen von 4,5 Milliarden Tokens ist Self-Hosting auf 8x H100 Nodes (~14.000 $/Monat) günstiger als Cloud-APIs.
  • vLLM vs. SGLang: SGLang erzielt bei DeepSeek-R1 671B durch Expert Parallelism 18-25 % höhere TPS als vLLM.
  • Destillierte Modelle (32B/70B): Bieten auf 2x A100 oder 4x L40S das beste Preis-Leistungs-Verhältnis für mittlere Unternehmen.

TCO-Vergleich (Monatliche Kosten)

Monatliche Tokens DeepSeek Offizielle API Together AI Self-Hosted (8x H100) Gewinner
10 Millionen 13,70 $ 45,00 $ 14.000,00 $ Offizielle API
100 Millionen 137,00 $ 450,00 $ 14.000,00 $ Offizielle API
1 Milliarde 1.370,00 $ 4.500,00 $ 14.000,00 $ Offizielle API
10 Milliarden 13.700,00 $ 45.000,00 $ 14.000,00 $ Self-Hosted (Break-Even)
50 Milliarden 68.500,00 $ 225.000,00 $ 28.000,00 $ (2 Nodes) Self-Hosted (87% Ersparnis)

Fazit

Nutzen Sie die offizielle API für kleine Volumina, destillierte 32B/70B Modelle für Datenschutz und Self-Hosting bei mehr als 10 Milliarden Tokens pro Monat.