effidevFlutter · Edge de Cloudflare · Optimización de costes en la nube
Español

Guía de Costes y Rendimiento 2026: DeepSeek-R1 y Qwen2.5 Self-Hosting vs. API

Comparación de costes entre Self-Hosting y API para DeepSeek-R1

En 2026, los modelos DeepSeek-R1 y Qwen2.5 representan la vanguardia del código abierto. La arquitectura MoE de 671B de DeepSeek-R1 activa solo 37B de parámetros por token, reduciendo significativamente los costes de inferencia.

Este artículo analiza si es más rentable alquilar servidores GPU (8x H100) para Self-hosting con vLLM/SGLang o utilizar APIs administradas.

Puntos Clave

  • Punto de Equilibrio: El Self-hosting en un nodo 8x H100 (~14.000$/mes) resulta más económico que las APIs a partir de 4.500 millones de tokens al mes.
  • vLLM vs. SGLang: SGLang logra entre un 18% y 25% más de TPS en modelos MoE 671B gracias a la optimización de Expert Parallelism.
  • Modelos Destilados (32B/70B): Ofrecen la mejor relación coste-rendimiento en servidores con 2x A100 o 4x L40S.

Comparativa de TCO Mensual

Tokens Mensuales DeepSeek API Oficial Together AI Self-Hosted (8x H100) Ganador
10 Millones 13,70 $ 45,00 $ 14.000,00 $ API Oficial
100 Millones 137,00 $ 450,00 $ 14.000,00 $ API Oficial
1.000 Millones 1.370,00 $ 4.500,00 $ 14.000,00 $ API Oficial
10.000 Millones 13.700,00 $ 45.000,00 $ 14.000,00 $ Self-Hosted (Equilibrio)
50.000 Millones 68.500,00 $ 225.000,00 $ 28.000,00 $ (2 nodos) Self-Hosted (Ahorro 87%)

Conclusión

Elige la API oficial para volúmenes bajos, modelos destilados (32B/70B) para privacidad empresarial y Self-hosting en 8x H100 para volúmenes superiores a 10.000 millones de tokens mensuales.