Guía para Crear un Clúster de Inferencia de IA On-Premises con M3/M4 Mac Studio y Ollama/vLLM

Implementar APIs de LLM en la nube a gran escala plantea dos grandes desafíos: los altos costos mensuales y la privacidad de los datos sensibles.
Gracias a la arquitectura de Memoria Unificada de Apple Silicon (M3/M4 Max & Ultra), los Mac Studio con 192GB a 512GB de RAM y un ancho de banda de 400GB/s a 800GB/s pueden ejecutar modelos de 70B a 120B parámetros en un solo equipo de escritorio de forma fluida.
Esta guía enseña a configurar un clúster de Mac Studio con Ollama y vLLM-MLX, balanceo de carga con Nginx y cálculo de costo total de propiedad (TCO).
Resumen Clave
- Eficiencia de Memoria Unificada: Permite cargar modelos de 70B (~42GB RAM en Q4_K_M) sin errores de falta de memoria VRAM (OOM).
- Ollama vs vLLM-MLX: Ollama es ideal para desarrollo y servidores individuales, mientras que vLLM-MLX destaca en procesamiento de lotes continuos con mayor rendimiento.
- Balanceo de Carga: Configurar Nginx o HAProxy permite distribuir solicitudes entre varios Mac Studio con streaming de respuestas (SSE) sin interrupciones.
Rendimiento de Inferencia (Tokens/seg)
| Modelo y Cuantización | Dispositivo | Velocidad de Generación (tokens/s) |
|---|---|---|
| Llama 3.3 70B (Q4_K_M) | M3 Max (128GB) | 28.5 t/s |
| Llama 3.3 70B (Q8_0) | M4 Ultra (192GB) | 42.1 t/s |
| Qwen 2.5 72B (Q8_0) | M4 Ultra (192GB) | 39.8 t/s |
Conclusión
Un clúster de 4 Mac Studio recupera la inversión inicial en 2.5 meses en comparación con las tarifas de APIs de nube para empresas con alto volumen de tokens.