effidevFlutter · Edge de Cloudflare · Optimización de costes en la nube
Español

Guía para Crear un Clúster de Inferencia de IA On-Premises con M3/M4 Mac Studio y Ollama/vLLM

Creación de un Clúster de IA On-Premises con Mac Studio y Ollama

Implementar APIs de LLM en la nube a gran escala plantea dos grandes desafíos: los altos costos mensuales y la privacidad de los datos sensibles.

Gracias a la arquitectura de Memoria Unificada de Apple Silicon (M3/M4 Max & Ultra), los Mac Studio con 192GB a 512GB de RAM y un ancho de banda de 400GB/s a 800GB/s pueden ejecutar modelos de 70B a 120B parámetros en un solo equipo de escritorio de forma fluida.

Esta guía enseña a configurar un clúster de Mac Studio con Ollama y vLLM-MLX, balanceo de carga con Nginx y cálculo de costo total de propiedad (TCO).

Resumen Clave

  • Eficiencia de Memoria Unificada: Permite cargar modelos de 70B (~42GB RAM en Q4_K_M) sin errores de falta de memoria VRAM (OOM).
  • Ollama vs vLLM-MLX: Ollama es ideal para desarrollo y servidores individuales, mientras que vLLM-MLX destaca en procesamiento de lotes continuos con mayor rendimiento.
  • Balanceo de Carga: Configurar Nginx o HAProxy permite distribuir solicitudes entre varios Mac Studio con streaming de respuestas (SSE) sin interrupciones.

Rendimiento de Inferencia (Tokens/seg)

Modelo y Cuantización Dispositivo Velocidad de Generación (tokens/s)
Llama 3.3 70B (Q4_K_M) M3 Max (128GB) 28.5 t/s
Llama 3.3 70B (Q8_0) M4 Ultra (192GB) 42.1 t/s
Qwen 2.5 72B (Q8_0) M4 Ultra (192GB) 39.8 t/s

Conclusión

Un clúster de 4 Mac Studio recupera la inversión inicial en 2.5 meses en comparación con las tarifas de APIs de nube para empresas con alto volumen de tokens.