Ejecutando Gemma 4 26B a 5 tokens/seg en un Xeon de 13 años sin GPU
Ejecutar un modelo Gemma 4 de 26B parámetros en CPU Xeon de 10–13 años a alrededor de 5 tokens por segundo demuestra que los grandes LLM modernos pueden ejecutarse localmente en hardware envejecido, siempre que haya suficiente RAM y una cuantización cuidadosa. Los comentaristas debaten cuán práctico es realmente esto, contraponiendo las velocidades lentas de token y el alto consumo eléctrico con el atractivo de la privacidad, el uso ilimitado y el cálculo “gratis si ya lo tienes”, y comparando costes con los proveedores de inferencia en la nube. El hilo también aborda la trayectoria hacia modelos MoE y cada vez más grandes en máquinas de consumo, y plantea preocupaciones sobre las entradas técnicas escritas por IA y las normas de la comunidad sobre la divulgación.
Contenido escrito por IA y normas de HN
- Varios comentaristas sostienen que la entrada del blog y algunos comentarios “suenan como” salida de IA y señalan que las publicaciones/comentarios escritos por IA violan las normas de HN.
- Otros discrepan o dicen que es difícil distinguirlo cuando la gente usa mucho los LLM para redactar texto.
- El autor afirma que el parche de código fue asistido por IA, pero la publicación aclara qué partes fueron humanas y cuáles de IA.
Errores y detalles técnicos
- El fork original asumía AVX2; los Xeon Ivy Bridge más antiguos no lo tienen, lo que causaba fallos de compilación y, de forma más sutil, la ausencia de rutas de despacho para dos operaciones de MoE.
- En compilaciones sin AVX2, las salidas de expertos MoE provenían de memoria no inicializada, produciendo texto fluido pero sin sentido.
- Se ha enviado una corrección aguas arriba como pull request.
Rendimiento, cuantización y RAM
- Hay múltiples informes de ejecución de Gemma 4 y otros modelos en Xeon antiguos, servidores con doble CPU y hardware Mac.
- Las tasas de tokens varían mucho: ~5 t/s para Gemma 4 26B en Xeons de la era 2013; tasas más altas en GPUs y en modelos más pequeños o fuertemente cuantizados.
- Discusión sobre Q4 frente a Q8: Q4 reduce a la mitad las necesidades de ancho de banda y puede casi duplicar la velocidad en sistemas limitados por ancho de banda, pero se prefieren Q8/Q6 cuando la RAM lo permite por motivos de calidad.
- Es común una RAM grande (80–100+ GB usados por modelos 26B); algunos experimentan con configuraciones de RAM extremadamente bajas y cargadores personalizados.
Usabilidad de los modelos locales lentos
- Hay una fuerte división: algunos consideran aceptables 5–10 t/s para flujos de trabajo en segundo plano o por lotes; otros lo ven inutilizable para programación interactiva o cadenas largas de razonamiento.
- Debate sobre el “estado de flujo”: los modelos rápidos (cientos de t/s) permiten iterar con rapidez; los modelos lentos empujan a la gente hacia el uso de poner en cola y alejarse.
Coste, potencia y eficiencia
- Varias estimaciones rápidas sugieren que la inferencia local en CPU puede costar más en electricidad que los tokens en la nube, especialmente con servidores de 300–500W y precios de energía altos.
- Contraargumentos: electricidad más barata, energía solar o usar el calor residual para calefacción pueden cambiar el cálculo.
- Limitar la potencia de la GPU puede reducir significativamente el consumo con una pérdida modesta de velocidad.
- Algunos señalan que los proveedores de nube podrían estar vendiendo tokens por debajo de su coste real, por lo que los precios podrían subir.
Privacidad, control y motivación para lo local
- Muchos subrayan la privacidad, la independencia y la libertad frente a los límites del proveedor como las razones principales para la inferencia local, no el coste.
- Otros ven el hardware local como valioso para experimentar, pero todavía no competitivo con los mejores modelos en la nube en calidad o velocidad.
Futuro de los LLM locales
- Predicciones optimistas: modelos MoE de >200B e incluso equivalentes a ~1T parámetros en hardware de consumo para ~2027–2028, ayudados por entrenamiento ternario/de 1 bit, MoE disperso, nuevas GPUs y aceleradores especializados.
- Los escépticos destacan el ancho de banda de la RAM, las restricciones de potencia, la capacidad de fabricación y los incentivos económicos para priorizar los centros de datos.
- Algunos sostienen que los transformadores están estructuralmente mal adaptados para una inferencia local eficiente; otros ven prometedores los avances continuos en arquitectura y hardware.
Problemas de herramientas y configuración
- Consejos prácticos: ajustar los timeouts en Ollama, explorar la TTL/las configuraciones de expulsión en LM Studio y usar marcos de lotes/agentes para aprovechar mejor los modelos locales lentos.