Groq ejecuta Mixtral 8x7B-32k con 500 T/s

Groq ha presentado un servicio de alojamiento de LLM en el que el modelo Mixtral 8x7B funciona a aproximadamente 500 tokens por segundo sobre ASICs personalizados de “Language Processing Unit”, superando con mucho a las implementaciones típicas basadas en GPU. Los comentaristas están impresionados por las respuestas casi instantáneas, de clase GPT‑3.5, y por el bajo precio por token, pero investigan cómo se consigue esto, cuestionando el coste total del hardware, el consumo energético, la escalabilidad más allá de unos pocos modelos estrella y la sostenibilidad a largo plazo del modelo de negocio. El hilo también explora detalles técnicos como la arquitectura determinista con mucho SRAM, la cuantización parcial en FP8, el soporte para modelos afinados y cargas de trabajo no LLM, y lo que estas reducciones de latencia podrían permitir para voz en tiempo real, agentes y otras aplicaciones interactivas.

Rendimiento e impresiones de los usuarios

  • Muchos usuarios informan de 400–500+ tokens/s en Mixtral 8x7B y ~200 t/s en Llama 2 70B a través de la demo y la API de Groq.
  • Las reacciones subjetivas son muy positivas: velocidad “instantánea” o “sobrehumana”, especialmente en comparación con GPT‑3.5/4 y Gemini.
  • Varios dicen que esta velocidad cambia materialmente la UX: es más fácil escanear, iterar y construir herramientas interactivas; la autorregresión lenta ahora parece “anticuada”.
  • Algunos consideran que la calidad del modelo es comparable o superior a GPT‑3.5 para programación y tareas generales, aunque no al nivel de GPT‑4.

Hardware y arquitectura

  • Groq utiliza ASICs personalizados (“GroqChips” / LPU) con ~230 MB de SRAM en chip cada uno, integrados en racks de cientos de chips; la demo actual, según se informa, usa ~568 chips.
  • La arquitectura hace hincapié en la determinación, el reloj fijo y un motor matricial tipo sistólico con interconexión determinista chip a chip (enlaces de ~100 Gbps).
  • Se usa KV cache; la decodificación actualmente se ejecuta de forma efectiva con tamaño de batch 1, con alto rendimiento gracias a la arquitectura.
  • Parte de la canalización del compilador y la infraestructura están implementadas en Haskell; otros componentes usan C++/MLIR y Python.

Latencia, rendimiento y batching

  • Groq se posiciona como optimizado para inferencia de baja latencia y lotes pequeños, en contraste con las pilas GPU que dependen mucho del batching grande para alcanzar alto rendimiento.
  • Los benchmarks independientes citados muestran un tiempo hasta el primer token muy bajo y un alto rendimiento por solicitud individual, incluso a través de la API pública.
  • La discusión señala que las GPU pueden lograr tokens/s totales muy altos, pero normalmente con menor velocidad por usuario.

Precisión, cuantización y calidad

  • Las activaciones se calculan en FP16; algunos pesos se almacenan como FP8 “en reposo”. Groq afirma que no hay una pérdida de calidad significativa frente a FP16 completo.
  • Los usuarios informan que la calidad de Mixtral está al menos a la par con modelos fuertes de clase 3.5; otros destacan alucinaciones claras y fallos aritméticos (p. ej., primos, factorización), subrayando que un hardware más rápido no arregla las limitaciones del modelo.

Coste, escala y modelo de negocio

  • Las tarjetas aceleradoras minoristas son caras (~$20k cada una), lo que implica hardware de varios millones de dólares para la escala de la demo; Groq dice que su propio coste es mucho menor que el precio minorista.
  • Algunos observadores cuestionan los tokens/s por dólar y el consumo total de energía; otros señalan que la baja latencia puede justificar un capex alto para ciertos casos de uso.
  • Groq vende tanto tokens “como servicio” (con la promesa de batir los precios por token de los competidores para los modelos admitidos) como sistemas completos a empresas; no hay planes de hardware para aficionados a corto plazo.

API, ecosistema y acceso

  • Hay una API de chat/completions al estilo OpenAI con compatibilidad parcial; se proporcionan documentación y un Discord.
  • El enorme interés reciente ha creado listas de espera y colas; algunos usuarios reportan esperas largas a pesar de que la generación es rápida una vez que comienza.
  • Varios desarrolladores expresan un fuerte interés en usar Groq como backend para aplicaciones, sistemas RAG y herramientas de código.

Casos de uso y aplicaciones

  • La baja latencia se considera especialmente valiosa para: agentes de voz en tiempo real (demo de CNN), centros de llamadas, trading, asistentes tipo “copilot”, NPCs de juegos/VR y pipelines de agentes de varios pasos.
  • Groq afirma que el hardware es computación numérica de propósito general, adecuada para visión y modelos de difusión; existe algo de trabajo en difusión, pero aún no está expuesto públicamente.

Críticas, limitaciones y preguntas abiertas

  • Entre las preocupaciones están: la falta de HBM limita la capacidad del modelo por chip; se necesitan cientos de chips para un modelo grande; el rendimiento total del sistema no está claro; y la fijación de precios podría no ser sostenible.
  • Algunos argumentan que las GPU con HBM pueden ser mejores para escenarios multi-modelo, multi-LoRA o on-prem; otros responden que el sistema determinista de Groq y la SRAM son críticos para una latencia ultrabaja.
  • Se señalan bugs y problemas de UX: comportamiento confuso al cambiar de modelo en la demo, peculiaridades de la UI móvil, dependencias de carga de fuentes y salidas que ocasionalmente entran en bucle.
  • Varios usuarios insisten en que las alucinaciones y los límites de razonamiento siguen ahí; la velocidad por sí sola no resuelve los problemas centrales de fiabilidad del modelo.