Groq ejecuta Mixtral 8x7B-32k con 500 T/s
Groq ha presentado un servicio de alojamiento de LLM en el que el modelo Mixtral 8x7B funciona a aproximadamente 500 tokens por segundo sobre ASICs personalizados de “Language Processing Unit”, superando con mucho a las implementaciones típicas basadas en GPU. Los comentaristas están impresionados por las respuestas casi instantáneas, de clase GPT‑3.5, y por el bajo precio por token, pero investigan cómo se consigue esto, cuestionando el coste total del hardware, el consumo energético, la escalabilidad más allá de unos pocos modelos estrella y la sostenibilidad a largo plazo del modelo de negocio. El hilo también explora detalles técnicos como la arquitectura determinista con mucho SRAM, la cuantización parcial en FP8, el soporte para modelos afinados y cargas de trabajo no LLM, y lo que estas reducciones de latencia podrían permitir para voz en tiempo real, agentes y otras aplicaciones interactivas.
Rendimiento e impresiones de los usuarios
- Muchos usuarios informan de 400–500+ tokens/s en Mixtral 8x7B y ~200 t/s en Llama 2 70B a través de la demo y la API de Groq.
- Las reacciones subjetivas son muy positivas: velocidad “instantánea” o “sobrehumana”, especialmente en comparación con GPT‑3.5/4 y Gemini.
- Varios dicen que esta velocidad cambia materialmente la UX: es más fácil escanear, iterar y construir herramientas interactivas; la autorregresión lenta ahora parece “anticuada”.
- Algunos consideran que la calidad del modelo es comparable o superior a GPT‑3.5 para programación y tareas generales, aunque no al nivel de GPT‑4.
Hardware y arquitectura
- Groq utiliza ASICs personalizados (“GroqChips” / LPU) con ~230 MB de SRAM en chip cada uno, integrados en racks de cientos de chips; la demo actual, según se informa, usa ~568 chips.
- La arquitectura hace hincapié en la determinación, el reloj fijo y un motor matricial tipo sistólico con interconexión determinista chip a chip (enlaces de ~100 Gbps).
- Se usa KV cache; la decodificación actualmente se ejecuta de forma efectiva con tamaño de batch 1, con alto rendimiento gracias a la arquitectura.
- Parte de la canalización del compilador y la infraestructura están implementadas en Haskell; otros componentes usan C++/MLIR y Python.
Latencia, rendimiento y batching
- Groq se posiciona como optimizado para inferencia de baja latencia y lotes pequeños, en contraste con las pilas GPU que dependen mucho del batching grande para alcanzar alto rendimiento.
- Los benchmarks independientes citados muestran un tiempo hasta el primer token muy bajo y un alto rendimiento por solicitud individual, incluso a través de la API pública.
- La discusión señala que las GPU pueden lograr tokens/s totales muy altos, pero normalmente con menor velocidad por usuario.
Precisión, cuantización y calidad
- Las activaciones se calculan en FP16; algunos pesos se almacenan como FP8 “en reposo”. Groq afirma que no hay una pérdida de calidad significativa frente a FP16 completo.
- Los usuarios informan que la calidad de Mixtral está al menos a la par con modelos fuertes de clase 3.5; otros destacan alucinaciones claras y fallos aritméticos (p. ej., primos, factorización), subrayando que un hardware más rápido no arregla las limitaciones del modelo.
Coste, escala y modelo de negocio
- Las tarjetas aceleradoras minoristas son caras (~$20k cada una), lo que implica hardware de varios millones de dólares para la escala de la demo; Groq dice que su propio coste es mucho menor que el precio minorista.
- Algunos observadores cuestionan los tokens/s por dólar y el consumo total de energía; otros señalan que la baja latencia puede justificar un capex alto para ciertos casos de uso.
- Groq vende tanto tokens “como servicio” (con la promesa de batir los precios por token de los competidores para los modelos admitidos) como sistemas completos a empresas; no hay planes de hardware para aficionados a corto plazo.
API, ecosistema y acceso
- Hay una API de chat/completions al estilo OpenAI con compatibilidad parcial; se proporcionan documentación y un Discord.
- El enorme interés reciente ha creado listas de espera y colas; algunos usuarios reportan esperas largas a pesar de que la generación es rápida una vez que comienza.
- Varios desarrolladores expresan un fuerte interés en usar Groq como backend para aplicaciones, sistemas RAG y herramientas de código.
Casos de uso y aplicaciones
- La baja latencia se considera especialmente valiosa para: agentes de voz en tiempo real (demo de CNN), centros de llamadas, trading, asistentes tipo “copilot”, NPCs de juegos/VR y pipelines de agentes de varios pasos.
- Groq afirma que el hardware es computación numérica de propósito general, adecuada para visión y modelos de difusión; existe algo de trabajo en difusión, pero aún no está expuesto públicamente.
Críticas, limitaciones y preguntas abiertas
- Entre las preocupaciones están: la falta de HBM limita la capacidad del modelo por chip; se necesitan cientos de chips para un modelo grande; el rendimiento total del sistema no está claro; y la fijación de precios podría no ser sostenible.
- Algunos argumentan que las GPU con HBM pueden ser mejores para escenarios multi-modelo, multi-LoRA o on-prem; otros responden que el sistema determinista de Groq y la SRAM son críticos para una latencia ultrabaja.
- Se señalan bugs y problemas de UX: comportamiento confuso al cambiar de modelo en la demo, peculiaridades de la UI móvil, dependencias de carga de fuentes y salidas que ocasionalmente entran en bucle.
- Varios usuarios insisten en que las alucinaciones y los límites de razonamiento siguen ahí; la velocidad por sí sola no resuelve los problemas centrales de fiabilidad del modelo.