Groqchat
Groqchat muestra el modelo Llama 2 70B de Meta ejecutándose en el hardware personalizado “Language Processing Unit” de Groq, alcanzando cientos de tokens por segundo por usuario, mucho más rápido que las implementaciones típicas basadas en GPU. Los comentaristas quedan impresionados por la velocidad y la baja latencia, especialmente para código e inferencia con modelos grandes, pero señalan que la calidad de salida y los filtros de seguridad estrictos están limitados por el modelo Llama 2 chat subyacente y no por el hardware. El hilo también explora la arquitectura y estrategia de escalado de Groq, su enfoque en la inferencia (no en el entrenamiento) y el interés por soporte futuro para modelos como Mixtral y un acceso más amplio a la API.
Rendimiento y pruebas de referencia
- El principal entusiasmo gira en torno a la velocidad: los usuarios informan ~270–300 tokens/s para Llama‑2‑70B, frente a ~60 tokens/s en otros servicios para el mismo modelo.
- Varios señalan que es lo más rápido que han visto para un modelo ≥70B; otros enfatizan que el punto son los tokens/s y la latencia, no la calidad del modelo.
- Algunos quieren pruebas de referencia más claras y comparaciones justas entre iguales (mismo modelo, longitud de contexto, tamaño de lote, además de $/token y vatios).
- Miembros de Groq mencionan implementaciones que usan 9 racks / 576 chips, con todo el modelo fragmentado en SRAM en chip para una latencia muy baja.
Calidad del modelo, seguridad y censura
- Muchos encuentran las respuestas rápidas pero a menudo incorrectas, alucinatorias o en bucle; algunas tareas (código, consejos básicos de diseño de apps, recetas) parecen “a la par” con GPT‑4, otras claramente peores.
- Varios usuarios se quejan de filtros de seguridad muy estrictos: rechazos para poesía, letras de canciones, contenido sexual o romántico ligero, e incluso prompts de imágenes benignos; descrito como “sobre-censurado” o “aburrido.”
- Otros sostienen que esto es lo esperado de la afinación de seguridad al estilo Llama‑2‑chat y que la elección del modelo, no el hardware, determina la calidad.
Hardware y arquitectura
- Groq se describe como una empresa de hardware de chips personalizados; sus LPUs / GroqChips forman una “compute fabric” de baja latencia y alto rendimiento en lugar de arquitecturas estilo GPU.
- Almacenan los modelos por completo en SRAM a través de muchos chips (sin DRAM), lo que se señala como caro pero ideal para inferencia rápida con batch‑1.
- Se dice que el entrenamiento sigue favoreciendo a las GPUs; Groq se centra en la inferencia, especialmente donde importan la latencia y los tokens/s por usuario.
Ecosistema, productos y precios
- Una API y precios “llegarán pronto”, con afirmaciones de que serán competitivos en precio con OpenAI pero mucho más rápidos.
- Los usuarios preguntan por: despliegues de mixtral‑8x7B y Mistral‑7B (en progreso), contexto largo, cajas domésticas/LLM, tarjetas individuales y casos de uso verticales (p. ej., salud).
- Algunos se preocupan por la madurez del stack de software y la adaptabilidad a largo plazo a nuevas arquitecturas (p. ej., MoE); las respuestas afirman que la cadena de herramientas puede compilar modelos arbitrarios de PyTorch/ONNX.
UX y miscelánea
- Varios elogian la capacidad de respuesta pero critican la interfaz de chat (streaming que desplaza constantemente la pantalla, autocorrección de iOS deshabilitada).
- Existe cierta confusión en torno a la verificación de que las salidas coincidan exactamente con Llama‑2‑70B en otros lugares; esto sigue sin estar claro en el hilo.