Qwen 3.8 27B disponible en Cerebras a 1500 tokens/s
Cerebras ha lanzado inferencia en la nube ultrarrápida para el modelo Qwen 3.8 27B, alcanzando alrededor de 1.500 tokens por segundo e impresionando a muchos usuarios por sus capacidades de codificación y su capacidad de respuesta. Sin embargo, los desarrolladores señalan inconvenientes importantes: 128k de contexto en lugar del potencial completo del modelo, límites estrictos de tokens por minuto, ninguna ventaja de precio por el caché de prompts y costos relativamente altos que hacen que las cargas de trabajo de codificación sostenida o agéntica sean imprácticas. Muchos concluyen que el servicio funciona más como una vitrina para el hardware de Cerebras que como una alternativa competitiva para el día a día frente a despliegues más baratos basados en GPU o autoalojados.
Rendimiento y velocidad del modelo
- Qwen 3.8 27B en Cerebras es ampliamente elogiado por ser muy potente para codificación y razonamiento, con una salida extremadamente rápida (hasta ~1500 tok/s) y baja latencia.
- Algunos usuarios informan que “se siente” transformador para la UX (respuestas casi instantáneas), especialmente para búsqueda, resumido y tareas rápidas de código.
- Otros dicen que el procesamiento de entrada sigue dominando el tiempo para prompts grandes, por lo que las mejoras en tiempo real frente a modelos de ~100–200 tok/s pueden ser modestas una vez que se incluyen llamadas a herramientas y comandos de shell.
Precios, caché y economía de tokens
- El precio ronda los $0.99/M tokens de entrada y $1.49/M tokens de salida en un modelo de créditos de pago por uso (sin cuota recurrente, crédito mínimo de $10).
- Se admite el caché de prompts, pero:
- Los tokens de entrada cacheados cuestan lo mismo que los tokens nuevos.
- Los tokens cacheados siguen contando para los límites de tokens por minuto.
- Muchos ven esto como un caché “solo de marketing” que elimina el principal beneficio económico, haciendo que las cargas de trabajo agénticas sean significativamente más caras que con competidores que descuentan mucho los aciertos de caché.
Límites de tasa y adecuación para cargas de trabajo de codificación/agénticas
- Límites del endpoint público: ~150k tokens/min no cacheados, 450k total/min.
- A 1500 tok/s, los usuarios alcanzan estos límites muy rápido, especialmente con contextos grandes y llamadas frecuentes a herramientas.
- Varios informan haber gastado los créditos gratuitos en minutos y haber alcanzado los límites en 60–90 segundos de codificación agéntica sostenida.
- Consenso: bueno para tareas cortas y en ráfagas; a menudo “inutilizable” para agentes de codificación de larga duración y proyectos grandes.
Ventana de contexto y configuración del modelo
- Cerebras expone solo 128k de contexto, pese a que el modelo admite más en otros lugares.
- Muchos consideran que 128k es insuficiente para configuraciones serias de codificación/agentes una vez que se incluyen prompts del sistema, herramientas, historial y base de código; el contexto se llena rápido y la compactación se convierte en un cuello de botella.
- Algunos señalan que el valor predeterminado de Qwen 3.8 de “razonamiento extra alto” amplifica las necesidades de contexto.
Comparaciones: otros proveedores y alojamiento local
- Otros hosts (por ejemplo, OpenRouter, proveedores dedicados de GPU) ofrecen velocidades más lentas (~80–300 tok/s) pero:
- Mejores descuentos de caché.
- Menor costo efectivo para sesiones largas.
- Varios usuarios ejecutan Qwen 3.8 27B localmente (GPUs, ninfer, llama.cpp) a 30–200 tok/s sin límites de tasa, lo que muchos prefieren para cargas sostenidas y datos sensibles.
- Para cargas pequeñas, el sobreprecio de velocidad de Cerebras puede valer el costo extra; para codificación agéntica a gran escala, las alternativas suelen ser más baratas en total.
Estrategia de producto, fiabilidad y soporte
- Varios comentaristas ven la API pública como un canal de demostración/marketing para vender hardware de Cerebras y acuerdos empresariales (por ejemplo, alojar modelos muy grandes para clientes importantes).
- Las quejas incluyen:
- Cuotas ajustadas, modelos eliminados/en niveles compartidos (por ejemplo, Gemma 4) con poco aviso.
- Fiabilidad inestable y errores confusos sobre facturación/acceso.
- Gran dependencia de Discord para el soporte, incluidos problemas de incorporación.
- Sentimiento general: hardware impresionante y velocidad bruta, pero el servicio público se percibe como limitado por capacidad, caro para codificación continua y poco amigable para desarrolladores.