GPT-6 Astra en OpenRouter
El nuevo modelo GPT‑6 Astra de OpenAI, ahora accesible vía OpenRouter, Codex y algunos niveles de ChatGPT, está recibiendo elogios por grandes mejoras en razonamiento, generación de SVG y reconstrucción compleja de web/UI, pero a un coste elevado por token. Los comentaristas debaten si la mayor calidad de Astra y su aparente eficiencia en tokens justifican su precio frente a GPT‑5.6 Sol, Luna y modelos chinos más baratos, especialmente para empresas sensibles al comportamiento de “token-maxing”. También hay escrutinio sobre la oferta de Azure, más cara y con retención cero de datos, los límites de tasa y los problemas de fiabilidad con pasarelas de terceros como OpenRouter, lo que subraya cómo las decisiones de despliegue dependen tanto de la confianza y la gobernanza como de la capacidad bruta.
Acceso y despliegue
- Astra estuvo disponible para usuarios Pro/Plus y Business, aunque el momento varió según la cuenta y la región (p. ej., acceso solo por Codex para algunos europeos, sin ChatGPT).
- Algunos usuarios recibieron “restablecimientos bancables” por cada día que no tuvieron acceso a Astra y los usaron para probar Sol mientras tanto.
- Astra también está expuesto a través de OpenRouter y Azure; algunos informan problemas tempranos de “Not Found” en OpenRouter y restricciones de llamadas a herramientas en Copilot/Foundry cuando el razonamiento está habilitado.
Azure, ZDR y preocupaciones empresariales
- Confusión sobre si Astra en Azure es realmente Zero Data Retention (ZDR) y qué implica el “monitoreo de abusos que preserva la privacidad”.
- Quejas de que la interfaz de Azure dificulta distinguir entre modelos ZDR y no ZDR o bloquear las opciones no ZDR.
- Se dice que Azure es más caro, pero ofrece garantías ZDR e integración con identidad de Azure; no está claro si el uso de Codex es ZDR.
Capacidades: SVG, programación y visión
- Astra recibe elogios generalizados por la generación de SVG: las comparaciones de “pelícano en bicicleta” muestran una calidad visual y consistencia sustancialmente superiores frente a Luna, Sol, Terra y modelos más antiguos.
- Los usuarios debaten si este benchmark ahora está “sobreajustado” o si sigue siendo útil; algunos sospechan entrenamiento explícito, otros lo atribuyen a mejoras generales en SVG.
- Pruebas adicionales de SVG (hámster de ping-pong, otros animales en scooters) muestran una salida estilística sólida, pero errores geométricos y anatómicos claros.
- Se destaca la combinación visión + desarrollo web de Astra: puede replicar de cerca diseños SVG complejos y fluidos a partir de una maqueta estática, superando a otros modelos en fidelidad de diseño.
- En escenarios de programación, Astra ha encontrado rápidamente errores sutiles (p. ej., tiempos de vida de recursos) y ha producido buen código para Blender y web, aunque al menos un informe califica su código en Odin como muy malo.
Velocidad, tokens y precios
- Astra a menudo “se siente más rápido” a pesar de tener menos tokens por segundo, probablemente debido a menos tokens internos de “pensamiento”.
- Varios usuarios enfatizan que Astra usa menos tokens totales por tarea que Sol/Opus en algunos benchmarks; otros citan métricas donde Sol alto/medio iguala a Astra bajo en “inteligencia” con un coste mucho menor por $/M tokens.
- En general: fuerte desacuerdo sobre si Astra es más barato por tarea; hay consenso en que el precio por token es alto.
- Ejemplo: una sola compilación frontend simple mediante Astra costó unos ~$24 en uso de API, visto como trivial por algunos (para diseños finales) y no trivial por otros (poco margen para experimentar).
- Algunas organizaciones están limitando el acceso tras ver facturas grandes, especialmente por parte de “token maxers”.
Comparaciones de modelos y orquestación
- Los usuarios suelen usar Luna para el trabajo cotidiano/barato, Terra o Sol para tareas más complejas, y reservan Astra/Fable para los problemas más difíciles.
- Un enfoque: usar un modelo “frontier” (Sol/Astra) como orquestador que supervisa un subagente Luna más barato que hace la lectura/implementación en masa, reduciendo el uso de tokens del frontier.
- Se debate si Astra es mejor que Sol al mismo nivel de “esfuerzo”: algunos dicen que Astra medio/alto es estrictamente mejor o igual con un coste por tarea similar o menor; otros lo disputan basándose en datos externos de benchmarks.
Benchmarks y debates de evaluación
- La galería SVG de pelícanos y las cuadrículas de costes se elogian como herramientas intuitivas para comparar modelos.
- Preocupa que usar repetidamente el mismo prompt del pelícano anime a los proveedores a optimizar específicamente para él, reduciendo su valor como benchmark general.
- Otros prompts alternativos (lémur/cebra en scooters, puntos de vista no estándar) siguen exponiendo debilidades, por ejemplo, oclusión, anatomía y consistencia.
Limitaciones y modos de fallo
- Las salidas SVG, aunque mucho mejores, siguen mostrando perspectivas incorrectas, extremidades o bocas extra o faltantes, tablas mal formadas y posiciones incorrectas en escenas de ping-pong.
- Algunos señalan la frecuente falta de cascos, rodillas de pelícano anatómicamente extrañas y detalles de bicicleta incorrectos (p. ej., patrones de radios, ausencia de cadenas) como ejemplos de “comprensión” incompleta.
- Según se informa, las tasas de fallo de llamadas a herramientas en Astra de OpenAI son más altas que en Azure en un conjunto de datos, aunque los detalles son escasos.
Experiencia de usuario y problemas del ecosistema
- Unos pocos usuarios informan haber obtenido acceso a Astra sin restablecimientos extra; otros acumulan varios.
- Un usuario informa haber sido suspendido automáticamente en OpenRouter tras depositar fondos, sin soporte efectivo y con una postura de “sin reembolsos”, lo que llevó a advertencias y sugerencias de iniciar contracargos.
- Es común el escepticismo hacia el marketing de “AGI”; algunos sienten que los medios y los “normies” están exagerando las capacidades, dadas las evidentes fallas básicas.
- Panorama más amplio de precios: algunos comparan desfavorablemente los niveles de Astra de $10/$50 con modelos chinos mucho más baratos, y prevén desafíos de adopción salvo que el coste por tarea gane claramente.