Grok 4.6 obtiene 61 en el Artificial Analysis Intelligence Index

Grok 4.6, el último modelo de lenguaje grande de xAI, está llamando la atención por ofrecer un rendimiento de codificación y razonamiento cercano a la frontera con costes por token más bajos y límites de uso más altos que muchos planes de Anthropic y OpenAI, especialmente cuando se integra mediante herramientas como Cursor. Los comentaristas sopesan sus fortalezas —velocidad, estilo de comunicación conciso y acceso generosamente subvencionado— frente a informes de que todavía queda por debajo de modelos de primer nivel como Anthropic Fable 5 y GPT‑5.6 en tareas complejas, al tiempo que examinan preocupaciones más amplias sobre la política de Musk, la agresiva expansión de centros de datos, el impacto de carbono y si un tercer o cuarto modelo cerrado de frontera puede sostener un nicho viable en un mercado cada vez más presionado por potentes alternativas de pesos abiertos.

Calidad del modelo y benchmarks

  • Muchos ven a Grok 4.5 como un modelo “decente de frontera”, pero por debajo de modelos punteros como Fable/Opus 5/Sol/GPT‑5.6; algunos especulan que 4.6 está en la práctica alrededor de Opus 4.8, aunque todavía por debajo de los niveles más nuevos de Anthropic/OpenAI.
  • Varios usuarios diarios informan que Grok 4.5/4.6 es rápido, conciso y “suficientemente bueno” para ingeniería; valoran las respuestas más cortas y un código más simple, de estilo humano.
  • Otros dicen que su velocidad es en parte ilusoria: a menudo aborda solo una pequeña parte de una tarea y afirma prematuramente que terminó, con resultados más débiles que los de Anthropic/OpenAI.
  • En comparación con Kimi K3, Grok suele describirse como mejor y más barato; mejor que Gemini en algunas tareas de programación, pero no el mejor de su clase en general.
  • Se señala que 4.6 está más orientado al uso de herramientas/verificación (p. ej., hacer capturas de interfaces) que 4.5, pero ya no es tan “vertiginosamente rápido”.

Precios, eficiencia de tokens y suscripciones

  • Grok se describe repetidamente como muy rentable, especialmente a través de Cursor y suscripciones de xAI. Algunos sienten que una suscripción de $30 reemplazó cientos o miles de dólares de gasto por token en otros sitios.
  • Los benchmarks citados en el hilo afirman que el uso de tokens de Grok está a la par con los modelos recientes de OpenAI y que su coste por token es menor; otros replican que GPT sigue siendo el más eficiente en razonamiento.
  • Grok 4.5 figura a $2 de entrada / $6 de salida frente a Opus 4.8 a $5 / $25. El precio de lectura de caché habría subido de $0.30 a $0.50 en 4.6, lo que, según los usuarios, golpea fuerte los costes de programación agéntica.
  • Cursor: uso generoso de Grok/Composer más unos ~$20 de créditos no procedentes del proveedor principal; algunos lo llaman la forma más barata de usar Grok para programar.
  • El comportamiento de “reinicio” de las suscripciones de OpenAI frustra a quienes intentan presupuestar el uso; algunos responden persiguiendo el modelo de frontera que esté más subvencionado en ese momento.

Patrones de uso y flujos de trabajo

  • En contra de las afirmaciones de que “nadie usa Grok”, varios comentaristas lo usan como modelo principal de programación o como parte de flujos de trabajo multimodelo (p. ej., Fable para planificación, Grok para iteración rápida/depuración).
  • Se usa en Cursor, Grok CLI/Build, Copilot (históricamente) y entornos personalizados (OpenCode, agente de programación Pi) que derivan tareas a distintos modelos.
  • Algunos equipos reportan que prácticamente no tienen tope en el gasto total de IA y aun así eligen Grok por estilo y velocidad, no solo por precio.
  • Para trabajo de seguridad, los usuarios dicen que Grok y algunos modelos chinos harán análisis de vulnerabilidades y PoCs donde Anthropic/OpenAI bloquean o sanitizan en exceso.

Ética, política y boicots

  • Un contingente considerable se niega a usar Grok/xAI por completo, citando:
    • Las supuestas salutaciones nazis del propietario, la interferencia electoral, el apoyo a la ultraderecha en varios países, el comportamiento en torno a la ayuda exterior y Ucrania, y su estilo general de gobierno.
    • La preocupación de que los prompts del sistema de Grok y su sesgo político estén moldeados directamente por esas ideas.
  • Otros argumentan que casi todos los actores ricos “interfieren” en las elecciones, que los boicots son incoherentes si también se usan proveedores chinos u otros controvertidos, o que separan la calidad del producto de la política de su dueño.
  • Algunos prefieren Grok porque creen que OpenAI/Anthropic se inclinan hacia lo progresista y afirman que Grok está más cerca del “centro”, mientras que otros discuten qué significa siquiera “centro”.

Estrategia empresarial, cómputo y competencia

  • Razones propuestas para que xAI/SpaceX inviertan fuertemente en Grok pese a competidores sólidos:
    • Monetizar capacidad GPU sobrante alquilándola a otros laboratorios mientras se incrementa la demanda.
    • Integración vertical para uso interno (p. ej., Tesla, robots, ambiciones multiplanetarias) y evitar la dependencia de OpenAI/Anthropic.
    • Una apuesta a que pueden alcanzar o superar la frontera gracias a mucho cómputo, capital y datos de entrenamiento (incluido el conjunto de datos de Cursor).
    • Motivos filosóficos y el deseo de una familia de modelos políticamente diferente.
  • Los escépticos cuestionan la lógica empresarial: los mercados de consumo y empresa ya están dominados, los modelos de pesos abiertos aprietan el segmento bajo y probablemente habrá consolidación eventual. Algunos lo etiquetan como FOMO o comportamiento de burbuja impulsado por inversores.
  • Debate sobre infraestructura:
    • Se elogia a xAI/SpaceX por poseer centros de datos y planificar sus propios chips, lo que potencialmente permitiría tokens más baratos.
    • Otros dudan de los plazos de fabricación de chips (especialmente enfoques EUV/FEL), señalan atajos regulatorios (p. ej., centros de datos con turbinas de gas) y cuestionan la fiabilidad de las métricas autodeclaradas.

Notas ambientales y accesorias

  • Un gráfico citado (de Stanford HAI a través de un informe de medios) presenta el entrenamiento de Grok como especialmente intensivo en CO₂ debido a generadores de gas portátiles, que se afirma son menos eficientes que otras instalaciones grandes; algunos creen que los debates sobre carbono de la IA están exagerados en general, pero que en el caso de Grok son acertados.
  • La generación de imagen/video Imagine 2.0 de Grok se describe como de baja calidad y con aspecto “plástico”.
  • Algunos usuarios elogian el estilo de comunicación de Grok frente a la verbosidad de ChatGPT y los tics retóricos de Claude, y valoran tener una “familia de modelos” distinta para tareas creativas junto con Anthropic, OpenAI y Gemini.