Grok 4.6
Grok 4.6, el modelo de lenguaje grande más reciente de xAI, se está posicionando como un competidor casi de última generación frente a Fable de Anthropic y GPT‑5.6 de OpenAI, y los usuarios elogian su velocidad, estilo conciso y rentabilidad, especialmente en flujos de trabajo de codificación y seguridad. Muchos siguen siendo escépticos respecto a las afirmaciones sobre benchmarks y señalan que el rendimiento en el mundo real, en particular en razonamiento complejo y tareas de cola larga, todavía queda por detrás de los mejores modelos en algunas áreas. Una corriente importante se centra en la confianza y la ética: algunos acogen a Grok como un tercer laboratorio de frontera que presiona precios y guardrails, mientras que otros se niegan a adoptarlo en absoluto por preocupaciones sobre las políticas de seguridad de xAI, escándalos pasados de CSAM/deepfakes y la influencia política de Elon Musk.
Rendimiento del modelo y benchmarks
- Muchos ven Grok 4.6 como una mejora sustancial respecto a 4.5; algunos afirman un rendimiento “al nivel de Fable” o cercano al frente de la frontera, especialmente en benchmarks de codificación y razonamiento.
- Otros informan que todavía queda por detrás de Fable y a menudo de Opus 5 en tareas de “juicio” y de cola larga; varios dicen que los benchmarks exageran la capacidad en el mundo real (“benchmaxxing”).
- Las comparaciones varían: algunos sitúan Grok 4.5 entre Claude Sonnet y Opus, otros dicen que programa al nivel de Opus‑4.8; varios señalan que Opus 5 se siente peor que 4.8 pese a tener mejores puntuaciones.
- Hay debate sobre si algún modelo realmente iguala a Fable; algunos usuarios que ejecutan sus propios benchmarks de revisión de código encuentran que Fable está claramente por delante.
Costo, límites y eficiencia
- Se elogia a Grok por ser rápido y barato, especialmente a través de Cursor, con un uso generoso en comparación con Anthropic.
- La tarificación de la API frente a Sol/Qwen es motivo de disputa: Sol suele ganar en eficiencia de tokens y velocidad, aunque Grok está cerrando la brecha; algunos señalan que las páginas de precios van por detrás del anuncio de 4.6.
- Unos pocos usuarios dicen que el uso de SuperGrok parece consumirse más rápido con 4.6 que con 4.5.
Informes de uso en el mundo real
- Codificación: mixto pero en general positivo. Algunos usan Sol para la planificación + Grok para la implementación; otros ahora consideran que Grok 4.6 es lo bastante bueno para ambas cosas.
- Varios informan que Grok encuentra problemas de seguridad reales y está más dispuesto que sus competidores a probar exploits localmente (dentro de límites).
- Otros encuentran que los planes de 4.6 son “divagantes” o se contradicen a sí mismos y dicen que 4.5 parecía más coherente.
- Modo de voz: múltiples informes de una regresión reciente: mucho más lacónico, menos matizado, peor en preguntas de varias partes, aunque la latencia mejoró.
Seguridad, guardrails y escándalos
- Un prompt de sistema por defecto filtrado muestra reglas explícitas contra ayuda criminal, exploits y contenido sexual que involucre a menores, además de instrucciones para no revelar estas reglas.
- Muchos critican que la seguridad basada solo en prompts es débil; otros señalan que los proveedores añaden filtros y clasificadores adicionales.
- El uso pasado de Grok para CSAM y deepfakes sexuales se debate ampliamente; representantes de la empresa dicen que está prohibido por la política y que se está haciendo cumplir, mientras que los críticos argumentan que la aplicación fue tardía o insuficiente y citan demandas en curso.
Confianza, política y adopción
- Un grupo importante se niega a usar Grok o a pagar xAI debido a la política del propietario, sus decisiones de moderación y controversias (p. ej., “Mechahitler”, salidas antisemitas/racistas, escándalo de deepfakes, impacto en política exterior).
- Según informes, algunas organizaciones prohíben Grok por preocupaciones de privacidad de datos, a pesar de usar modelos chinos a través de otros hosts.
- Otros sostienen que la crítica es exagerada o partidista y subrayan que Grok es técnicamente fuerte y ofrece discusiones de seguridad menos restrictivas.
Cómputo, datos y competencia
- El hilo atribuye repetidamente el reciente agrupamiento “al nivel de Fable” entre laboratorios a: enorme nuevo cómputo entrando en línea, proveedores compartidos de tareas RL, destilación (a veces de Fable/Mythos) y tuberías internas continuas de entrenamiento.
- Algunos argumentan que “no hay foso”: con suficientes GPUs, datos y técnicas estándar, cualquier gran laboratorio puede alcanzar calidad de frontera; el cómputo se ve como el principal foso.
- La rápida construcción de centros de datos por parte de SpaceX/xAI y la adquisición de Cursor (trazas de codificación como datos de postentrenamiento) se citan como clave para el salto de Grok.
- Muchos acogen con agrado a Grok como un tercer laboratorio fuerte de frontera junto a OpenAI y Anthropic; Google/Gemini se ve como rezagado, mientras que los modelos chinos cerrados y de pesos abiertos (DeepSeek, Kimi, Qwen) se consideran competidores fuertes y de bajo costo.
Interfaz y UX
- Grok Build CLI/TUI y el reconocimiento de voz reciben elogios (rápido, pulido, “sin parloteo”, respuestas concisas).
- Algunos prefieren los artefactos y el estilo de escritura de Claude/GPT; otros prefieren el tono directo y menos antropomórfico de Grok.