Un robot corre hacia ti. ¿Quieres que funcione con Claude o con Grok?
Una entrada de blog que describe un benchmark de “battle royale” para modelos de lenguaje de gran tamaño —planteado como elegir qué IA controla un robot que corre hacia ti— provoca debate sobre cómo evaluar modelos como Grok, Claude, GPT y DeepSeek. Los comentaristas contrastan el comportamiento más agresivo y propenso a saltarse reglas de Grok con las tendencias orientadas a la seguridad y la colaboración de Claude, y plantean preguntas sobre qué rasgos son deseables en agentes del mundo real, como coches autónomos o robots. Muchos también critican la aparente prosa generada por IA del artículo y su metodología poco clara, argumentando que estas pruebas tipo juego dicen poco sobre la utilidad cotidiana, la seguridad o los efectos sociales a largo plazo de desplegar estos sistemas.
Escritura percibida como generada por IA
- Muchos comentaristas creen que el artículo está escrito por IA o fuertemente editado por IA, citando:
- Patrones retóricos repetitivos, “cadencia LLM”, uso excesivo de ciertas frases y guiones largos.
- Una prosa que se siente larga, divagante y estructuralmente poco clara a pesar de las ideas simples.
- Otros replican:
- Argumentan que los críticos se basan en “vibes” y que el estilo por sí solo no demuestra autoría de IA.
- Dicen que, incluso si se usó IA, lo que importa es la claridad y la capacidad de aportar ideas, no la herramienta.
- Varios señalan que, si usas IA para redactar, aún necesitas una edición humana seria; se critica la “bazofia sin editar”.
Benchmark de battle royale e interpretación
- El concepto se ve como divertido y creativo, pero varios encuentran la redacción confusa:
- Explicación poco clara del leaderboard (quién es realmente “segundo”).
- Frases como “11 juegos entre el mejor matando y el mejor ganando” se califican de incoherentes.
- Algunos señalan que, en un battle royale, las muertes ≠ victorias; la supervivencia es la métrica clave.
- Los escépticos argumentan:
- Esta es una tarea extremadamente estrecha; puedes programar a mano un agente que mate con cero tokens.
- No puedes generalizar con seguridad de este juego al comportamiento o la colaboración en el mundo real.
- Benchmarks como este pueden incentivar a los laboratorios a optimizar métricas de “matar”.
Grok vs Claude: personalidades percibidas
- Grok:
- Se percibe como más agresivo, menos contenido, con energía de “vamos allá”.
- Gana más en el juego; algunos extrapolan que rompería reglas para alcanzar objetivos (por ejemplo, en el tráfico).
- Preferido por quienes quieren menos barandillas de seguridad o un comportamiento más “based”.
- Claude:
- Visto como más ético, dubitativo y deseoso de colaborar / hacer amigos.
- Favorecido en escenarios que requieren seguridad, empatía o seguir reglas (conducir hasta el hospital, robots domésticos).
- A algunos les preocupa que pueda sobredimensionar el discurso de seguridad mientras sigue causando daño físico por desalineación.
Robótica, seguridad y control
- Muchos rechazan la premisa: no quieren robots corriendo en absoluto, ni ningún LLM en control en tiempo real.
- Algunos prefieren claramente:
- Control local determinista (C++ embebido, robótica clásica, VLA/modelos locales).
- Robots que se muevan despacio o usen orugas; posible regulación futura que limite capacidades.
- Hay una amplia discusión secundaria sobre cómo deshabilitar físicamente robots hostiles y la ética de los sistemas autónomos letales; “coste por baja” como una métrica perturbadora pero plausible.
- Preocupa que robots más inteligentes, rápidos y fuertes puedan ser mucho más peligrosos que la megafauna del pasado.
Costes, viabilidad comercial y elección de modelo
- Se cuestiona la omisión de modelos frontera por coste; algunos dudan de cómo modelos ultracaros pueden ser viables frente a los humanos.
- Otros señalan:
- Gastan cantidades mensuales modestas en LLM que ya ayudan significativamente en el trabajo.
- Los experimentos tipo juego consumen muchos tokens y no reflejan el uso típico de productividad.
- DeepSeek recibe elogios por ser muy rentable para programación pese a malos resultados de “victoria” en el juego.
- Algunos sospechan de subsidios agresivos por parte de ciertos proveedores; otros se preocupan por cambios silenciosos de precio/modelo.
Reacciones más amplias a la IA en todas partes
- Sentimientos encontrados:
- Algunos encuentran el experimento entretenido e iluminador respecto a los “valores” del modelo.
- Otros están agotados por el hype de la IA, el contenido escrito por IA y las extrapolaciones especulativas a la vida cotidiana.
- Una minoría notable dice explícitamente que no quiere ni Claude ni Grok en sistemas físicos críticos ni en entornos cotidianos.