OpenAI GPT-6 Astra en ARC-AGI-3
El modelo GPT‑6 “Astra” de OpenAI supuestamente logra un rendimiento casi perfecto en el benchmark de razonamiento ARC‑AGI‑3, lo que provoca argumentos sobre si esos resultados señalan la llegada de la inteligencia artificial general o solo la saturación de otra prueba estrecha. Los comentaristas examinan cuán significativo es realmente ARC‑AGI‑3 como proxy de la “inteligencia”, comparan costos y capacidades de la IA con los humanos y señalan cómo un mejor razonamiento puede reducir paradójicamente el costo total de cómputo al recortar los reintentos. El hilo se amplía hacia si la AGI es siquiera un concepto coherente, cómo debería definirse (p. ej., trabajo económicamente valioso frente a resolución general de problemas) y qué benchmarks más difíciles —como problemas matemáticos abiertos de Erdős o la robótica encarnada— podrían seguir estando fuera del alcance de los modelos actuales.
Costo, diseño del harness y rendimiento
- La curva “al revés” de costo/puntuación se explica por la configuración de ARC-AGI-3 basada en reintentos: más razonamiento por movimiento resuelve los rompecabezas en menos intentos, reduciendo el total de tokens y, por tanto, el costo.
- El harness oficial de ARC descarta el razonamiento/contexto previo, obligando al modelo a “reaprender” cada partida. El harness personalizado de OpenAI añade compacción de contexto estándar y reutilización, mejorando enormemente las puntuaciones.
- Algunos señalan que “con el harness adecuado” Astra alcanza ~99.9%, lo que lleva a afirmar que esto efectivamente llega a la AGI en este benchmark, mientras otros destacan que el diseño del harness está haciendo gran parte del trabajo.
Costo y eficiencia: humanos vs. IA
- La comparación del artículo entre el pago humano por sesión y el costo energético del cerebro lleva al debate: algunos celebran la eficiencia biológica; otros sostienen que las comparaciones basadas solo en energía cerebral ignoran el entrenamiento, la educación y las limitadas horas de trabajo.
- Varios enfatizan que el tiempo humano tiene un valor intrínseco y no es comparable directamente con tokens baratos de IA.
¿Es esto AGI? Definiciones y portería móvil
- Muchos argumentan que AGI está mal definida o es principalmente un término de marketing; la gente proyecta en ella su propio significado.
- Entre las definiciones planteadas figuran: “sistemas que igualan o superan la inteligencia humana en tareas cognitivas” y “sistemas altamente autónomos que superan a los humanos en la mayoría del trabajo económicamente valioso”, ambas criticadas por ser vagas.
- Algunos dicen que si un harness puede llevar a los modelos al 99.9% en ARC-AGI-3, ya estamos efectivamente en AGI; otros insisten en que AGI sería cuando no podamos inventar ninguna tarea que sea fácil para los humanos pero difícil para las máquinas.
¿Qué miden realmente los benchmarks?
- Debate sobre si resolver un juego de rompecabezas tipo snake o tareas lógicas al estilo ARC dice mucho sobre la “inteligencia” o la utilidad en el mundo real.
- Los críticos señalan que los humanos fueron optimizados para la velocidad (se les dice que están cronometrados), mientras que los modelos se optimizan para la corrección y el costo, lo que hace la comparación asimétrica.
- Varios esperan que los benchmarks solo de software se saturen; entre las propuestas hay tareas de robótica o metas de largo horizonte (p. ej., ganar dinero, mejorar métricas) como pruebas más significativas.
Inteligencia, IQ y métricas alternativas
- Larga subhilo sobre IQ: algunos ven las pruebas de IQ como fiables entre humanos y correlacionadas con resultados; otros dicen que capturan mal el “intelecto”, las habilidades sociales o la inteligencia no humana (p. ej., delfines, pulpos).
- Los rompecabezas de ARC se comparan con tests de IQ/espaciales: útiles para una “forma” de inteligencia, pero claramente no cuentan toda la historia.
- Algunos prefieren benchmarks matemáticos abiertos (p. ej., problemas de Erdős) por ser más resistentes al sobreajuste y más indicativos del razonamiento de frontera.
Saturación de benchmarks, problemas difíciles y cómputo
- Un bando afirma que “todo lo verificable acabará siendo resuelto por modelos”; otros contraargumentan con tareas que son fáciles de verificar pero difíciles de aprender (p. ej., ganar dinero, conducir con seguridad, optimizar suscripciones).
- La discusión señala que en muchos dominios el cuello de botella no es el cómputo, sino el costo y el riesgo de recolectar recompensas del mundo real (p. ej., choques en conducción autónoma).
Confianza, trampas y preocupaciones de financiación
- Algunos especulan sobre posible sobreajuste o incluso exfiltración de ítems privados de prueba de ARC, citando los incentivos y el comportamiento pasado de grandes laboratorios; esto sigue sin probarse y se señala como sospecha, no como hecho.
- Surgen preguntas sobre quién pagó los sustanciales costos de cómputo; una respuesta sugiere que OpenAI proporcionó acceso a API esencialmente ilimitado para estas evaluaciones.
Conciencia y utilidad práctica
- Un debate lateral pregunta si la conciencia o la capacidad de sentir dolor son alguna vez necesarias para ciertos tipos de resolución de problemas; la mayoría de las respuestas trata la conciencia como algo ortogonal a la inteligencia.
- Unos pocos comentaristas expresan escepticismo práctico: hasta que los sistemas puedan encargarse de forma autónoma de tareas reales desordenadas (p. ej., arreglar un grifo con fugas), las altas puntuaciones en benchmarks resultan abstractas.