Leaderboard de ARC-AGI

Una nueva leaderboard de ARC-AGI que muestra al Opus 5 de Anthropic muy por delante de otros modelos ha provocado escrutinio sobre cuán fiables siguen siendo los benchmarks de IA. Los comentaristas cuestionan si los modelos están siendo “benchmaxxed” mediante entrenamiento con acertijos similares, andamiajes de prompt ocultos o datos de prueba filtrados, y debaten si las tareas tipo juego de ARC-AGI miden de forma significativa la inteligencia general o solo el rendimiento en un género estrecho. El hilo también plantea preocupaciones sobre las promesas de retención de datos de modelos cerrados, la exclusión de harnesses y agentes de las puntuaciones oficiales, y una brecha creciente entre los resultados impresionantes en benchmarks y la utilidad cotidiana percibida de los modelos de frontera.

El rendimiento y la credibilidad de Opus 5 en ARC-AGI-3

  • Los comentaristas señalan una enorme brecha entre Opus 5 y otros modelos en ARC-AGI-3; algunos lo consideran “una locura” después de intentar las tareas.
  • Otros cuestionan su plausibilidad: los intentos abiertos actuales (p. ej., Kaggle) supuestamente obtienen ~2% con mucho cómputo, y algunas afirmaciones de “99%” en subconjuntos públicos se ven como no demostradas.
  • Varios sospechan entrenamiento dirigido en tareas al estilo de ARC-AGI-3 en lugar de un salto amplio de “inteligencia general”.

Benchmaxxing, contaminación y conjuntos de datos privados

  • Persiste la preocupación de que los benchmarks sean fáciles de “benchmaxx” mediante memorización, entrenamiento específico por género o instrucciones ocultas.
  • Algunos sostienen que el comportamiento de Opus 5 (perfecto en tareas similares a plantillas, peor en otras nuevas) parece entrenamiento en datos específicos de un género, no ganancias de razonamiento general.
  • Otros señalan la dificultad de probar la contaminación; existen divisiones privadas/semi-privadas, pero aun así pueden filtrarse mediante trazas, lectura del harness o datos compartidos por usuarios.

Harnesses frente a evaluación con un solo prompt

  • Debate sobre permitir “harnesses” (envoltorios que usan herramientas) alrededor de los modelos.
  • Una postura: los harnesses dominan el rendimiento, así que los benchmarks miden el envoltorio, no el modelo; permitir harnesses específicos de ARC rompe la “G” de AGI.
  • La otra postura: los humanos usan herramientas; prohibir harnesses hace que el benchmark sea menos relevante para sistemas de agentes del mundo real. Algunos sugieren dejar que los modelos construyan sus propias herramientas durante la sesión.

Retención de datos, Fable y confianza

  • Fable está ausente porque su política de retención de datos, según se informa, impidió el uso seguro del conjunto semi-privado.
  • Varios comentaristas desconfían de las garantías de “no training” de los grandes laboratorios, aunque uno señala que una afirmación de retención cero se mantuvo en un tribunal.
  • Algunos plantean la dificultad de distinguir entre “nunca almacenado” y “almacenado y luego borrado”.

Experiencia de usuario frente a mejoras en benchmarks

  • Un subconjunto de usuarios siente que los nuevos modelos rinden mejor en benchmarks, pero no resultan sustancialmente más útiles que los antiguos, o incluso se sienten “peores” por las restricciones y la cautela excesiva.
  • Otros informan mejoras claras (p. ej., en razonamiento técnico de nicho) y atribuyen la sensación de estancamiento a la adaptación hedónica.

¿Es ARC-AGI un buen benchmark?

  • Los críticos dicen que ARC-AGI-3 sobrepondera acertijos tipo juego, asume convenciones de juego humanas y está mal alineado con las fortalezas textocéntricas de los LLM.
  • Los defensores argumentan que las tareas novedosas e interactivas tipo juego son precisamente lo que se necesita para probar la generalización y el razonamiento sin herramientas.

Costes, incentivos y retórica de AGI

  • A algunos les sorprenden los costes de evaluación reportados (hasta decenas de miles de dólares).
  • Hay cinismo sobre que las enormes apuestas financieras y el marketing de “AGI/ASI” crean fuertes incentivos para sobreajustar o hacer trampa en los benchmarks.
  • Unos pocos sostienen que la AGI sigue a 10–20 años de distancia y que los sistemas actuales son coincidencia avanzada de patrones, no verdadera inteligencia general.