Cuando los benchmarks de IA se estancan: un estudio sistemático de la saturación de benchmarks
Las afirmaciones de que los modelos de lenguaje grandes están “al final del camino” porque están saturando los benchmarks estándar de IA están recibiendo una fuerte respuesta de investigadores y profesionales. Muchos sostienen que la aparente meseta refleja fallos en los propios benchmarks —conjuntos de prueba pequeños, estáticos y susceptibles de ser manipulados, con elementos mal etiquetados o de baja señal— más que un límite duro de la capacidad del modelo, y señalan leyes de escalado y evaluaciones más nuevas que siguen mostrando progreso constante. El hilo destaca un cambio creciente hacia evaluaciones más robustas, evolutivas y específicas de dominio, como entornos multiagente y baterías de pruebas propietarias, para capturar mejor la utilidad en el mundo real y evitar el gaming de benchmarks.
Saturación de benchmarks y qué significa
- Muchos benchmarks ahora muestran modelos agrupándose cerca del 80–90% de precisión, lo que algunos ven como “llegar a un muro”, mientras que otros lo consideran una señal de que los benchmarks son ruidosos o defectuosos.
- Varios comentaristas sostienen que elementos mal etiquetados, preguntas ambiguas y la desordenada naturaleza inherente de los benchmarks hacen que un 90% sea un techo plausible sin implicar límites del modelo.
- Otros señalan que hay miles de benchmarks; algunos se saturan rápido, otros (por ejemplo, pruebas más recientes al estilo de “último examen”) siguen siendo discriminativos.
- Una visión: la “saturación” es en parte un efecto de selección: una vez que las tareas fáciles se resuelven, solo quedan los valores atípicos difíciles y ruidosos, lo que hace más difícil medir el progreso.
¿Es este el final del camino para los LLM?
- Un grupo escéptico afirma que la rápida saturación sugiere límites fundamentales de los enfoques actuales de “regresión sobre texto”; ven el progreso desplazándose hacia mejoras estrechas, centradas en perseguir benchmarks.
- Los opositores lo califican de prematuro y sin datos, y señalan el progreso constante en índices agregados de capacidad y en leyes de escalado que siguen cumpliéndose.
- Algunos sienten que los modelos de frontera han llegado a una meseta en “generalidad” mientras mejoran en dominios específicos como matemáticas y programación. Otros informan de ganancias recientes drásticas en asistencia para programar.
Comprender los LLM frente a la inteligencia
- Un lado insiste en que “sabemos exactamente” cómo funcionan los LLM a nivel de mecanismos (atención, multiplicaciones de matrices), rechazando las afirmaciones de misterio.
- Otros argumentan que conocer la mecánica de bajo nivel no es lo mismo que comprender el comportamiento emergente, de forma análoga a conocer las ecuaciones cuánticas sin entender por completo los materiales o la cognición.
- Varios señalan que la propia “inteligencia” es vaga, lo que hace difícil fundamentar afirmaciones sobre su techo.
Evaluación, gaming y nuevos benchmarks
- Preocupación: los benchmarks fijos y públicos se convierten en objetivos de “benchmaxxing”, de manera similar a cómo el hardware de PC se ajustaba para benchmarks específicos de juegos.
- Respuestas propuestas:
- Benchmarks propietarios o en constante evolución para reducir la contaminación del entrenamiento y el gaming.
- Entornos multiagente, abiertos y tareas de tipo juego que capturen mejor la programación del mundo real y las capacidades “sociales”.
- Cautela con tamaños de muestra pequeños y con sobreinterpretar rankings de gran granularidad.
Utilidad práctica y progreso futuro
- Algunos usuarios informan que los modelos más nuevos se sienten peores para escribir o para tareas generales pese a tener mejores puntuaciones.
- Otros enfatizan que la “habilidad” al usar LLM y las tareas altamente verificables (programación, matemáticas formales) muestran mejoras fuertes y continuas.
- Hay desacuerdo sobre si RL y la retroalimentación humana pueden seguir escalando o si chocarán con límites económicos y de datos.