¿Qué pasa cuando un LLM nunca ve material más allá de quinto grado?

Limitar los datos de entrenamiento de un modelo de lenguaje al material curricular K–5 de EE. UU. produce una IA que puede imitar a un niño muy lector, pero que aun así alucina y responde con confianza mucho más allá de su supuesto nivel de conocimiento. Los comentaristas examinan qué tan bien funcionó el filtrado por nivel de grado, si un modelo así puede decir de forma fiable “no lo sé” y qué implica esto para los LLM actuales en general: que sus capacidades están fuertemente limitadas por los datos de preentrenamiento y no por una “inteligencia” abstracta emergente. Algunos ven esto como una valiosa sonda de investigación sobre techos de conocimiento y humildad en los modelos; otros sostienen que solo confirma que los sistemas actuales siguen siendo autocompletado sofisticado más que verdaderos razonadores.

Alcance y configuración del experimento

  • El modelo se entrena con texto filtrado para abarcar aproximadamente “≤ quinto grado” / currículo K–5 de EE. UU.
  • Canal de filtrado: partir de un corpus web educativo, aplicar umbrales de edad de adquisición de palabras (descartar muestras donde >5% de las palabras superen la edad de 12 años), eliminar símbolos matemáticos de nivel superior y luego entrenar un clasificador para refinar la विभisión.
  • Algunos comentaristas quieren más transparencia: ejemplos de datos incluidos y comprobaciones humanas puntuales del nivel de grado; el conjunto de datos todavía no se ha publicado.

Preocupaciones sobre filtraciones y calidad de los datos

  • Varias respuestas sugieren que el modelo claramente conoce conceptos más allá de quinto grado (dispersión de Rayleigh, entrelazamiento cuántico, chistes sobre el gato de Schrödinger, Python básico, etc.).
  • Se especula que el filtro es imperfecto; se permite un “5% de palabras avanzadas” y material infantil escrito por adultos podría introducir conocimiento de nivel superior.
  • Otros argumentan que muchas de estas explicaciones aparecen en libros de ciencia para niños, así que aún podrían estar dentro de un corpus K–5 plausible.

Comportamiento, calidad de las respuestas e “inteligencia de quinto grado”

  • Los usuarios reportan respuestas muy erróneas o incoherentes (por ejemplo, tabla del cinco, raíz cuadrada de −1, impacto del amianto, maximizar una función, algoritmos de ordenación que causan un bucle infinito).
  • Algunos lo ven como “solo un modelo débil”, no como un análogo bien fundamentado de un alumno de quinto grado; un niño real muchas veces diría “no lo sé”.
  • Otros lo comparan con un lector omnívoro de todos los textos de primaria, con recuerdo perfecto pero poco razonamiento genuino.

Alucinaciones, incapacidad de decir “no lo sé” y RLHF

  • Un subhilo grande debate por qué los LLM rara vez dicen “no lo sé”:
    • Una postura: los modelos base imitan texto en el que la gente casi nunca termina con “no lo sé”.
    • Postura contraria: el ajuste por instrucciones y RLHF pueden entrenar explícitamente a los modelos para expresar incertidumbre, pero eso compite con los benchmarks que recompensan respuestas seguras.
  • Discusión sobre el comportamiento de “sabelotodo”: LLMs aduladores, que rara vez rechazan ideas de forma subjetiva; otros señalan que los modelos frontera más nuevos se oponen o corrigen a los usuarios con más frecuencia.
  • Algunos relacionan RLHF con una menor varianza: menos rechazos puede maximizar las puntuaciones de los benchmarks y el engagement.

Techos de capacidad e implicaciones para la AGI

  • Afirmación clave del artículo (parafraseada en el hilo): el escalado, el ajuste por instrucciones, RL y trucos en contexto amplifican lo que enseña el currículo, pero no empujan más allá de él; el filtro del preentrenamiento fija un techo efectivo de capacidad.
  • Muchos consideran este resultado importante: sugiere que la inteligencia está estrechamente limitada por el alcance de los datos de entrenamiento, lo que desafía la esperanza de que la mera escala produzca conocimiento cualitativamente nuevo a partir de corpus limitados.
  • Algunos ven esto como una confirmación de las críticas del “loro estocástico”; otros siguen interesados en si un entrenamiento de razonamiento más fuerte, la memoria y tareas de largo horizonte aún podrían producir descubrimientos novedosos incluso desde un currículo restringido.

Ideas alternativas de entrenamiento y posibles usos

  • Entre las propuestas están:
    • Entrenamiento estricto basado en currículo a través de grados con puntos de control en cada nivel.
    • Crecimiento impulsado por curiosidad: cuando el modelo admite ignorancia, un modelo mayor recupera y añade nuevos datos.
    • Entrenar con corpus altamente verificados y bien equilibrados en lugar de mezclas ruidosas de la web.
  • Algunos ven aplicaciones de nicho: un modelo K–5 restringido para automatización del hogar o asistentes más seguros, aunque persisten las preocupaciones sobre alucinaciones persistentes.