Los modelos se están volviendo más tontos a propósito

Los modelos de lenguaje grandes se están optimizando cada vez más para almacenar menos conocimiento factual en sus pesos y depender en su lugar de herramientas, búsqueda y bases de conocimiento externas, lo que plantea preguntas sobre cómo equilibrar “motores de razonamiento” con información actualizada. Los comentaristas debaten si los modelos expertos especializados y enchufables son deseables o siquiera compatibles con las arquitecturas actuales, frente a la tendencia histórica de que los modelos grandes y generales con entrenamiento amplio superan a las especializaciones diseñadas a mano (“la bitter lesson”). Otros critican el artículo referenciado por estar desactualizado y probablemente generado por IA, y subrayan que sacar los hechos de los pesos no resuelve por sí solo las alucinaciones ni garantiza citas fiables.

Validez de los benchmarks y frescura del artículo

  • Varios comentarios dicen que el artículo se apoya en benchmarks desactualizados (SimpleQA detenéndose en 2025) y tergiversa a los líderes y capacidades actuales.
  • Se proporcionan enlaces a gráficos actualizados de SimpleQA-Verified que muestran mejor rendimiento y a registros de ejemplos concretos.
  • Varios participantes afirman que es probable que la propia entrada del blog haya sido generada por IA y esté desfasada, lo que socava su autoridad sobre que “los modelos se están volviendo más tontos”.

Separación entre conocimiento y razonamiento

  • A muchos les gusta la división conceptual entre “motor de razonamiento” y “conocimiento en herramientas/KBs”, citando modelos pequeños de razonamiento (p. ej., Needle, VibeThinker) como ejemplos tempranos.
  • Otros argumentan que el razonamiento está fuertemente entrelazado con el conocimiento del mundo y el uso del lenguaje; no se pueden quitar limpiamente los “hechos” sin degradar el razonamiento.
  • Algunos plantean objeciones filosóficas: el razonamiento siempre está incrustado en prácticas lingüísticas específicas.

Modelos especializados / enchufables frente a modelos de propósito general

  • Un largo subhilo explora un sueño de “base de conocimiento enchufable”: pequeño núcleo de razonamiento + módulos de dominio intercambiables (Swift, GIS, frontend, etc.), idealmente ejecutándose de forma local.
  • Los críticos responden que los LLM transformadores actuales no se componen de esa manera; los datos entre dominios (p. ej., varios idiomas) a menudo mejoran el rendimiento debido a estructuras abstractas compartidas.
  • Se malinterpreta con frecuencia MoE: los comentaristas explican que los “expertos” no son módulos de dominio ordenados como “experto en Swift”, sino subredes abstractas de patrones.
  • Se invoca la “Bitter Lesson”: es probable que las arquitecturas modulares diseñadas a mano sean superadas por grandes modelos generales junto con prompts sencillos y arneses de agentes.

Alucinaciones, uso de herramientas y calidad de la búsqueda

  • Varios señalan que sacar los hechos de los pesos y meterlos en herramientas/RAG no “soluciona” automáticamente las alucinaciones; los modelos aún pueden inventar o manejar mal los datos recuperados.
  • Un comportamiento fiable de “no lo sé” se considera crucial y todavía no resuelto/no claro.
  • Algunos informan que los chatbots modernos alucinan menos debido al uso agresivo de herramientas y a indicaciones para verificar mediante búsqueda web.
  • Existe preocupación de que depender de la búsqueda web sea frágil a medida que la calidad de la búsqueda pública se degrada, pero las KB curadas/específicas de dominio y los índices internos pueden mitigar esto.

Patrones de uso y sistemas agénticos

  • Los participantes debaten el uso en el mundo real: muchos no desarrolladores usan los LLM para aprender, procesar texto y redactar, no para programar o agentes pesados.
  • Otros argumentan que el uso de código y agentes con muchos tokens puede dominar el consumo de cómputo aunque el número de usuarios esté sesgado hacia otros casos.
  • Se proponen sistemas multiagente y arneses especializados como la vía práctica actual hacia una “inteligencia modular”, en lugar de reconfigurar los pesos del modelo.

Inteligencia, conocimiento y confianza

  • Algunos subrayan que los LLM son modelos estadísticos de secuencias, no “inteligentes” en un sentido humano; otros señalan que la inteligencia misma está mal definida.
  • Varios se preocupan de que los ensayos escritos por IA y revisados superficialmente erosionen la confianza del lector y obliguen a los lectores a hacer su propio control de calidad sobre el razonamiento y los hechos.