¿Es real la maldición de la inversión en los LLM?
Las afirmaciones de que los modelos de lenguaje grandes sufren una “maldición de la inversión” —no poder inferir “B es A” a partir de “A es B” (por ejemplo, pasar de “Tom Cruise es el hijo de Mary Lee Pfeiffer” a “Mary Lee Pfeiffer es la madre de Tom Cruise”)— han generado debate sobre qué aprenden realmente estos sistemas. Los comentaristas discuten si se trata de un fallo fundamental de la deducción lógica, de un artefacto de cómo el entrenamiento almacena asociaciones o simplemente de una reflejo de la ambigüedad del lenguaje natural, donde “A es B” a menudo no implica una relación reversible. El hilo también explora paralelos con la memoria humana, la diferencia entre el razonamiento en contexto y lo incrustado en el entrenamiento, y los límites de usar modelos comerciales opacos y en constante cambio como GPT‑4 para extraer conclusiones científicas generales sobre las capacidades de los LLM.
Realidad y significado de la “maldición de la inversión”
- Muchos consideran que la “maldición” (no poder pasar de “A es B” a “B es A”) no resulta sorprendente dado cómo funcionan los modelos de siguiente token y la asimetría del lenguaje.
- Otros sostienen que, en casos de identidad (“X fue el noveno canciller”), la mayoría de los usuarios espera reversibilidad, así que los fallos son un bug desde la perspectiva del producto.
- Algunos dicen que el artículo exagera: el efecto es real, pero tiene más que ver con el recuerdo/representación que con la incapacidad de realizar deducción lógica.
Semántica de “is” y lenguaje natural
- Varios comentarios subrayan que “A es B” normalmente no implica “B es A” en lenguaje natural (“un pájaro es un animal” vs “un animal es un pájaro”).
- Distinciones planteadas: “is of identity” vs “is of predication”; “A is B” vs “A is a B”; artículos definidos frente a indefinidos.
- Otros responden que el artículo se centra en formas claramente reversibles como “X es el Y” o roles únicos (madre/hijo, número de canciller).
Entrenamiento vs comportamiento en contexto
- Hay un fuerte consenso en que los LLM pueden invertir relaciones de manera fiable cuando ambas partes aparecen en el prompt; el problema surge en la generalización en tiempo de entrenamiento.
- Algunos lo formulan como “el modelo puede inferir B a partir de A, pero el proceso de entrenamiento no almacena los hechos de forma simétrica”.
- Debate sobre si el entrenamiento es solo “optimización torpe” o alguna clase de metaaprendizaje “inteligente”.
Comparaciones con la cognición humana
- Múltiples analogías: tarjetas de aprendizaje de idiomas, direccionalidad de Anki, punta de la lengua, memoria asimétrica de roles en películas, “fuerza = masa × aceleración” frente a usar la fórmula al revés.
- Algunos argumentan que los humanos tampoco obtienen las inversiones “gratis”, solo tras inferencia explícita y práctica.
- Otros responden que, para muchas relaciones factuales simples, los humanos son mucho más robustos y casi invariables al orden.
Prompting, datos y fine-tuning
- Varios comentaristas enfatizan que los hechos infrarrepresentados, los prompts ambiguos y los conjuntos de fine-tuning pequeños o mal diseñados amplifican el efecto.
- Los ejemplos muestran que la redacción (“is” vs “was”, “octavo” vs “noveno”) y el contexto adicional pueden cambiar respuestas incorrectas por correctas.
- Algunos temen que esto vuelva frágiles a los modelos afinados para recuperación factual, incluso si los modelos base manejan inversiones en contextos ricos.
Conteo, numeración y el caso del canciller alemán
- Un largo subhilo examina respuestas erróneas sobre “el octavo/noveno canciller federal de Alemania”.
- Surgen desacuerdos sobre si un titular “en funciones” debería contar; algunos dicen que el modelo está claramente equivocado, otros que la ambigüedad explica su elección.
- Más ampliamente, se señala la dificultad de los LLM con preguntas posicionales/ordinales (p. ej., “la quinta palabra de una lista”) como una debilidad relacionada.
Explicaciones mecánicas y arquitectónicas
- Una línea de discusión cita trabajos que muestran capas feed-forward actuando como almacenes clave-valor: los tokens del sujeto proporcionan claves, los valores almacenan hechos, y la atención más las frases de relación recuperan esos hechos.
- Desde esta perspectiva, las inversiones no son gratuitas: “B es A” requiere su propio mapeo clave-valor separado, por lo que cabe esperar almacenamiento asimétrico.
- Algunos especulan que los modelos bidireccionales (p. ej., estilo BERT) podrían rendir mejor, pero esto sigue sin estar claro en el hilo.
Implicaciones más amplias y escepticismo
- Los escépticos dicen que el problema de la inversión refuerza la idea de que los LLM no “entienden” ni hacen deducción lógica general, sino solo completado estadístico de patrones.
- Otros sostienen que los LLM sí aproximan el razonamiento en contexto, pero el entrenamiento no aprovecha esa capacidad para imponer generalización simétrica.
- Hay frustración por sacar conclusiones científicas fuertes de modelos propietarios y cambiantes; aparecen llamadas a estudios más abiertos y mecánicos.
- Algunos concluyen que el efecto es sobre todo un matiz a tener en cuenta más que una acusación demoledora; otros lo ven como emblemático de límites más profundos.