¿Cuántas patas tienen diez elefantes, si dos de ellos no tienen patas?
Los grandes modelos de lenguaje tropiezan con regularidad ante acertijos matemáticos y lógicos aparentemente sencillos, como contar las patas de elefantes cuando algunos están “sin patas”, revelando errores que van desde fallos aritméticos básicos hasta explicaciones surrealistas. Quienes comentan usan estos fallos para destacar que los LLM generan texto estadísticamente plausible en lugar de razonar de verdad, y para debatir si añadir herramientas como intérpretes de Python cierra de manera significativa esa brecha. El hilo también trata de las peculiaridades de la tokenización, el sobreajuste a acertijos comunes y lo que estos comportamientos implican sobre los límites de los sistemas de IA actuales frente a las aspiraciones de la AGI.
Tema general: fallos de los LLM en matemáticas y razonamiento básico
- El hilo gira en torno a un acertijo simple (“diez elefantes, dos sin patas”) y a cómo muchos LLM dan respuestas obviamente incorrectas.
- Entre las respuestas reportadas están: 32 (correcta), 36, 38, 40, 64, 78, e incluso “dieciocho”, a menudo con un razonamiento seguro pero incoherente.
- Algunos modelos afirman que los elefantes tienen 8 patas, aplican mal la resta o cuentan dos veces las patas “faltantes”. Otros manejan mal preguntas inversas (dado el total de patas, inferir cuántos elefantes hay).
Por qué los LLM tienen dificultades con las matemáticas (según el hilo)
- Varios comentarios subrayan que los LLM son predictores probabilísticos del siguiente token, no motores simbólicos de matemáticas ni sistemas lógicos.
- Los números son solo tokens: 0, 10, 100 pueden ser cada uno un solo token; 98 puede ser varios. Los modelos no cambian de forma inherente a un modo de “razonamiento numérico”.
- La aritmética y las matemáticas son una parte diminuta de los corpus de entrenamiento y se mapean mal con la tokenización, así que el rendimiento es frágil y desigual.
- Algunos ven estos errores como evidencia de que los LLM carecen de comprensión o razonamiento genuinos; otros sostienen que siguen siendo potentes detectores de patrones, pero que simplemente no fueron optimizados para matemáticas.
Uso de herramientas frente al comportamiento de un LLM “puro”
- Varias personas señalan que GPT‑4 a menudo acierta las preguntas del elefante y de fechas escribiendo y ejecutando código Python en un intérprete aislado.
- Hay debate sobre si esto es una impresionante “generalización más uso de herramientas” o solo añadir una calculadora a un motor de autocompletado.
- Se traza una distinción clara entre el LLM en bruto y el sistema circundante (LLM + herramientas).
Inconsistencia entre modelos y prompts
- El mismo prompt produce respuestas distintas en Bard, GPT‑3.5, GPT‑4, Claude, Mixtral y Bing; incluso el mismo modelo puede cambiar su comportamiento con el tiempo.
- Algunos modelos más pequeños o más nuevos responden correctamente; otros dan lógica extraña (por ejemplo, redondear patas negativas hacia 1).
- Se observa sobreajuste a acertijos comunes (por ejemplo, responder siempre “pesan lo mismo” en variantes de plumas y ladrillos).
Reflexiones más amplias
- Los fallos se usan para argumentar tanto que los LLM son “solo autocompletado” como que están mejorando rápidamente (especialmente con modelos más grandes y herramientas).
- Varios comentarios presentan a los LLM como “tamizadores” o asistentes muy capaces más que como razonadores, y ven estos rompecabezas como buenas pruebas de estrés para sus límites.