¿En qué tipo de matemáticas son buenos los LLMs?
Los modelos de lenguaje grandes están empezando a ayudar con demostraciones matemáticas formales y búsqueda de contraejemplos, pero todavía fallan en muchas tareas cotidianas de razonamiento y en problemas reales desordenados, como interpretar anuncios de empleo o resolver acertijos lógicos abiertos. Los comentaristas contrastan la fortaleza de los LLMs para el reconocimiento de patrones, el código y la demostración de teoremas dentro de sistemas bien especificados con su debilidad en benchmarks de razonamiento general, comprensión espacial y seguimiento fiable de instrucciones sutiles. Esto lleva al debate sobre si los sistemas actuales califican como “inteligencia general”, cuánto progreso está impulsado por búsqueda por fuerza bruta más verificación, y si los futuros modelos llegarán alguna vez a producir ideas matemáticas genuinamente nuevas y elegantes en lugar de resultados incrementales o de fuerza bruta.
Alcance de las capacidades de los LLMs
- Muchos comentaristas distinguen entre:
- Buen rendimiento en tareas formales de dominio cerrado (matemáticas, código, demostraciones formales, Lean).
- Rendimiento débil e inconsistente en tareas abiertas del “mundo normal” (búsqueda de empleo, razonamiento general, sentido común).
Fallos en tareas del mundo real frente a la calidad del prompt
- Un comentarista informa de que modelos frontier fallan en una tarea agentiva aparentemente simple: encontrar trabajos freelance de consultoría IT en un país específico, confundiendo:
- Roles freelance frente a permanentes.
- Ubicación del trabajo frente a ubicación de la agencia.
- Otros discrepan y señalan que:
- El prompt descrito es difícil de interpretar; no se conoce la calidad real del prompt.
- La calidad de los datos y la ambigüedad del scraping (portales de empleo, agencias) probablemente importan.
- Hay una idea más amplia de que los agentes LLM de extremo a extremo para flujos de trabajo reales y desordenados siguen siendo frágiles y necesitan pipelines descompuestos y verificables.
Benchmarks de razonamiento y límites
- Benchmarks citados (General365, ARC-AGI-3) muestran:
- Los modelos frontier puntúan muy por debajo de los humanos en tareas de razonamiento diversas cuando se controla el conocimiento previo.
- Los acertijos de ejemplo son extremadamente difíciles incluso para los humanos; algunos sostienen que una precisión del 60%+ es impresionante, otros lo ven como evidencia contra la “AGI”.
- Otra línea de crítica: los LLMs se distraen fácilmente con contexto irrelevante; prompts más largos y verbosos pueden perjudicar.
Matemáticas, demostraciones y “fuerza bruta” frente a intuición
- La discusión de resultados matemáticos recientes asistidos por LLM enfatiza:
- Uso intensivo de generar-y-probar, muchos subagentes, miles de scripts/comandos.
- Algunos lo ven como una búsqueda por fuerza bruta glorificada; otros lo enmarcan como búsqueda heurística iterativa, similar a la evolución.
- Se considera que los LLMs son:
- Excelentes para recorrer casos, buscar contraejemplos y producir largas demostraciones formales cuando se combinan con verificadores/solvers SAT.
- Aún no parecen capaces de producir conceptos nuevos y profundamente “elegantes” (p. ej., análogos de la transformada de Fourier).
Inteligencia, AGI y confianza
- Un sector argumenta que:
- Conocimiento amplio del mundo + razonamiento simulado + transferencia entre dominios ya cumple su criterio personal de “AGI”.
- Los críticos responden que:
- El fallo en tareas de abstracción al nivel de un niño y la fragilidad práctica contradicen eso.
- Una AGI real tendría que ser digna de confianza para ingeniería de alto riesgo (puentes, aviones, guerra) sin redes de seguridad humanas, algo que está muy lejos de la realidad actual.
- Varios señalan que la experiencia humana sigue siendo necesaria tanto para guiar a los LLMs como para verificar los resultados; los usuarios no expertos rara vez logran avances.
Observaciones meta
- Los LLMs se presentan como potentes generadores de “trazas de razonamiento plausibles al estilo humano” que pueden mejorar la búsqueda estocástica, pero:
- Siguen siendo propensos a errores en el razonamiento sistemático de varios pasos, especialmente en cadenas largas o en lógica de concurrencia/temporal.
- Hay preocupación por una próxima avalancha de demostraciones y resultados generados por máquina que solo una diminuta comunidad experta podrá verificar.