FunSearch: Haciendo nuevos descubrimientos en las ciencias matemáticas usando LLMs

El nuevo sistema “FunSearch” de DeepMind usa modelos de lenguaje grandes para generar e iterar pequeños programas en Python, guiados por una función de puntuación automática, con el fin de abordar problemas combinatorios difíciles como cap sets y bin packing. Los comentaristas están divididos sobre si el avance refleja una nueva visión matemática genuina del LLM o principalmente el poder de una búsqueda evolutiva que conserva solo las mejores variantes de código, señalando que ideas similares existen desde hace tiempo en la programación genética y la síntesis inductiva de programas. El intercambio destaca cuestiones más amplias sobre cómo acreditar de forma justa a los LLM en sistemas híbridos, cuánto “razonan” realmente, qué experimentos se necesitan para demostrar su valor frente a métodos tradicionales y qué implica esta línea de trabajo para el futuro del descubrimiento científico y las capacidades de la IA.

Reacción general a FunSearch

  • Muchos consideran que el resultado es sorprendente: la búsqueda guiada por LLM produjo soluciones de vanguardia para cap sets y bin packing, superando a resolutores computacionales anteriores.
  • Otros lo ven como una mejora incremental sobre la programación genética / la búsqueda heurística más que como una revolución o un momento de “desde el fuego”.

Qué está haciendo realmente el LLM

  • Hay amplio acuerdo en que el trabajo pesado lo hace la búsqueda evolutiva + el evaluador; el LLM principalmente propone ediciones de código en lugar de mutaciones aleatorias.
  • Quienes lo apoyan sostienen que el LLM es crucial porque:
    • Genera programas sintácticamente correctos y verosímiles.
    • Evita un “arranque en frío” en el que la mayoría de los programas aleatorios tienen aptitud cero.
    • Sirve como un mutador de código “casi experto”, un solucionador general de problemas a nivel de programación.
  • Quienes son escépticos señalan:
    • El LLM solo ve fragmentos de código y firmas de tipos; no es un experto en dominio en combinatoria.
    • Las ablaciones comparan con una línea base de mutación aleatoria extremadamente débil, no con sistemas fuertes y existentes de programación genética.
    • Sigue sin estar claro cuánto de la ventaja proviene específicamente del LLM frente al simple cómputo y la búsqueda.

Novedad, extrapolación y el debate del “loro estocástico”

  • Algunos sostienen que esto contradice la idea de que los LLM solo regurgitan datos de entrenamiento, citando extrapolación en alta dimensión y construcciones matemáticas evidentemente nuevas.
  • Otros apuntan a evidencias de memorización y enfatizan que generar muchos candidatos malos más un filtro no es lo mismo que un razonamiento genuino.
  • Hay consenso en que los LLM pueden ser útiles en la práctica incluso si carecen de “comprensión verdadera”.

Alcance, limitaciones y extensiones

  • FunSearch funciona mejor cuando:
    • Hay un evaluador rápido y rico.
    • El problema puede formularse como la evolución de un pequeño núcleo de código dentro de un esqueleto fijo.
  • El método es explícitamente inadecuado para problemas como la generación de pruebas, donde no está claro un puntaje numérico rico.
  • Varios comentarios desearían que el sistema evolucionara pruebas formales (por ejemplo, en Lean) o integrara más razonamiento simbólico y síntesis de programas clásica.
  • Algunos señalan piezas prácticas ausentes: no hay una implementación de referencia de la interfaz del LLM en el repositorio y aún no hay replicaciones claras de terceros.

Implicaciones más amplias

  • Algunos lo ven como una validación de “LLM + herramientas” o de los híbridos neurosimbólicos como el camino correcto.
  • Otros subrayan que es impresionante, pero muy lejos de una singularidad; en su mayor parte es un poderoso truco de aceleración de búsqueda.