Más allá de A*: mejor planificación con Transformers
Los investigadores están explorando si los modelos transformer pueden superar a los algoritmos clásicos de planificación de rutas como A* aprendiendo de sus trazas de ejecución, por ejemplo en laberintos y rompecabezas Sokoban. Los comentaristas consideran el enfoque intelectualmente interesante, especialmente como una forma de aprender heurísticas o guiar métodos de búsqueda tradicionales, pero señalan que la reducción reportada del 26,8% en los pasos de búsqueda probablemente conlleva un coste computacional mucho mayor y garantías de optimalidad más débiles que A*. El intercambio resalta preguntas más amplias sobre cuándo tiene sentido reemplazar algoritmos simbólicos bien entendidos por modelos neuronales pesados, y si este tipo de trabajo mejora el rendimiento práctico o principalmente ilustra la flexibilidad de los transformers.
Nomenclatura y terminología del modelo
- Varios comentaristas no gustan del nombre “Searchformer”; sugieren alternativas (p. ej., nombres con temática de planificación, “T*”), y señalan colisiones de nombres con trabajos anteriores.
- Algunos argumentan que “Search” es apropiado por la herencia de A*; otros dicen que “Planning” encajaría mejor con la terminología de la planificación simbólica y evitaría confusión con la “búsqueda” de recuperación de información.
- Bromas sobre nombres, marcas registradas y la proliferación de nombres con temática de transformers.
Rendimiento frente a A y la búsqueda clásica*
- El artículo afirma menos pasos de búsqueda A* en tareas de Sokoban y laberintos; los comentaristas señalan que esto no necesariamente implica menos tiempo real de ejecución.
- Varios participantes afirman que el coste por paso de A* es trivial en comparación con ejecutar un transformer; algunos dudan de cualquier ganancia de velocidad, especialmente porque no se informan tiempos reales de ejecución.
- Hay discusión sobre que A* es óptimo bajo sus supuestos, y que métodos específicos de dominio (p. ej., Jump Point Search) pueden superarlo explotando la estructura.
Heurísticas aprendidas y enfoques híbridos
- Hay gran interés en usar modelos aprendidos para proporcionar heurísticas o desempates para A*, branch-and-bound, ILP, SAT y otros optimizadores discretos.
- Varios comentaristas prefieren sistemas híbridos: conservar algoritmos demostrables y augmentarlos con heurísticas aprendidas por ML en lugar de reemplazarlos por completo.
- Algunos ven este artículo como un paso hacia una forma genérica y basada en datos de ajustar estrategias de búsqueda en lugar de diseñar heurísticas a mano.
Sokoban, benchmarks y valor científico
- Los críticos señalan que los solucionadores SOTA de Sokoban superan con mucho al A* simple, así que vencer al A* sin modificaciones es un resultado modesto.
- Surgen dudas sobre la contribución científica del artículo si en gran medida reproduce trazas de A* y las mejora por un factor constante.
- Otros replican que la investigación no necesita ser SOTA para ser valiosa; puede ilustrar un nuevo enfoque (transformers sobre trazas de ejecución) e inspirar trabajo posterior.
Optimalidad, insolubilidad y limitaciones
- Preocupa que los planificadores basados en transformers no demuestran de forma natural la optimalidad o la ausencia de soluciones, mientras que A* puede hacerlo en espacios finitos.
- Se discuten las dificultades de los transformers con formas fuertes de negación lógica y garantías.
- Algunos ven el trabajo como evidencia de la sorprendente generalidad de los transformers; otros advierten contra extrapolar en exceso el éxito de la IA generativa a todos los problemas de planificación/optimización.