超越 A*:使用 Transformer 进行更好的规划

研究人员正在探索,Transformer 模型是否能通过学习经典路径规划算法(如 A*)的执行轨迹,在迷宫求解和 Sokoban 拼图等任务上表现得更好。评论者认为这种方法在智识上很有趣,尤其适合作为学习启发式或引导传统搜索方法的途径;但也指出,文中报告的搜索步数减少 26.8% 可能伴随着高得多的计算成本,并且与 A* 相比,其最优性保证也更弱。这场讨论也引出了更广泛的问题:在什么情况下应当用人们已经充分理解的符号算法来替代沉重的神经模型,以及这类工作究竟是在推进实际性能,还是主要展示 Transformer 的灵活性。

模型命名与术语

  • 一些评论者不喜欢“Searchformer”这个名字;他们提出了替代方案(例如,带有规划主题的名字、“T*”),并指出它与先前工作存在命名冲突。
  • 有人认为“Search”是合适的,因为它承接了 A* 的传统;也有人说“Planning”会更符合符号规划领域的术语,并避免与信息检索中的“search”混淆。
  • 还有人拿命名、商标以及各种 transformer 风格名字的泛滥开玩笑。

与 A 和经典搜索的性能比较*

  • 论文声称在 Sokoban 和迷宫任务上,A* 搜索步骤更少;评论者指出,这并不一定意味着墙钟时间更短。
  • 多位参与者认为,A* 每一步的成本与运行一个 transformer 相比微不足道;他们怀疑会有任何速度收益,尤其是论文没有报告墙钟时间的情况下。
  • 讨论中提到,A* 在其假设成立时是最优的,而领域专用方法(例如 Jump Point Search)可以通过利用结构信息来超越它。

学习到的启发式与混合方法

  • 大家对使用学习模型为 A*、branch-and-bound、ILP、SAT 和其他离散优化器提供启发式或打破平局规则非常感兴趣。
  • 几位评论者更偏好混合系统:保留可证明的算法,再用 ML 学到的启发式进行增强,而不是完全替换它们。
  • 有人认为这篇论文是在朝着一种通用的、数据驱动的方法迈进,用以调优搜索策略,而不是手工设计启发式。

Sokoban、基准与科学价值

  • 批评者指出,Sokoban 的 SOTA 求解器远远超过普通 A*,所以仅仅击败原始 A* 只是一个较为有限的结果。
  • 也有人质疑,如果论文大体上只是复制 A* 的轨迹并以一个常数因子改进,那么它的科学贡献究竟有多大。
  • 另一些人反驳说,研究不必达到 SOTA 才有价值;它可以展示一种新的表述方式(在执行轨迹上使用 transformer),并启发后续工作。

最优性、不可解性与局限性

  • 有人担心基于 transformer 的规划器并不能自然证明最优性或不存在解,而 A* 在有限空间中可以做到这一点。
  • 讨论还涉及 transformer 在强形式逻辑否定与各种保证方面的困难。
  • 有些人将这项工作视为 transformer 惊人通用性的证据;也有人警告不要把生成式 AI 的成功过度推广到所有规划/优化问题上。