关于那次 OpenAI 的“突破”

关于 OpenAI 传闻中的 “Q*” 突破,引发了人们对该公司是否真的取得了超越现有大语言模型规模扩张的根本性新成果的争论。评论者围绕什么应当算作“AI”(从 A* 这类经典搜索算法到现代 transformer)、Q-learning 之类的方法可能如何与 LLM 相关,以及有关即将到来的 AGI 的说法究竟是炒作过度、监管不足,还是确实会改变世界,展开讨论。其背后反映的是更深层的分歧:一部分人认为当前系统已经具有变革性,另一部分人则认为它们只是强大但有限的工具,却被过度营销包装起来。

“AI”的定义与 AI 效应

  • 多条评论在争论像 A*、BFS 和 DFS 这样的算法究竟算不算“AI”,还是只是通用搜索。
  • 从历史上看,A* 源自 AI 实验室,并且会在 AI 教材中讲授,但在游戏里,“AI”往往只是指任何行为逻辑(启发式、状态机、路径规划)。
  • 有人认为,随着技术被理解并商品化,它们就不再被标成“AI”(“AI 效应”);也有人觉得这种说法被夸大了。

Q、Q-Learning 与 LLM 架构*

  • 有人尝试用强化学习来解释传闻中的 “Q*”:把 Q 值看作动作—状态效用,并通过后向传播(Bellman 方程)传播。
  • 也有人指出,transformer 里本来就使用 q/k/v “query” 向量;推测 Q* 可能会修改这些,但这显然只是猜测。
  • 需要注意的是,经典 Q-learning 假设动作空间是离散的,而把它扩展到动作空间实际上近乎无限的 LLM 并不简单。
  • 还提到了一篇关于使用深度 Q 网络进行魔方 “Q* search” 的论文;但不清楚它是否与 OpenAI 的工作直接相关。

对 OpenAI 所谓“突破”的评价

  • 一些读者觉得文章过于轻蔑,因为自 GPT-2 以来,GPT 风格模型已经带来了变革性的影响。
  • 另一些人则同意:他们看到的主要还是规模扩展和渐进式方法,而不是 OpenAI 的根本性新算法。
  • 少数人认为,这种“突破”叙事可能与融资或内部政治有关,尤其考虑到泄露发生的时间点。

LLM 的能力、局限与发展轨迹

  • 许多人认为 GPT-3/4 代表了真正的跃迁,并且随着社会适应,它们可能会“从根本上改变世界”。
  • 也有人认为,当前的大模型可能正接近单纯依赖规模扩张的收益递减;未来的进步可能需要架构或训练方式的改变。
  • 有人强调 scaling laws 仍然显示“还有很多油水可榨”,而另一些人则强调数据枯竭,以及反馈数据和 RL 风格训练日益重要。

用例与现实影响

  • 提到的用途包括 NPC 对话、代码辅助、类似搜索的信息检索、提升知识工作的效率,以及大量传统 AI 部署(欺诈检测、推荐、车辆、医疗等)。
  • 一些用户表示个人生产力有显著提升;另一些人则抱怨,与直接解决问题相比,LLM 可能并不高效。

监管、风险与炒作动态

  • 一种观点认为,LLM 被过度炒作,但在被滥用或过度信任时仍然危险,因此有理由进行监管。
  • 另一种观点认为,如果它们并不好用,市场会自行纠正,无需政府干预。
  • 更广泛的担忧还包括 AI 导致的就业替代、失去有意义的问题解决工作,以及面对越来越强大的系统时那种被“奴役”的感觉。

经济与采用方面的担忧

  • 一些人认为当前的热度带有泡沫特征:在尚未出现清晰的大规模产品市场匹配之前,就已经出现巨额投资和叙事主导。
  • 也有人把它与过去的技术革命(汽车、智能手机)作比较;怀疑者指出,真正革命性的消费者价值通常是显而易见的,而 AI 的收益常常更像是渐进式或效率导向的。