Karpathy 的鹈鹕
一个病毒式传播的演示展示了 AI 模型根据文本提示生成《指环王》3D 场景,这一演示被用来讨论什么才算是大型语言模型的有意义基准。评论者把这个新的“一次成片”3D 动画与早先的 SVG“骑自行车的鹈鹕”测试进行对比,争论这些把戏究竟是在展示推理、空间理解和软件创造方面的真实进步,还是只是在产出越来越精致但低价值的“slop”。许多人也质疑,为了炫目的演示而烧掉大量 token 的经济、创意与环境成本,以及 AI 系统距离在现实世界中可靠地构建有用、有趣、稳健的东西还有多远。
新基准:LotR 3D 动画 vs 鹈鹕 SVG
- 讨论围绕用更难的基准来替代“骑自行车的鹈鹕”SVG 测试展开:生成《指环王》开场的 three.js 动画。
- 一些人认为这更能检验模型:内容更长、更具空间性和叙事性,需要代码、物理和镜头运作,而不只是静态绘图。
- 也有人认为 LotR 不是好选择,因为模型已经大量接触过其文本和图像,所以它们可能只是在复刻电影,而不是真的在“理解”这段内容。
基准的价值与设计
- 支持者认为:新任务应该一开始表现很差,并留有提升空间;鹈鹕 SVG 已经趋于收敛,区分度变弱。
- 批评者认为:鹈鹕并没有“解决”(自行车仍然无法正常工作),所以现在转向新基准还为时过早,而且更多是被演示效果驱动。
- 还有几个人呼吁基准应当贴近真实世界任务(审计、UI、后端、自动售货机),而不是任意花哨的把戏。
游戏/媒体中的质量、创造力与“AI slop”
- 许多人指出,AI 生成的游戏和 3D 场景在片段里看起来很惊艳,但往往无聊、破碎或无法游玩;有人把它们比作“演示色情”或“跳舞的熊”。
- 怀疑者不相信 LLM 能真正优化“好玩”或创意性的游戏体验。
- 也有人认为它作为着色器/图形/代码助手很有价值,但并不适合做自主的游戏设计师。
超个性化娱乐 vs 共享文化
- 一派设想由高层提示词生成“1:1”的 AI 电影/游戏(大规模的你选择冒险)。
- 另一派则反驳:大多数人并没有对定制内容的明确欲望,更重视共同体验(例如大家一起讨论同一个系列)。
能力与弱点
- 展现出的强项包括:生成非平凡的 three.js/WebGL 场景、Blender 集成、程序化动画、文本转音乐实验。
- 持续存在的弱点包括:空间推理(自行车、弹珠台、3D 打印)、现实世界约束,以及无法稳健地审计自身输出。
- 有人指出版权拒绝策略并不一致;也有人担心对标志性训练数据的高度依赖(例如 LotR 电影)。
成本、外部性与“~free”叙事
- “~free” 这一说法受到质疑:仅 LotR 这个演示就花了约 100 万 tokens(约 10 美元),而且依赖大型、资源密集型数据中心。
- 数据中心对环境和本地基础设施的影响,也被拿来作为反对把大规模运行视为几乎免费的论据。
软件与一次性工具
- 不少人预见会出现“扔掉就算的软件”:由 LLM 快速生成的一次性工具,而不是打磨完善的产品。
- 也有人认为,长期维护的软件在经济上仍然更优;对于复杂系统,持续重生成并不现实,而且 token 成本高昂。
信任、炒作与信息传达
- 有些评论者对能力的快速提升感到震撼;另一些人则看到夸大宣传、公司营销,以及关于时间线的不断变换叙事。
- 对前景的兴奋与对炒作、垃圾内容以及浅层、优化注意力的演示的不满之间,持续存在张力。