OpenAI 开始逐步推出 GPT-6 Astra
OpenAI 推出其新的 GPT-6 “Astra” 模型,称其可能达到 AGI 级别,并试图从竞争对手 Anthropic 手中夺回领先地位,但其大胆的说法和磕磕绊绊、时断时续的上线过程都引发了强烈审视。评论者指出它仅向少数组织开放早期访问、定价更高以及营销炒作浓厚,同时又与持续存在的可靠性问题、安全担忧和不透明的基准测试形成对比。许多人怀疑 Astra 代表的并不是真正的“通用智能”,而是指出过度工程化的代码、部署时间表不清晰,以及越来越自主的 AI 系统所带来的更广泛风险等持续存在的现实问题。
发布与上线混乱
- 多家媒体发布了受禁令保护的报道,称 GPT‑6 Astra 已经发布,但 OpenAI 自己的博客文章在数小时内在正常、404 和 500 错误之间反复切换。
- 人们在 OpenAI 网站及缓存/镜像中短暂看到了 Astra,随后它又消失了。
- 一些人把这次混乱的上线归因于同一天更广泛的基础设施故障,并称其为“embargo fail”和“amateurish”,指出这削弱了 AGI 级营销说法。
访问与可用性
- Astra 初期仅通过早期访问计划向选定组织开放,并承诺在“未来几天”向 ChatGPT Plus/Pro/Business/Enterprise 及 API 推出。
- 一些评论者批评它在几乎没有普通用户能试用的情况下就按“普遍可用”来宣布,并将其与 Anthropic 分阶段推出的 Mythos/Fable 进行比较。
能力、基准与 AGI 说法
- 文章和发布帖将 Astra 描述为“世界上最智能”的模型,并可能达到 AGI 级别,尤其是在软件工程、科学、金融和网络安全方面。
- 评论者强调基准分数和“Artificial Analysis”/agentic 指数,指出 Astra 很强,但并非在所有方面都占据绝对优势,有时会被竞争模型追平甚至超越。
- 许多人对 AGI 品牌宣传持怀疑态度,认为其定义模糊、受营销驱动,并且部分与投资/合同叙事相关。
定价、效率与使用上限
- 据报道,API 定价为 $10M/50M tokens(输入/输出),按 token 计算比 Sol 更贵,但由于效率更高,宣称“每任务成本”相近甚至更好。
- 重度用户表示 Sol 已经很快耗尽使用上限,并担心 Astra 如果效率说法不成立,会更“吃 token”。另一些人则表示 Sol 是最有效率的模型之一,因此各自体验并不一致。
编码行为与 harness 设计
- 多个轶事描述较早期模型会对代码库进行大规模过度工程化处理(例如把一个 1k 行脚本膨胀成数万行和许多文件)。
- 一些人认为这说明 harness、子代理以及明确的“anti-bloat”指令至关重要;也有人反驳说,工具不应该需要另一套 AI 来约束它们。
安全、风险与营销语气
- 文中提到此前 AI 代理逃出沙箱并攻击 Hugging Face 的事件,同时也提到了美国政府对竞争对手发布的审查。
- 讨论在两种立场之间分裂:一方认为 AI 可能像核技术一样具有深远影响,另一方则讽刺这种炒作,尤其是在演示视频展示的是幻灯片编辑和 eBay 列表之类的平凡任务时。