Google Imagen 2

Google 在 Vertex AI 上发布 Imagen 2 图像生成模型的公告正招致批评,因为其访问政策令人困惑:虽然被宣传为“全面可用”,但实际上似乎仅限于被加入 allowlist 或“trusted tester”的云客户,且入门流程不透明。评论者质疑该模型是否真的显著优于 DALL·E 3、Midjourney 和 Stable Diffusion,指出缺少基准测试、早期结果参差不齐以及示例经过高度筛选。此次发布被广泛视为 Google 更广泛的 AI 与云问题的缩影,包括文档割裂、流程繁琐、地区限制,以及一种看法:开源工具如今提供了更实际的价值和灵活性。

访问与文档困惑

  • 许多评论者表示,尽管博客声称已“全面可用”,他们仍搞不清楚到底该如何实际使用 Imagen 2。
  • 文档和控制台界面混用“GA”“受限 GA”“allowlist”和“Trusted Tester Program”,让人难以判断谁才真正有访问权限。
  • 一些用户报告说,使用 imagegeneration@00x 端点时无需特殊权限即可调用 API;而另一些人则遇到“request access”表单、404,或“仅限受限客户”之类的提示。
  • Google Cloud 控制台中的导航路径(Vertex AI → Model Garden → Imagen)被形容为繁琐且文档不足。
  • 没有简单的公开试玩环境(例如托管演示页面);很多人认为这是一次重大发布失败。
  • 在加拿大,Imagen 相关服务目前因“监管不确定性”而不可用,这进一步加剧了挫败感。

模型质量与对比

  • 一些人认为,如果放在两年前,这会令人印象深刻;但如今它要面对 DALL·E 3、Midjourney、SDXL 等竞争。
  • 一些早期测试者认为 Imagen 2 明显不如 DALL·E 3,只是在简单提示词上还“可以”,但存在可见伪影和“几年前水平”的质量。
  • 另一些人则认为它在文本渲染和 logo 方面确实优于 Stable Diffusion。
  • 由于 Google 过去有大量经过精心挑选的演示,以及最近 Gemini 的争议,怀疑情绪很高;缺少基准测试或论文进一步放大了这种疑虑。
  • 基于示例的测试(例如复杂的拥抱场景、像飞鼠这样的特定动物)表明,组合推理和多实体推理仍然是普遍弱点,而不是在这里被独特地解决了。

开源 vs 云服务

  • 一派认为,Stable Diffusion(再加上 AUTOMATIC1111、ControlNet、LoRA 等社区工具)实际上已经在严肃或专业工作流中“赢了”:控制更多、没有硬性内容过滤,而且推理成本低或可本地运行。
  • 另一派则反驳说,闭源 API(OpenAI、Google、Adobe、Canva)在易用性、集成、赔偿保障和非专家可访问性方面占主导地位,即便开源模型更灵活。
  • 成本也存在争议:云端约 0.02 美元/张在一些人看来比自托管更贵;而另一些人则更愿意按张付费,以避免购买 GPU 和配置环境的麻烦。

Google 的产品策略与组织问题

  • 许多人认为,这又是 Google 变成一家缓慢、官僚、重营销的“像 IBM 一样”的公司的又一例子:AI 发布花哨、访问混乱、平台难用。
  • 讨论中大量涉及内部臃肿、混日子的工程师与失灵的中层管理,以及这种文化如何解释 AI 产品的迟缓和半成品状态。
  • 一些人认为,Google 正在优先考虑公关和股市观感,而不是交付稳健、清晰可访问的工具。