Google Gemini Pro API 可通过 AI Studio 使用
Google 已通过 AI Studio 将其 Gemini Pro 大语言模型开放给开发者,并提供了慷慨的免费层,引发了人们对其定价、功能以及它能否轻松替代或补充 OpenAI GPT API 的兴趣。评论者注意到其颇具吸引力的限制(每分钟最多 60 次免费查询)、多模态支持和 function calling,但许多人报告了糟糕的 UX、地区访问限制,以及在推理任务上的表现大致只相当于 GPT‑3.5 而非 GPT‑4。人们还担心 Google 会利用免费层数据改进模型、未来可能涨价,以及像自动生成博客文章这类工具对网页质量的更广泛影响。
访问与可用性
- Gemini Pro 可通过 Google AI Studio / MakerSuite 以及 Vertex AI 使用,并支持许多国家和语言。
- 一些用户报告“Access restricted”“internal error”或 Early Access 权限问题,即使管理员设置看起来正确也是如此。
- 有些人只能通过美国 VPN 访问 MakerSuite;据称 Gemini 目前在欧盟尚不可用,而那里的 Bard 可能仍在运行 PaLM 2。
- Firefox 用户在 AI Studio / MakerSuite 网站上看到大量被拦截的弹窗。
定价与免费层
- 免费层允许每分钟最多 60 次查询,许多人认为这非常慷慨,也很有动力去试用。
- 有人怀疑这是亏本引流,并担心之后会像 Google Maps 那样大幅涨价。
- 免费层数据会被用于改进产品。
- 付费定价按字符计费;粗略比较表明,考虑字符与 token 的差异后,总体成本与 GPT‑3.5 Turbo 大致相当。
模型质量与对比
- 多个简单推理题(房子里的书、兄弟姐妹、盘子下面的橙子)暴露出 Gemini Pro 经常出现逻辑错误,在这些测试中大致与 GPT‑3.5 相当,但弱于 GPT‑4 和一些较新的开源模型。
- Gemini Pro 的视觉能力也会犯明显错误(例如把竖起大拇指误判为倒拇指,还给出夸张的解释)。
- 多位用户形容 Bard/Gemini 令人失望;大家的热情主要来自价格和可访问性,而不是能力。
- Gemini Ultra(Google 定位为 GPT‑4 竞争对手)尚未发布。
UX 与上手流程
- 常见抱怨包括 AI Studio、MakerSuite 和 GCP/Vertex 之间的流程令人困惑、返回按钮失效、弹窗过多,以及 API key 创建错误。
- 也有对 Google 云产品 UX、更广泛的语言/区域设置处理,以及使上手打磨被降级的组织激励机制的批评。
API 设计与集成
- 该 API 被视为对 OpenAI chat API 的简单替换:“messages” → “content”,角色略有不同(没有显式的 system 角色),并带有内置的审核控制。
- 支持 function calling、embeddings、semantic retrieval 和多模态输入;Qdrant 也有 embeddings 的示例文档。
- 对 Node.js 与 Web SDK 示例之间一些细微差异存在困惑;后来被澄清为文档/重载问题。
隐私与广告
- 有人担心 Bard/Gemini 查询会立即影响 Google 各产品中的个性化广告;一位用户观察到,ChatGPT 的使用则不会这样。
内容与网页质量
- 一个“blog post creator”提示模板示例被视为在为 AI 生成的网页垃圾内容正名。
- 另一种观点认为,结构化文本生成(例如新闻稿)可以是有效用途,不过有些人更喜欢原始事实列表,而不是填充性散文。
品牌与命名
- 有人指出名称与现有的 Gemini Internet 协议重名;也有人认为“Gemini”很通用,而 Google 的使用指的是太空计划和内部团队结构。