我用了一周 Gemini Pro 1.5——它太棒了

Google 的 Gemini Pro 1.5 是一款新的大语言模型,拥有百万 token 级上下文窗口,因其能够吞入整本书或大型代码库并给出看似连贯、富含上下文的回答而备受关注。评论者对更智能的电子阅读器、法律与研究工具,以及将长上下文与检索技术结合的用例充满期待,但也质疑成本、可扩展性,以及在真实负载下质量是否会退化。许多人还担心幻觉、意识形态护栏和环境影响,并指出即便是有经验的用户也已经在把伪造输出当作事实。

模型能力与上下文窗口

  • 讨论纠正了文章中的说法:GPT‑4 Turbo 通过 API 有 128k 上下文,在网页/应用中为 16–32k;Gemini 1.5 的 1M–10M 上下文仍被视为真正的跃升。
  • 有人猜测 Google 采用了暴力扩展加系统技巧;也有人提到 LongRoPE、Mamba、FlashAttention、PagedAttention 等技术,但没人确切知道。
  • 几位评论者指出,据报道 Gemini 1.5 不只是“能接受”长上下文,而是更好地利用了长上下文,这点优于当前模型。

超大上下文的用途

  • 大家强烈期待把整本书、代码库和大型文档集喂给模型:
    • 电子阅读器助手(角色查询、无剧透回顾、缩写提醒、动机分析)。
    • 深度学习辅导工具,以及从多本教材/建议类书籍中汇总出的“顾问团”。
    • 跨整个代码库的功能建议,以及更有上下文感知能力的编程工具。
    • 跨大量论文的大规模研究综合或元分析。
  • 也有人提到 Kindle X-Ray 及类似功能,作为部分先例。

成本、可用性与可扩展性

  • 目前长上下文调用极其昂贵,这让人担忧;做聊天摘要或 Telegram 摘要工作流的人发现 GPT‑4 成本很快飙升。
  • 对未来成本看法不一:有人预计长期会接近零价(类比大型机),也有人反驳说 Gemini 可能比替代方案更贵,并担心选择性开放。
  • 在完整 Google 规模负载下的性能仍不确定;文章本身也提到当前延迟很高。

幻觉、准确性与信任

  • 多个严重幻觉案例被提及(伪造传记轶事;在竞选资金 PDF 中编造捐赠者;代码里捏造方法)。
  • 人们担心,即便是很专业的用户也在发布未经验证的 AI 内容,而读者越来越把 LLM 输出当成权威。
  • 共识是:模型可以很强大,但任何事实性或高风险内容都必须核实,最好由人类专家检查。

偏见、护栏与“觉醒化”

  • 围绕 Gemini 早前图像生成失败以及更广泛的“DEI/护栏”展开激烈争论:
    • 有人认为存在系统性的、带意识形态倾向的偏见,并担心其影响搜索和文本输出。
    • 也有人认为问题主要是过于激进的系统提示,而不是训练数据被清洗掉了。
    • 少数人明确喜欢强包容性,认为这比相反情况更好;另一些人则拒绝使用“公开种族主义”或政治倾向明显的系统。
  • 还有人怀疑“Pro”或私有版本在这方面会有实质不同。

RAG vs 长上下文

  • 有人认为长上下文会减少对重切块式 RAG 的需求;直接把完整文档塞进去就行。
  • 也有人认为 RAG 仍然至关重要:
    • 主要瓶颈是智能选择相关材料,而不是纯粹的窗口大小。
    • 对持续运行的应用来说,你不会每次都重发整座资料库;成本和效率仍然重要。
  • 很多人对 RAG + 巨型上下文 的组合感到兴奋:用 RAG 选出相关片段,再用大窗口承载跨来源的大量证据,从而实现更可靠的综合。

隐私、AR 与监控

  • 长上下文加 AR 引发了“每个人头上都显示姓名牌”和个人 CRM 叠层的想象:

    • 对容易记不住姓名/脸的人来说非常有用,也类似政治上的“Farley files”和 CRM 系统。
    • 也有人称这会是隐私噩梦:全面的行为记忆会侵蚀“遗忘”的社会价值,并招致跟踪、勒索和蜜罐。
    • 有人认为社会规范最终会适应;也有人担心人们会在公共场合变得极度戒备,像政客一样。
  • 另一个话题设想情报机构(例如 NSA)用长上下文 LLM 查询海量监控档案:

    • 有人声称,与大型科技云相比,NSA 的存储比大家想象得更有限。
    • 也有人提到犹他州数据中心和大型云合同,质疑这些安慰说法,并预期会有大量数据和 AI 分析。

能源、气候与资源担忧

  • 几位评论者担心数据中心耗电以及 AI 对气候变化的贡献,尤其是在大量使用只是处理琐碎内容时(例如猫图、低价值聊天)。
  • 也有人指出,与建筑或旅行相比,算力目前只占全球排放的一小部分,而且大型 AI 公司在可再生能源方面相对激进。
  • 对“碳中和”声明和碳抵消持怀疑态度;有人坚持我们仍需真正减少排放,而不是依赖账面技巧。
  • 大家普遍认同 AI 需求正在上升,我们或许需要更好的方法来判断其净收益是否足以证明资源成本合理。

产品质量、退化与 Google 对 OpenAI

  • 有人担心公开部署会削弱 Gemini 的质量(类似人们感受到的 ChatGPT “降智”),并敦促 Google 优先保持一致性,即便这意味着更高价格或更有限开放。
  • 也有人质疑“退化”是否真实存在,还是主要来自感知偏差加上偶发的糟糕输出。
  • 少数测试者表示 Gemini Ultra 在编程方面并不出色;也有人说 Gemini 1.5 Pro 感觉很快、能力很强,但目前速度慢、负载轻。
  • 也有少数人因 Google 被认为的搜索质量下降或意识形态偏向而直接否定 Gemini。

社会与劳动影响

  • 对 AI 快速进步的感受很复杂:
    • 有人对生产力提升感到兴奋(编程、法律、摘要)。
    • 也有人担心精英会攫取大部分收益,而低收入人群会进一步被边缘化,甚至因经济压力出现“软性消除”。
  • 另一种看法则预期价格会广泛下降,并可能出现政策回应(例如刺激政策,甚至可能是 UBI),不过大家也承认结果仍不确定。
  • 类比争论:AI 会像鼓机那样增强人类而不是取代人类,还是会像汽车之于马车那样淘汰旧角色?很多人认为未来更可能是更复杂、由 AI 辅助的工作,而不是所有岗位直接消失。