Google 已收购破产的美国航空公司 Spirit 的数据

Google 从 Spirit Airlines 的破产程序中收购其企业数据用于 AI 训练,引发了对隐私、同意以及将个人信息视为可交易资产的担忧。评论者质疑,数百万封电子邮件、通话录音、工单和内部文档所谓的“去标识化”在大型科技公司能通过交叉比对其他数据集轻易重新识别个人的情况下是否真的有意义,并指出破产程序往往会凌驾于原始用途同意之上。另一些人则认为,这反映了更广泛的趋势:AI 公司竞相获取独特的真实世界运营数据以自动化白领工作,而监管机构却难以及时更新数据保护规则。

出售范围与合法性

  • Spirit 的内部数字“排泄物”(电子邮件、Teams/SharePoint/OneDrive 相关内容、运营数据、支持日志、工单等)在破产程序中被拍卖,并被 Google 买下,名义上是为了“改进 AI 服务”。
  • 评论者争论这是否根本就不该合法:许多人认为这违反了客户和员工的预期,尤其是在同意是针对“训练”人类,而不是 LLM 的情况下。
  • 也有人认为在美国是“谁拥有电脑,谁就拥有数据”,而破产法院优先考虑债权人回收,除非有特定法规(例如类似 GDPR 的规则)阻止,否则合同会被重写。

包含了哪些数据(存在争议)

  • 有人引用报道说,Google 将获得大量客户行为数据(通话、聊天、电子邮件地址、Wi‑Fi 购买记录等)。
  • 另一些人读了法院文件后说,“客户行为”数据明确被排除在 Google 的购买请求之外,并指责文章报道错误。
  • 文中提到一个“Deidentification Agent”(由 Google 选定的第三方),并引用了加州 CCPA 去标识化标准。

去标识化与重新识别

  • 许多人对 1 亿多封电子邮件、3000 万通电话以及丰富运营日志这样的宝库能否真正去标识化持深度怀疑态度,尤其是在与其他数据集交叉关联时。
  • 举例包括:此前 AOL/Yahoo 的“匿名”数据集、少量准标识符(性别、生日、邮编)就足以造成唯一性,以及文体学分析(写作风格指纹识别)。
  • 有人指出,对已去标识化数据进行重新识别名义上违反大型科技公司的政策,甚至可能导致被解雇,但也有人提到激励机制、执法薄弱,以及“有限的不信任”。

Google 为什么想要这些数据

  • 这被视为一座金矿,可用于:
    • 客服交互,用于通话/聊天机器人训练。
    • 跨电子邮件、工单、聊天和运营数据的丰富、带时间戳的企业工作流,用于训练能模拟经营公司的“agent swarms”。
    • 真实白领工作的独特内部风格和模式,超越通用网页文本。
  • 少数人认为这也许能用于黑名单、类似社会信用的评分,或更细粒度的价格歧视,不过这被表述为猜测和担忧。

隐私、监管与规范

  • 多次与 GDPR 对比:目的受限的同意、不可转移的使用范围,以及有实际力度的罚款;相比之下,美国的默认规则更偏向商业友好。
  • 有人指出 GDPR 并不完美,也会通过“合法利益”被规避,但仍然远胜于没有。
  • 几位评论者认为“去标识化”标准没有跟上机器学习能力的发展,并呼吁紧急出台新的监管。

更广泛的反应

  • 人们对“数据作为资产”在公司生命周期结束后仍然存在并在破产中被货币化感到强烈不安。
  • 也有人带着认命的语气评论:大多数人早已把类似数据交给了 Gmail、Teams 等;数据经纪商和追踪无处不在。
  • 另一些人则更关注这种反乌托邦方向:用人类的苦难来训练模型、普通人失去有意义的隐私,以及 AI 成为企业更紧密控制和攫取的工具。