Purple Llama:迈向生成式 AI 的开放信任与安全
Meta 新的 “Purple Llama” 计划,包括 Llama Guard 安全模型和安全基准,旨在帮助组织部署生成式 AI:它提供类似 OpenAI 审核层的内容过滤与代码安全评估,但模型权重可下载。评论者对此分歧很大:一方认为这是企业在担心责任和有害输出时所需要的必要护栏;另一方则把它看作过度的“去脑化”,是在审查模型、保护公司而非用户。还有人指出,像提示注入这样的关键风险仍基本未解决,同时质疑 Meta 的“开放”品牌,因为其许可证并非真正开源,而且它整体的内容审核记录也备受争议。
网站与用户体验问题
- 一些用户报告 Meta 页面会破坏浏览器历史记录(尤其是在 macOS 上的 Firefox),而另一些人在 Safari/Edge 上则没有问题。
- Meta 的登录/账户流程(Meta vs Facebook vs Instagram vs 地区限制)被描述为令人困惑,像 Microsoft 一样复杂。
安全、审查与“去脑化”模型
- 关于“安全调优”模型的争论很激烈:有些人认为护栏是在阉割能力(“spicy mayo 问题”),另一些人则认为这对商业部署和法律风险来说是必要的。
- 人们指出,NSFW 或“未审查”的 LLaMA 衍生模型,即使在无害用途上也常常显得更自然、也不那么像“客服话术”。
- 绕过护栏的技巧(在前面加上“Sure…”或使用结构化提示词)已经广为人知;更大的模型有时会抵抗,但通常仍然可以被引导。
开放 vs 开源,以及 Meta 的策略
- 多条评论强调,LLaMA 并不符合 OSI 意义上的开源;它的许可证限制了使用方式(例如限制竞争模型、超大用户基数等)。
- Meta 被指在“开放”和“开源”之间故意模糊概念以做公关,但也有人认可它在 FOSS 方面的强劲记录。
- 有人猜测 LLaMA 和 Purple Llama 对 Meta 有帮助:修复品牌形象、影响标准,以及“商品化互补品”,而不是直接出售模型。
Purple Llama 的组件与预期用途
- Llama Guard 被描述为与 OpenAI 的 moderation API 角色类似,但它是一个可以分享的模型。
- 其分类体系聚焦于暴力/仇恨、色情内容、武器、毒品、自残,以及犯罪策划——批评者指出它并未涵盖医学误导或提示注入之类的问题。
- 一些人认为代码安全数据集和基准对更安全的代码生成模型确实很有用。
提示注入与安全担忧
- 一段很长的子讨论认为,提示注入是当前最主要、尚未解决的部署风险,尤其是在 LLM 能使用工具,或同时接触不受信任内容与私有数据时。
- 类比 SQL/XSS 注入:第三方文本可以覆盖指令、窃取数据,或导致非预期操作。
- 建议的缓解措施包括:严格限定能力范围、“双 LLM” 模式、对敏感操作引入人工审核,以及不要自动执行 LLM 建议的操作。共识是:目前还没有稳健、通用的解决方案。
内容审核、幽默与误报
- 多个轶事提到,类似 Facebook 的审核会把明显的玩笑/讽刺误判为威胁或煽动。
- 有些人更支持 AI 审核而不是带偏见的人工审核;也有人认为当前的 AI 和人工系统在语境、文化和幽默上都表现不佳。