AI 图像生成器可以被诱导生成 NSFW 图像

研究人员已经表明,带有内置安全过滤器的 AI 图像生成器仍然可以被提示生成 NSFW 或其他受限内容,包括通过绕过输入和输出检查的“秘密”无意义词。评论者围绕这些控制是有益的还是仅仅是公司与监管层面的“安全表演”展开争论,并引出了审查、儿童安全、法律风险、广告商和应用商店压力,以及当前对齐技术局限等更广泛问题。许多人指出,这些漏洞的重要性不止在于色情:如果系统连裸露都无法可靠屏蔽,那么在更高风险的应用中也就不可能完全值得信任。

“安全”和 NSFW 的含义

  • 多条评论澄清,这里的“安全”指的是 NSFW、“trust and safety”以及“brand safety”,而不是物理危险。
  • 有人认为裸露本身并不一定不安全;“unsafe”主要指会被解雇或违反社会规范。
  • 也有人反驳说,人们完全可以合理地觉得公开裸露令人反感,并希望有边界。

过滤架构及其缺陷

  • 许多人认为大型图像生成器同时使用提示词过滤和输出过滤。
  • 用户报告:
    • 提示词能通过输入过滤,但输出会被拦截,包括误判(例如:年轻人穿米色衣服、词语“breast pocket”)。
    • 不同平台(Bing、DALL·E、OpenAI APIs)表现相似,有时即使结果被拦截也会收费。
  • 较小/独立的 API 往往没有或只有极少的过滤。

对抗性提示词和“无意义”标记

  • 论文的贡献被认为是以算法方式生成对抗性提示词,从而绕过提示词和基于图像的 NSFW 分类器,包括通过“无意义”标记。
  • 一些人对这些 token embedding 如何出现,以及为什么它们会映射到 NSFW 概念感兴趣。
  • 另一些人指出,这削弱了更广泛的对齐主张:如果你连色情内容都无法可靠屏蔽,那么更有害的行为大概也无法可靠阻止。

审查 vs 能力 的争论

  • 一派观点:限制模型(只保留 80% 功能)以避免滥用,并满足平台、广告商、应用商店和监管机构。
  • 另一派观点:更愿意保留完整能力,把责任放在用户身上;将这些限制视为家长式、清教徒式或“安全表演”。
  • 本地 / 自托管模型被描述为绕过企业过滤器的“Linux vs Windows”路线。

儿童、产品与责任

  • 一些人强调要保护孩子和学校:需要一个“安全”的生成器,这样教育类应用不会意外展示色情内容。
  • 另一些人认为孩子总会找到办法看到 NSFW 内容,而过度净化主要是为了公司公关,而不是真实伤害。

法律与伦理边缘案例

  • 有人区分了一般 NSFW 与“NSFLE”(非法内容,如合成儿童虐待内容),后者即使是 AI 生成也可能带来严重法律后果。
  • 关于这种纯人工非法内容是否应被刑事化的争论,被标记为有争议且尚无定论。

对研究和报道的更广泛反应

  • 有些人认为这项研究显而易见或微不足道(“当然,如果你足够努力,就能突破约束”)。
  • 另一些人将其比作黑客攻击或逼迫自动驾驶汽车:这是必要的压力测试,而不是毫无意义。
  • 少数人批评 IEEE 文章对 LLM 的解释过于简化,并且聚焦裸露有点幼稚,因为还有更严重的对齐问题。