电子邮件混淆:2023 年还管用什么?
在网页上发布邮箱地址的混淆技术,如今看起来远没有过去那么关键了,因为许多人现在都表示,得益于现代过滤以及泄露邮箱数据集的普遍存在,而不是网页爬取,收件箱里的垃圾邮件很少。评论者讨论了简单手段(URL 编码、基础文本变形)与更复杂的基于 JS/CSS 或图片的方案之间的权衡,并指出可访问性、复制粘贴可用性,以及有决心的爬虫往往仍能绕过这些方案的问题。一个反复出现的主题是,垃圾邮件已从随机轰炸转向更“看起来正规”的营销和名单经纪邮件,因此一些人更倾向于使用每站点别名和 catch-all 域名来追踪并阻止滥用,而不是单纯依赖混淆。
方法论与结果可靠性
- 几位评论者质疑样本量太小(一年内只有六个机器人)以及百分比过于粗略(17/50/67/83%),认为这不足以推广到一般情况。
- 对“对照组”(未受保护的地址)以及“拦截的垃圾邮件”如何定义存在困惑;有些人觉得解释不清楚,甚至在内部自相矛盾。
- 一种解读是:同一页面上的所有地址都被部分相同的机器人命中,而“对照组”是所有地址上唯一垃圾邮件消息的并集。
公开发布电子邮件地址现在仍然是真实风险吗?
- 多位用户表示,他们长期公开、明文暴露的地址收到的垃圾邮件一直很可控(从接近零到每天几十封,多数已被过滤)。
- 有人认为,如今更大的风险是数据泄露和被售卖的名单,而不是网页爬取。
- 也有人指出,新域名或某些 TLD(例如没有 WHOIS 隐私保护的 .us)会很快吸引大量垃圾邮件。
垃圾邮件过滤器 vs 混淆
- 许多人表示,垃圾邮件在收件箱层面基本已经“解决”了,现代过滤器和 SMTP 级别阻断都很有效。一些人自托管使用 Postfix、灰名单、贝叶斯过滤器等,几乎收不到垃圾邮件。
- 反方观点:对于某些业务场景,误判为正常邮件仍然让垃圾邮件过滤很痛苦;减少进入的垃圾邮件总量仍然有价值。
- 总体看法:单靠混淆不能替代过滤器,但可以作为补充手段。
可访问性与可用性问题
- 几位评论者指出,过度混淆会损害可访问性,尤其是对屏幕阅读器用户。
- 建议的替代方案是:用按钮 + CAPTCHA 来显示明文,可能再加音频 CAPTCHA,不过这会带来可用性和成本问题。
讨论到的技术与规避方式
- 提到的方法包括:URL 编码、base64 + JS、JS 中的 XOR、基于 CSS 的重建、WebAssembly 技巧、带文字的图片、ARIA 角色、悬停解码、DOM 字符打乱。
- 有人表示 JS/CSS 或基于 WASM 的方法在现实中效果不错;也有人怀疑其长期有效性,因为无头浏览器和更聪明的爬虫正在普及。
- 图片仍被认为有效,但很烦人(不能复制粘贴),并且可能会被 OCR 破解。
替代地址策略
- 受欢迎的做法:使用 catch-all 域名并为每个网站设置别名;便于拉黑和追踪泄露来源。
- 变体包括:加盐/哈希或随机本地部分;“奇怪”但合法的格式(例如不寻常的本地部分或 TLD),可能能避开简单爬虫。
- 有些人正在考虑放弃复杂方案,改为单一公开地址加上强过滤。