有个幽灵在 Unicode 中出没
Unicode 对东亚文字的处理暴露了抽象字符模型与混乱历史现实之间的张力。评论者深入讨论了像 彁 这样的“幽灵字符”如何通过扫描或编码错误进入标准、具争议的中日韩汉字统一,以及它对搜索、字体和 OCR 的实际影响。虽然许多人认为,在 Unicode 不再受 16 位限制后,这些怪现象如今大多只是无害的历史遗留,但它们也凸显了为活的、视觉上多变的书写系统构建一个通用编码有多么困难。
幽灵 / “Spectre” 字符
- 几条评论认为幽灵字符(如 彁)的故事很有趣,但最终影响不大:如今 Unicode 不再受 16 位限制的严格约束,额外的 codepoint 只是“无害的历史怪癖”。
- 有些人认为保留错误或幽灵字符是有价值的,因为它们能促进讨论、历史分析,以及一些有趣的用途(例如作为 QA 标记、虚构的幽灵名字、纹身,或表示“未知/不可言说”概念的符号)。
- 也有人质疑,为什么明显的错误不能直接替换成正确字符;他们把严格不删除视为一种“奇怪的绝对主义”,更偏向保留错误而不是追求正确。
汉字统一与 CJK 的复杂性
- 一大段子讨论汉字统一:把视觉上或历史上相关的中、日、韩字符合并到共享的 codepoint。
- 批评者称其结果是“一团不连贯的乱麻”,破坏了搜索、字体选择和语言身份方面的预期;他们认为这主要是为了在 16 位内生存,并“把 CJK 塞进 BMP”。
- 也有人为这一过程辩护,认为这是严肃学者的工作;他们指出 CJK 统一早于 Unicode,并强调 Unicode 也有许多出于兼容性和数学语义而重复的类似拉丁字母 codepoint。
- 对于结果究竟是受日语还是中文压力所塑造,存在分歧;归因并不清楚。
哲学 / 模型争论
- 有人把 Unicode 的字符模型描述为“本质主义”的:许多视觉上不同的字形会映射到共享的抽象字符(例如不同风格的 “A”、黑体字、草书、以及不同地区间的书写风格差异)。
- 也有人指出 Unicode 并没有统一一切(如拉丁/希腊/西里尔的 A,或者许多带重音的形式),因此汉字统一对 CJK 用户来说显得格外不一致。
- 讨论还涉及一些哲学家对 Unicode 的“字符 vs 字形”方法的批评,但细节多半是转述而来,仍然不够清楚。
OCR、起源与证据
- 多条评论讨论 彁 的可能起源:很可能是由于一份扫描质量很差的报纸中把 彊 误读所致;文中还提到了一些日文来源。
- 关于 OCR 的争论:早期 CJK OCR 速度慢且不可靠;对罕见或根本不存在的字符进行训练很困难。
- 也有一些关于 OCR 可能使用部首进行识别的技术推测,但其精确的历史还原被认为并不确定。
其他编码笔记
- 其他分支讨论包括:
- 依赖字体的差异(中文与日文字形、保加利亚语与俄语西里尔字母)。
- 使用 compose-key 输入罕见符号。
- 一些奇怪的拉丁字母(ÿ、Ÿ)以及组合附加符号与预组合字符的例子。