1978年,日本通产省(现经济产业省的前身)发布了JIS X 0208字符标准,规定日文打字排版要用到的汉字集合。标准一出来,懂日文的人就发现不对劲:里面有十几个字,没人认识,查无出处,连怎么念都说不清。这些字后来被叫做幽灵文字——不是哪个文豪造的生僻字,是标准里凭空冒出来的字。

更值得琢磨的是它们的下场:半个世纪过去,这些字没有被清理掉,反而顺着标准继承的链条,钻进了Unicode。也就是说,你此刻用的电脑、手机,字符表深处理论上都装着这几个谁也不认识的字。

速读:一次拼贴,怎么变成了字

  • 1978年,JIS X 0208公布,规定日文汉字集合,标准里理应给每个字标注出处。
  • 标准公布后,十几个字来历不明、发音不明,长期无人能解释。
  • 1997年,日本学者启动溯源调查,靠采访当年参与编目的人,翻查原始档案。
  • 调查发现.12个核心幽灵文字里,11个查到了来历,大多是抄录、剪贴或误认造成的编目错误;只有""字始终没找到出处,推测是"彊"字被看错,但没查到具体事件。
  • 这批字后来随JIS标准一起被Unicode继承,进入全球通用字符集——需要说明的是,这和Unicode自己在CJK统一过程中另外产生的一批"幽灵漢字"是两回事,不是同一个问题。
调查结果:12个字,11个查明,1个存疑 12 核心幽灵文字总数 11 找到编目错误链条 1 "彁"字,来源仍未坐实

妛字案例:一道接缝,被当成了一笔

最典型的一个字叫""。它本该是"山"字压在"女"字上面,这个组合字出现在某个日本地名里,该收进标准。问题是,当时印刷条件做不出这个上下叠合的字,编目人员就把"山"和"女"分别印出来,剪下来,拼贴到一张纸上,再复印存档。

复印件上,两片小纸的接缝看起来像一笔——于是这道拼贴的缝,被误认成了字形的一部分,原样收进了JIS草案。真正的原字("𡚴")反而晚了很久才被补进标准,而且至今很多字体、很多网页都显示不出来。

"妛"字诞生记 山、女 分别印出 剪下拼贴 合成一字 复印存档 接缝像一笔 收入JIS 错字被固化 原字 更晚 才补

标准不会遗忘

覆水难收,标准亦然。

这句话不是感慨,是这件事的全部逻辑。JIS标准一旦发布,就有无数排版系统、字典、数据库开始依赖它;等到1997年查清"妛"字是拼贴接缝造出来的,已经没人敢直接删——删掉一个字,意味着所有引用过它的地名记录、旧文档、旧系统都要跟着改。纠错的成本,永远比造错的成本高得多,这才是这批幽灵文字真正吓人的地方。

  • 结论.技术标准一旦形成全球兼容性依赖,早期的小错误也会被基础设施永久固化。

它们跟Unicode自己在CJK统一过程中产生的另一批幽灵字符不是一回事——那是不同汉字集合合并时的取舍问题,这批是JIS编目阶段的纯手误,两条线各自独立,只是都留在了同一个标准体系里。

  • 提醒.进入Unicode不等于所有字体都配了字形,不少幽灵文字在很多设备上仍显示为方框或替代符,不是"全球电脑统一显示"这么夸张。

有意思的对照是,徐冰在《天书》里手工刻了几千个谁都不认识的假汉字,是艺术家故意做的一场文字实验;JIS的幽灵文字则是编目员的手滑,没有任何创作意图,却因为搭上了标准化和全球兼容的顺风车,活得比大多数正经汉字还持久。技术基础设施最不讲道理的地方就在这——它不管你是精心设计还是纯属失误,只要你被写进了标准,就有了继承的资格。