1978年,日本通产省(现经济产业省的前身)发布了JIS X 0208字符标准,规定日文打字排版要用到的汉字集合。标准一出来,懂日文的人就发现不对劲:里面有十几个字,没人认识,查无出处,连怎么念都说不清。这些字后来被叫做幽灵文字——不是哪个文豪造的生僻字,是标准里凭空冒出来的字。
更值得琢磨的是它们的下场:半个世纪过去,这些字没有被清理掉,反而顺着标准继承的链条,钻进了Unicode。也就是说,你此刻用的电脑、手机,字符表深处理论上都装着这几个谁也不认识的字。
速读:一次拼贴,怎么变成了字
- 1978年,JIS X 0208公布,规定日文汉字集合,标准里理应给每个字标注出处。
- 标准公布后,十几个字来历不明、发音不明,长期无人能解释。
- 1997年,日本学者启动溯源调查,靠采访当年参与编目的人,翻查原始档案。
- 调查发现.12个核心幽灵文字里,11个查到了来历,大多是抄录、剪贴或误认造成的编目错误;只有"彁"字始终没找到出处,推测是"彊"字被看错,但没查到具体事件。
- 这批字后来随JIS标准一起被Unicode继承,进入全球通用字符集——需要说明的是,这和Unicode自己在CJK统一过程中另外产生的一批"幽灵漢字"是两回事,不是同一个问题。
妛字案例:一道接缝,被当成了一笔
最典型的一个字叫"妛"。它本该是"山"字压在"女"字上面,这个组合字出现在某个日本地名里,该收进标准。问题是,当时印刷条件做不出这个上下叠合的字,编目人员就把"山"和"女"分别印出来,剪下来,拼贴到一张纸上,再复印存档。
复印件上,两片小纸的接缝看起来像一笔——于是这道拼贴的缝,被误认成了字形的一部分,原样收进了JIS草案。真正的原字("𡚴")反而晚了很久才被补进标准,而且至今很多字体、很多网页都显示不出来。
标准不会遗忘
覆水难收,标准亦然。
这句话不是感慨,是这件事的全部逻辑。JIS标准一旦发布,就有无数排版系统、字典、数据库开始依赖它;等到1997年查清"妛"字是拼贴接缝造出来的,已经没人敢直接删——删掉一个字,意味着所有引用过它的地名记录、旧文档、旧系统都要跟着改。纠错的成本,永远比造错的成本高得多,这才是这批幽灵文字真正吓人的地方。
- 结论.技术标准一旦形成全球兼容性依赖,早期的小错误也会被基础设施永久固化。
它们跟Unicode自己在CJK统一过程中产生的另一批幽灵字符不是一回事——那是不同汉字集合合并时的取舍问题,这批是JIS编目阶段的纯手误,两条线各自独立,只是都留在了同一个标准体系里。
- 提醒.进入Unicode不等于所有字体都配了字形,不少幽灵文字在很多设备上仍显示为方框或替代符,不是"全球电脑统一显示"这么夸张。
有意思的对照是,徐冰在《天书》里手工刻了几千个谁都不认识的假汉字,是艺术家故意做的一场文字实验;JIS的幽灵文字则是编目员的手滑,没有任何创作意图,却因为搭上了标准化和全球兼容的顺风车,活得比大多数正经汉字还持久。技术基础设施最不讲道理的地方就在这——它不管你是精心设计还是纯属失误,只要你被写进了标准,就有了继承的资格。
