从姓名与世系进行身份识别:规范化与记录链接
摘要
重复的姓名及其多种拼写方式,使得区分不同个体成为家谱系统中的一项根本性挑战。本文回顾了记录链接领域的研究文献,从 Fellegi 与 Sunter 奠定的统计学基础 [1],到语音匹配与字符串相似度度量 [2][3],再到阿拉伯语姓名所带来的特殊挑战 [4],直至现代的实体解析 [6]。随后我们从宏观层面阐述 Nasayeb 平台构建"身份指纹"的方法论,但不披露其内部细节。
1. 问题所在
在任何一个大家族中,总会反复出现一个问题:这位"艾哈迈德之子穆罕默德",与另一支系中的那位是同一个人,还是恰好同名的另一个人?错误的答案要么导致同一个人有两条记录(虚假膨胀与相互矛盾),要么将两个不同的人合并(丢失真相)。姓名的两个特性使这一难题更加复杂:拼写方式的多样性,以及它们在同一家族内部的高度重复。
2. 姓名带来的挑战
同一个姓名,因哈姆扎、阿里夫、闭合塔(taa marbuta)等字母的拼写差异,可能会有多种写法(Fuʾad/Fuwad、Aḥmad/Ahmad)。姓名也常常为纪念先辈而重复使用,因此在同一支系内,你会发现好几个人姓名相同、父名也相同。可见,仅凭姓名,甚至姓名加上父名,都不足以可靠地进行身份区分。这在链接历史与人口记录的研究中是一个众所周知的普遍问题 [5]。
3. 文献综述
1969 年,Fellegi 与 Sunter 建立了记录链接的经典概率框架,其基础是在多个字段上权衡匹配与非匹配的概率 [1]。在此前后,语音匹配也不断演进:Soundex 算法以及随后的 NYSIIS,将尽管拼写不同却读音相近的姓名归为一类 [2]。诸如 Levenshtein 和 Jaro–Winkler 这样的字符串相似度度量,则为两个文本字符串的接近程度提供了量化衡量 [3]。
阿拉伯语姓名本身在规范化与转写方面带来了特殊挑战,自然语言处理领域的研究以统一拼写变体、处理前缀与词缀等技术加以应对 [4]。更广泛地说,近年的综述性研究拓展出"实体解析"这一概念,将该问题推广为在多个来源之间链接指向同一实体的记录 [6],而数据匹配领域的文献则提供了全面的实践框架 [7]。
一个姓名指向众人,一个身份指向唯一。
4. 从姓名到结构
这些文献中反复出现的一个教训是:姓名本身是一个微弱的信号;准确性来自多种信号的结合,来自将一个实体与其周围的结构相链接,而非孤立地看待它。在世系的语境下,这个周围的结构正是亲属网络本身:血缘、婚姻,以及在图谱中所处的位置。这就把身份问题与亲属关系的表示问题紧密联系在了一起。
5. Nasayeb 方法论(进阶层次)
Nasayeb 平台构建了一个"身份指纹",它在经过统一拼写变体的语言学规范化之后,将姓名、世系链条以及配偶姓名等附加信号结合起来。这些信号的汇聚,使两个不同的人之间发生偶然匹配的情形变得罕见,因此重复记录能够被高精度地检测出来并加以合并。其中精确的参数、匹配权重与阈值属于我们的专有成果,恕不披露。
此处的贡献有两方面:一是将匹配领域的文献适配到多种文化下姓名与世系的具体情形,二是将身份与亲属结构本身相绑定,而非孤立地处理姓名。其结果是一份洁净的家族记录,其中每个人只保留一次,是一份你可以信赖、可以依靠的记录。
6. 结论
在姓名高度相似的家族中区分不同个体,是一个由来已久、文献丰富的老问题,从概率匹配一直延伸到实体解析。切实可行的解决办法不是单一信号,而是将姓名、世系与周围上下文结合起来的身份指纹,并建立在一套尊重语言特性的语言学规范化之上。如此一来,家族才能保持为一份准确的记录,而不是一堆相互矛盾的副本。
参考文献
- Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
- Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
- Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
- Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
- Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
- Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
- Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
