名前と系譜からの同一人物判定:正規化とレコードリンケージ
要旨
名前の重複と、その多様な綴りは、個人を区別することを系譜システムにおける根本的な課題としている。本稿では、Fellegi と Sunter が築いた統計的基盤 [1] から、音声照合および文字列類似度指標 [2][3]、アラビア語名に固有の課題 [4]、さらには現代のエンティティ解決 [6] に至るまで、レコードリンケージに関する文献を概観する。続いて、その内部構造を開示することなく「同一性フィンガープリント」を構築する Nasayebプラットフォームの手法を、概略的なレベルで述べる。
1. 課題
大きな家系においては、必ず一つの問いが繰り返される。すなわち、この「ムハンマド・イブン・アフマド」は別の支系にいる人物と同一人物なのか、それとも偶然同じ名前を持つ別人なのか、という問いである。誤った答えは、一人の人物に対して二つの記録が生じること(誤った水増しと矛盾)か、あるいは二人の別人が統合されてしまうこと(真実の喪失)のいずれかを意味する。この困難は、名前が持つ二つの性質、すなわち綴り方が多岐にわたること、そして単一の家系の中で名前が頻繁に繰り返されることによって、いっそう増大する。
2. 名前という課題
一つの名前は、ハムザ、アリフ、ター・マルブータなどの綴りに応じて複数の形で表記されうる(Fuʾad/Fuwad、Aḥmad/Ahmad)。また、名前は祖先に敬意を表して頻繁に繰り返されるため、一つの支系の中に、同じ名前かつ同じ父称を持つ複数の人物が見つかる。したがって、名前だけ、あるいは名前と父称を合わせても、確実な区別のためには十分ではない。これは、歴史的記録や人口統計記録を一般にリンクする際に、よく知られた問題である [5]。
3. 文献レビュー
1969年、Fellegi と Sunter は、複数のフィールドにわたって一致と不一致の確率を比較衡量することに基づく、レコードリンケージの古典的な確率的枠組みを確立した [1]。その前後には音声照合が発展し、Soundex アルゴリズム、続いて NYSIIS が、綴りの違いにもかかわらず発音の似た名前をまとめ上げた [2]。Levenshtein や Jaro–Winkler といった文字列類似度指標は、二つのテキスト文字列がどれほど近いかを定量的に測る手段を加えた [3]。
一方、アラビア語の名前は、正規化と翻字において固有の課題を提起する。これに対しては、自然言語処理の研究が、綴りの異形を統一し、接頭辞や接辞を扱う技術によって取り組んできた [4]。より広く見れば、近年のサーベイは「エンティティ解決」へと議論を拡張しており、これは同一の実体を指す記録を複数の情報源にまたがってリンクする問題として一般化するものである [6]。データマッチングの文献には、包括的で実践的な枠組みが示されている [7]。
名前は多数を指し示すが、同一性はただ一人を指し示す。
4. 名前から構造へ
この文献群に繰り返し現れる教訓は、名前それ自体は弱い信号にすぎず、精度は複数の信号を組み合わせること、そして実体を孤立して扱うのではなく、それを取り巻く構造と結びつけることから生まれる、というものである。系譜の文脈においては、その取り巻く構造とは親族ネットワークそのもの、すなわち血統、婚姻、そして系図の中での位置である。これにより、同一性の問題は、親族関係を表現する問題と密接に結びつくことになる。
5. Nasayebの手法(上級レベル)
Nasayebプラットフォームは、綴りの異形を統一する言語的正規化を施したうえで、名前、血統の連鎖、さらには配偶者の名前といった追加の信号を組み合わせた「同一性フィンガープリント」を構築する。これらの信号が収束することにより、二人の別人が偶然に一致することはまれとなり、重複した記録が高い精度で検出され、統合される。正確なパラメータ、照合の重み、そして閾値は、当社独自の成果の一部であり、開示しない。
ここでの貢献は二つある。一つは、照合に関する文献を、複数の文化にまたがる名前と系譜の特性に適応させたこと。もう一つは、名前を孤立して処理するのではなく、同一性を親族構造そのものに結びつけたことである。その結果として得られるのは、各人が一度だけ保持される整然とした家系記録であり、信頼し、拠り所とすることのできるものである。
6. 結論
名前の類似性が高い家系において個人を区別することは、確率的照合からエンティティ解決に至るまで、豊かな文献を持つ古くからの問題である。実践的な解決策は、単一の信号ではなく、名前、系譜、そして周辺の文脈を組み合わせた同一性フィンガープリントであり、それは言語の特性を尊重した言語的正規化の上に築かれる。このようにして、家系は矛盾する複製の寄せ集めではなく、正確な記録であり続ける。
参考文献
- Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
- Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
- Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
- Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
- Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
- Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
- Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
