Разрешение идентичности по именам и родословной: нормализация и связывание записей
Аннотация
Повторяющиеся имена и множество вариантов их написания делают различение отдельных людей фундаментальной задачей генеалогических систем. В этой статье рассматривается литература по связыванию записей: от статистического основания, заложенного Феллеги и Сантером [1], через фонетическое сопоставление и метрики схожести строк [2][3], к особым трудностям арабских имён [4] и далее к современному разрешению сущностей [6]. Затем мы на высоком уровне описываем методологию платформы Nasayeb для построения «отпечатка идентичности», не раскрывая её внутреннего устройства.
1. Постановка задачи
В любой большой семье повторяется один и тот же вопрос: является ли этот «Мухаммад ибн Ахмад» тем же человеком, что и в другой ветви, или это другой человек, которому случайно досталось то же имя? Неверный ответ означает либо две записи для одного человека (ложное разрастание и противоречия), либо слияние двух разных людей (утрату истины). Трудность усугубляется двумя свойствами имён: множеством способов их написания и тем, насколько часто они повторяются внутри одной семьи.
2. Проблема имени
Одно и то же имя может быть записано в нескольких формах в зависимости от написания хамзы, алифа, та-марбуты и других знаков (Фуад/Фувад, Ахмад/Ахмад). Имена также часто повторяются в честь предков, поэтому внутри одной ветви встречается несколько человек с одним именем и одним именем отца. Тогда одного имени, или даже имени вместе с именем отца, недостаточно для надёжного различения. Это хорошо известная проблема при связывании исторических и демографических записей в целом [5].
3. Обзор литературы
В 1969 году Феллеги и Сантер разработали классическую вероятностную модель связывания записей, основанную на взвешивании вероятностей совпадения и несовпадения по нескольким полям [1]. До и после этого развивалось фонетическое сопоставление: алгоритм Soundex, а затем NYSIIS, группировавшие имена, которые звучат схоже, несмотря на различия в написании [2]. Метрики схожести строк, такие как расстояние Левенштейна и Джаро — Винклера, добавили количественную меру того, насколько близки две текстовые строки [3].
Арабские имена, со своей стороны, создают особые трудности при нормализации и транслитерации, которые решаются исследованиями в области обработки естественного языка с помощью методов унификации вариантов написания и обработки приставок и аффиксов [4]. В более широком плане недавние обзоры расширили понятие «разрешения сущностей», обобщающее эту задачу до связывания записей, относящихся к одной и той же сущности, из нескольких источников [6], с исчерпывающими практическими подходами в литературе по сопоставлению данных [7].
Имя указывает на многих; идентичность указывает на одного.
4. От имени к структуре
Повторяющийся урок этой литературы состоит в том, что имя само по себе — слабый сигнал; точность достигается за счёт объединения нескольких сигналов и привязки сущности к окружающей её структуре, а не рассмотрения её в изоляции. В контексте родословной окружающей структурой является сама сеть родственных связей: происхождение, брак и положение в схеме. Это тесно связывает проблему идентичности с проблемой представления родства.
5. Методология Nasayeb (продвинутый уровень)
Платформа Nasayeb строит «отпечаток идентичности», который сочетает имя, цепочку происхождения и дополнительные сигналы, такие как имя супруга, после лингвистической нормализации, унифицирующей варианты написания. Сходимость этих сигналов делает случайное совпадение между двумя разными людьми редким, поэтому дублирующиеся записи выявляются и объединяются с высокой точностью. Точные параметры, веса сопоставления и пороговые значения являются частью нашей проприетарной работы, которую мы не раскрываем.
Вклад здесь двоякий: адаптация литературы по сопоставлению к особенностям имён и родословной в разных культурах и привязка идентичности к самой структуре родства вместо обработки имён в изоляции. Результат — чистая семейная запись, в которой каждый человек присутствует один раз и на которую можно положиться.
6. Заключение
Различение отдельных людей в семьях с высоким сходством имён — давняя проблема с богатой литературой, от вероятностного сопоставления до разрешения сущностей. Практическое решение — не единичный сигнал, а отпечаток идентичности, объединяющий имя, родословную и окружающий контекст и построенный на лингвистической нормализации, учитывающей особенности языка. Так семья остаётся точной записью, а не грудой противоречивых копий.
Литература
- Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
- Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
- Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
- Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
- Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
- Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
- Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
