Retour au blog
Article5 juin 2026· 13 min de lecture

Résolution d'identité à partir des noms et de la lignée : normalisation et appariement d'enregistrements

Résumé

Les noms qui se répètent et leurs nombreuses variantes orthographiques font de la distinction entre individus un défi fondamental dans les systèmes généalogiques. Cet article passe en revue la littérature sur l'appariement d'enregistrements, depuis le fondement statistique posé par Fellegi et Sunter [1], en passant par l'appariement phonétique et les métriques de similarité de chaînes [2][3], jusqu'aux défis particuliers des noms arabes [4], et jusqu'à la résolution d'entités moderne [6]. Nous décrivons ensuite, à un niveau général, la méthodologie de la plateforme Nasayeb pour construire une « empreinte d'identité » sans en divulguer les rouages internes.

1. Le problème

Dans toute grande famille, une question revient sans cesse : ce « Muhammad ibn Ahmad » est-il la même personne que celui d'une autre branche, ou une personne différente qui porte simplement le même nom ? Une mauvaise réponse aboutit soit à deux enregistrements pour une seule personne (inflation erronée et contradiction), soit à la fusion de deux personnes différentes (une perte de la vérité). La difficulté est aggravée par deux propriétés des noms : la multitude de façons de les orthographier, et la fréquence à laquelle ils se répètent au sein d'une même famille.

2. Le défi des noms

Un même nom peut être écrit sous plusieurs formes selon l'orthographe des hamzas, de l'alif, du taa marbuta et d'autres (Fuʾad/Fuwad, Aḥmad/Ahmad). Les noms se répètent aussi fréquemment en l'honneur des ancêtres, si bien qu'au sein d'une seule branche on trouve plusieurs personnes portant le même nom et le même nom de père. Le nom seul, donc, ou même le nom accompagné du nom du père, ne suffit pas à une désambiguïsation fiable. C'est un problème bien connu dans l'appariement des enregistrements historiques et démographiques en général [5].

3. Revue de la littérature

En 1969, Fellegi et Sunter ont établi le cadre probabiliste classique de l'appariement d'enregistrements, fondé sur la pondération des probabilités d'une correspondance par rapport à une non-correspondance à travers plusieurs champs [1]. Avant et après cela, l'appariement phonétique a évolué : l'algorithme Soundex, puis NYSIIS, regroupaient les noms qui se prononcent de façon semblable malgré des différences d'orthographe [2]. Des métriques de similarité de chaînes telles que Levenshtein et Jaro–Winkler ont ajouté une mesure quantitative de la proximité entre deux chaînes de texte [3].

Les noms arabes, quant à eux, posent des défis particuliers en matière de normalisation et de translittération, traités par la recherche en traitement automatique du langage naturel au moyen de techniques d'unification des variantes orthographiques et de gestion des préfixes et des affixes [4]. Plus largement, des études récentes ont approfondi la « résolution d'entités », qui généralise le problème à l'appariement d'enregistrements se rapportant à la même entité à travers plusieurs sources [6], avec des cadres pratiques complets dans la littérature sur l'appariement de données [7].

Un nom désigne plusieurs personnes ; une identité n'en désigne qu'une.

4. Du nom à la structure

La leçon récurrente de cette littérature est qu'un nom pris isolément est un signal faible ; la précision naît de la combinaison de plusieurs signaux et du fait de relier une entité à la structure qui l'entoure plutôt que de la traiter isolément. Dans le contexte de la lignée, cette structure environnante est le réseau de parenté lui-même : la descendance, le mariage et la position au sein de l'arbre. Cela lie étroitement le problème de l'identité à celui de la représentation de la parenté.

5. La méthodologie Nasayeb (niveau avancé)

La plateforme Nasayeb construit une « empreinte d'identité » qui combine le nom, la chaîne de descendance et des signaux supplémentaires tels que le nom d'un conjoint, après une normalisation linguistique qui unifie les variantes orthographiques. La convergence de ces signaux rend rare une correspondance accidentelle entre deux personnes différentes, de sorte que les enregistrements en double sont détectés et unifiés avec une grande précision. Les paramètres exacts, les poids d'appariement et les seuils font partie de notre travail propriétaire, que nous ne divulguons pas.

La contribution est ici double : adapter la littérature sur l'appariement aux spécificités des noms et de la lignée à travers plusieurs cultures, et lier l'identité à la structure de parenté elle-même au lieu de traiter les noms isolément. Le résultat est un registre familial propre, dans lequel chaque personne n'est conservée qu'une seule fois, un registre auquel vous pouvez vous fier et vous en remettre.

6. Conclusion

Distinguer les individus dans des familles à forte similarité onomastique est un problème ancien doté d'une riche littérature, de l'appariement probabiliste à la résolution d'entités. La solution pratique n'est pas un signal unique, mais une empreinte d'identité qui combine le nom, la lignée et le contexte environnant, bâtie sur une normalisation linguistique qui respecte les particularités de la langue. De cette façon, la famille demeure un registre exact, et non un amas de copies contradictoires.

Références

  1. Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
  2. Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
  3. Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
  4. Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
  5. Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
  6. Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
  7. Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
← Tous les articles
Votre vie privée compte. Nasayeb n'utilise aucun cookie de suivi ni traceur tiers, seulement un stockage local essentiel pour vous garder connecté.