Volver al Blog
Artículo5 de junio de 2026· 13 min de lectura

Resolución de identidad a partir de nombres y linaje: normalización y vinculación de registros

Resumen

Los nombres que se repiten y sus múltiples grafías convierten la distinción entre individuos en un desafío fundamental de los sistemas genealógicos. Este artículo repasa la literatura sobre vinculación de registros, desde el fundamento estadístico establecido por Fellegi y Sunter [1], pasando por la coincidencia fonética y las métricas de similitud de cadenas [2][3], hasta los desafíos particulares de los nombres árabes [4], y llegando a la resolución de entidades moderna [6]. A continuación describimos, a alto nivel, la metodología de la plataforma Nasayeb para construir una «huella de identidad» sin revelar su funcionamiento interno.

1. El problema

En cualquier familia numerosa recurre una pregunta: ¿este «Muhammad ibn Ahmad» es la misma persona que aparece en otra rama, o una persona distinta que simplemente comparte el nombre? La respuesta equivocada supone o bien dos registros para una sola persona (inflación falsa y contradicción), o bien la fusión de dos personas distintas (una pérdida de la verdad). La dificultad se agrava por dos propiedades de los nombres: las muchas formas en que pueden escribirse, y con cuánta frecuencia se repiten dentro de una misma familia.

2. El desafío de los nombres

Un mismo nombre puede escribirse de múltiples formas según la grafía de las hamzas, del alif, de la taa marbuta y otras (Fuʾad/Fuwad, Aḥmad/Ahmad). Los nombres también se repiten con frecuencia en honor a los antepasados, de modo que dentro de una sola rama se encuentran varias personas con el mismo nombre y el mismo nombre del padre. El nombre por sí solo, entonces, o incluso el nombre junto con el nombre del padre, no basta para una desambiguación fiable. Se trata de un problema bien conocido en la vinculación de registros históricos y demográficos en general [5].

3. Revisión de la literatura

En 1969, Fellegi y Sunter establecieron el marco probabilístico clásico para la vinculación de registros, basado en ponderar las probabilidades de una coincidencia frente a una no coincidencia a lo largo de múltiples campos [1]. Antes y después de eso, la coincidencia fonética evolucionó: el algoritmo Soundex y luego NYSIIS agruparon nombres que suenan parecido pese a las diferencias de grafía [2]. Las métricas de similitud de cadenas, como Levenshtein y Jaro–Winkler, añadieron una medida cuantitativa de cuán próximas están dos cadenas de texto [3].

Los nombres árabes, por su parte, plantean desafíos particulares en la normalización y la transliteración, abordados por la investigación en procesamiento de lenguaje natural con técnicas para unificar las variantes de grafía y manejar prefijos y afijos [4]. De manera más amplia, estudios recientes han desarrollado la «resolución de entidades», que generaliza el problema a vincular registros que se refieren a la misma entidad a través de múltiples fuentes [6], con marcos prácticos exhaustivos en la literatura sobre emparejamiento de datos [7].

Un nombre señala a muchos; una identidad señala a uno.

4. Del nombre a la estructura

La lección recurrente en esta literatura es que un nombre por sí solo es una señal débil; la precisión proviene de combinar múltiples señales y de vincular una entidad a su estructura circundante en lugar de tratarla de forma aislada. En el contexto del linaje, la estructura circundante es la propia red de parentesco: la descendencia, el matrimonio y la posición dentro del diagrama. Esto vincula estrechamente el problema de la identidad con el problema de representar el parentesco.

5. La metodología Nasayeb (nivel avanzado)

La plataforma Nasayeb construye una «huella de identidad» que combina el nombre, la cadena de descendencia y señales adicionales, como el nombre de un cónyuge, tras una normalización lingüística que unifica las variantes de grafía. La convergencia de estas señales hace que una coincidencia accidental entre dos personas distintas sea rara, de modo que los registros duplicados se detectan y unifican con gran precisión. Los parámetros precisos, los pesos de emparejamiento y los umbrales forman parte de nuestro trabajo propietario, que no divulgamos.

La contribución aquí es doble: adaptar la literatura sobre emparejamiento a las particularidades de los nombres y el linaje a través de múltiples culturas, y vincular la identidad a la propia estructura de parentesco en lugar de procesar los nombres de forma aislada. El resultado es un registro familiar limpio en el que cada persona se conserva una sola vez, uno en el que se puede confiar y en el que se puede apoyar.

6. Conclusión

Distinguir entre individuos en familias con alta similitud onomástica es un problema antiguo con una literatura rica, desde el emparejamiento probabilístico hasta la resolución de entidades. La solución práctica no es una sola señal, sino una huella de identidad que combina nombre, linaje y contexto circundante, construida sobre una normalización lingüística que respeta las particularidades del idioma. De este modo la familia sigue siendo un registro preciso, y no un montón de copias contradictorias.

Referencias

  1. Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
  2. Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
  3. Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
  4. Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
  5. Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
  6. Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
  7. Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
← Todas las entradas
Tu privacidad importa. Nasayeb no utiliza cookies de rastreo ni rastreadores de terceros, solo almacenamiento local esencial para mantener tu sesión iniciada.