이름과 혈통을 통한 신원 확인: 정규화와 레코드 링크
초록
반복되는 이름과 그 수많은 철자 변형은 계보 시스템에서 개인을 구별하는 일을 근본적인 과제로 만듭니다. 본 논문은 Fellegi와 Sunter가 세운 통계적 기반[1]에서 출발하여, 음성학적 매칭과 문자열 유사도 지표[2][3], 아랍어 이름 특유의 과제[4], 그리고 현대의 개체 해소[6]에 이르기까지 레코드 링크 관련 문헌을 개괄합니다. 이어서 Nasayeb 플랫폼이 내부 구현을 공개하지 않으면서 "신원 지문"을 구축하는 방법론을 높은 수준에서 설명합니다.
1. 문제
어떤 큰 가문에서든 하나의 질문이 반복됩니다. 이 "무함마드 이븐 아흐마드"는 다른 가지에 있는 그 인물과 같은 사람일까요, 아니면 우연히 이름이 같을 뿐인 다른 사람일까요? 잘못된 답은 한 사람에 대한 두 개의 레코드(허위 증식과 모순)를 낳거나, 서로 다른 두 사람을 병합(진실의 상실)하게 됩니다. 이 어려움은 이름이 지닌 두 가지 속성으로 인해 가중됩니다. 이름이 표기될 수 있는 방식이 여럿이라는 점과, 한 가문 안에서 이름이 매우 많이 반복된다는 점입니다.
2. 이름의 과제
하나의 이름은 함자, 알리프, 타 마르부타 등의 철자에 따라 여러 형태로 쓰일 수 있습니다(Fuʾad/Fuwad, Aḥmad/Ahmad). 또한 이름은 조상을 기리기 위해 자주 반복되므로, 한 가지 안에서 같은 이름과 같은 아버지 이름을 가진 여러 사람을 발견하게 됩니다. 따라서 이름만으로는, 심지어 이름과 아버지 이름을 합쳐도 신뢰할 만한 구별에는 충분하지 않습니다. 이는 역사적·인구학적 레코드를 연결하는 데서 일반적으로 잘 알려진 문제입니다[5].
3. 문헌 검토
1969년 Fellegi와 Sunter는 여러 필드에 걸쳐 일치 확률과 불일치 확률을 저울질하는 것에 기반한, 레코드 링크의 고전적 확률론적 틀을 확립했습니다[1]. 그 전후로 음성학적 매칭이 발전했습니다. Soundex 알고리즘과 그 뒤를 이은 NYSIIS는 철자의 차이에도 불구하고 발음이 비슷한 이름들을 함께 묶었습니다[2]. Levenshtein과 Jaro–Winkler 같은 문자열 유사도 지표는 두 텍스트 문자열이 얼마나 가까운지를 정량적으로 측정하는 방법을 더했습니다[3].
한편 아랍어 이름은 정규화와 음역에서 특유의 과제를 제기하는데, 이는 철자 변형을 통일하고 접두사와 접사를 처리하는 기법을 갖춘 자연어 처리 연구에서 다루어졌습니다[4]. 더 넓게 보면, 최근의 개괄 연구들은 여러 출처에 걸쳐 동일한 개체를 가리키는 레코드를 연결하는 문제로 일반화한 "개체 해소"를 확장해 왔으며[6], 데이터 매칭 문헌에는 포괄적이고 실용적인 프레임워크가 담겨 있습니다[7].
이름은 여럿을 가리키고, 신원은 하나를 가리킨다.
4. 이름에서 구조로
이 문헌에서 반복되는 교훈은, 이름 그 자체만으로는 약한 신호라는 것입니다. 정확도는 여러 신호를 결합하는 데서, 그리고 개체를 고립적으로 다루지 않고 그것을 둘러싼 구조와 연결하는 데서 나옵니다. 혈통의 맥락에서 그 둘러싼 구조란 친족 네트워크 그 자체입니다. 즉 혈통, 혼인, 그리고 도표 안에서의 위치입니다. 이로써 신원의 문제는 친족 관계를 표현하는 문제와 긴밀히 결부됩니다.
5. Nasayeb 방법론 (고급 수준)
Nasayeb 플랫폼은 철자 변형을 통일하는 언어학적 정규화를 거친 뒤, 이름과 혈통의 연쇄, 그리고 배우자의 이름 같은 추가 신호를 결합하는 "신원 지문"을 구축합니다. 이러한 신호들이 수렴하면 서로 다른 두 사람 사이에 우연한 일치가 일어나는 일이 드물어지므로, 중복 레코드가 높은 정확도로 감지되고 통합됩니다. 정확한 매개변수, 매칭 가중치와 임계값은 저희가 공개하지 않는 독자적 작업의 일부입니다.
여기서의 기여는 두 가지입니다. 매칭 문헌을 여러 문화에 걸친 이름과 혈통의 특성에 맞게 조정한 점, 그리고 이름을 고립적으로 처리하는 대신 신원을 친족 구조 그 자체에 결부한 점입니다. 그 결과 각 사람이 한 번만 유지되는 깔끔한 가문 레코드, 즉 신뢰하고 의지할 수 있는 레코드가 만들어집니다.
6. 결론
이름의 유사성이 높은 가문에서 개인을 구별하는 일은 확률론적 매칭에서 개체 해소에 이르기까지 풍부한 문헌을 지닌 오래된 문제입니다. 실용적인 해법은 단일 신호가 아니라, 언어의 특성을 존중하는 언어학적 정규화 위에 세워진, 이름과 혈통과 주변 맥락을 결합한 신원 지문입니다. 이렇게 함으로써 가문은 서로 모순되는 사본의 더미가 아니라 정확한 레코드로 남게 됩니다.
참고 문헌
- Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
- Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
- Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
- Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
- Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
- Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
- Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
