شناسایی هویت از روی نامها و انساب: نرمالسازی و تطبیق سوابق
چکیده
تکرار نامها و گوناگونی شیوههای نگارش آنها، تمایز میان افراد را به چالشی بنیادین در نظامهای انساب بدل میکند. این مقاله ادبیات تطبیق سوابق (record linkage) را مرور میکند، از پایهگذاری آماری آن به دست Fellegi و Sunter [۱]، گذر از تطبیق آوایی و سنجههای شباهت رشتهها [۲][۳]، چالشهای ویژه نامهای عربی [۴]، تا تطبیق کیانات (entity resolution) نوین [۶]. سپس در سطحی کلی روششناسی پلتفرم نَسايِب را در ساخت «اثر انگشت هویت» شرح میدهیم، بیآنکه جزئیات آن را افشا کنیم.
۱. مسئله
در هر خانواده بزرگی این پرسش پیوسته تکرار میشود: آیا این «محمد بن احمد» همان کسی است که در شاخه دیگر آمده، یا شخص دیگری است که همان نام را دارد؟ پاسخ نادرست یا به دو سابقه برای یک فرد میانجامد (تورمی ساختگی و ناسازگاری)، یا به ادغام دو فرد متفاوت (از دست رفتن حقیقت). دشواری با دو ویژگی نامها دوچندان میشود: تعدد اشکال نگارش، و شدت تکرار درون یک خانواده واحد.
۲. چالش نام
یک نام واحد بسته به املای همزهها و الف و تاء مربوطه و مانند آن به اشکال گوناگون نوشته میشود (فؤاد/فواد، أحمد/احمد). همچنین نامها به احترام نیاکان بسیار تکرار میشوند، چنانکه در یک شاخه چند تن با همان نام و همان نام پدر یافت میشوند. از این رو نام بهتنهایی، و حتی نام همراه با نام پدر، برای تمایز مطمئن کافی نیست. این معضلی شناختهشده در پیوند سوابق تاریخی و جمعیتی بهطور عام است [۵].
۳. مرور ادبیات
Fellegi و Sunter در سال ۱۹۶۹ چارچوب احتمالاتی کلاسیک تطبیق سوابق را بنیان نهادند، که بر موازنه احتمال تطابق و عدم تطابق در میان چند میدان (field) استوار است [۱]. پیش و پس از آن، تطبیق آوایی تکامل یافت: الگوریتم Soundex و سپس NYSIIS برای گروهبندی نامهایی که تلفظشان همانند است اما نگارششان متفاوت [۲]. سنجههای شباهت رشتهها نیز مانند Levenshtein و Jaro–Winkler، سنجشی کمّی از نزدیکی دو رشته متنی افزودند [۳].
اما نامهای عربی چالشهای ویژهای در نرمالسازی و آوانگاری پیش میکشند، که پژوهشهای پردازش زبان طبیعی با تکنیکهایی برای یکسانسازی اشکال نگارش و برخورد با پسوندها و اضافهها به آن پرداختهاند [۴]. در گسترهای وسیعتر، مرورهای نوین به «تطبیق کیانات» (entity resolution) گسترش یافتهاند که مسئله را به پیوند سوابقی که به کیان واحدی در میان چند منبع اشاره دارند تعمیم میدهد [۶]، همراه با چارچوبهای عملی جامع در ادبیات تطبیق دادهها [۷].
نام به بسیاری اشاره دارد؛ هویت به یکی.
۴. از نام تا ساختار
درس پیوستهای که این ادبیات میآموزد آن است که نام بهتنهایی نشانهای ضعیف است؛ و دقت از درهمآمیختن نشانههای متعدد، و از پیوند کیان با ساختار پیرامون آن پدید میآید، نه از پرداختن به آن بهصورت منزوی. در بستر انساب، ساختار پیرامون همان شبکه خویشاوندی است: نسب، ازدواج، و جایگاه در نمودار. و این، مسئله هویت را به مسئله بازنمایی خویشاوندی پیوندی ناگسستنی میزند.
۵. روششناسی پلتفرم نَسايِب (سطح پیشرفته)
پلتفرم نَسايِب «اثر انگشت هویت» میسازد که نام و سلسله نسب و نشانههای افزودهای مانند نام همسر را، پس از نرمالسازی زبانی که اختلافات نگارش را یکسان میکند، گرد هم میآورد. گردآمدن این نشانهها تطابق تصادفی میان دو فرد متفاوت را نادر میسازد، چنانکه سوابق تکراری کشف و با دقت بالا یکپارچه میشوند. اما ضرایب دقیق و وزنهای تطبیق و آستانههای آن، بخشی از کار اختصاصی ماست که آن را افشا نمیکنیم.
سهم ما در اینجا دوگانه است: تطبیق ادبیات همتاسازی با ویژگی نامها و انساب در فرهنگهای گوناگون، و پیوند هویت با ساختار خویشاوندی بهجای پرداختن به نامها بهصورت جدا از آن. نتیجه، سابقهای خانوادگی و پاکیزه است که در آن هر فرد یک بار نگاه داشته میشود، سابقهای که میتوان به آن اعتماد کرد و بر آن تکیه زد.
۶. جمعبندی
تمایز میان افراد در خانوادههایی که شباهت اسمی فراوانی دارند، مسئلهای دیرینه با ادبیاتی غنی است، از تطبیق احتمالاتی تا تطبیق کیانات. و راهحل عملی نه با یک نشانه، بلکه با اثر انگشت هویتی به دست میآید که نام و نسب و پیرامون را گرد هم میآورد، بنا شده بر نرمالسازی زبانی که ویژگی زبان را ارج مینهد. بدینسان خانواده سابقهای دقیق میماند، نه انباشتی از نسخههای ناسازگار.
منابع
- Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
- Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
- Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
- Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
- Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
- Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
- Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
