بازگشت به وبلاگ
مقاله۵ ژوئن ۲۰۲۶· ۱۳ دقیقه مطالعه

شناسایی هویت از روی نام‌ها و انساب: نرمال‌سازی و تطبیق سوابق

چکیده

تکرار نام‌ها و گوناگونی شیوه‌های نگارش آن‌ها، تمایز میان افراد را به چالشی بنیادین در نظام‌های انساب بدل می‌کند. این مقاله ادبیات تطبیق سوابق (record linkage) را مرور می‌کند، از پایه‌گذاری آماری آن به دست Fellegi و Sunter [۱]، گذر از تطبیق آوایی و سنجه‌های شباهت رشته‌ها [۲][۳]، چالش‌های ویژه نام‌های عربی [۴]، تا تطبیق کیانات (entity resolution) نوین [۶]. سپس در سطحی کلی روش‌شناسی پلتفرم نَسايِب را در ساخت «اثر انگشت هویت» شرح می‌دهیم، بی‌آنکه جزئیات آن را افشا کنیم.

۱. مسئله

در هر خانواده بزرگی این پرسش پیوسته تکرار می‌شود: آیا این «محمد بن احمد» همان کسی است که در شاخه دیگر آمده، یا شخص دیگری است که همان نام را دارد؟ پاسخ نادرست یا به دو سابقه برای یک فرد می‌انجامد (تورمی ساختگی و ناسازگاری)، یا به ادغام دو فرد متفاوت (از دست رفتن حقیقت). دشواری با دو ویژگی نام‌ها دوچندان می‌شود: تعدد اشکال نگارش، و شدت تکرار درون یک خانواده واحد.

۲. چالش نام

یک نام واحد بسته به املای همزه‌ها و الف و تاء مربوطه و مانند آن به اشکال گوناگون نوشته می‌شود (فؤاد/فواد، أحمد/احمد). همچنین نام‌ها به احترام نیاکان بسیار تکرار می‌شوند، چنان‌که در یک شاخه چند تن با همان نام و همان نام پدر یافت می‌شوند. از این رو نام به‌تنهایی، و حتی نام همراه با نام پدر، برای تمایز مطمئن کافی نیست. این معضلی شناخته‌شده در پیوند سوابق تاریخی و جمعیتی به‌طور عام است [۵].

۳. مرور ادبیات

Fellegi و Sunter در سال ۱۹۶۹ چارچوب احتمالاتی کلاسیک تطبیق سوابق را بنیان نهادند، که بر موازنه احتمال تطابق و عدم تطابق در میان چند میدان (field) استوار است [۱]. پیش و پس از آن، تطبیق آوایی تکامل یافت: الگوریتم Soundex و سپس NYSIIS برای گروه‌بندی نام‌هایی که تلفظشان همانند است اما نگارششان متفاوت [۲]. سنجه‌های شباهت رشته‌ها نیز مانند Levenshtein و Jaro–Winkler، سنجشی کمّی از نزدیکی دو رشته متنی افزودند [۳].

اما نام‌های عربی چالش‌های ویژه‌ای در نرمال‌سازی و آوانگاری پیش می‌کشند، که پژوهش‌های پردازش زبان طبیعی با تکنیک‌هایی برای یکسان‌سازی اشکال نگارش و برخورد با پسوندها و اضافه‌ها به آن پرداخته‌اند [۴]. در گستره‌ای وسیع‌تر، مرورهای نوین به «تطبیق کیانات» (entity resolution) گسترش یافته‌اند که مسئله را به پیوند سوابقی که به کیان واحدی در میان چند منبع اشاره دارند تعمیم می‌دهد [۶]، همراه با چارچوب‌های عملی جامع در ادبیات تطبیق داده‌ها [۷].

نام به بسیاری اشاره دارد؛ هویت به یکی.

۴. از نام تا ساختار

درس پیوسته‌ای که این ادبیات می‌آموزد آن است که نام به‌تنهایی نشانه‌ای ضعیف است؛ و دقت از درهم‌آمیختن نشانه‌های متعدد، و از پیوند کیان با ساختار پیرامون آن پدید می‌آید، نه از پرداختن به آن به‌صورت منزوی. در بستر انساب، ساختار پیرامون همان شبکه خویشاوندی است: نسب، ازدواج، و جایگاه در نمودار. و این، مسئله هویت را به مسئله بازنمایی خویشاوندی پیوندی ناگسستنی می‌زند.

۵. روش‌شناسی پلتفرم نَسايِب (سطح پیشرفته)

پلتفرم نَسايِب «اثر انگشت هویت» می‌سازد که نام و سلسله نسب و نشانه‌های افزوده‌ای مانند نام همسر را، پس از نرمال‌سازی زبانی که اختلافات نگارش را یکسان می‌کند، گرد هم می‌آورد. گردآمدن این نشانه‌ها تطابق تصادفی میان دو فرد متفاوت را نادر می‌سازد، چنان‌که سوابق تکراری کشف و با دقت بالا یکپارچه می‌شوند. اما ضرایب دقیق و وزن‌های تطبیق و آستانه‌های آن، بخشی از کار اختصاصی ماست که آن را افشا نمی‌کنیم.

سهم ما در اینجا دوگانه است: تطبیق ادبیات همتاسازی با ویژگی نام‌ها و انساب در فرهنگ‌های گوناگون، و پیوند هویت با ساختار خویشاوندی به‌جای پرداختن به نام‌ها به‌صورت جدا از آن. نتیجه، سابقه‌ای خانوادگی و پاکیزه است که در آن هر فرد یک بار نگاه داشته می‌شود، سابقه‌ای که می‌توان به آن اعتماد کرد و بر آن تکیه زد.

۶. جمع‌بندی

تمایز میان افراد در خانواده‌هایی که شباهت اسمی فراوانی دارند، مسئله‌ای دیرینه با ادبیاتی غنی است، از تطبیق احتمالاتی تا تطبیق کیانات. و راه‌حل عملی نه با یک نشانه، بلکه با اثر انگشت هویتی به دست می‌آید که نام و نسب و پیرامون را گرد هم می‌آورد، بنا شده بر نرمال‌سازی زبانی که ویژگی زبان را ارج می‌نهد. بدین‌سان خانواده سابقه‌ای دقیق می‌ماند، نه انباشتی از نسخه‌های ناسازگار.

منابع

  1. Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
  2. Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
  3. Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
  4. Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
  5. Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
  6. Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
  7. Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
← همه وبلاگ
حریم خصوصی شما برای ما مهم است. نَسايِب از هیچ کوکی ردیابی یا ابزار ردیابی شخص ثالثی استفاده نمی‌کند، تنها از حافظهٔ محلی ضروری برای حفظ ورود شما به حساب استفاده می‌شود.