নাম ও বংশধারা থেকে পরিচয় নিরূপণ: স্বাভাবিকীকরণ ও রেকর্ড সংযুক্তি
সারসংক্ষেপ
পুনরাবৃত্ত নাম এবং সেগুলোর নানা বানান ব্যক্তিদের মধ্যে পার্থক্য করাকে বংশতালিকা ব্যবস্থায় একটি মৌলিক চ্যালেঞ্জ করে তোলে। এই নিবন্ধটি রেকর্ড-সংযুক্তি সম্পর্কিত সাহিত্য পর্যালোচনা করে—ফেলেগি ও সান্টার [1] প্রতিষ্ঠিত পরিসংখ্যানগত ভিত্তি থেকে শুরু করে ধ্বনিভিত্তিক মিলকরণ ও স্ট্রিং-সাদৃশ্য পরিমাপ [2][3], আরবি নামের বিশেষ চ্যালেঞ্জ [4], এবং আধুনিক সত্তা নিরূপণ (entity resolution) [6] পর্যন্ত। এরপর আমরা উচ্চ পর্যায়ে বর্ণনা করি কীভাবে Nasayeb প্ল্যাটফর্ম তার অভ্যন্তরীণ কৌশল প্রকাশ না করেই একটি "পরিচয় ফিঙ্গারপ্রিন্ট" গড়ে তোলে।
১. সমস্যা
যেকোনো বড় পরিবারে একটি প্রশ্ন বারবার ফিরে আসে: এই "মুহাম্মদ ইবনে আহমদ" কি অন্য শাখার সেই ব্যক্তিটিই, নাকি ভিন্ন কেউ যিনি কেবল একই নাম বহন করেন? ভুল উত্তরের অর্থ হয় একজন ব্যক্তির জন্য দুটি রেকর্ড (মিথ্যা স্ফীতি ও স্ববিরোধিতা), অথবা দুই ভিন্ন ব্যক্তির একীভবন (সত্যের বিলুপ্তি)। নামের দুটি বৈশিষ্ট্য এই কঠিনতাকে আরও বাড়িয়ে তোলে: এগুলো কত ভিন্নভাবে বানান করা যায়, এবং একই পরিবারের ভেতরে কত ঘন ঘন এগুলোর পুনরাবৃত্তি ঘটে।
২. নামের চ্যালেঞ্জ
একটি নাম হামজা, আলিফ, তা-মারবুতা প্রভৃতির বানানভেদে নানা রূপে লেখা যেতে পারে (ফুআদ/ফুওয়াদ, আহমদ/আহমাদ)। পূর্বপুরুষদের সম্মানে নামের পুনরাবৃত্তিও ঘন ঘন ঘটে, ফলে একই শাখার মধ্যে একই নাম ও একই পিতার নামধারী একাধিক ব্যক্তি পাওয়া যায়। তাই কেবল নাম, এমনকি পিতার নামসহ নামও, নির্ভরযোগ্যভাবে পৃথকীকরণের জন্য যথেষ্ট নয়। ঐতিহাসিক ও জনতাত্ত্বিক রেকর্ড সংযুক্তকরণে এটি সাধারণভাবে একটি সুপরিচিত সমস্যা [5]।
৩. সাহিত্য পর্যালোচনা
১৯৬৯ সালে ফেলেগি ও সান্টার একাধিক ক্ষেত্রজুড়ে মিল বনাম অমিলের সম্ভাবনা তুলনা করার ভিত্তিতে রেকর্ড সংযুক্তির চিরায়ত সম্ভাবনাভিত্তিক কাঠামো প্রতিষ্ঠা করেন [1]। এর আগে ও পরে ধ্বনিভিত্তিক মিলকরণের বিকাশ ঘটে: সাউন্ডেক্স অ্যালগরিদম এবং পরে NYSIIS বানানভেদ সত্ত্বেও শোনায় একই রকম নামগুলোকে দলবদ্ধ করত [2]। লেভেনশটাইন ও জারো–উইঙ্কলারের মতো স্ট্রিং-সাদৃশ্য পরিমাপ দুটি টেক্সট স্ট্রিং কতটা কাছাকাছি তার একটি পরিমাণগত মাপকাঠি যোগ করে [3]।
আরবি নাম নিজস্বভাবে স্বাভাবিকীকরণ ও প্রতিবর্ণীকরণে (transliteration) বিশেষ চ্যালেঞ্জ তৈরি করে, যা প্রাকৃতিক-ভাষা-প্রক্রিয়াকরণ গবেষণায় বানানের বিভিন্ন রূপ একীভূত করা এবং উপসর্গ ও প্রত্যয় সামলানোর কৌশলের মাধ্যমে মোকাবিলা করা হয়েছে [4]। আরও বিস্তৃতভাবে, সাম্প্রতিক সমীক্ষাগুলো "সত্তা নিরূপণ" (entity resolution) ধারণাকে সম্প্রসারিত করেছে, যা সমস্যাটিকে একাধিক উৎসজুড়ে একই সত্তাকে নির্দেশকারী রেকর্ড সংযুক্ত করার সাধারণ রূপ দেয় [6], আর ডেটা-মিলকরণ সাহিত্যে এর সুবিস্তৃত ব্যবহারিক কাঠামো রয়েছে [7]।
একটি নাম বহুজনকে নির্দেশ করে; একটি পরিচয় নির্দেশ করে একজনকে।
৪. নাম থেকে কাঠামো
এই সাহিত্যের বারবার আসা শিক্ষাটি হলো, নাম নিজে একটি দুর্বল সংকেত; নির্ভুলতা আসে একাধিক সংকেতের সমন্বয় থেকে, এবং কোনো সত্তাকে বিচ্ছিন্নভাবে না দেখে তার চারপাশের কাঠামোর সঙ্গে সংযুক্ত করা থেকে। বংশধারার প্রেক্ষাপটে এই চারপাশের কাঠামোই হলো আত্মীয়তার নেটওয়ার্ক: বংশানুক্রম, বিবাহ, এবং তালিকায় অবস্থান। এতে পরিচয়ের সমস্যা আত্মীয়তা উপস্থাপনের সমস্যার সঙ্গে ঘনিষ্ঠভাবে জড়িয়ে যায়।
৫. Nasayeb পদ্ধতি (উন্নত স্তর)
Nasayeb প্ল্যাটফর্ম একটি "পরিচয় ফিঙ্গারপ্রিন্ট" তৈরি করে, যা বানানের বিভিন্ন রূপ একীভূত করে এমন একটি ভাষাগত স্বাভাবিকীকরণের পর নাম, বংশানুক্রমের শৃঙ্খল এবং সঙ্গীর নামের মতো অতিরিক্ত সংকেত একত্র করে। এই সংকেতগুলোর অভিসারণ দুই ভিন্ন ব্যক্তির মধ্যে আকস্মিক মিলকে বিরল করে তোলে, ফলে সদৃশ রেকর্ড উচ্চ নির্ভুলতায় শনাক্ত ও একীভূত হয়। সুনির্দিষ্ট প্যারামিটার, মিলকরণের ওজন ও প্রান্তসীমা আমাদের মালিকানাধীন কাজের অংশ, যা আমরা প্রকাশ করি না।
এখানে অবদান দ্বিমুখী: একাধিক সংস্কৃতিজুড়ে নাম ও বংশধারার নির্দিষ্টতার সঙ্গে মিলকরণ সাহিত্যকে খাপ খাওয়ানো, এবং নাম বিচ্ছিন্নভাবে প্রক্রিয়া করার বদলে পরিচয়কে আত্মীয়তার কাঠামোর সঙ্গেই যুক্ত করা। এর ফল একটি পরিচ্ছন্ন পারিবারিক রেকর্ড, যেখানে প্রতিটি ব্যক্তি একবারই সংরক্ষিত থাকে—এমন একটি রেকর্ড যাতে আপনি আস্থা রাখতে ও নির্ভর করতে পারেন।
৬. উপসংহার
উচ্চ নামগত সাদৃশ্যসম্পন্ন পরিবারে ব্যক্তিদের মধ্যে পার্থক্য করা একটি পুরোনো সমস্যা, যার রয়েছে সমৃদ্ধ সাহিত্য—সম্ভাবনাভিত্তিক মিলকরণ থেকে সত্তা নিরূপণ পর্যন্ত। ব্যবহারিক সমাধান কোনো একক সংকেত নয়, বরং একটি পরিচয় ফিঙ্গারপ্রিন্ট, যা নাম, বংশধারা ও চারপাশের প্রেক্ষাপট একত্র করে এবং ভাষার নিজস্বতাকে সম্মান করে এমন একটি ভাষাগত স্বাভাবিকীকরণের উপর গড়ে ওঠে। এভাবেই পরিবার একটি নির্ভুল রেকর্ড হিসেবে টিকে থাকে, পরস্পরবিরোধী অনুলিপির স্তূপ নয়।
তথ্যসূত্র
- Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
- Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
- Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
- Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
- Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
- Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
- Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
