नामों और वंशावली से पहचान का निर्धारण: सामान्यीकरण और अभिलेख-संयोजन
सारांश
दोहराए जाने वाले नाम और उनकी अनेक वर्तनियाँ, व्यक्तियों के बीच अंतर करने को वंशावली प्रणालियों की एक मौलिक चुनौती बना देती हैं। यह लेख अभिलेख-संयोजन के साहित्य की समीक्षा करता है—Fellegi और Sunter [1] द्वारा रखी गई सांख्यिकीय नींव से लेकर ध्वन्यात्मक मिलान और स्ट्रिंग-समानता मापकों [2][3], अरबी नामों की विशिष्ट चुनौतियों [4] और आधुनिक इकाई-निर्धारण [6] तक। इसके बाद हम Nasayeb प्लेटफ़ॉर्म की उस पद्धति का सामान्य परिचय देते हैं जिससे एक "पहचान-छाप" (identity fingerprint) बनाई जाती है, बिना उसकी आंतरिक कार्यप्रणाली प्रकट किए।
1. समस्या
किसी भी बड़े परिवार में एक प्रश्न बार-बार उठता है: क्या यह "मुहम्मद इब्न अहमद" वही व्यक्ति है जो किसी दूसरी शाखा में है, या समान नाम वाला कोई दूसरा व्यक्ति? ग़लत उत्तर से या तो एक व्यक्ति के दो अभिलेख बनते हैं—जिससे अभिलेखों की कृत्रिम वृद्धि और विरोधाभास पैदा होते हैं—या दो अलग-अलग व्यक्तियों को एक मान लिया जाता है, जिससे सही जानकारी नष्ट होती है। नामों के लिखे जाने के अनेक तरीके और एक ही परिवार में उनका बार-बार दोहराया जाना इस कठिनाई को और बढ़ाते हैं।
2. नाम की चुनौती
एक ही नाम कई रूपों में लिखा जा सकता है, जो हमज़ा, अलिफ़, ता मरबूता और अन्य की वर्तनी पर निर्भर करता है (फ़ुआद/फ़ुवाद, Aḥmad/Ahmad)। नाम पूर्वजों के सम्मान में अक्सर दोहराए भी जाते हैं, इसलिए एक ही शाखा के भीतर आपको एक ही नाम और एक ही पिता के नाम वाले कई लोग मिलते हैं। तब अकेला नाम, या पिता के नाम के साथ भी नाम, विश्वसनीय ढंग से भेद करने के लिए पर्याप्त नहीं है। सामान्यतः ऐतिहासिक और जनसांख्यिकीय अभिलेखों को जोड़ने में यह एक सुविख्यात समस्या है [5]।
3. साहित्य-समीक्षा
1969 में Fellegi और Sunter ने अभिलेख-संयोजन के लिए शास्त्रीय प्रायिकतावादी ढाँचा स्थापित किया, जो कई डेटा फ़ील्डों में मिलान बनाम अ-मिलान की प्रायिकताओं को तौलने पर आधारित था [1]। उससे पहले और बाद में ध्वन्यात्मक मिलान का विकास हुआ: Soundex एल्गोरिद्म और फिर NYSIIS ने ऐसे नामों को एक साथ समूहबद्ध किया जो वर्तनी में अंतर के बावजूद एक जैसे सुनाई देते हैं [2]। Levenshtein और Jaro–Winkler जैसे स्ट्रिंग-समानता मापकों ने इस बात का परिमाणात्मक माप जोड़ा कि दो पाठ-स्ट्रिंग कितनी निकट हैं [3]।
अरबी नाम, अपनी ओर से, सामान्यीकरण और लिप्यंतरण में विशेष चुनौतियाँ प्रस्तुत करते हैं, जिन्हें प्राकृतिक-भाषा-संसाधन अनुसंधान ने वर्तनी-भेदों को एकीकृत करने तथा उपसर्गों और प्रत्ययों को सँभालने की तकनीकों के साथ संबोधित किया है [4]। अधिक व्यापक रूप से, हाल के सर्वेक्षणों ने "इकाई-निर्धारण" पर विस्तार किया है, जो इस समस्या का सामान्यीकरण करते हुए कई स्रोतों में एक ही इकाई का उल्लेख करने वाले अभिलेखों को जोड़ने तक पहुँचता है [6], और डेटा-मिलान साहित्य में इसके व्यापक व्यावहारिक ढाँचे मौजूद हैं [7]।
एक नाम अनेकों की ओर संकेत करता है; एक पहचान एक की ओर संकेत करती है।
4. नाम से संरचना तक
इस साहित्य से बार-बार यही निष्कर्ष निकलता है कि अकेला नाम एक कमज़ोर संकेत है। सटीकता कई संकेतों को जोड़ने और किसी इकाई को अलग-थलग देखने के बजाय उसे आसपास की संरचना से संबद्ध करने से आती है। वंशावली के संदर्भ में यह संरचना स्वयं नातेदारी का जाल है: वंशानुक्रम, विवाह और चार्ट में व्यक्ति का स्थान। इसलिए पहचान की समस्या नातेदारी के प्रतिनिधित्व की समस्या से गहराई से जुड़ी है।
5. Nasayeb की पद्धति (उन्नत स्तर)
Nasayeb प्लेटफ़ॉर्म एक "पहचान-छाप" बनाता है, जो वर्तनी-भेदों को एकीकृत करने वाले भाषिक सामान्यीकरण के बाद नाम, वंशानुक्रम की शृंखला और जीवनसाथी के नाम जैसे अतिरिक्त संकेतों को जोड़ता है। इन संकेतों का मेल दो अलग-अलग व्यक्तियों के बीच आकस्मिक मिलान को दुर्लभ बना देता है, जिससे दोहरे अभिलेखों का उच्च सटीकता के साथ पता लगाकर उन्हें एकीकृत किया जा सकता है। सटीक प्राचल, मिलान-भार और सीमा-मान हमारे स्वामित्व वाली तकनीक का हिस्सा हैं, जिन्हें हम प्रकट नहीं करते।
यहाँ योगदान दोहरा है: मिलान-साहित्य को अनेक संस्कृतियों में नामों और वंशावली की विशिष्टताओं के अनुरूप ढालना, और नामों को अलग-थलग संसाधित करने के बजाय पहचान को स्वयं नातेदारी-संरचना से जोड़ना। परिणाम एक स्वच्छ पारिवारिक अभिलेख है जिसमें प्रत्येक व्यक्ति एक ही बार रखा जाता है — ऐसा अभिलेख जिस पर आप भरोसा कर सकते हैं और निर्भर हो सकते हैं।
6. निष्कर्ष
उच्च नाम-समानता वाले परिवारों में व्यक्तियों के बीच भेद करना एक पुरानी समस्या है, जिस पर प्रायिकतावादी मिलान से लेकर इकाई-निर्धारण तक समृद्ध साहित्य उपलब्ध है। व्यावहारिक समाधान कोई एक संकेत नहीं, बल्कि ऐसी पहचान-छाप है जो नाम, वंशावली और आसपास के संदर्भ को जोड़ती है तथा भाषा की विशिष्टताओं का सम्मान करने वाले भाषिक सामान्यीकरण पर आधारित होती है। इस प्रकार परिवार एक सटीक अभिलेख बना रहता है, न कि परस्पर-विरोधी प्रतियों का ढेर।
संदर्भ
- Fellegi, I. P., & Sunter, A. B. "A Theory for Record Linkage." Journal of the American Statistical Association, 1969.
- Russell, R. C. / Odell, M. Soundex (US Patents, 1918/1922); Taft, R. NYSIIS, 1970.
- Winkler, W. E. "String Comparator Metrics and Enhanced Decision Rules in the Fellegi–Sunter Model." US Census Bureau, 1990.
- Marton, Y., & Zitouni, I. "Transliteration Normalization for Information Extraction and Machine Translation." Journal of King Saud University — Computer and Information Sciences, 2014.
- Newcombe, H. B., et al. "Automatic Linkage of Vital Records." Science, 1959.
- Getoor, L., & Machanavajjhala, A. "Entity Resolution: Theory, Practice & Open Challenges." Proc. VLDB, 2012.
- Christen, P. Data Matching: Concepts and Techniques for Record Linkage. Springer, 2012.
