系譜データ標準:GEDCOM から現代のモデルへ
要旨
本稿は、系譜データを表現・交換・保存するための一般的な標準を概観する。まず 1980 年代末に FamilySearch が導入した GEDCOM 形式 [1] から始め、GEDCOM X [2] や GEDCOM 7.0 [3] といった近代化の試みを経て、セマンティック・ウェブに基づくモデルや系譜の RDF 表現 [4][9] に至るまでを扱う。系譜が絡み合った家系に直面したときのこれらの形式の構造的欠陥、長期保存の問題を論じたうえで、実装の詳細を明かすことなく、Nasayebプラットフォームが採用した方向性を概略として述べる。
1. はじめに:なぜ「標準」が重要なのか
いかなるインターフェースや機能に先立って、あらゆる系譜システムは静かながら決定的な選択に直面する。すなわち、家族をどのようなデータ構造に格納するのか、という選択である。この選択は、システムが何を表現でき何を表現できないか、そしてユーザーのデータが持ち運び可能で永続的であるか、それとも単一のツールに閉じ込められるかを決定づける。だからこそ、表現と交換の標準は二次的な技術上の細部ではなく、礎石なのである [8]。
2. 歴史的背景
GEDCOM(Genealogical Data Communication)は 1984 年、プログラム間で系譜データを交換するためのテキスト形式として登場した [1]。番号付きのレベルと短いタグに基づく、単純な行指向の階層構造を採用しており、プログラムによる記述や解析が容易であったため、広く普及し、やがてこの分野の事実上の標準となった。しかし、この単純さには代償があった。緩やかな意味論、プログラム間で分かれる解釈、そして厳密な形式モデルの欠如である [5]。
利用が広がるにつれ、更新の必要性が生じた。FamilySearch は GEDCOM X の取り組みを導入し、より明確な概念モデル、XML と JSON の双方での表現、そして現代的なウェブ指向の API を提供した [2]。並行して、旧来の曖昧さに対処するため 2021 年に GEDCOM 7.0 が公開された。文字エンコーディングの UTF-8 への標準化、メディア処理の厳格化、ドキュメントの改善などである [3]。別の観点からは、セマンティック・ウェブの研究が、情報源どうしの連携や自動推論を容易にするために、系譜を RDF と専用のオントロジーで記述されたグラフとして表現することを提唱した [4][9]。
3. 既製の形式はどこで力不足になるのか
こうした進歩にもかかわらず、大半の形式に潜む暗黙の前提は、依然として単純な家族モデル、すなわち一夫一婦の婚姻と単一で明確な血統の系譜へと偏っている。研究は、この枠組みの中で標準的でない関係を表現することの難しさを次のように記録してきた。
• 複数の婚姻。子孫が複数の家族単位に分散し、それらをきれいに結び付けるのが難しい。• 血族婚から生じる循環的な親族関係。系譜構造に「循環」を持ち込み、樹木という前提を破壊する。• 同一の個人が縁組を通じて複数の位置に現れること。重複や欠落につながる。• 複数の暦と命名の伝統。多くの形式はこれらを根幹ではなく例外的なケースとして扱う [5][6]。
より深い次元では、数理人類学が、親族構造はこれらの形式が捉えるよりもはるかに豊かであり、樹木というよりむしろグラフや群に近いことを示してきた [7]。言い換えれば、欠陥はフィールドの不足ではなく、モデルそのものの欠陥なのである。
よい標準は家族に一つの形を押し付けはしない。家族のさまざまな形に合わせて広がるのである。
4. ロックインと長期保存の問題
構造的な欠陥に加えて、それに劣らず重要な問題がある。データの長期にわたる行く末である。多くの形式は特定のツールやプラットフォームに結び付いており、「ベンダー・ロックイン」への懸念や、ツールが提供を終了した場合にデータを移動・復旧することの難しさを生む。デジタルデータのアーカイブに関する文献は、こうしたリスクを詳しく論じ、OAIS 標準モデル [8] のような長期保存のための参照モデルを確立してきた。この観点からすれば、表現が正確であるだけでは十分でない。それはオープンであり、文書化され、時とともにエクスポートや移行が可能でなければならない。
5. なぜ継ぎ接ぎでは不十分なのか
既存の形式に付随的なフィールドを追加して、困難なケースを扱うこともできたかもしれない。しかし、その目的のために設計されたわけではない土台の上に継ぎ接ぎを重ねることは、絶え間ない脆さと増大する複雑さを残す。あらゆる例外が特別なフィールドで処理され、あらゆるプログラムがそれを異なって解釈し、本来の目標であった相互運用性が損なわれるのである。正しい構造は、例外の連鎖からではなく、正しいモデルから始まる。
6. Nasayebが貢献するところ(概略)
Nasayebプラットフォームは、複雑な血統、複数の親族の結び付き、複数の暦に対応できるよう、最初から設計された柔軟なデータモデルを採用し、同時にエクスポート可能性と永続性を保っている。ここでは技術的な詳細を明かすことなく、一般的な原則を述べるにとどめる。この層は当社の独自の成果であり、私たちが築く優位性の一部を成すからである。その根本にある指針は本質的に単純である。すなわち、簡略化された雛形が命じるがままにではなく、家族をあるがままに表現すること、である。
私たちは、真の貢献を単なる「新しい形式」ではなく、一つの設計上の約束と捉えている。すなわち、ツールを単一の文脈のために設計された雛形に閉じ込めるのではなく、現実の家族が持つ複雑さ、そしてアラブやイスラームを含む多様な文化の独自性に合わせて構築する、という約束である。そしてデータがその所有者のものであり続け、エクスポート可能であることによって、私たちは正確性、オープン性、永続性を兼ね備える。
7. 結論
GEDCOM から現代のセマンティック・モデルへと至る系譜標準の道のりは、絶え間ない改善の物語である。しかしそれは、単純な家族モデルとロックインの懸念に囚われたままであった。次なる前進は、古いものを継ぎ接ぎすることからではなく、モデルそのものを問い直し、現実の家族をそのすべての複雑さとともに包み込めるよう広げると同時に、データが自由であり、その人々のものであり続けることを確かにすることから訪れるだろう。
参考文献
- The Church of Jesus Christ of Latter-day Saints. GEDCOM Standard Release 5.5.1. FamilySearch, 1999.
- FamilySearch. GEDCOM X Conceptual Model and Serializations (XML/JSON). 2012.
- FamilySearch. The FamilySearch GEDCOM Specification 7.0. 2021.
- Zandhuis, I. "Toward a Genealogical Ontology for the Semantic Web." Humanities, Computers and Cultural Heritage, 2005.
- Campanyà Artés, J., Conesa Caralt, J., & Mayol, E. "Modeling Genealogical Domain: An Open Problem." KEOD, 2012.
- Bouchard, G. "Population Databases and Genealogical Reconstruction." Historical Methods, 1992.
- Read, D. "Kinship Algebra Expert System (KAES)." Structure and Dynamics, 2006.
- Consultative Committee for Space Data Systems. Reference Model for an Open Archival Information System (OAIS). ISO 14721, 2012.
- Berners-Lee, T., Hendler, J., & Lassila, O. "The Semantic Web." Scientific American, 2001.
