블로그로 돌아가기
글2026년 6월 15일· 읽는 데 14분

족보 데이터 표준: GEDCOM에서 현대 모델까지

초록

본 논문은 족보 데이터를 표현·교환·보존하기 위한 일반적인 표준들을 살펴본다. 1980년대 후반 FamilySearch가 도입한 GEDCOM 포맷[1]에서 출발하여, GEDCOM X[2]와 GEDCOM 7.0[3]과 같은 현대화 노력을 거쳐, 시맨틱 웹 기반 모델과 족보의 RDF 표현[4][9]에 이르기까지 이를 다룬다. 우리는 이러한 포맷들이 혈통이 서로 얽힌 가족을 마주했을 때 드러나는 구조적 결함과 장기 보존의 문제를 논의하고, 이어서 구현 세부 사항을 공개하지 않는 선에서 Nasayeb 플랫폼이 채택한 방향을 개괄적으로 언급한다.

1. 서론: 왜 '표준'이 중요한가?

모든 족보 시스템은 어떤 인터페이스나 기능에 앞서, 조용하지만 결정적인 선택에 직면한다. 즉, 가족을 어떤 데이터 구조에 저장할 것인가 하는 문제다. 이 선택은 시스템이 무엇을 표현할 수 있고 없는지, 그리고 사용자의 데이터가 이식 가능하고 오래 지속되는지 아니면 하나의 도구에 갇히는지를 결정한다. 그렇기에 표현 및 교환 표준은 부차적인 기술적 세부 사항이 아니라 초석이다[8].

2. 역사적 배경

GEDCOM(Genealogical Data Communication)은 프로그램 간에 족보 데이터를 교환하기 위한 텍스트 포맷으로 1984년에 등장했다[1]. 이는 번호가 매겨진 레벨과 짧은 태그로 구성된 단순한 계층적 라인 기반 구조를 채택했는데, 덕분에 프로그램적으로 작성하고 파싱하기가 쉬웠고, 이 분야의 사실상의 표준이 될 때까지 폭넓은 채택을 이끌었다. 그러나 이러한 단순함에는 대가가 따랐다. 느슨한 의미론, 프로그램마다 제각각인 해석, 그리고 엄밀한 형식 모델의 부재가 그것이다[5].

사용이 늘면서 업데이트의 필요성이 대두되었다. FamilySearch는 더 명확한 개념 모델과 XML 및 JSON 양쪽 표현, 그리고 현대적인 웹 지향 API를 제공하는 GEDCOM X 이니셔티브를 선보였다[2]. 이와 병행하여, 2021년에는 기존의 모호함을 해소하기 위해 GEDCOM 7.0이 발표되었다. 문자 인코딩을 UTF-8로 표준화하고, 미디어 처리를 엄격히 하며, 문서화를 개선한 것이다[3]. 또 다른 관점에서, 시맨틱 웹 연구는 출처 간 연결과 자동 추론을 용이하게 하기 위해 족보를 RDF와 전용 온톨로지로 기술되는 그래프로 표현할 것을 촉구했다[4][9].

3. 기성 포맷은 어디에서 부족한가?

이러한 진전에도 불구하고, 대부분의 포맷에 내재된 암묵적 가정은 여전히 단순한 가족 모델, 즉 일부일처 혼인과 하나의 명확한 계보에 치우쳐 있다. 여러 연구는 이러한 틀 안에서 비표준적 관계를 표현하기가 어렵다는 점을 기록해 왔으며, 그 예는 다음과 같다.

• 복수의 혼인. 이 경우 자손이 여러 가족 단위에 분산되어 깔끔하게 연결하기 어렵다. • 근친혼에서 비롯되는 순환적 친족 관계. 이는 계보 구조에 '순환'을 만들어 트리 가정을 깨뜨린다. • 통혼을 통해 동일 인물이 둘 이상의 위치에 나타나면서 발생하는 중복 또는 누락. • 다수의 달력과 작명 전통. 많은 포맷이 이를 근본 요소가 아니라 예외적 사례로 취급한다[5][6].

더 근본적인 차원에서, 수리인류학은 친족 구조가 이러한 포맷이 담아내는 것보다 훨씬 풍부하며, 트리보다는 그래프와 군(群)에 더 가깝다는 점을 보여 주었다[7]. 다시 말해, 이 결함은 필드의 부족이 아니라 모델 자체의 결함이다.

좋은 표준은 가족에 형태를 강요하지 않는다. 가족의 형태에 맞추어 확장된다.

4. 종속(lock-in)과 장기 보존의 문제

구조적 결함에 더해, 그에 못지않게 중요한 문제가 있다. 바로 장기적인 데이터의 운명이다. 많은 포맷이 특정 도구나 플랫폼에 묶여 있어 '벤더 종속(vendor lock-in)'과, 해당 도구가 중단될 경우 데이터를 옮기거나 복구하기 어렵다는 우려를 낳는다. 디지털 데이터 아카이빙에 관한 문헌은 이러한 위험을 폭넓게 다루었고, 표준 OAIS 모델과 같은 장기 보존을 위한 참조 모델을 정립했다[8]. 이러한 관점에서 볼 때, 표현이 정확한 것만으로는 충분하지 않다. 그것은 또한 개방적이고 문서화되어 있으며, 시간이 지나도 내보내고 이전할 수 있어야 한다.

5. 왜 땜질만으로는 충분하지 않은가?

어려운 사례를 처리하기 위해 기존 포맷에 부가 필드를 덧붙일 수도 있었을 것이다. 그러나 애초에 그 목적을 위해 만들어지지 않은 토대 위에 땜질을 하는 것은 영구적인 취약성과 점점 커지는 복잡성을 남긴다. 모든 예외를 특수 필드로 처리하고, 프로그램마다 이를 다르게 해석하며, 본래 목표였던 상호운용성은 약화된다. 올바른 구조는 예외의 연쇄가 아니라 올바른 모델에서 시작된다.

6. Nasayeb의 기여는 어디에 있는가 (개괄)

Nasayeb 플랫폼은 복잡한 계보, 다중 친족 관계, 다수의 달력을 수용하도록 처음부터 설계된 유연한 데이터 모델을 채택하면서도 내보내기 가능성과 지속성을 보존한다. 이 계층은 우리의 독자적 성과이자 우리가 쌓아 올리는 강점의 일부이므로, 여기서는 기술적 세부 사항을 공개하지 않고 일반 원칙을 언급하는 데 그친다. 그 지배 원칙은 본질적으로 단순하다. 단순화된 템플릿이 규정하는 대로가 아니라, 가족을 있는 그대로 표현하라는 것이다.

우리는 진정한 기여가 단지 '새로운 포맷'이 아니라 하나의 설계 원칙에 대한 다짐이라고 본다. 즉, 도구가 하나의 맥락에 맞춰 설계된 템플릿에 사람들을 가두는 대신, 실제 가족의 복잡성과 아랍 및 이슬람 문화를 포함한 여러 문화의 특수성에 맞도록 만들어져야 한다는 것이다. 그리고 데이터가 그 소유자에게 귀속되고 내보낼 수 있는 상태로 남음으로써, 우리는 정확성, 개방성, 지속성을 결합한다.

7. 결론

GEDCOM에서 현대의 시맨틱 모델에 이르는 족보 표준의 여정은 끊임없는 개선의 이야기이지만, 단순한 가족 모델과 종속에 대한 우려에 여전히 사로잡혀 있는 이야기이기도 하다. 다음 도약은 낡은 것을 땜질하는 데서가 아니라, 데이터가 자유롭고 그 사람들에게 귀속되도록 보장하면서 실제 가족의 모든 복잡성에 맞도록 확장되게끔 모델 자체를 다시 사유하는 데서 올 것이다.

참고문헌

  1. The Church of Jesus Christ of Latter-day Saints. GEDCOM Standard Release 5.5.1. FamilySearch, 1999.
  2. FamilySearch. GEDCOM X Conceptual Model and Serializations (XML/JSON). 2012.
  3. FamilySearch. The FamilySearch GEDCOM Specification 7.0. 2021.
  4. Zandhuis, I. "Toward a Genealogical Ontology for the Semantic Web." Humanities, Computers and Cultural Heritage, 2005.
  5. Campanyà Artés, J., Conesa Caralt, J., & Mayol, E. "Modeling Genealogical Domain: An Open Problem." KEOD, 2012.
  6. Bouchard, G. "Population Databases and Genealogical Reconstruction." Historical Methods, 1992.
  7. Read, D. "Kinship Algebra Expert System (KAES)." Structure and Dynamics, 2006.
  8. Consultative Committee for Space Data Systems. Reference Model for an Open Archival Information System (OAIS). ISO 14721, 2012.
  9. Berners-Lee, T., Hendler, J., & Lassila, O. "The Semantic Web." Scientific American, 2001.
← 모든 글
귀하의 개인정보는 소중합니다. Nasayeb는 추적 쿠키나 제3자 추적기를 사용하지 않으며, 로그인 상태를 유지하기 위한 필수 로컬 저장소만 사용합니다.