【ITニュース解説】AI-assisted genealogy, a follow-up
2026年09月24日に「Dev.to」が公開したITニュース「AI-assisted genealogy, a follow-up」について初心者にもわかりやすく解説しています。
ITニュース概要
AIによる家系図作成の進捗を報告する。AIは「幻覚」を起こすため、家系図サイトの情報を公的記録で確認する「信用しつつ確認」が必須だ。情報収集の自動化にはPlaywright等を活用し、ログイン情報を安全に管理する。記録の文字起こしはAIアシスタントが効率的だが、課題もある。現在、1200人以上、13世代の家系図を構築中だ。
ITニュース解説
AIの力を借りて先祖の系図をたどるプロジェクトについて、前回記事への様々な反響を受けて、さらに詳しく解説する。特に、AIの特性や、情報の信頼性をどう確保するかという点、そして技術的な工夫について理解を深められるだろう。
まず、AIの応答について一部で懸念された「幻覚」の問題についてだが、これはAIが質問に対し、時に事実ではないもっともらしい答えを生成する現象を指す。理論上はあり得る話だが、今回の系図作成プロジェクトのように、基となるデータが明確に存在する場合、AIがでたらめな情報を生み出す可能性は非常に低い。とはいえ、系図サイトに掲載されている情報が必ずしも正確とは限らないという指摘ももっともだ。多くの系図サイトは、他のユーザーが入力した情報が主体であり、誤りが含まれる可能性を否定できない。
この課題を解決するため、プロジェクトでは「信頼せよ、されど確認せよ」という原則を徹底している。具体的なプロセスは次のようになる。まず、まだ親が特定されていない人物を一人選び、AIアシスタントに調査を依頼する。アシスタントは、系図サイトや公的アーカイブサイトを検索し、関連する記録を探す。公式な記録(出生、結婚、死亡などの公文書や教会の記録)が見つかったら、その内容を画像から文字データへと変換し、新しい人物を系図データファイル(GEDCOMファイルと呼ばれる系図専用のデータ形式)に追加する。そして、その人物と既存の系図とのつながりを確立し、情報源を正確に記録する。この一連の作業が完了すると、その変更を確定し、保存する。これをIT用語で「コミット」という。このサイクルを繰り返すことで、系図の枝葉を広げていく。
情報の信頼性については、GEDCOMファイルが持つ「品質(QUAY)」という概念を活用している。これは、情報の裏付けとなる証拠の信頼度を数値で示すものだ。例えば、インタビューや国勢調査のような情報は「QUAY 1」(疑問のある信頼性)とされ、イベント後に記録された二次的な証拠は「QUAY 2」(二次証拠)となる。そして、最も信頼性の高い、直接的で一次的な証拠、すなわち公式記録に基づく情報は「QUAY 3」(一次証拠)と定義されている。このプロジェクトでは、系図サイトから得られた情報を最初は「QUAY 2」として扱い、その後、公式記録でその情報が確認できた場合にのみ「QUAY 3」へと格上げする。もし公式記録で見つからなければ、その情報は破棄される。こうして、信頼できる情報のみが系図に組み込まれていく仕組みになっている。
AIアシスタントがインターネット上の情報源にアクセスするためには、特定のサイトを巡回するための「スキル」が必要となる。ここでいうスキルとは、アシスタントに特定の作業を行わせるための指示やプログラムのまとまりのことだ。系図サイトの種類が多いように、各アーカイブサイトも多様な特性を持つため、それぞれに合わせたスキルを用意する。アーカイブサイトへのアクセス方法は、サイトが完全に一般公開されているか、アカウント登録が必要か、そしてボット(自動プログラム)対策がどの程度厳重かによって大きく異なる。簡単なサイトであれば、直接データを取得するツール(curl)でアクセスできるが、より高度なサイトでは、実際にブラウザを操作するような仕組み(Playwrightという自動操作ツールを使用)が必要となる。さらに、Cloudflareのような高度なボット対策が施されたサイトでは、人間が操作しているように見せかけるため、Chromeのデバッグモードを使い、アシスタントがそのブラウザを遠隔操作するという複雑な方法を用いることもある。
サイトによってはログインが必要になるが、アシスタントに直接ログイン情報を与えるのはセキュリティ上好ましくない。そこで、ログイン情報を安全に管理する工夫も凝らしている。通常のログインが必要なサイトでは、Playwrightを使って永続的なセッションを設定する。これは、一度ブラウザに手動でログインし、その認証情報をブラウザのプロファイルに保存しておく方法だ。こうすることで、アシスタントは後で同じプロファイルを使ってブラウザを起動すれば、再度ログインすることなく、認証済みの状態でサイトにアクセスできる。この方法は、ブラウザを閉じた後もセッションが維持されるため、非常に便利だ。しかし、最も高度なボット対策が施されたサイトでは、Chromeのデバッグモードで手動ログインし、そのブラウザをアシスタントが操作する形を取るため、ブラウザが閉じてしまうとセッションが終了してしまうという脆さがある。
系図サイトの活用方法も進化している。以前は、まず有料プランで系図サイトの膨大なデータを活用し、その後公式記録で確認するという流れだった。しかし今は、公式記録から新しい祖先を発見した後、再び系図サイトに戻るというサイクルを取り入れている。これは、新しく見つけた祖先が、他のユーザーの系図にも既に登録されている場合があり、「スマートマッチ」という機能を使って、一気に数世代分の情報を発見できることがあるためだ。スマートマッチは非常に便利だが、誤った情報が系図に取り込まれるリスクもあるため、マッチングされた情報は慎重に確認することが不可欠だ。また、祖先の名前の異なるスペルを発見するきっかけになることもあり、検索漏れを防ぐ上でも役立つ。多くの系図サイトには無料と有料のプランがあり、有料プランで利用できる試用期間や、年間購読のみのサイトもあるため、複数のメールアドレスを登録して試用期間を有効活用するといった工夫も行っている。
系図データを視覚的に整理するために、「Topola」というGEDCOMビューアも活用している。このツールでは、系図上の人物にプロフィール画像を設定したり、関連する複数の画像を時系列順に並べて表示したりできるため、多くの情報を整理して理解するのに役立つ。
古い公式記録は、しばしば手書きの画像形式で保存されているため、その内容をデジタルデータとして抽出する「転写」の作業が不可欠となる。手書き文字の解読は非常に難しく、書いた人の筆跡、使われている言語、そして記録が作られた時代によって、難易度は大きく変わる。このため、転写作業の多くをAIアシスタントに委任している。アシスタントは、不明な単語や文字に対しては無理に推測せず、プレースホルダーを置くなど、非常に慎重なアプローチを取る。他の転写ツールもいくつか試したが、Transkribusのようにモデルの訓練が必要だったり、krakenのようにアシスタントほどの精度が出なかったりと、決定的なものは見つからなかった。特に、フランス語の手書き文字転写において非常に優れた能力を発揮したFilaeというサービスが停止してしまったのは残念だ。
この系図作成プロジェクトを進める中で、いくつかの予想外の困難にも直面した。例えば、何世代にもわたって同じ名前の祖先が複数いると、誰が誰なのかを区別するのが非常に難しくなる。また、出生、洗礼、結婚、死亡、埋葬といった異なる種類の記録が一つの文書にまとめて書かれていたり、さらには日付が時系列順ではない(バラバラな順序で書かれている)記録に遭遇することもあり、必要な情報を見つけるための検索や整理が非常に複雑になる場面もあった。
このプロジェクトは現在も進行中で、すでに1200人以上の人物と、ある系統では13世代にわたる系図を構築している。ここで紹介した追加のアドバイスが、AIアシストによる系図作成という同じ道を選ぶ人々にとって、少しでも役立つことを願う。