Webエンジニア向けプログラミング解説動画をYouTubeで配信中!
▶ チャンネル登録はこちら

【ITニュース解説】I Tried to Prove DocLang Beats Markdown for PDF→LLM. The Data Said Otherwise.

2026年09月09日に「Medium」が公開したITニュース「I Tried to Prove DocLang Beats Markdown for PDF→LLM. The Data Said Otherwise.」について初心者にもわかりやすく解説しています。

作成日: 更新日:

ITニュース概要

「DocLang」と「Markdown」のPDFからAI(LLM)への変換性能を比較する実験が行われた。DocLangが優れるという予想に反し、データはそう示さなかった。両形式の得意な点が明らかになった。

ITニュース解説

現代のITの世界では、大量の情報がデジタルドキュメントとして存在し、その情報をいかに効率よく活用するかが重要な課題となっている。特に、近年注目を集める大規模言語モデル(LLM)のような人工知能にドキュメントの内容を正確に理解させ、活用させる技術は、システム開発の現場でも不可欠になりつつある。しかし、一口にドキュメントと言っても、その形式は多岐にわたる。中でも、文書のレイアウトを固定して表示できるPDFは広く使われているが、その固定された見た目ゆえに、内部の構造をプログラムで読み解くのが難しいという側面がある。

このような背景から、PDFドキュメントの情報をLLMに渡し、内容を正確に理解させるための最適な方法を探る実験が行われた。この記事の著者は、PDFから情報を抽出する際に、二つの異なるドキュメント記述言語、すなわちDocLangとMarkdownのどちらがLLMに対してより効果的な中間形式となるかを検証した。当初の仮説では、より構造化された情報を記述できるであろうDocLangが優位に立つと考えられていたが、実際のデータは異なる結果を示したという。

まず、ここで登場する主要な技術要素について簡単に説明する。 「PDF」は、Portable Document Formatの略で、どのような環境でも同じ見た目で文書を表示できるように設計されたファイル形式だ。文字や画像、レイアウトが固定されるため、見た目の再現性が高い反面、文書の論理的な構造(例えば、これがタイトルで、これが箇条書きで、というのが)が失われやすいという特徴がある。 次に、「LLM(大規模言語モデル)」は、膨大なテキストデータを学習し、人間のように自然な文章を生成したり、質問に答えたり、要約を作成したりできるAIのことだ。PDFから抽出したテキスト情報や構造情報をLLMに与えることで、その内容を深く理解させ、さまざまなタスクに活用できるようになる。 そして、「Markdown」は、シンプルで読みやすい記法でテキストを構造化できる軽量マークアップ言語である。見出し、箇条書き、太字などの基本的な書式を、簡単な記号を使って表現できるため、多くの開発者や技術者に利用されている。そのシンプルさゆえに、テキストエディタで直接記述でき、多くのシステムが対応している。 「DocLang」については、この記事の著者がより厳密な構造定義やリッチな表現を可能にするために提唱している、あるいは注目している新しいドキュメント言語のアプローチだと推測される。Markdownよりもさらに詳細な構造情報を持たせ、複雑なドキュメントの表現に適していることを目指している可能性が高い。

この実験の目的は、実際のビジネスで使われるPDFドキュメントをLLMに効率よく理解させるために、PDFから抽出した情報をDocLangとMarkdownのどちらの形式で整形し、LLMに渡すのが最適かを明らかにすることだった。実験には、実際の業務で使用される15ページのリクエスト・フォー・プロポーザル(RFP)という、構造が複雑で情報量が多い現実的なドキュメントが用いられた。また、特定の変換ツールに依存しない「converter-independent」な形で比較することで、それぞれのドキュメント形式が持つ本質的な強みや弱みを評価しようとした点も重要だ。これは、特定のツールによる性能差ではなく、形式そのものの優劣を見極めるための工夫である。

そして、実験の結果は著者の予想を裏切った。当初、より多くの構造情報を保持できると考えられていたDocLangが、PDFからLLMへの変換において常にMarkdownよりも優れているわけではないことが判明したのだ。むしろ、多くのケースでMarkdownがDocLangと同等か、場合によってはそれ以上の性能を発揮したという。

なぜ、シンプルなMarkdownが、より複雑な構造を記述できると期待されたDocLangに匹敵する、あるいは凌駕する結果を出したのだろうか。その理由として考えられるのは、Markdownの「シンプルさ」と「普及度」、そして「テキストベースでの構造化能力」にある。LLMは、自然言語のパターンを学習することに長けており、Markdownのように人間が読みやすく、かつ構造が明確に表現されたテキスト形式は、LLMにとっても理解しやすい形式だったのかもしれない。Markdownの記法は非常に直感的で、テキストの流れの中で見出しやリストといった構造を明確に区別できるため、LLMがドキュメントの論理的な階層を把握するのに役立ったと考えられる。

また、Markdownは非常に多くのツールやシステムでサポートされており、PDFからMarkdownへの変換ツールも豊富に存在する。これらのツールやMarkdownの普遍性が、データ変換のプロセスにおいて安定した品質をもたらした可能性もある。一方、DocLangは比較的新しいアプローチであるため、その変換プロセスやツールの成熟度が、現時点ではMarkdownに及ばなかった可能性も考えられる。

この実験結果は、システムエンジニアを目指す者にとって重要な教訓を与えてくれる。それは、「最新の、あるいはより複雑な技術や形式が常に最適とは限らない」ということだ。既存のシンプルで広く普及している技術が、特定の用途においては予想外の強力なソリューションとなる場合がある。技術選定においては、単に機能の多さや新しさだけでなく、その技術が持つシンプルさ、成熟度、そして実際のデータやユースケースにおける適合性を、具体的な検証を通して評価することの重要性を示している。

もちろん、DocLangのようなより構造化されたドキュメント言語が、特定の非常に複雑なドキュメントや、より厳密なセマンティックな情報を必要とするアプリケーションにおいて、将来的に大きな価値を発揮する可能性は十分にある。しかし、少なくともPDFからLLMへの一般的な情報抽出というシナリオにおいては、Markdownの持つシンプルさと柔軟性が、現時点では非常に強力な選択肢であることが証明された。

この研究は、ドキュメントの処理方法を検討する際に、常に実データに基づいた検証を行うことの重要性を強調している。技術の選択は、理論上の優位性だけでなく、実際の運用環境と目的に応じて柔軟に行われるべきであり、時には最も単純な解決策が最善の結果をもたらすこともあるのだ。

関連コンテンツ

関連ITニュース