Docling とは
Docling は、ドキュメントを大規模言語モデル (LLM) で分析対象や学習ソースとして使用できる構造化データへと変換するオープンソースのツールであり、同名のプロジェクトによって開発されています。
組織のデータのほとんどは、AI が読み取ってデータを抽出するのが難しいファイル形式で存在しています。それらのドキュメントを検索拡張生成 (RAG)、ファインチューニング、またはエージェント型 AI などのワークフローで使用するには、マークダウン、プレーンテキスト、JSON などの形式に変換する必要があります。
Docling は、簡単に言えば生成 AI のためのドキュメント処理コンパニオンであり、標準的なドキュメント形式と機械中心のデータ要件との間のギャップを埋めるものです。
YouTube 動画: Docling がドキュメントを AI データに変換する方法 (12:22)
Docling の機能
Docling は、より正確で透明性の高い結果を生成するために AI が PDF、プレゼンテーション、スプレッドシート、音声ファイル、動画ファイルなどを使用できるよう支援します。Docling は単にテキストを抽出するだけではなく、レイアウトや階層構造、さらには複数ページにわたる表、画像、箇条書き、見出しといった複雑な要素も理解します。
Docling のファイル変換機能を使用すると、さまざまな形式のドキュメントを LLM 対応のクリーンなナレッジパイプラインへと変換できるので、データ準備作業が単純化されます。Docling はディープラーニング・アルゴリズムを活用して元データの構造を保持することにより、先進的な AI ワークフローにおける「garbage in, garbage out」(ゴミを入れればゴミが出る = 出力の質は入力の質に依存する)というジレンマを解決します。
Docling は、PDF(Portable Document Format)、DOCX(Microsoft Word ドキュメント)、XLSX(Excel スプレッドシート)、PPTX(PowerPoint プレゼンテーション)、HTMLなどのファイルを、AI にとってより扱いやすい形式に変換します。
Docling と RAG
RAG システムで正確性を確保するためには、データと、そのデータのコンテキストにアクセスできる必要があります。Docling が登場する前は、ドキュメントからレイアウトを維持しつつデータを抽出することは困難で、列や行が混同されたり、脚注が段落から分離してしまったりすることがありました。Docling はドキュメントの構造を維持できるため、ハルシネーションを軽減し、RAG システムの有効性を保つことができます。
Docling とファインチューニング
ファインチューニングを行うには、クリーンで一貫した形式のサンプルテキストが必要です。サンプルデータのページ番号がランダムな順番になっていたり、見出しが何度も繰り返し出現したり、中途半端な位置の改行で段落がぶつ切りになっていたりすると、データ取り込み時にモデルが混乱し、エラーを含む出力が生成される原因となる可能性があります。Docling は、いわば自動化されたデータクリーニング・エンジンです。視覚的なノイズを取り除き、モデルが取り込むためのクリーンで整理されたデータを作成します。
Docling と MCP
モデルコンテキストプロトコル (MCP) は、AI アプリケーションと外部サービス間の双方向接続と標準化された通信を可能にするオープンソース・プロトコルです。これは、LLM とツールの間で万能な翻訳機のような役割を果たします。
Docling の公式 MCP サーバー (ドキュメントを変換するコンポーネント) は、任意の MCP クライアント (Claude Desktop、LM Studio、Cursor など、外部データやリソースへのアクセスをリクエストする AI アプリケーション) にプラグインとして接続できます。この接続によってアプリケーションは Docling の機能を利用できるようになり、ドキュメントからの情報の抽出やデータの変換が可能になります。使用する LLM やエージェントの種類にかかわらず、アプリケーションがツールの呼び出しをサポートしていれば、Docling MCP サーバーを使用できます。
AI テクノロジーの導入に関する 4 つのキーポイント
Docling による複雑なドキュメント構造の処理の流れ
Docling は以下のように、ドキュメントを単一のパイプラインで段階的に処理します。
- ユーザーが、元となる PDF ファイルを Docling にアップロードします。
- Docling はそのドキュメントを解析し、分解して各部分が何であるかを解明します。このとき Docling は、大きくて太字のテキストを見出し、語句のブロックを段落、数字のグリッドを表として認識します。このレイアウト解析の過程で、各部分に DocTag (AI が読み取り可能な特殊なコード) が付けられます。
- ドキュメントはパイプラインを進み、順に光学文字認識 (OCR)、表構造認識、およびさらなるレイアウト分析が適用されます。パイプラインのこの部分はカスタマイズ可能であり、モデルの追加や置換、追加の設定パラメーターの導入が可能です。
- Docling は、ドキュメントについて取得したすべての情報をまとめ、デジタルフォルダーを生成します。後処理モデルにより、ドキュメントの清書、各要素の整理、およびクリーンなマークダウンファイルまたは JSON ファイルへの変換が行われます。この最終ファイルが Docling ドキュメントと呼ばれます。
質問:Docling は OCR およびスキャンされたドキュメントに対応していますか?
はい、Docling は OCR (画像やテキストを編集可能、検索可能、機械可読なデータに変換する技術) を完全にサポートしています。OCR は画像の明暗部分を分析して文字や数字を識別します。たとえば、レシートの写真を撮影して経費報告書の添付ファイルとしてアップロードすると、OCR はその数字を読み取ることができます。
Docling と OCR
Docling が大きな飛躍を遂げられたのは、OCR という下地があったからこそです。Docling は OCR を基盤としながらも、より高度な機能を備えています。
OCR の機能は、ピクセルをテキストに変換することです。数字や文字は識別できますが、レイアウト、階層構造、書式設定を認識する能力は高くありません。たとえば、表の列と行を混同してしまうことがあります。
Docling は OCR の機能をさらに一歩進め、レイアウト、階層構造、書式設定に関する優れた理解能力によってドキュメントを解析することができます。Docling は見出し、段落、グラフ、表、数式、リストを認識でき、マークダウンまたは JSON ファイルとして出力する際にも、この構成を維持します。
純粋なテキスト抽出が必要な場合 (ドキュメントがぼやけたコピーや手書きのメモだった場合など)、Docling は OCR を使用します。
質問:Docling はローカルで実行できますか?
はい、Docling はデフォルトで、ユーザーのマシン上で完全にローカルに動作します。データがマシンから外部に送信されることがないため、機密ドキュメントも Docling で解析できます。ローカルで実行できることは、コスト削減の面で特に有利に働きます。Docling はクラウド処理ツールではなく、ユーザーのコンピュータ・ハードウェアを使用するため、何千ページものデータを処理しても、月末に高額な請求書が送られてくることはありません。
質問:Docling はエアギャップ環境での使用に適していますか?
はい、Docling は高度なセキュリティで保護されたエアギャップ環境でも問題なく動作します。ただしその場合、インターネットに接続した環境で Docling の AI モデルをダウンロードし、それをセキュアなネットワークに転送してから、Docling を「オフラインモード」で実行するように設定する必要があります。その設定が完了すれば、外部から完全に遮断されたエンタープライズグレードのドキュメントパーサーが完成します。
Docling とオープンソース・コミュニティ
Docling はもともと、IBM Research が社内ツールとして開発したものです。2025 年 4 月、IBM は Docling を Linux® Foundation AI & Data Foundation に寄贈しました。これにより、Docling は無料で自由に利用でき、特定のベンダーに依存せず、グローバルなオープンソース・コミュニティの貢献によって進化していくものになりました。
質問:Docling は安全に使用できますか?
Docling プロジェクトは、法的保護を提供し、脆弱性を継続的にスキャンするサイバーセキュリティ・ツールを展開する統括組織である Linux Foundation の一部です。法的セキュリティと技術的セキュリティという 2 つのレイヤーによって保護されているため、医療や金融業界といった規制の厳しい環境でも安心して使用できます。
Docling の実際の活用例
多種多様なドキュメントを扱う組織であれば、Docling を利用することでメリットが得られます。たとえば、以下のようなユースケースがあります。
金融サービス
四半期決算報告書、規制当局への提出書類、各種フォームの多くで、複数列のテキストや多数の表が使用されています。Docling を使用すると、財務データの抽出を自動化し、テーブルを分離してマークダウングリッドに変換できます。AI エージェントに Docling ドキュメントの出力を読み込ませれば、指標を瞬時に計算できます。アナリストが手作業で何時間もかけて数値をスプレッドシートにコピー & ペーストする必要はありません。
法的文書の分析とディスカバリー
法律事務所や法務部門は何千もの契約書、ファイル、ドキュメントを管理していますが、それらにはスキャンされた画像、脚注、傍注などが含まれていることが多く、通常のテキストリーダーでは正しく読み取れないこともよくあります。Docling はドキュメントの階層構造を綿密に追跡して、脚注と元の文の結び付きを保持し、文脈的に正しい状態を維持します。RAG 適性の高いデータを準備できるので、法務担当者は AI チャットインタフェースを使用して複雑な質問をし、正確な回答を得ることができるようになります。
科学研究
製薬会社や研究機関は、研究開発を加速させるために、数千もの科学雑誌、医学論文、特許出願に関する最新情報を常に把握しておく必要があります。Docling は、複雑な複数列の学術文献を取り込み、数式を分析し、図とキャプションを正しく関連付けることができます。ドメイン固有の LLM をファインチューニングするためのより正確なトレーニングデータが生成されるので、医療用 AI ツールで数百万ページに及ぶ研究論文を一度にスキャンし、薬物相互作用や化学構造における新たなパターンを発見することができます。
政府および防衛機関
政府機関では、極秘のマニュアル、契約書、ドキュメントなどを取り扱います。そのようなファイルを ChatGPT などのパブリッククラウド AI サービスにアップロードして分析することはできません。Docling はローカルで動作し、エアギャップ環境をサポートします。そのため政府機関は、機密データを保護しながら重要な技術情報をスキャンして抽出する、セキュリティ重視の内部 AI ツールを構築できます。
Docling の使用を開始する方法
Docling をダウンロードする前に、お使いのコンピュータに Python がインストールされていること、および Docling の AI レイアウトモデルと PyTorch (オープンソースのディープラーニング・フレームワーク) を保存するのに十分なストレージ容量があることを確認してください。
それらが確認できたら、Docling はターミナルでコマンドを 1 つ実行するだけでダウンロードできます。 後は、Docling を任意の AI チャットインタフェースに接続し、ドキュメントをチャットウィンドウにドラッグ & ドロップすれば、Docling が作業を開始します。
Docling のシンプルさによるメリットがどれほど大きなものであるかを実感するには、複数の形式のドキュメントからデータを抽出する作業がどれほど時間のかかるものだったかを考えてみてください。そうしたプロセスでは通常、たとえば「ファイル名の末尾が .pdf の場合はこれを実行し、画像があればあれを実行する」のような、処理ロジックを指示するコードを何百行も記述することが必要になります。Docling と MCP があれば、このプロセスがはるかに簡単になります。
Red Hat のサポート内容
Red Hat® AI は、vLLM 搭載のサーバーを通じて、高速で柔軟かつ効率的な推論を行うように構築されています。モデルをデータと確実に接続し、専用エージェントのカスタマイズと開発を単一のプラットフォームで行うことができます。Red Hat AI と Docling を組み合わせることで、複雑なドキュメントを有用な情報へと変換するために必要なツールが得られます。これらはいずれもオープンソースを基盤として構築されているため、あらゆる規模で AI ワークフローをエンドツーエンドで完全に制御することができます。
また、Red Hat AI ポートフォリオには AI 推論、エージェント型 AI ワークフロー、AI 対応アプリケーションをあらゆるインフラストラクチャ上でデプロイ、管理、スケーリングするためのプラットフォームである Red Hat AI Enterprise が含まれています。
Artificial Intelligence (AI)
See how our platforms free customers to run AI workloads and models anywhere