【Databricks】PDF資料をAIに読み込ませて回答させる

目次

はじめに

先日(2026年9月9日)、Databricksが発表した「Genie Agentsの機能拡張」について、実際に検証してみました。今回は、その中でも特に注目度が高い、PDFなどの非構造化データへの対応に焦点を当て、機能の概要と実際の使用感をご紹介します。


DatabricksGenieエージェントとは

Genie Agentsは、Databricks上のデータに対して自然言語で質問できる、会話型の分析AIエージェントです。

ユーザーが日本語などの自然言語で質問すると、Genieエージェントが裏側でSQLを生成・実行し、結果を分かりやすい回答として返してくれます。

これまでは主にテーブルなどのデータが対象でしたが、今回のアップデートにより、対応範囲がPDFやスライド資料などの非構造化データにも広がりました。

非構造化データへの接続

機能概要

今回のアップデートにより、Genieエージェントは、PDFやスライド資料などのファイルの中身を読み取り、テーブルデータと合わせて回答を生成できるようになりました。

機能制限

対象ファイル

検索インデックスを使用しない場合、対応するファイル形式は次の通りです。

  • PDF
  • JPG / JPEG
  • PNG
  • TIFF / TIF
  • DOC / DOCX
  • PPT / PPTX

かなり幅の広い非構造化データに対応できていることが分かります。

制限事項

Databricks上で実際に使用する際の制限事項について記載します。PDF資料等はDatabricskのボリュームに保存し、Genieエージェントと接続を行います。

1つのエージェントに接続できるボリュームは、最大10個です。

なお、検索インデックスを使用しない場合(後述)

  • 1ボリュームあたり最大500ファイル(TXT/MDを除く)
  • 1ファイルあたり最大10MBまで
  • 1回の質問で参照されるファイルは最大5件まで

という制約があります。

一方、検索インデックスを有効にすると、

  • 1ボリュームあたり最大10,000ファイル
  • 1ファイルあたり最大50MBまで

となり、検索インデックスを有効にすることで、より大規模なファイル群を、低遅延で扱えるようになります。


実装

Genieエージェントの用意

まず、検証用のGenieエージェントを新規に作成します。サイドバーから「Genie Agents」を開き、右上の「New」をクリックし、対象とするデータソースを選択して「Create」をクリックするだけで作成できます。

作成し、Genieエージェントの画面を開くと以下のようになります。

ダウンロードしたPDFファイルは、Unity Catalogのボリュームにアップロードします。

続いてGenieエージェントのソースの欄から該当するボリュームを選択し、接続を完了させます。接続が完了すると以下のような画面になります。

ファイルの用意

今回は、検証用のファイルとして、総務省が公開している「令和7年版 情報通信白書」を使用します。

この白書は、2025年7月8日に総務省が公表した、情報通信分野の現状と課題をまとめた年次報告書です。第Ⅰ部ではAIの進展やSNS・クラウドなどのデジタル活用、サイバーセキュリティ、デジタル格差といった課題を、第Ⅱ部ではICT産業やプラットフォーム、データセンター、スマート農業などの情報通信政策の展開を扱っており、IT・通信分野の専門用語が多く含まれているため、今回の検証用テストデータとして適しています。なお全体のページ数は241ページです。

ダウンロードしたPDFファイルは、Unity Catalogのボリュームにアップロードします。

続いてGenieエージェントのソースの欄から該当するボリュームを選択し、接続を完了させます。接続が完了すると以下のような画面になります。

コンテンツ検索の有効化

ボリュームにファイルをアップロードしたら、そのボリュームに対して「コンテンツ検索」を有効化します。以下のボリューム画面から「コンテンツ検索」パネルを開き、有効化のボタンをクリックするだけで設定できます。

実験

それでは構築したGenieエージェントに対して資料から読み取れる事柄をいくつか記載してみます。

質問1

該当ファイル148ページなどにデジタルインフラ整備に関する取り組みが記載されています。

これについて資料を参照しながら適切な回答が返ってくるかを確認しました。

質問内容:

デジタルインフラに関する取り組みについて教えてください

答え:

思考時間約2分ほどで資料から情報を取得し、以下の回答を生成しました。

質問2

続いて51ページにICT市場の規模に関する記載があります。

これについて質問を行い、回答を確認しました。

質問内容:

ICTの市場規模について教えてください

答え:

思考時間約1分ほどで資料から情報を取得し、以下の回答を生成しました。

質問3

続いて103ページにAIの動向に関する記載があります。

これについて質問を行い、回答を確認しました。

質問内容:

AIの動向について教えてください

答え:

思考時間約2分ほどで資料から情報を取得し、以下の回答を生成しました。

終わりに

今回の検証を通じて、Genieエージェントのファイル推論機能は、非常に高い精度で回答を生成できることが確認できました。

今回使用した「令和7年版 情報通信白書」は241ページに及ぶ長大な資料でしたが、いずれの質問に対しても、該当ページ(148ページ、51ページ、103ページ)の内容を正確に参照した回答が返ってきました。

今回は公的白書を対象に検証しましたが、社内のマニュアルや規定集、過去の資料など、非構造化データを幅広く扱う業務でも、同様の活用が期待できると感じています。

参考文献

CTA
  • URLをコピーしました!
  • URLをコピーしました!
この記事を書いた人
目次