PDFからHTMLを抽出する
このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。
Sitecore Searchドキュメントエクストラクタ はHTMLしか解析できません。そのため、タイトル、説明、タグなどの属性を正確に抽出するために、PDFのHTML構造がどのようなものかを知る必要があります。
これを行うには、PDFのHTML構造を明らかにするだけの目的を持つ一時的なソースを設定してください。このソースでJavaScriptドキュメントエクストラクタを選択し、html() jQueryメソッドを使ってPDF全体 からHTMLを抽出します。その後、Content CollectionでPDFのHTML構造を確認した後、個々の属性をどのように抽出するかを最適に判断できます。
このウォークスルーでは、以下の方法を説明します:
- HTML抽出を可能にするダミー属性を作成します
- 一時的な高度なウェブクローラーソースを作成し、トリガーを設定してください
- HTMLを抽出するためにJavaScriptドキュメントエクストラクタを設定しましょう
- View Content CollectionのPDFのHTML構造:::
!注始める前に
持っているPDFコンテンツの種類を表すURLをいくつか集めましょう。
PDFをスキャンしてパターンを探しましょう。例えば、表が多いテキストが多いもの、テキストが限られた画像が多いもの、質問と回答のリストのものなどに気づくかもしれません。各グループから1 PDF URLをメモすれば、3つの代表的なPDFが得られます。
代表的なPDFを特定しましょう。後で すべてのPDFを抽出するソースを設定する際には、サンプルPDFのHTML構造に基づいてドキュメントエクストラクタを作成します。
HTML抽出を可能にするダミー属性を作成します
PDFドキュメント全体をHTML形式で抽出するための属性が必要です。混乱を避けるために、この目的専用の属性を作成することをお勧めします。
HTML抽出を可能にするダミー属性を作成するには:
- エンティティ: Content。
- 表示名: PDFからHTMLへ、または類似の形式。
- Attribute 名前: pdf_to_html、または類似の名称。
- 配置:標準。
- データ型: 文字列。
一時的な高度なウェブクローラーソースを作成し、トリガーを設定してください
PDF内容を表すPDFだけをクロールできる 高度なウェブクローラー を作成します。必要な トリガー は、開始前に特定したPDFのURLだけです。
一時的な高度なウェブクローラーソースを作成し、トリガーを設定するには:
- CONNECTORタイプの**ウェブクローラー(上級版)でソースを作成します。目的を明確にするためにソース名を明示してください。例えば、PDFからHTMLへの変換などです。
- 前提条件で指定したPDFのURLでリクエストトリガーを作成してください。その他の設定はデフォルトのままにしてください。
- 他のPDF URLについてもステップ2を繰り返します。例えば、3つのサンプルPDFを特定し、それぞれに異なるパターンがある場合、 Request トリガーは3つあります。
- ハイパーリンクされたURLのインデックスをクローラーで止めるには、最大深度**> Settingsクローラー**をクリックし、値を0に変更してください。
HTMLを抽出するためにJavaScriptドキュメントエクストラクタを設定しましょう
ドキュメント抽出器は 元のコンテンツから インデックス文書 を作成します。各インデックスドキュメントには属性と属性値があります。この例では、pdf_to_html属性の値だけを気にします。PDFのHTML構造を抽出するには、html() メソッドを使ってpdf_to_html属性の値を抽出するJavaScriptドキュメントエクストラクタを設定してください。
JavaScriptドキュメントエクストラクタをHTML抽出するために設定するには:
-
以下の機能を使用するJavaScriptドキュメントエクストラクタを作成します:
// Sample document extractor function to get HTML from PDF content. function extract(request, response) { $ = response.body;
return { 'pdf_to_html': $('html').html(), // gets the HTML structure of the document's root element and assigns it to the pdf_to_HTML attribute 'type': "pdf" //Mandatory attribute. Uses the fixed value of 'pdf' }; }
-
公開 してソースをスキャンしてください。
ViewはPDFのHTML構造をContent Collectionでご覧ください
Content Collectionを使ってインデックスされた文書を見つけ、pdf_to_html属性で抽出された内容を確認できます。
Content CollectionでHTML版のPDFを見るには:
-
Click Content Collection。
-
Sourcesでフィルターを選び、一時的な高度なウェブクローラーを作成した際に作成したソースを選択してください。
インデックスしたPDFを表すcontent itemsのリストが表示されます。
-
Click a content item。
-
Content Detailsのセクションで、「PDF to HTML」属性を探してください。この属性の値はPDFのHTML構造です。

-
すべてのcontent itemsについて、ステップ4と5を繰り返します。
PDFのHTML構造がどのようなものかを確認したので、この情報を活用して正確なドキュメントエクストラクターを作成してPDFコンテンツを抽出できます。