1. PDFファイル

PDFからHTMLを抽出する

日本語翻訳に関する免責事項

このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。

Sitecore Searchドキュメントエクストラクタ はHTMLしか解析できません。そのため、タイトル説明タグなどの属性を正確に抽出するために、PDFのHTML構造がどのようなものかを知る必要があります。

これを行うには、PDFのHTML構造を明らかにするだけの目的を持つ一時的なソースを設定してください。このソースでJavaScriptドキュメントエクストラクタを選択し、html() jQueryメソッドを使ってPDF全体 からHTMLを抽出します。その後、Content CollectionでPDFのHTML構造を確認した後、個々の属性をどのように抽出するかを最適に判断できます。

このウォークスルーでは、以下の方法を説明します:

  1. HTML抽出を可能にするダミー属性を作成します
  2. 一時的な高度なウェブクローラーソースを作成し、トリガーを設定してください
  3. HTMLを抽出するためにJavaScriptドキュメントエクストラクタを設定しましょう
  4. View Content CollectionのPDFのHTML構造:::

!注始める前に

  • 持っているPDFコンテンツの種類を表すURLをいくつか集めましょう。

  • PDFをスキャンしてパターンを探しましょう。例えば、表が多いテキストが多いもの、テキストが限られた画像が多いもの、質問と回答のリストのものなどに気づくかもしれません。各グループから1 PDF URLをメモすれば、3つの代表的なPDFが得られます。

  • 代表的なPDFを特定しましょう。後で すべてのPDFを抽出するソースを設定する際には、サンプルPDFのHTML構造に基づいてドキュメントエクストラクタを作成します。

HTML抽出を可能にするダミー属性を作成します

PDFドキュメント全体をHTML形式で抽出するための属性が必要です。混乱を避けるために、この目的専用の属性を作成することをお勧めします。

HTML抽出を可能にするダミー属性を作成するには:

以下の詳細を含む属性を作成・公開します:

  • エンティティ: Content
  • 表示名: PDFからHTMLへ、または類似の形式。
  • Attribute 名前: pdf_to_html、または類似の名称。
  • 配置:標準。
  • データ型: 文字列

一時的な高度なウェブクローラーソースを作成し、トリガーを設定してください

PDF内容を表すPDFだけをクロールできる 高度なウェブクローラー を作成します。必要な トリガー は、開始前に特定したPDFのURLだけです。

一時的な高度なウェブクローラーソースを作成し、トリガーを設定するには:

  1. CONNECTORタイプの**ウェブクローラー(上級版)でソースを作成します。目的を明確にするためにソース名を明示してください。例えば、PDFからHTMLへの変換などです。
  2. 前提条件で指定したPDFのURLでリクエストトリガーを作成してください。その他の設定はデフォルトのままにしてください。
  3. 他のPDF URLについてもステップ2を繰り返します。例えば、3つのサンプルPDFを特定し、それぞれに異なるパターンがある場合、 Request トリガーは3つあります。
  4. ハイパーリンクされたURLのインデックスをクローラーで止めるには、最大深度**> Settingsクローラー**をクリックし、値を0に変更してください。

HTMLを抽出するためにJavaScriptドキュメントエクストラクタを設定しましょう

ドキュメント抽出器は 元のコンテンツから インデックス文書 を作成します。各インデックスドキュメントには属性と属性値があります。この例では、pdf_to_html属性の値だけを気にします。PDFのHTML構造を抽出するには、html() メソッドを使ってpdf_to_html属性の値を抽出するJavaScriptドキュメントエクストラクタを設定してください。

JavaScriptドキュメントエクストラクタをHTML抽出するために設定するには:

  1. 以下の機能を使用するJavaScriptドキュメントエクストラクタを作成します:

    // Sample document extractor function to get HTML from PDF content. function extract(request, response) { $ = response.body;

    return { 'pdf_to_html': $('html').html(), // gets the HTML structure of the document's root element and assigns it to the pdf_to_HTML attribute 'type': "pdf" //Mandatory attribute. Uses the fixed value of 'pdf' }; }

  2. 公開 してソースをスキャンしてください。

ViewはPDFのHTML構造をContent Collectionでご覧ください

Content Collectionを使ってインデックスされた文書を見つけ、pdf_to_html属性で抽出された内容を確認できます。

Content CollectionでHTML版のPDFを見るには:

  1. Click Content Collection

  2. Sourcesでフィルターを選び、一時的な高度なウェブクローラーを作成した際に作成したソースを選択してください。

    インデックスしたPDFを表すcontent itemsのリストが表示されます。

  3. Click a content item。

  4. Content Detailsのセクションで、「PDF to HTML」属性を探してください。この属性の値はPDFのHTML構造です。

    The Content Details page of an item in the Content Collection. There is a PDF to HTML section displaying lots of HTML code.
  5. すべてのcontent itemsについて、ステップ4と5を繰り返します。

PDFのHTML構造がどのようなものかを確認したので、この情報を活用して正確なドキュメントエクストラクターを作成してPDFコンテンツを抽出できます。

この記事を改善するための提案がある場合は、 お知らせください!