メディアファイルの索引内容

Version:
日本語翻訳に関する免責事項

このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。

Sitecore Content Search APIは、以下のオープンソースライブラリを使用してメディアファイルからテキスト内容を抽出し、インデックス化しています。

メディアインデックスの設定

デフォルトのテキストエクストラクタは、.pdf、.docx、.xlsx、.pptxのファイル形式のみをサポートしています。拡張リストが必要な場合は、IFilterテキストエクスプレクタの使用を検討してください。

この場合、Sitecore セクション内の設定を使用し、以下の拡張機能でコンテンツをインデックス化しようとします

、odt、doc、dot、docx、dotx、docm、dotm、xls、xlt、xla、xlsx、xlsm、xlsm、xlam、xlsb、ppt、pot、pps、ppa、pptx、potx、ppsx、ppam、pptm、potm、ppsm、またはMIMEタイプのapplication/pdf、text/html、text/plain。操作の成功はシステムにインストールされているiFilterに依存します。

アプリケーションがAzure Web Appとして展開されている場合、iFilterオプションは使えません。

異なるファイルタイプのインデックスを使いたい場合は、検索プロバイダーのmediaIndexing設定ノードをパッチで修正してファイルタイプを指定できます。Solrの場合、デフォルト設定はApp_Config\Sitecore\ContentSearch\Sitecore.ContentSearch.Solr.DefaultIndexConfiguration.configファイルにあります。

mediaIndexingノードの下には2つのノードがあります:

  • mimeTypes

    このノードは、含まれる(インデックス付け)または除外される(インデックスされていない)MIMEタイプを指定します。

  • extensions

    このノードは、含まれる(インデックス付き)または除外される(インデックスされていない)ファイルの拡張子を指定します。

各ノードには2つのノードがあり、excludesとincludesで、インデックスしないものとインデックスするものを指定します。両方の場所でアスタリスク(*)をワイルドカードとして使うことができます。ワイルドカードを使ってホワイトリストとブラックリストを実装できます。ホワイトリストはexcludesノードにワイルドカードを追加し、includesノードにホワイトリストの拡張やMIMEタイプを追加してください。 includesノードにワイルドカードを追加してブラックリストにし、excludesノードで特定の拡張やMIMEタイプをブラックリストにします。

インデックス作成にIFilterを使用するようにコンテンツ検索を設定する

SitecoreコンテンツSearch APIをネイティブMicrosoft WindowsのIFilterインターフェースで設定できます。

PDF iFilterはデフォルトでインストールされていません。PDFファイルのコンテンツをインデックスするには、インデックスを行う各Sitecoreインスタンスを見つけてください。SolrやAzure Searchプロバイダーを使う場合、通常はCMインスタンスです。そのようなSitecoreインスタンスをホストする各マシンにPDF IFilterをインストールする必要があります。

IFIlterがメディアファイルの内容を抽出してインデックス作成できるようにするために:

  • Modify(パッチ) App_Config\Sitecore\ContentSearch\Sitecore.ContentSearch.configを、implementationType属性の値を次のように変更します:

この記事を改善するための提案がある場合は、 お知らせください!