1. インデックスの設定

ウェブクローラーの設定

日本語翻訳に関する免責事項

このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。

Sitecore Searchウェブクローラーは、ハイパーリンクを通じてコンテンツをクロールしてインデックス文書を作成するソースです。ウェブクローラーはシンプルで設定が簡単で、コーディングも不要です。ウェブクローラーはハイパーテキストリンクを通じてアクセス可能なHTMLページとPDFの両方をインデックス化します。

ウェブクローラーはトリガーと呼ばれる出発点から始まります。もし出発点がサイトマップまたはサイトマップインデックスであれば、クローラーはサイトマップまたはサイトマップインデックス内のすべてのURLをクロールします。もし出発点が単一のURL(リクエスト)であれば、クローラーはそのページから新しいページへのハイパーリンクをたどります。

!重要インデックス方法を選ぶ際はクローラータイプの詳細な仕様を参照してください。

クローラーを完全な ウェブサイトのインデックス作成、頻繁な新規更新の記録、そしてインデックス 作成のために設定する際には、考慮すべきベストプラクティスがあります。

ほとんどの場合、まずウェブクローラーソースを作成することをお勧めします。その後、より多くの機能が必要だと感じたら、ウェブクローラーソースを高度なウェブクローラーソースに変換してください。

このウォークスルーでは、以下の方法を説明します:

  1. ウェブクローラーソースを作成する
  2. クローラー設定の設定
  3. 属性の抽出値
  4. 抽出ロジックの検証
  5. クローラーのスケジュールを決めてください
  6. ソースへの更新を公開してください:::

この例では、著者名前 属性の値を抽出します。

!注サイトマップのトリガーは、サイトマップ内の各URLの最終修正日(lastmod)フィールドを活用します。これによりインデックスの速度が向上し、コンテンツ更新の効率が向上します。

ウェブクローラーソースを作成する

ウェブクローラーのソースを作成するには:

  1. メニューバーで「 Sources」をクリックしてください。
  2. Click Plus_add__grey.png 情報源を追加してください。
  3. SOURCE NAMEフィールドにソースの名前を入力します。
  4. DESCRIPTION欄で、設定したいソースを数行入力してください。
  5. CONNECTORドロップダウンリストで「Web Crawler」をクリックします。
  6. Click Save。エラーがなければ、Searchは新しいソースを作成します。

クローラー設定の設定

ウェブクローラーの設定には、クロールトリガーの定義やクロールする最大URL数の指定が含まれます。

!注クロールが許可されているドメインを指定することをお勧めします。そうしないと、ウェブクローラーはURLの開始点からすべてのリンクをたどってしまい、パフォーマンスに悪影響を及ぼす可能性があります。

クローラー設定の設定:

  1. メニューバーで「 Sources 」をクリックし、作成したソースをクリックしてください。

  2. 左側のペインで「Web Crawler」をクリックしSettings「Web Crawler Settings」セクションで「 pencil_grey.png 編集」をクリックします。

  3. ウェブクローラーのトリガーを設定するには、TRIGGER TYPEドロップダウンリストから、RequestSitemapSitemap Indexのいずれかを選択します。

  4. URLまたはURLs欄にサイトマップのURLを入力します。

    例えば、*https://doc.sitecore.com/search/sitemap.xml*を入力するとします。

    !注サイトマップやサイトマップのインデックスを選択すると、複数のURLを追加できます。

  5. クローラーがクロールするURLの深さと数を設定するには:

    • 最大深度フィールドで、クローラーがURL間進んでほしい最大レベル数を入力します。

      例えば、5を入力します。

    • MAX URLsフィールドには、クローラーがクロールできる最大URL数を入力します。クローラーが抜け落ちないURLを確実にするために大きな数を入力してください。

      例えば、5000を入力するとします。

  6. 特定のURLパターンをクローラーの範囲から除外するには、「 除外パターンを追加」をクリックします。次に、TYPEドロップダウンメニューでGlob式 または 正則表現を選択します。 VALUEフィールドで、除外するURLを一致させる式を入力します。

    例えば、クローラーが検索ページをクロールするのを防ぐには、以下のGlob式を入力してください:

    **/search/**

  7. TIMEOUTフィールドには、クローラーが応答を待つ時間(ミリ秒単位)を入力します。

    例えば、5000を入力してください。これにより、クローラーはクロールするすべてのURLから応答を得るために5000ミリ秒、つまり5秒間待つことになります。

  8. オプションでヘッダーを追加するには「 Add Header」をクリックしてください。次に、Keyフィールドにコンテンツが期待するユーザーエージェントの名前を入力します。 Valueフィールドに、コンテンツが期待するユーザーエージェントの値を入力してください。このセキュリティ対策により、Searchクローラーのみがデータをクロールでき、他のクローラーは行えません。

    例えば、キーuser-agent値にsitecorebot入力します。

  9. Click Save

属性の抽出値

ウェブクローラーは属性の値を抽出するためのさまざまな方法を提供しています。どの方法を選ぶかは、値の場所やアクセス方法によって異なります。

!注1回のクロールで複数のエンティティの値を抽出するには、ウェブクローラーを高度なウェブクローラーに変換する必要があります。ウェブクローラーは1つの エンティティの値しか抽出できません。

属性に対して、次の値を設定します:

  • ウェブページのヘッダーセクションにあるメタタグから抽出されます。
  • XMLドキュメントを走査して抽出します。
  • クローラーでインデックスされたすべてのアイテムで同一です。

設定を簡素化するために、ウェブクローラーはXPathメソッドを使って タイプURL名前記述の値を抽出するように事前に設定されています。 EXTRACTION TYPEドロップダウンリストで別のタイプを選択することで、いつでもメソッドを変更することができます。

エンティティ内のすべての属性の値の抽出を編集または設定するには、以下のタブで説明されている手順をご利用ください。

::::タブ:::tab{title="Meta tag"}{ .notintoc }

ウェブページのヘッダーセクションのメタタグから値を抽出するには、Meta Tag抽出メソッドを使う必要があります。

属性の値を抽出するには、Meta Tagメソッドを用いて著者を呼び出します:

  1. 左側のペインで「Attribute抽出」をクリックし、Attribute抽出セクションで「pencil_grey.png編集」をクリックします。

  2. Attribute抽出ページのメニューバーで「Plus_add__grey.png追加Attribute」をクリックしてください。

  3. 属性セレクターで、抽出したい属性の横にある「 Add Plus_add__grey.png 」をクリックし、下部のAddをクリックします。

  4. 設定したい属性の横、タイプ****ドロップダウンメニューで「Meta Tag」をクリックします

    例えば、著者の横にあるMetaタグをクリックしてください。

  5. VALUE欄に、使いたいメタタグまたはプロパティタグの名前を入力します。

    例えば、著者を入力すると。

    これを行うと、まずSearch //meta@name='author'/@contentを作成して実行します。

    この式から値が得られなければ、//meta@property='description'/@contentを生成して実行します。

  6. Click Save

::::::tab{title="XPath"}{ .notintoc }

XMLドキュメントの要素を順次移動して値を抽出するには、XPath抽出メソッドを使う必要があります。

属性nameの値を抽出するには、のXPathメソッドを用います:

  1. ソースSettingsページで、抽出Attribute横の**「pencil_grey.png編集**」をクリックしてください。

  2. 抽出したい属性の隣で「 抽出タイプ 」ドロップダウンメニューをクリックし、その後XPathをクリックします。

    例えば、名前属性の横にあるXPathをクリックします。

  3. VALUE欄に使いたいXPath式を入力します。

    例えば、div[@class='wy-menu-vertical']/pと入力します。これにより、ページの最初の

    タグの

    タグ内のテキストに、名前属性のclass値wy-menu-verticalを割り当てます。

  4. Click Save

::::::tab{title="Fixed"}{ .notintoc }

このソースでインデックスされたすべてのアイテムに対して同じ値を設定したい場合、Fixed抽出方法を使う必要があります。

例えば、クローラーが特定のブランドBrandの商品をインデックス化する場合、固定方法を使って、すべてのクロールアイテムのブランド属性の値としてBrandを設定することができます。

属性に固定値を使う場合:

  1. 左側のペインで「Attribute抽出」をクリックし、Attribute抽出セクションで「pencil_grey.png編集」をクリックします。

  2. 編集したい属性の隣で「 抽出タイプ 」ドロップダウンメニューをクリックし、「 修正済み」をクリックします。

    例えば、タイプ属性の横にある**「固定」**をクリックします。

  3. VALUEフィールドに、この属性に使用する定数を入力します。

    例えば、商業の項目です。

  4. Click Save

抽出ロジックの検証

定義した属性抽出ロジックが期待する属性値が得られるか確認するには、設定を 検証 できます。

属性抽出ロジックの検証:

  1. 左側のペインで「Attribute抽出」をクリックし、Attribute抽出セクションで「pencil_grey.png編集」をクリックします。

  2. ページ上部のメニューバーで「 検証」をクリックします。

  3. 検証ウィンドウのVALIDATION URLフィールドで、インデックスしたいコンテンツからURLを入力してください。

    例えば、*www.bank.comのすべてのコンテンツをインデックスするソースを設定する場合、www.bank.com/commercial/loans*をサンプルURLとして入力して検証をテストできます。

  4. オプションで「 Add Validation URL 」をクリックして、さらにURLを入力してください。

    例えば *、www.bank.com*の例を続けると、ウェブサイトの商業個人住宅ローン の各セクションからサンプルURLを入力できます。また、ウェブサイトのあるセクションに多数の画像があり、別のセクションに動画がある場合は、それぞれのセクションから1 URLずつ入力することもできます。

    !注抽出ロジックがインデックス対象のすべてのコンテンツで動作するように、複数のURLを入力することをおすすめします。異なるページ構造やコンテンツタイプのURLを入力してください。

  5. Click Validate

    各URLの下には、属性と対応する値のリストが表示されます。

    !注属性の横にエラーが見られたら、現在の抽出ロジックがそのURLで動作していないことがわかり、編集が必要かもしれません。

  6. 検証ウィンドウを閉じるには、「 閉じclose_x.png」をクリックしてください。

  7. オプションとして、属性抽出ロジックを更新し、新しいロジックがすべてのサンプルURLの属性値を返すかどうかを確認するために、ステップ2から5を繰り返します。

  8. Click Save

クローラーのスケジュールを決めてください

クローラーのスケジュールをつけるには:

  1. 左側のペインで「Crawler Scheduler」をクリックし、その後「Crawler Scheduler」セクションで「 pencil_grey.png 編集」をクリックします。
  2. STARTSドロップダウンリストで、以下のオプションをクリックしてください:
    • Anytime - スケジュールをできるだけ早く始めたいなら。
    • Specific Date - 特定の日付からクロールを開始したい場合は。また、日付選択器で日付を選択する必要があります。
  3. (任意)REPEAT ドロップダウンリストで、一度だけクロールするには「 DOES NOT REPEAT」 をクリックし、ページを閉じるには 「保存」をクリックします。
  4. クローラーをスケジュールで実行するには、 REPEAT ドロップダウンメニューで 「はい」をクリックします。
  5. 「 **毎回繰り返し」**のドロップダウンリストで、クロールの頻度を定義するために:
    • 繰り返しカウントのドロップダウンリストで、 1 から 99までの値をクリックします。
    • 区間ドロップダウンリストで、次の中から「 時間」「 」「 」の中から値をクリックします。
  6. ステップ2で特定の日付からスケジュールを開始した場合、クロール開始時刻を定義するために、 RUN TIME ドロップダウンリストで開始時間をクリックしてください。
  7. 終了日 」ドロップダウンメニューで、クローラースケジュールの終了を設定するには、以下のオプションからクリックしてください:
    • Never - スケジュールを無期限に続けたいなら。
    • Specific Date - スケジュールを特定の日に終了させたい場合は、また、日付選択器で日付を選択する必要があります。
  8. Click Save

ソースへの更新を公開する

最初のクロールとインデックスを始めるには、ソースを公開する必要があります。また、ソースに変更を加えるたびにソースを公開する必要があります。

情報源を公開するには:

  1. メニューバーで「 Sources」をクリックしてください。
  2. 公開したいソースをClickで「 公開」をクリックします。
  3. ソース公開ダイアログで、このソースの再クロールをSearchしたい場合は、「公開後にソース再クロールをトリガー」チェックボックスを選択してください。
  4. Click Publish
この記事を改善するための提案がある場合は、 お知らせください!