ウェブクローラーの設定
このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。
Sitecore Searchウェブクローラーは、ハイパーリンクを通じてコンテンツをクロールしてインデックス文書を作成するソースです。ウェブクローラーはシンプルで設定が簡単で、コーディングも不要です。ウェブクローラーはハイパーテキストリンクを通じてアクセス可能なHTMLページとPDFの両方をインデックス化します。
ウェブクローラーはトリガーと呼ばれる出発点から始まります。もし出発点がサイトマップまたはサイトマップインデックスであれば、クローラーはサイトマップまたはサイトマップインデックス内のすべてのURLをクロールします。もし出発点が単一のURL(リクエスト)であれば、クローラーはそのページから新しいページへのハイパーリンクをたどります。
!重要インデックス方法を選ぶ際はクローラータイプの詳細な仕様を参照してください。
クローラーを完全な ウェブサイトのインデックス作成、頻繁な新規更新の記録、そしてインデックス 作成のために設定する際には、考慮すべきベストプラクティスがあります。
ほとんどの場合、まずウェブクローラーソースを作成することをお勧めします。その後、より多くの機能が必要だと感じたら、ウェブクローラーソースを高度なウェブクローラーソースに変換してください。
このウォークスルーでは、以下の方法を説明します:
この例では、著者、名前、型 属性の値を抽出します。
!注サイトマップのトリガーは、サイトマップ内の各URLの最終修正日(lastmod)フィールドを活用します。これによりインデックスの速度が向上し、コンテンツ更新の効率が向上します。
ウェブクローラーソースを作成する
ウェブクローラーのソースを作成するには:
- メニューバーで「 Sources」をクリックしてください。
- Click
情報源を追加してください。 - SOURCE NAMEフィールドにソースの名前を入力します。
- DESCRIPTION欄で、設定したいソースを数行入力してください。
- CONNECTORドロップダウンリストで「Web Crawler」をクリックします。
- Click Save。エラーがなければ、Searchは新しいソースを作成します。
クローラー設定の設定
ウェブクローラーの設定には、クロールトリガーの定義やクロールする最大URL数の指定が含まれます。
!注クロールが許可されているドメインを指定することをお勧めします。そうしないと、ウェブクローラーはURLの開始点からすべてのリンクをたどってしまい、パフォーマンスに悪影響を及ぼす可能性があります。
クローラー設定の設定:
-
メニューバーで「 Sources 」をクリックし、作成したソースをクリックしてください。
-
左側のペインで「Web Crawler」をクリックしSettings「Web Crawler Settings」セクションで「
編集」をクリックします。 -
ウェブクローラーのトリガーを設定するには、TRIGGER TYPEドロップダウンリストから、Request、Sitemap、Sitemap Indexのいずれかを選択します。
-
URLまたはURLs欄にサイトマップのURLを入力します。
例えば、*https://doc.sitecore.com/search/sitemap.xml*を入力するとします。
!注サイトマップやサイトマップのインデックスを選択すると、複数のURLを追加できます。
-
クローラーがクロールするURLの深さと数を設定するには:
-
最大深度フィールドで、クローラーがURL間進んでほしい最大レベル数を入力します。
例えば、5を入力します。
-
MAX URLsフィールドには、クローラーがクロールできる最大URL数を入力します。クローラーが抜け落ちないURLを確実にするために大きな数を入力してください。
例えば、5000を入力するとします。
-
-
特定のURLパターンをクローラーの範囲から除外するには、「 除外パターンを追加」をクリックします。次に、TYPEドロップダウンメニューでGlob式 または 正則表現を選択します。 VALUEフィールドで、除外するURLを一致させる式を入力します。
例えば、クローラーが検索ページをクロールするのを防ぐには、以下のGlob式を入力してください:
**/search/**
-
TIMEOUTフィールドには、クローラーが応答を待つ時間(ミリ秒単位)を入力します。
例えば、5000を入力してください。これにより、クローラーはクロールするすべてのURLから応答を得るために5000ミリ秒、つまり5秒間待つことになります。
-
オプションでヘッダーを追加するには「 Add Header」をクリックしてください。次に、Keyフィールドにコンテンツが期待するユーザーエージェントの名前を入力します。 Valueフィールドに、コンテンツが期待するユーザーエージェントの値を入力してください。このセキュリティ対策により、Searchクローラーのみがデータをクロールでき、他のクローラーは行えません。
例えば、キーにuser-agent、値にsitecorebotを入力します。
-
Click Save。
属性の抽出値
ウェブクローラーは属性の値を抽出するためのさまざまな方法を提供しています。どの方法を選ぶかは、値の場所やアクセス方法によって異なります。
!注1回のクロールで複数のエンティティの値を抽出するには、ウェブクローラーを高度なウェブクローラーに変換する必要があります。ウェブクローラーは1つの エンティティの値しか抽出できません。
属性に対して、次の値を設定します:
- ウェブページのヘッダーセクションにあるメタタグから抽出されます。
- XMLドキュメントを走査して抽出します。
- クローラーでインデックスされたすべてのアイテムで同一です。
設定を簡素化するために、ウェブクローラーはXPathメソッドを使って タイプ、URL、名前、記述の値を抽出するように事前に設定されています。 EXTRACTION TYPEドロップダウンリストで別のタイプを選択することで、いつでもメソッドを変更することができます。
エンティティ内のすべての属性の値の抽出を編集または設定するには、以下のタブで説明されている手順をご利用ください。
::::タブ:::tab{title="Meta tag"}{ .notintoc }
ウェブページのヘッダーセクションのメタタグから値を抽出するには、Meta Tag抽出メソッドを使う必要があります。
属性の値を抽出するには、Meta Tagメソッドを用いて著者を呼び出します:
-
左側のペインで「Attribute抽出」をクリックし、Attribute抽出セクションで「
編集」をクリックします。 -
Attribute抽出ページのメニューバーで「
追加Attribute」をクリックしてください。 -
属性セレクターで、抽出したい属性の横にある「 Add
」をクリックし、下部のAddをクリックします。 -
設定したい属性の横、タイプ****ドロップダウンメニューで「Meta Tag」をクリックします
例えば、著者の横にあるMetaタグをクリックしてください。
-
VALUE欄に、使いたいメタタグまたはプロパティタグの名前を入力します。
例えば、著者を入力すると。
これを行うと、まずSearch //meta@name='author'/@contentを作成して実行します。
この式から値が得られなければ、//meta@property='description'/@contentを生成して実行します。
-
Click Save。
::::::tab{title="XPath"}{ .notintoc }
XMLドキュメントの要素を順次移動して値を抽出するには、XPath抽出メソッドを使う必要があります。
属性nameの値を抽出するには、のXPathメソッドを用います:
-
ソースSettingsページで、抽出Attribute横の**「
編集**」をクリックしてください。 -
抽出したい属性の隣で「 抽出タイプ 」ドロップダウンメニューをクリックし、その後XPathをクリックします。
例えば、名前属性の横にあるXPathをクリックします。
-
VALUE欄に使いたいXPath式を入力します。
例えば、div[@class='wy-menu-vertical']/pと入力します。これにより、ページの最初の
タグのタグ内のテキストに、名前属性のclass値wy-menu-verticalを割り当てます。
-
Click Save。
::::::tab{title="Fixed"}{ .notintoc }
このソースでインデックスされたすべてのアイテムに対して同じ値を設定したい場合、Fixed抽出方法を使う必要があります。
例えば、クローラーが特定のブランドBrandの商品をインデックス化する場合、固定方法を使って、すべてのクロールアイテムのブランド属性の値としてBrandを設定することができます。
型属性に固定値を使う場合:
-
左側のペインで「Attribute抽出」をクリックし、Attribute抽出セクションで「
編集」をクリックします。 -
編集したい属性の隣で「 抽出タイプ 」ドロップダウンメニューをクリックし、「 修正済み」をクリックします。
例えば、タイプ属性の横にある**「固定」**をクリックします。
-
VALUEフィールドに、この属性に使用する定数を入力します。
例えば、商業の項目です。
-
Click Save。
抽出ロジックの検証
定義した属性抽出ロジックが期待する属性値が得られるか確認するには、設定を 検証 できます。
属性抽出ロジックの検証:
-
左側のペインで「Attribute抽出」をクリックし、Attribute抽出セクションで「
編集」をクリックします。 -
ページ上部のメニューバーで「 検証」をクリックします。
-
検証ウィンドウのVALIDATION URLフィールドで、インデックスしたいコンテンツからURLを入力してください。
例えば、*www.bank.comのすべてのコンテンツをインデックスするソースを設定する場合、www.bank.com/commercial/loans*をサンプルURLとして入力して検証をテストできます。
-
オプションで「 Add Validation URL 」をクリックして、さらにURLを入力してください。
例えば *、www.bank.com*の例を続けると、ウェブサイトの商業、個人、住宅ローン の各セクションからサンプルURLを入力できます。また、ウェブサイトのあるセクションに多数の画像があり、別のセクションに動画がある場合は、それぞれのセクションから1 URLずつ入力することもできます。
!注抽出ロジックがインデックス対象のすべてのコンテンツで動作するように、複数のURLを入力することをおすすめします。異なるページ構造やコンテンツタイプのURLを入力してください。
-
Click Validate。
各URLの下には、属性と対応する値のリストが表示されます。
!注属性の横にエラーが見られたら、現在の抽出ロジックがそのURLで動作していないことがわかり、編集が必要かもしれません。
-
検証ウィンドウを閉じるには、「 閉じる
」をクリックしてください。 -
オプションとして、属性抽出ロジックを更新し、新しいロジックがすべてのサンプルURLの属性値を返すかどうかを確認するために、ステップ2から5を繰り返します。
-
Click Save。
クローラーのスケジュールを決めてください
クローラーのスケジュールをつけるには:
- 左側のペインで「Crawler Scheduler」をクリックし、その後「Crawler Scheduler」セクションで「
編集」をクリックします。 - STARTSドロップダウンリストで、以下のオプションをクリックしてください:
- Anytime - スケジュールをできるだけ早く始めたいなら。
- Specific Date - 特定の日付からクロールを開始したい場合は。また、日付選択器で日付を選択する必要があります。
- (任意)REPEAT ドロップダウンリストで、一度だけクロールするには「 DOES NOT REPEAT」 をクリックし、ページを閉じるには 「保存」をクリックします。
- クローラーをスケジュールで実行するには、 REPEAT ドロップダウンメニューで 「はい」をクリックします。
- 「 **毎回繰り返し」**のドロップダウンリストで、クロールの頻度を定義するために:
- 繰り返しカウントのドロップダウンリストで、 1 から 99までの値をクリックします。
- 区間ドロップダウンリストで、次の中から「 時間」「 日」「 週」の中から値をクリックします。
- ステップ2で特定の日付からスケジュールを開始した場合、クロール開始時刻を定義するために、 RUN TIME ドロップダウンリストで開始時間をクリックしてください。
- 「 終了日 」ドロップダウンメニューで、クローラースケジュールの終了を設定するには、以下のオプションからクリックしてください:
- Never - スケジュールを無期限に続けたいなら。
- Specific Date - スケジュールを特定の日に終了させたい場合は、また、日付選択器で日付を選択する必要があります。
- Click Save。
ソースへの更新を公開する
最初のクロールとインデックスを始めるには、ソースを公開する必要があります。また、ソースに変更を加えるたびにソースを公開する必要があります。
情報源を公開するには:
- メニューバーで「 Sources」をクリックしてください。
- 公開したいソースをClickで「 公開」をクリックします。
- ソース公開ダイアログで、このソースの再クロールをSearchしたい場合は、「公開後にソース再クロールをトリガー」チェックボックスを選択してください。
- Click Publish。