高度なウェブクローラーの設定
このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。
Sitecore Search高度なウェブクローラーは、コンテンツをクロールしてインデックスに追加する強力なクローラーです。ソースコンテンツにアクセスするための認証、複数言語でのインデックス文書作成、属性値の抽出JavaScriptなど、複雑なユースケースにも対応可能です。
!重要インデックス方法を選ぶ際はクローラータイプの詳細な仕様を参照してください。
ベストプラクティスを成功裏にインデックス化したり、更新をクロールしたりするために、これらのベストプラクティスに従ってください。
ほとんどの場合、まずウェブクローラーソースを作成することをお勧めします。その後、より多くの機能が必要だと感じたら、ウェブクローラーソースを高度なウェブクローラーソースに変換してください。
このウォークスルーでは、以下の方法を説明します:
!注元のコンテンツがクローラーアクセスする前に認証が必要な場合は、クローラー認証設定を設定してください。例えば、元のコンテンツにはGUIベースのユーザー名やパスワード、リクエストヘッダー内のアクセストークンやキーが必要かもしれません。これはソース作成後いつでも可能です。
高度なウェブクローラーソースを作成する
ソースを作成するには:
- メニューバーで「 Sources」をクリックしてください。
- Click
情報源を追加してください。 - SOURCE NAMEフィールドにソースの名前を入力します。
- DESCRIPTION欄で、設定したいソースを数行入力してください。
- CONNECTORドロップダウンリストで「Web Crawler(Advanced)」をクリックします。
- Click Save。エラーがなければ、Searchは新しいソースを作成します。
クローラー設定の設定
ウェブクローラーの設定には、許可されるドメインや最大URLの定義などが含まれます。
クローラー設定の設定:
-
メニューバーで「 Sources 」をクリックし、作成したソースをクリックしてください。
-
左側のペインで「Web Crawler」をクリックしSettings「Web Crawler Settings」セクションで「
編集」をクリックします。 -
オプションで、ALLOWED DOMAINS欄でクローラーがその中に残るドメインを入力します。これを行うことで、ウェブクローラーがSitecoreドキュメントドメインのみをクロールし、リンクされる可能性のある外部サイトはクロールしません。
例えば、*www.doc.sitecore.com*と入力します。
-
クローラーがクロールするURLの深さと数を設定するには:
-
最大深度フィールドで、クローラーがURL間進んでほしい最大レベル数を入力します。
例えば、5を入力します。
-
MAX URLsフィールドには、クローラーがクロールできる最大URL数を入力します。クローラーが抜け落ちないURLを確実にするために大きな数を入力してください。
例えば、5000を入力するとします。
-
-
特定のURLパターンをクローラーの範囲から除外するには、「 除外パターンを追加」をクリックします。次に、TYPEドロップダウンメニューでGlob式 または 正則表現を選択します。 VALUEフィールドで、除外するURLを一致させる式を入力します。
例えば、クローラーが検索ページをクロールするのを防ぐには、以下のGlob式を入力してください:
**/search/**
-
並列にクロールするワーカー数の設定と、リクエスト間のオプションの遅延設定:
-
PARALLELISM (WORKERS) ドロップダウンメニューの値をクリックして、同時にクロールしコンテンツをインデックスするスレッド(ワーカー)の数を定義できます。
例えば、2を入力して2のワーカーだけを並列にクロールできるようにします。これはデフォルトの5ワーカーよりも少ないメモリを使用します。
-
オプションで、ワーカーを1つだけ設定している場合は、クローラーが次のインデックス対象URLにアクセスするまでの待機時間を定義できます。これを行うには、DELAY(MS) フィールドで時間をミリ秒単位で入力します。
例えば、3を入力します。
-
-
TIMEOUTフィールドには、クローラーが応答を待つ時間(ミリ秒単位)を入力します。
例えば、5000を入力してください。これにより、クローラーはクロールするすべてのURLから応答を得るために5000ミリ秒、つまり5秒間待つことになります。
-
オプションでヘッダーを追加するには「 Add Header」をクリックしてください。次に、Keyフィールドにコンテンツが期待するユーザーエージェントの名前を入力します。 Valueフィールドに、コンテンツが期待するユーザーエージェントの値を入力してください。このセキュリティ対策により、Searchクローラーのみがデータをクロールでき、他のクローラーは行えません。
例えば、キーにuser-agent、値にsitecorebotを入力します。
-
オプションで、クローラーがナビゲーションクッキーを受け入れないようにしたい場合は、「追加Settings」セクションで「クロール中にナビゲーションクッキーを有効にする」をオフにしてください。
ナビゲーションクッキーはクローラーの経路を追跡し、訪問したURLを記録します。時にはクッキーがクローラーを誤誘導して、以前に訪問したURLを再インデックスさせることがあります。しかし、クッキーは特に認証が必要なウェブサイトにとって重要です。
-
オプションで、クローラーがページのソースに加えてページ上のJavaScriptを待機してクロールしたい場合は、「追加Settings」セクションで**「Render JavaScript**」をオンにしてください。
-
Click Save。
トリガーの設定
高度なウェブクローラーの トリガー を設定することで、インデックス化するコンテンツを探す出発点となります。この手順で説明したリクエストトリガーの使用に加え、以下のようなトリガーを使用できます。
- JavaScript
- RSS
- サイトマップ
- サイトマップ索引
!注サイトマップのトリガーは、サイトマップ内の各URLの最終修正日(lastmod)フィールドを活用します。これによりインデックスの速度が向上し、コンテンツ更新の効率が向上します。
リクエストトリガーの設定:
-
ソースSettingsページでトリガーの横
編集****をクリックしてください。 -
Click
トリガーを追加してください。 -
トリガータイプドロップダウンフィールドで「Request」を選択します。
-
任意で、Body欄にリクエストの本文を入力します。
-
オプションでヘッダーを設定するには、「 ヘッダーを追加 」をクリックし、キー フィールドと バリュー フィールドに値を入力してください。
例えば、キーにuser-agent、値にsitecorebotを入力します。
-
オプションで、メソッド のドロップダウンメニューでPOST、PUT、またはPATCHをクリックしてください。デフォルトではGETが選択されます。
-
URLフィールドにトリガーとして使いたいURLを貼り付けます。
例えば、ペースト https://dev.sitecore.net/
ドキュメントエクストラクタを作成する
ドキュメント抽出器の設定は、1つまたは複数のエンティティの属性の値を抽出する方法を指定します。
この手順で説明されているXPath文書エクストラクタタイプに加え、以下を利用できます:
- CSSドキュメントエクストラクタ
- JavaScript文書エクストラクタ
XPathドキュメントエクストラクタを作成するには:
-
メニューバーで「 Sources」をクリックしてください。
-
高度なウェブクローラーを選択してください。
-
ソースSettingsページで**、ドキュメント抽出器の横に「
編集**」をクリックします。 -
ドキュメントエクストラクターを作成するには、ドキュメントエクストラクター のページで:
-
名前欄に、このエクストラクタの意味のある名前を入力します。
例えば、Sitecoreの開発ポータルXPathエクストラクターが登場します。
-
エクス トラクタータイプ ドロップダウンメニューでXPathをクリックします。
-
オプションとして、このエクストラクタのロジックが特定のパターンに一致するURLにのみ適用されるようにするために、URLを「Match」に設定してください。これを行うには、「URLs To Match」フィールドで「Add Matcher」をクリックし
「Add Matcher」をクリックし、使いたい式のタイプを選択し、その式の値を入力してください。
-
-
属性の抽出方法を定義するには、タグのセクションで最初のタグの横にある「
編集」をクリックしてください。通常はコンテンツタグです。いくつかの属性と対応するXPath抽出式のリストが表示されます。Searchはこれらのサンプル属性と表現を提供し、設定の助けになります。
!注ドキュメントエクストラクタでは、それぞれがユニークなタグにリンクされた複数のタグガーを作成できます。このようにして、各タグ付け者は以下の通りになります:
-
索引文書のセットを生成します。
-
複数のルールを持つことができ、それぞれのルールが1つの属性の抽出ロジックを定義します。
例えば、5つのルールを持つタグ付け器は、それぞれ5つの属性を持つ1つの文書セットを生成します。
3つのタグ付け器でそれぞれ1つのルールを持つと、それぞれ1つの属性を持つ3つの文書セットが得られます。
-
-
この抽出器で不要なサンプル属性を削除するには、「削除
」をクリックしてください。 -
サンプル属性の設定を編集するには、「編集
」をクリックし、その後に変更を加えてください。 -
新しい属性の値の抽出方法を設定するには、「ルールを追加
」をクリックし、以下の詳細を入力してください:-
Attributeドロップダウンメニューで、設定したい属性を選択します。
例えば、Abstractをクリックします。
-
**「Value」**タイプのドロップダウンメニューで、属性値を固定値にするか式にするかを選択します。
例えば、「 **表現」**をクリックします。
-
EXPRESSIONフィールドにXPathの式を入力し、属性値を示します。
例えば、abstractという属性の値を取り出したい場合は、abstractという単語を含むすべての属性に含まれるすべての要素のpテキストから取得class、次のXPath式を入力します。
//*contains(@class, "abstract")//p
-
-
オプションで複数の属性値を取得する方法を設定するには、
選択機能を追加してください。次に、2つ目の選択体のExpressionフィールドに、属性値を生成するXPath式を入力します。例えば、2つ目の選択肢として、divクラス内のすべてのp要素の抽象をテキストから取得したいtopic-content。これを行うには、以下のXPath式を入力します。
//div@class="topic-content"//p
複数のセレクタがある場合、Searchはそれらを時系列順に実行し、結果を出す式に到達したら停止します。
-
タグエディターで「 保存」をクリックします。次に「 ドキュメント抽出器 」ページで「 保存」をクリックします。
-
オプションで、別のタグの属性を抽出するには「タグ付け
追加」をクリックし、タグのドロップダウンメニューでタグをクリックしてください。その後、ステップ7から9を繰り返します。 -
ドキュメント抽出器のページで、保存をクリックします。
クローラーのスケジュールを決めてください
クローラーのスケジュールをつけるには:
- 左側のペインで「Crawler Scheduler」をクリックし、その後「Crawler Scheduler」セクションで「
編集」をクリックします。 - STARTSドロップダウンリストで、以下のオプションをクリックしてください:
- Anytime - スケジュールをできるだけ早く始めたいなら。
- Specific Date - 特定の日付からクロールを開始したい場合は。また、日付選択器で日付を選択する必要があります。
- (任意)REPEAT ドロップダウンリストで、一度だけクロールするには「 DOES NOT REPEAT」 をクリックし、ページを閉じるには 「保存」をクリックします。
- クローラーをスケジュールで実行するには、 REPEAT ドロップダウンメニューで 「はい」をクリックします。
- 「 **毎回繰り返し」**のドロップダウンリストで、クロールの頻度を定義するために:
- 繰り返しカウントのドロップダウンリストで、 1 から 99までの値をクリックします。
- 区間ドロップダウンリストで、次の中から「 時間」「 日」「 週」の中から値をクリックします。
- ステップ2で特定の日付からスケジュールを開始した場合、クロール開始時刻を定義するために、 RUN TIME ドロップダウンリストで開始時間をクリックしてください。
- 「 終了日 」ドロップダウンメニューで、クローラースケジュールの終了を設定するには、以下のオプションからクリックしてください:
- Never - スケジュールを無期限に続けたいなら。
- Specific Date - スケジュールを特定の日に終了させたい場合は、また、日付選択器で日付を選択する必要があります。
- Click Save。
ソースへの更新を公開する
最初のクロールとインデックスを始めるには、ソースを公開する必要があります。また、ソースに変更を加えるたびにソースを公開する必要があります。
情報源を公開するには:
- メニューバーで「 Sources」をクリックしてください。
- 公開したいソースをClickで「 公開」をクリックします。
- ソース公開ダイアログで、このソースの再クロールをSearchしたい場合は、「公開後にソース再クロールをトリガー」チェックボックスを選択してください。
- Click Publish。