クローラー設定の設定
このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。
クローラーの設定は、ソースの範囲を定義します。これには、クローラーがクロールできるドメイン、回避すべきURL、クローラーが到達したい最大URL深度などが含まれます。
!注すべてのソースがすべての設定を提供しているわけではありません。特定のソースがどのような構成を持っているか知りたい場合は、そのソースのウォークスルーや、どのソースを使うかのトピックをご覧ください。
単一のウェブサイトからデータをインデックス化するには、1つのクローラーを使うのがベストプラクティスです。記事、ページ、PDF、その他のメタデータの保存方法が異なる可能性のあるドキュメントタイプからデータをインデックス化するには、複数のドキュメントエクストラクタをクローラーに適用することを推奨します。
クローラーの設定には以下の設定をご利用ください:
舞台設定
概要
許可ドメイン
クローラーにクロールしてインデックスを付けたいドメイン。通常は、クローラーにクロールさせたい最上位ドメインを入力します。例えば、クローラーにドキュメントのみをインデックスさせたい場合は、www.sitecore.com ではなく許可ドメインとして doc.sitecore.com を入力Sitecore許可ドメインとして入力 します。許可ドメインを定義すると 、クローラーがサードパーティのコンテンツをインデックス化するのを防ぎます。例えば、元のコンテンツに外部のソーシャルメディアサイトへのリンクがあるブログがあると仮定します。許可ドメインを定義すると、クローラーはブログページをインデックスし、ソーシャルメディアへのリンクは無視して次のURLに移動します。許可されたドメインを複数追加できます。デフォルト
。これは、クローラーが遭遇するすべてのドメインをクロールすることを意味します。最大深度
クローラーが1 URLにたどる最大リンク数。例えば、最大深さが3の場合。クローラーは深さレベル1の www.sitecore.com から始まり、深さレベル2の www.sitecore.com/products、さらに深さレベル3の www.sitecore.com/products/content-cloud に進みます。クローラーは最大深さ3に達しているため、最後のページでハイパーリンクを開きません。サイトマップまたはサイトマップインデックストリガーを持つウェブクローラーソースのデフォルト
。その他のすべてのソースについては2。LimitMAX URL
クロールできるURLの最大数(合計)。最大URL数は100,000のように大きな数字を入力することを推奨します。URLの推定値より多く設定してください。これにより、クロールが完了する前に停止されるのを防ぎます。デフォルト
。その他のクローラーは1000。最小文書閾値を有効にする
有効化すると、クロールジョブは設定済みの最小閾値より少ないドキュメントをインデックス化すると失敗します。
最小索引付き文書
クロールが成功するためにクローラーがインデックスしなければならない最低ドキュメント数。
排除パターン
クローラーにインデックスさせたくないURLを定義するグロブや正規表現。複数の除外パターンを作成できます。デフォルト
並列性(ワーカーズ)
同時にクロールとインデックスを作成するスレッド数(ワーカー数)が増えます。ワーカー数が増えればコンテンツインデックスが速くなりますが、同時により多くのリソースを消費します。デフォルト
制限遅延(MS)
時間、ミリ秒単位で、クローラーは次のURLにアクセスしてインデックスを作成する前に待つ必要があります。この設定を使ってクローラーのリクエストを調整でき、元のコンテンツをホストするリソースが過負荷になるのを防ぎます。注意遅延を定義するには、PARALLELISM (WORKERS)を1に設定してください。複数のワーカーが存在する場合、各ワーカーが独立して動作するため遅延を設定することはできません。デフォルト
、または遅延なし。Limit(5000ms)タイムアウト
時間(ミリ秒単位)は、各URLやドキュメントからの応答を待機します。タイムアウト期間が終了すると、クローラーはそのURLやドキュメントをインデックス化せず、次のものに移ります。デフォルト
,000。その他のクローラーは10,000。Limit,000ms(3分)ヘッダー
クローラーがあなたのウェブサイトをクロールする際に使用するユーザーエージェント。セキュリティのために、クローラー用のユーザーエージェントを設定し、このユーザーエージェントをホワイトリストに登録してください。これにより他のボットがあなたのサイトをクロールするのを防ぎます。キーと値の値を入力してください。例えば、キーをuser-agent、値をsitecorebotとして入力します。デフォルト
。クロール中にナビゲーションクッキーを有効にする
クローラーがウェブサイトが設定したナビゲーションクッキーを受け入れるかどうかを制御します。これらのクッキーはユーザー(ここではクローラー)の経路を追跡し、訪問されたURLを記録します。これらのクッキーを無効にしたい理由の一つは、クローラーが過去に訪問したURLを再インデックスするよう誤解されないようにするためです。もう一つの理由は、クッキーがクローラーを最初に遭遇したロケーションに限定できるため、複数のロケーション間でコンテンツをインデックスできない可能性があることです。ヒント
、クローラーでナビゲーションクッキーの受け入れを無効にすることをお勧めします。一方で、特に認証が必要なウェブサイトにはナビゲーションクッキーを有効にしたいかもしれません。デフォルト。クローラーはナビゲーションクッキーを受け入れます。Javascriptをレンダリングする
クローラーにページ上でJavaScriptをレンダリングさせたいかどうか。Render JavaScriptをオンにすると、クローラーはJavaScriptのレンダリングを待ち、そのコンテンツとページのソースを同時にインデックスします。Render JavaScriptをオンにしなければ、クローラーはページソース内のコンテンツのみをインデックスします。Render JavaScriptをオンにする場合は、追加設定を定義する必要があります。デフォルト:2000ms制限
,000ms(1分)