Request extractors
このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。
リクエストエクストラクタはクローラーがクロールするための追加のURLリストを作成します。もしクローラーが元のトリガーをたどってもインデックスに必要なすべてのコンテンツにアクセスできない場合は、リクエストエクストラクタを使いましょう。リクエストエクストラクタはトリガーの出力を入力として使用するJavaScript関数です。
例えば、ソースコンテンツ内のすべてのHTMLページを含むサイトマップがあり、そのサイトマップのURLをトリガーとして使う場合です。しかし、一部のページにはPDFコンテンツも埋め込まれています。サイトマップにはPDFのURLは含まれていません。この場合、リクエストエクストラクターを設定してPDFコンテンツのみをクロールするURLを生成します。
!注APIクローラーを設定する際には、Requestエクストラクタが非常に重要です。APIクローラーの場合、トリガーはURLではなくJSONを返します。これに対応するには、リクエストエクストラクタを設定し、トリガーの出力を使い、APIクローラーがクロールできるようにURLやAPIエンドポイントを返します。
リクエストエクストラクタを設定するには、URLやAPIエンドポイントのリストをクロールするJavaScript(JS)関数を追加します。
!注すべてのソースがすべての設定を提供しているわけではありません。特定のソースがどのような構成を持っているか知りたい場合は、そのソースのウォークスルーや、どのソースを使うかのトピックをご覧ください。
クローラー用のリクエストエクストラクタを定義するために、以下の設定を設定してください:
舞台設定
概要
名称
リクエストエクストラクタの意味のある名前です。
一致するURLを
このエクストラクタとそのルールが適用されるURLを定義するパターンです。正規表現やグロブ式を使用できます。このフィールドを使って、ソースコンテンツの異なる領域ごとに異なるエクストラクタを作成できます。これは任意の設定です。
JS出典
クローラーがクロールするためのURLやAPIエンドポイントを生成するJavaScript関数。定義したJavaScript関数は
。つまり、このformat extract(request, response) { $ = response.body; }オブジェクトの配列を返します。