クローラー仕様
このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。
以下の表は、各クローラータイプがサポートする機能を示しています:
|特徴 || ウェブクローラー | 上級ウェブクローラー | APIクローラー || --- ||--- |--- |--- |--- ||複数のエンティティ |複数のエンティティから属性値を抽出する |いいえ |はい |はい ||クロールおよび解析可能なContent |HTML |はい |はい |はい ||Microsoftオフィス形式 |はい |はい |いいえ ||PDF |はい |はい |いいえ ||JSON |いいえ |いいえ |はい ||General Settings |許可されるドメインを指定する |いいえ |はい |いいえ ||一部のURLを除外するパターンを定義してください |はい |はい |はい ||最大クローラー深度を指定する |はい |はい |はい ||クロール可能な最大URLを指定する |はい |はい |はい ||並列作業するワーカー数を指定する |いいえ |はい |はい ||クローラーのタイムアウトを指定する |いいえ |はい |いいえ ||オリジナルコンテンツがヘッダーを期待する場合は、クローラーにヘッダーを追加してください |はい |はい |はい ||ページソースに加えてJavaScriptをレンダリングし、クロールしてください |いいえ |はい |該当なし ||クロール開始中(トリガー) |リクエストURLを使用 |はい |はい |はい ||サイトマップを使用 |はい |はい |該当なし ||サイトマップのインデックスを使用 |はい |はい |該当なし ||JavaScript関数を使おう |いいえ |はい |はい ||RSSフィードを使おう |いいえ |はい |該当なし ||属性の抽出(ドキュメントエクストラクタ) |XPath式を使え |はい |はい |該当 ||CSS式を使える |いいえ |はい |該当 ||JavaScript関数を使える |いいえ |はい |はい ||JSONPathを使用 |いいえ |いいえ |はい ||属性を抽出する前に特定のURLパターンにマッチする |いいえ |はい |はい ||属性を抽出するための複数のルールを作成し、それらのルールを優先順位付けする |いいえ |はい |はい ||属性を抽出するためのエンティティベースのルールを指定する |いいえ |はい |はい ||索引文書を元の内容と最新に保つためにスキャンをスケジュールする ||はい |はい |はい ||複数のロケーションと言語を持つオリジナルコンテンツを扱う ||いいえ |はい |はい ||認証が必要なオリジナルコンテンツを扱う ||いいえ |はい |はい ||トリガーでカバーされていない追加の開始点を追加(Request Extractor)||いいえ |はい |はい ||インジェスションAPIを使ってインクリメンタル更新を行う ||いいえ |はい |はい ||エンティティベースのタグを使用 ||いいえ |はい |はい |