アナライザーの種類
このページの翻訳はAIによって自動的に行われました。可能な限り正確な翻訳を心掛けていますが、原文と異なる表現や解釈が含まれる場合があります。正確で公式な情報については、必ず英語の原文をご参照ください。
機能で使用する属性を設定すると、アナライザーは入力テキストを処理・変換して検索の関連性と機能性を向上させます。
Searchが適用するデフォルトのアナライザーはほとんどのユースケースで推奨されていますが、もっと高度なアナライザーもたくさんあります。
基本的なアナライザー
基本的なアナライザーは、テキストを小文字にしたり、句読点を除去したり、正確なマッチングを作成したりといった単純なテキスト処理作業を扱います。これらはほとんどの一般的な検索シナリオで使われます。
標準 rfk_standard
このStandard analyzerは、マルチロケール標準 アナライザーの古い英語専用バージョンです。マルチ ロケール標準 と全て同じ操作を行いますが、ローカリーは考慮しません。
英語データのみを扱う場合は、テキスト関連性のためにこのアナライザーを使用できます。ただし、Multi Locale Standard Analyzerの使用を推奨します。
マルチロケーション標準 rfk_standard_multi_locale
マルチロケール標準アナライザーは、入力を小文字にし、各単語の語根を語幹で判定し、同義語を適用し、ストップワードや句読点を削除して処理します。この作業中に地域要素も考慮しています。
例えば、訪問者が *「How can I improve search results?」*と検索した場合、標準 アナライザーは以下のトークンを出力します: how、can、i、improve、search、result。この例では、大文字は小文字にされ、単語 はimprove 、結果 はルート形に縮小され、疑問符は削除されています。
マルチロケール標準アナライザーは、地域ごとに異なる動作が可能です。例えば、異なる言語で異なるストップワードが存在します。英語ではストップワードがここにあり、スペイン語で対応するストップワードはaquíです。スペイン語圏では、マルチロケール標準アナライザがこの違いを考慮しています。
たとえドメインが複数の地域に対応していなくても、テキストの関連性にはMulti Locale標準アナライザーを使いましょう。
英数字のみ rfk_alphanumeric_only_analyzer
Alphanumeric onlyアナライザは標準アナライザと同じ変換を行いますが、非英数字文字をトークン区切りとして使う代わりにすべて削除します。
例えば、1235-abhe-3f34s ID文書の場合、Alphanumeric onlyアナライザは単一のトークン、1235abhe3f34sを生成します。これは訪問者がハイフンの有無の両方で検索できるようにしたい場合に役立ちます。この結果は、ハイフンを使ってIDを3つのトークン(1235、abhe、3f34s)に分けるStandardアナライザとは異なります。
キーワード rfk_keyword
Keywordアナライザは入力テキストを単一のトークンとして生成します。
例えば、訪問者がSitecore Searchを検索した場合、Keywordアナライザーは単一のトークン「Sitecore Search」を作成します。つまり、サイトコア**や個別検索は全文でしかマッチングできないためです。
この分析装置は 、フィルター やその他の特別な場合に、正確な一致が必要な場合に役立ちます。
小文字 rfk_lowercase
Lowercaseアナライザは、入力全体を小文字で表示した単一の出力トークンを生成します。
例えば、訪問者が 「How to create Search experiences(検索体験の作成方法)」を検索した場合、Lowercaseアナライザーは次のトークンを生成します: How to Create Search Experiences(検索体験の作成方法)。
プレフィックスマッチ rfk_prefix_match
Prefix matchアナライザーは3文字から15文字までの小文字接頭辞を生成し、入力から非英数字の文字をすべて除去します。
例えば、訪問者がISBN 978-3-16-148410-0を検索した場合、生成されるトークンには978、9783、97831、978316などが含まれます。
このアナライザーは、一意IDの照合にテキスト 関連 性でよく使われます。
高度な分析装置
高度なアナライザーは、nグラムの作成、複合語の処理、単語ペアの生成など、複雑なテキスト操作作業を扱います。
!注テキスト関連 性はもはやShingleジェネレーター およびNgramベースのマッチ アナライザーをサポートしていません。これらの分析ツールのいずれかをテキスト関連性でご参照の場合は、Sitecoreサポートまでご連絡ください。
Nグラムベースのマッチング rfk_ngram_analyzer
Ngramベースのマッチングアナライザーはテキストを単語に分割し、各単語に対して長さnのnグラムを作成します。
例えば、訪問者がSitecore Searchを検索し、nの値が2の場合、生成されるトークンにはSi、it、te、ec、co、or、re、Se、eaなどが含まれます。
このアナライザーは、日本語のようにスペースを使わない言語や、ドイツ語のように複合語が長い言語のクエリに有用です。接頭辞を扱う際にも役立ちます。 Ngramベースのマッチング は、suggestion blocksでよく使われます。
部分的な一致 rfk_partial_match
Partial matchアナライザは入力トークンの小文字バリエーションを生成し、特殊文字の分割や結合、ストップワードの除去を行います。
例えば、訪問者が「 How do I keep Sitecore Search results up-to-date」と検索すると、以下のトークンが生成されます: how、do、i、keep、sitecore、search、results、up、date、uptodate。この例では、すべての単語が小文字に変換され、ハイフン付きの単語 「up-todate 」は別々のトークンに分割され(ス トップワードは削除)、単一のトークン「 uptodate」に結合されます。
シングル発電機 rfk_shingle_analyzer
Shingle generatorアナライザーは、シングルと呼ばれるワードレベルのnグラムを生成することで動作します。
例えば、訪問者が「How to improve search results」を検索し、アナライザーが2語長のシングルを作成するように設定されている場合、以下のトークンが生成されます:in How toimprove, improve search, and search results.
このアナライザーは部分的なデータを抽出し、それと照合するのに有用です。 Shingle generatorアナライザーはsuggestion blocksでよく使われます。
標準ノーステマー rfk_no_stemmer_analyzer
標準的なノーステマーアナライザは、Standardアナライザと同じ操作を行いますが、ステミングを用いてトークンを根形に還元することはありません。
例えば、訪問者が「 How to improve search results??」と検索した場合、標準的なノーステマー アナライザーは以下のトークンを生成します: how、improve、search、results。単語は小文字に変換され、ストップワード のtoは削除され、疑問符も削除されます。 Standardアナライザーとは異なり、improveという単語は語根であるimprovに変更されません。
正確な接頭辞一致 rfk_exact_prefix_match
Exact prefix matchアナライザは、入力テキストから英数字以外の文字をすべて除去することで、3文字から10文字までの小文字プレフィックスを作成します。基本的なPrefix matchアナライザがドキュメント入力テキストと検索入力テキストの両方からプレフィックスを生成するのに対し、Exact prefix matchアナライザはドキュメントから小文字のプレフィックスのみを生成します。Exact prefix matchアナライザを使用する場合、入力テキストはそのまま保持され、プレフィックスに分割されません。
例えば、AB012を検索しても、ab0123、ab0124、ab0125のようにab012で始まる結果しか返ってきません。ab0223やab0133のように、正確な接頭辞で始まらない結果にはマッチしません。