メインコンテンツまでスキップ

テキストマッチ

Zilliz Cloud のテキストマッチは、特定の用語に基づいてドキュメントを正確に取得できます。この機能は主に、特定の条件を満たすためのフィルタ付き検索に使用され、スカラーフィルタリングを組み込んでクエリ結果を絞り込むことができます。これにより、スカラー条件を満たすベクトル内で類似検索を実行できます。

Notes

テキストマッチは、一致したドキュメントの関連性をスコアリングすることなく、クエリ用語が正確に出現する箇所を見つけることに重点を置きます。クエリ用語のセマンティックな意味と重要度に基づいて最も関連性の高いドキュメントを取得する場合は、Full Text Search の使用をおすすめします。

Zilliz Cloud では、テキストマッチをプログラムから、または Web コンソール経由で有効にできます。このページでは、テキストマッチをプログラムから有効にする方法に焦点を当てます。Web コンソールでの操作の詳細については、Manage Collections (Console) を参照してください。

概要​

Zilliz Cloud は、基盤となる転置インデックスと用語ベースのテキスト検索を実現するために Tantivy を統合しています。各テキストエントリについて、Zilliz Cloud は次の手順でインデックス化を行います。

  1. Analyzer: アナライザーは、入力テキストを個々の単語(トークン)にトークン化し、必要に応じてフィルターを適用して処理します。これにより、Zilliz Cloud はこれらのトークンに基づいてインデックスを構築できます。

  2. Indexing: テキスト解析後、Zilliz Cloud は一意の各トークンを、それを含むドキュメントに対応付ける転置インデックスを作成します。

ユーザーがテキストマッチを実行すると、転置インデックスを使用して、用語を含むすべてのドキュメントをすばやく取得できます。これは、各ドキュメントを個別にスキャンするよりもはるかに高速です。

N43zw7HuGhmCHRbYDDmctO1bnkd

テキストマッチを有効にする​

テキストマッチは VARCHAR フィールド型で動作し、これは Zilliz Cloud における文字列データ型に相当します。テキストマッチを有効にするには、コレクションスキーマを定義する際に enable_analyzer と enable_match の両方を True に設定し、必要に応じてテキスト解析用の analyzer を構成します。

enable_analyzer と enable_match を設定する​

特定の VARCHAR フィールドでテキストマッチを有効にするには、フィールドスキーマを定義するときに enable_analyzer と enable_match の両方のパラメータを True に設定します。これにより、Zilliz Cloud はテキストをトークン化して指定したフィールドの転置インデックスを作成し、高速で効率的なテキストマッチを可能にします。

python
from pymilvus import MilvusClient, DataType

schema = MilvusClient.create_schema(enable_dynamic_field=False)
schema.add_field(
field_name="id",
datatype=DataType.INT64,
is_primary=True,
auto_id=True
)
schema.add_field(
field_name='text',
datatype=DataType.VARCHAR,
max_length=1000,
enable_analyzer=True, # Whether to enable text analysis for this field
enable_match=True # Whether to enable text match
)
schema.add_field(
field_name="embeddings",
datatype=DataType.FLOAT_VECTOR,
dim=5
)

オプション: アナライザーを構成する​

キーワードマッチングのパフォーマンスと精度は、選択したアナライザーによって決まります。アナライザーは言語やテキスト構造に応じてそれぞれ適しており、適切なものを選択することが、特定のユースケースにおける検索結果に大きく影響します。

デフォルトでは、Zilliz Cloud は standard アナライザーを使用します。これは、空白と句読点に基づいてテキストをトークン化し、40 文字を超えるトークンを削除し、テキストを小文字に変換します。このデフォルト設定を適用するために追加のパラメータは必要ありません。詳細については、Standard を参照してください。

別のアナライザーが必要な場合は、analyzer_params パラメータを使用して構成できます。たとえば、英語のテキストを処理するために english アナライザーを適用するには、次のようにします。

python
analyzer_params = {
"type": "english"
}
schema.add_field(
field_name='text',
datatype=DataType.VARCHAR,
max_length=200,
enable_analyzer=True,
analyzer_params = analyzer_params,
enable_match = True,
)

Zilliz Cloud は、さまざまな言語やシナリオに適したその他のアナライザーも提供しています。詳細については、Analyzer Overview を参照してください。

テキストマッチを使用する​

コレクションスキーマで VARCHAR フィールドのテキストマッチを有効にすると、TEXT_MATCH 式を使用してテキストマッチを実行できます。

TEXT_MATCH 式の構文​

TEXT_MATCH 式は、検索するフィールドと用語を指定するために使用します。その構文は次のとおりです。

python
TEXT_MATCH(field_name, text)
  • field_name: 検索する VARCHAR フィールドの名前です。

  • text: 検索する用語です。複数の用語は、言語と構成したアナライザーに応じて、スペースまたはその他の適切な区切り文字で区切ることができます。

デフォルトでは、TEXT_MATCH は OR マッチングロジックを使用します。つまり、指定した用語のいずれかを含むドキュメントを返します。たとえば、text フィールドに machine または deep という用語を含むドキュメントを検索するには、次の式を使用します。

python
filter = "TEXT_MATCH(text, 'machine deep')"

複数の TEXT_MATCH 式を論理演算子で組み合わせて、AND マッチングを実行することもできます。

  • text フィールドに machine と deep の両方を含むドキュメントを検索するには、次の式を使用します。

    python
    filter = "TEXT_MATCH(text, 'machine') and TEXT_MATCH(text, 'deep')"
  • text フィールドに machine と learning の両方を含み、deep を含まないドキュメントを検索するには、次の式を使用します。

    python
    filter = "not TEXT_MATCH(text, 'deep') and TEXT_MATCH(text, 'machine') and TEXT_MATCH(text, 'learning')"

テキストマッチを使用した検索​

テキストマッチは、ベクトル類似検索と組み合わせて使用して検索範囲を絞り込み、検索パフォーマンスを向上させることができます。ベクトル類似検索の前にテキストマッチでコレクションをフィルタリングすると、検索が必要なドキュメントの数を減らすことができ、クエリ時間を短縮できます。

この例では、filter 式によって、検索結果は指定した用語 keyword1 または keyword2 に一致するドキュメントのみに絞り込まれます。その後、このフィルタリングされたドキュメントのサブセットに対してベクトル類似検索が実行されます。

python
# Match entities with `keyword1` or `keyword2`
filter = "TEXT_MATCH(text, 'keyword1 keyword2')"

# Assuming 'embeddings' is the vector field and 'text' is the VARCHAR field
result = client.search(
collection_name="my_collection", # Your collection name
anns_field="embeddings", # Vector field name
data=[query_vector], # Query vector
filter=filter,
search_params={"params": {"nprobe": 10}},
limit=10, # Max. number of results to return
output_fields=["id", "text"] # Fields to return
)

テキストマッチを使用したクエリ​

テキストマッチは、クエリ操作におけるスカラーフィルタリングにも使用できます。query() メソッドの expr パラメータに TEXT_MATCH 式を指定すると、指定した用語に一致するドキュメントを取得できます。

次の例では、text フィールドに keyword1 と keyword2 の両方の用語を含むドキュメントを取得します。

python
# Match entities with both `keyword1` and `keyword2`
filter = "TEXT_MATCH(text, 'keyword1') and TEXT_MATCH(text, 'keyword2')"

result = client.query(
collection_name="my_collection",
filter=filter,
output_fields=["id", "text"]
)

考慮事項​

  • フィールドで用語マッチングを有効にすると転置インデックスが作成され、ストレージリソースを消費します。この機能を有効にするかどうかを判断する際は、テキストサイズ、一意のトークン、使用するアナライザーによってストレージへの影響が異なる点を考慮してください。

  • スキーマでアナライザーを定義すると、その設定はそのコレクションに対して永続的になります。別のアナライザーのほうがニーズに適していると判断した場合は、既存のコレクションを削除し、目的のアナライザー設定で新しいコレクションを作成することを検討してください。

  • フレーズマッチのパフォーマンスは、テキストがどのようにトークン化されるかによって決まります。アナライザーをコレクション全体に適用する前に、run_analyzer メソッドを使用してトークン化の出力を確認してください。詳細については、Analyzer Overview を参照してください。

  • filter 式におけるエスケープ規則:

    • 式内で二重引用符または一重引用符で囲まれた文字は、文字列定数として解釈されます。文字列定数にエスケープ文字が含まれる場合は、エスケープ文字をエスケープシーケンスで表す必要があります。たとえば、\\ を使用して \ を表し、\\t を使用してタブ \t を表し、\\n を使用して改行を表します。

    • 文字列定数を一重引用符で囲む場合、定数内の一重引用符は \\' で表し、二重引用符は " または \\" で表すことができます。例: 'It\\'s milvus'

    • 文字列定数を二重引用符で囲む場合、定数内の二重引用符は \\" で表し、一重引用符は ' または \\' で表すことができます。例: "He said \\"Hi\\""