フィルタリングの解説
Zilliz Cloud は、データを正確にクエリできる強力なフィルタリング機能を提供します。フィルター式を使用すると、特定のスカラーフィールドを対象に、さまざまな条件で検索結果を絞り込めます。このガイドでは、Zilliz Cloud クラスターでフィルター式を使用する方法を、クエリ操作に焦点を当てた例とともに説明します。これらのフィルターは、検索リクエストと削除リクエストにも適用できます。
基本演算子
Zilliz Cloud は、データをフィルタリングするためのいくつかの基本演算子をサポートしています。
-
比較演算子:
==、!=、>、<、>=、<=を使用すると、数値フィールドまたはテキストフィールドに基づいてフィルタリングできます。 -
範囲とパターンのフィルター:
IN、LIKE、=~、!~は、値、ワイルドカードパターン、または正規表現パターンに一致します。文字列パターンの詳細については、Pattern Matching を参照してください。 -
算術演算子:
+、-、*、/、%、**は、数値フィールドを含む計算に使用します。 -
ビット演算子: 以降のバージョンでは、
&、|、^を使用して、権限やステータスビットなど、複数のフラグをエンコードした整数フィールドをフィルタリングできます。詳細については、Basic Operators を参照してください。 -
論理演算子:
AND、OR、NOTは、複数の条件を組み合わせて複雑な式を作成します。 -
IS NULL および IS NOT NULL 演算子:
IS NULL演算子とIS NOT NULL演算子は、フィールドが null 値(データの欠如)を含むかどうかに基づいてフィールドをフィルタリングするために使用します。詳細については、Basic Operators を参照してください。
例: 色によるフィルタリング
スカラーフィールド color で原色(赤、緑、青)を持つエンティティを検索するには、次のフィルター式を使用します。
filter='color in ["red", "green", "blue"]'
例: 権限ビットによるフィルタリング
整数型の permissions フィールドで SHARE ビットが設定されているエンティティを検索するには、ビット単位の AND 演算子(&)を使用します。
filter='(permissions & 4) == 4'
例: 正規表現パターンによるフィルタリング
message フィールドに E1001 などのエラーコードが含まれるエンティティを検索するには、正規表現一致演算子 =~ を使用します。
filter='message =~ "E[0-9]{4}"'
正規表現フィルターは部分文字列の一致を使用します。フィールド値全体をパターンに一致させる必要がある場合は、^ と $ のアンカーを追加してください。詳細については、Pattern Matching を参照してください。
例: JSON フィールドのフィルタリング
Zilliz Cloud では、JSON フィールド内のキーを参照できます。たとえば、キー price と model を持つ JSON フィールド product があり、特定のモデルで価格が 1,850 未満の製品を検索する場合は、次のフィルター式を使用します。
filter='product["model"] == "JSN-087" AND product["price"] < 1850'
例: 配列フィールドのフィルタリング
2000 年以降に観測所から報告された平均気温の記録を含む配列フィールド history_temperatures があり、2009 年(10 番目の記録)の気温が 23°C を超える観測所を検索する場合は、次の式を使用します。
filter='history_temperatures[10] > 23'
これらの基本演算子の詳細については、Basic Operators を参照してください。
フィルター式テンプレート
CJK 文字を使用してフィルタリングする場合、文字セットが大きく、エンコーディングも異なるため、処理がより複雑になることがあります。その結果、特に IN 演算子を使用するときにパフォーマンスが低下する可能性があります。
Zilliz Cloud は、CJK 文字を扱うときのパフォーマンスを最適化するために、フィルター式テンプレートを導入しています。動的な値をフィルター式から分離することで、クエリエンジンはパラメーターの挿入をより効率的に処理できます。
25 歳を超え、"北京"(北京)または "上海"(上海)に住む人物を検索するには、次のテンプレート式を使用します。
filter = "age > 25 AND city IN ['北京', '上海']"
パフォーマンスを向上させるには、パラメーターを使用した次のバリエーションを使用します。
filter = "age > {age} AND city in {city}",
filter_params = {"age": 25, "city": ["北京", "上海"]}
この方法により、解析のオーバーヘッドが削減され、クエリ速度が向上します。詳細については、Filter Templating を参照してください。
データ型固有の演算子
Zilliz Cloud は、JSON、ARRAY、VARCHAR フィールドなど、特定のデータ型向けの高度なフィルタリング演算子を提供します。
JSON フィールド固有の演算子
Zilliz Cloud は、JSON フィールドをクエリするための高度な演算子を提供し、複雑な JSON 構造内でも正確なフィルタリングを可能にします。
JSON_CONTAINS(identifier, jsonExpr): JSON 式がフィールド内に存在するかどうかを確認します。
# JSON data: {"tags": ["electronics", "sale", "new"]}
filter='json_contains(tags, "sale")'
JSON_CONTAINS_ALL(identifier, jsonExpr): JSON 式のすべての要素が存在することを確認します。
# JSON data: {"tags": ["electronics", "sale", "new", "discount"]}
filter='json_contains_all(tags, ["electronics", "sale", "new"])'
JSON_CONTAINS_ANY(identifier, jsonExpr): JSON 式の要素が少なくとも 1 つ存在するエンティティをフィルタリングします。
# JSON data: {"tags": ["electronics", "sale", "new"]}
filter='json_contains_any(tags, ["electronics", "new", "clearance"])'
JSON 演算子の詳細については、JSON Operators を参照してください。
ARRAY フィールド固有の演算子
Zilliz Cloud は、ARRAY_CONTAINS、ARRAY_CONTAINS_ALL、ARRAY_CONTAINS_ANY、ARRAY_LENGTH など、配列フィールド向けの高度なフィルタリング演算子を提供し、配列データをきめ細かく制御できます。
ARRAY_CONTAINS: 特定の要素を含むエンティティをフィルタリングします。
filter="ARRAY_CONTAINS(history_temperatures, 23)"
ARRAY_CONTAINS_ALL: リスト内のすべての要素が存在するエンティティをフィルタリングします。
filter="ARRAY_CONTAINS_ALL(history_temperatures, [23, 24])"
ARRAY_CONTAINS_ANY: リスト内のいずれかの要素を含むエンティティをフィルタリングします。
filter="ARRAY_CONTAINS_ANY(history_temperatures, [23, 24])"
ARRAY_LENGTH: 配列の長さに基づいてフィルタリングします。
filter="ARRAY_LENGTH(history_temperatures) < 10"
配列演算子の詳細については、ARRAY Operators を参照してください。
VARCHAR フィールド固有の演算子
Zilliz Cloud は、VARCHAR フィールドで正確なテキスト検索を行うための専用演算子を提供します。
パターンマッチング演算子
LIKE、=~、!~ 演算子は、VARCHAR フィールド、JSON の文字列パス、および特定の ARRAY<VARCHAR> 要素に対して文字列パターンを一致させます。単純なワイルドカードパターンには LIKE を使用します。RE2 正規表現には =~ と !~ を使用します。
詳細については、Pattern Matching を参照してください。
TEXT_MATCH 演算子
TEXT_MATCH 演算子を使用すると、特定のクエリ語句に基づいてドキュメントを正確に取得できます。スカラーフィルターとベクトル類似検索を組み合わせたフィルター検索に特に役立ちます。セマンティック検索とは異なり、Text Match は語句の完全一致に焦点を当てます。
Zilliz Cloud は Tantivy を使用して、転置インデックスと語句ベースのテキスト検索をサポートしています。処理の流れは次のとおりです。
-
Analyzer: 入力テキストをトークン化して処理します。
-
Indexing: 一意のトークンをドキュメントにマッピングする転置インデックスを作成します。
詳細については、Text Match を参照してください。
PHRASE_MATCH 演算子
PHRASE_MATCH 演算子を使用すると、クエリ語句の順序と隣接性の両方を考慮し、完全一致するフレーズに基づいてドキュメントを正確に取得できます。
詳細については、Phrase Match を参照してください。