メインコンテンツまでスキップ

主キー検索

類似検索を実行する際は、対象コレクションにクエリベクトルがすでに存在している場合でも、常に 1 つ以上のクエリベクトルを指定する必要があります。検索前にベクトルを取得することを避けるには、代わりに主キーを使用できます。

概要​

EC プラットフォームでは、ユーザーがキーワードを入力すると、それに一致する商品を取得できます。ユーザーが商品の詳細ページを表示すると、プラットフォームは、比較したいユーザー向けにページの下部に類似商品のリストも表示します。

レコメンデーションは、キーワードまたは現在の商品との類似度に基づいて並べ替えられます。これを実現するには、プラットフォームの開発者が、実際の類似検索の前にキーワードまたは現在の商品のベクトル表現を Milvus から取得する必要があります。そのため、プラットフォームと Milvus の間のラウンドトリップが増加し、多数の高次元浮動小数点数がネットワーク経由で送信されることになります。

アプリケーションと Milvus の間の連携ロジックを簡素化し、ラウンドトリップの回数を減らし、大量の高次元浮動小数点値をネットワーク経由で送信することを避けるには、主キー検索の使用を検討してください。

主キー検索では、クエリベクトルを指定する必要はありません。代わりに、クエリベクトルを含むエンティティの主キー(ids)を指定します。

制限事項​

  • 主キーを使用した検索は、BM25 関数のように VarChar フィールドから派生したスパースベクトルフィールドを除き、すべてのベクトルデータ型に適用されます。

  • フィルタ付き検索、範囲検索、グループ化検索では、クエリベクトルの代わりに主キーを使用できます。必要に応じてページネーションを有効にすることもできます。ただし、この機能はハイブリッド検索および検索イテレーターには適用されません。

  • embedding list を含む類似検索では、引き続きクエリベクトルを取得し、それらを embedding list に配置してから検索を実行する必要があります。

  • 存在しない主キーや形式が正しくない主キーについては、Milvus がエラーを返します。

  • 主キーとクエリベクトルは排他的です。両方を指定した場合もエラーになります。

例​

以下の例では、指定したすべての Int64 ID が対象コレクションに存在することを前提としています。

Notes

主キーはフィルタリングには使用されず、ベクトルの取得にのみ使用されます。

基本的な主キー検索を実行するには、クエリベクトルを主キーに置き換えるだけです。

python
from pymilvus import MilvusClient

client = MilvusClient(
uri="YOUR_CLUSTER_ENDPOINT",
token="YOUR_CLUSTER_TOKEN"
)

res = client.search(
collection_name="my_collection",
anns_field="vector",
ids=[551, 296, 43], # a list of primary keys
limit=3
)

for hits in res:
for hit in hits:
print(hit)

例 2: 主キーを使用したフィルタ付き検索​

以下の例では、color と likes が対象コレクションにスキーマ定義された 2 つのフィールドであることを前提としています。

python
res = client.search(
collection_name="my_collection",
ids=[551, 296, 43], #
filter='color like "red%" and likes > 50',
output_fields=["color", "likes"],
limit=3,
)

例 3: 主キーを使用した範囲検索​

python
res = client.search(
collection_name="my_collection",
ids=[551, 296, 43],
limit=3,
search_params={
"params": {
"radius": 0.4,
"range_filter": 0.6
}
}
)

例 4: 主キーを使用したグループ化検索​

以下の例では、docId が対象コレクションにスキーマ定義されたフィールドであることを前提としています。

python
res = client.search(
collection_name="my_collection",
ids=[551, 296, 43],
limit=3,
group_by_field="docId",
output_fields=["docId"]
)