メインコンテンツまでスキップ

エンティティをカウントする

この記事では、コレクション内のエンティティをカウントする方法と、エンティティ数が実際の数値と異なる可能性がある理由について説明します。

概要​

Zilliz Cloud では、コレクション内のエンティティをカウントするための 2つの方法を提供しています。

  • count(*) を出力フィールドとして指定したクエリ

    コレクション内の正確なエンティティ数を取得するには、この方法を使用し、次の点を必ず満たしてください。

    • 対象のコレクションをロードしていること。

    • クエリリクエストで consistency_level を Strong に設定していること。

    • output_field を ['count(*)'] に設定していること。

    このようなクエリを受け取ると、Zilliz Cloud はクエリノードにリクエストを送信し、すでにメモリにロードされているエンティティをカウントします。

    クエリで複数のパーティション名を指定すると、これらのパーティションに対応するエンティティ数を取得できます。詳細については、出力フィールドとして count(*) を指定したクエリ を参照してください。

  • get_collection_stats() を使用する

    上記の方法を使用すればコレクションの正確な件数を取得できますが、あらゆる場面での使用は推奨されません。この処理は基本的にクエリであるため、頻繁に呼び出すとネットワークの揺らぎが発生したり、ビジネスに関連する検索やクエリに影響を与えたりする可能性があります。

    精度が主な関心事でない場合は、代わりに get_collection_stats() と get_partition_stats() を使用してください。この呼び出しでは推定エンティティ数が返されますが、実行するために対象のコレクションをロードする必要はなく、内部トラッカーが記録した内容を報告するだけなので、コストは無視できるほど小さくなります。

    参考までに、すべてのデータ操作は非同期であるため、内部トラッカーはエンティティ数をリアルタイムで反映できません。詳細については、get_collection_stats() を使用する を参照してください。

Notes

上記の 2つの方法はどちらも、同じプライマリキーを持つエンティティを別々のエンティティとしてカウントします。

プログラムでエンティティ数を取得する代わりに、Zilliz Cloud コンソールでクラスター、コレクション、またはパーティションの数値を確認することもできます。詳細については、Zilliz Cloud コンソール上のエンティティ数 を参照してください。

出力フィールドとして count(*) を指定したクエリ​

正確なエンティティ数を取得するには、コレクションをロードし、出力フィールドとして count(*) を指定したクエリを実行し、そのクエリの整合性レベルを Strong に設定します。

python
# Count without the entities in growing segments
res = client.query(
collection_name="test_collection",
output_fields=['count(*)']
)

# Count with the entities in growing segments
res = client.query(
collection_name="test_collection",
output_fields=['count(*)'],
consistency_level="Strong"
)

# Count the entities in a specific partition
res = client.query(
collection_name="test_collection",
output_fields=['count(*)'],
partition_names=['_default']
)

# Get the entity count
print(res[0]['count(*)'])
# Output
# 20

get_collection_stats() を使用する​

前述のとおり、get_collection_stats() はコレクション内の推定エンティティ数を返すため、実際のエンティティ数とは異なる場合があります。これは、コレクションをロードせずに参照値として使用できます。

次の例では、test_collection という名前のコレクションが存在することを前提としています。

python
from pymilvus import MilvusClient

# 1. Set up a milvus client
client = MilvusClient(
uri="YOUR_CLUSTER_ENDPOINT",
token="YOUR_CLUSTER_TOKEN"
)

# 2. Get the entity count of a collection
client.get_collection_stats(collection_name="test_collection")

# Output
#
# {
# 'row_count': 1000
# }

# 3. Get the entity count of a partition
client.get_partition_stats(
collection_name="test_collection",
partition_name="_default"
)

# Output
#
# {
# 'row_count': 1000
# }

Zilliz Cloud コンソール上のエンティティ数​

プログラムでエンティティをカウントする代わりに、Zilliz Cloud コンソールにアクセスして、以下のページでクラスター、コレクション、またはパーティションのエンティティ数を確認することもできます。

Metrics​

クラスターの Metrics タブでは、Entity Count と Loaded Entities (Approx.) を確認できます。どちらの値も推定値です。曲線内の値は、get_collection_stats() を使用して取得されます。以降にデータの挿入や削除がなければ、Entity Count 曲線は最終的に現在のコレクション内の実際のエンティティ数を反映します。

ZVYcwdlqAhOUqDb4vC3c2Hf8n5e

Collection Details​

コレクションの詳細タブでは、そのコレクションの実際のエンティティ数を確認できます。この値は、出力フィールドとしてcount(*)を指定したクエリを使用して取得されます。

PfXfwGQoLhW0OBbVMMfccM0Qnaf

Partitions​

コレクションの Partitions タブを使用して、その子パーティションにロードされているエンティティの推定数を確認することもできます。この値は get_partition_stats() を使用して取得されます。

LKThwnS2fhTj8vbFJpEcjAMunwf

FAQ​

  • get_collection_stats() または get_partition_stats() を使用して取得したエンティティ数が、エンティティを挿入した後に対象のコレクションまたはパーティションの実際のエンティティ数を反映しないのはなぜですか?

    これらのメソッドは内部トラッカーが記録した内容のみを報告するため、すべてのデータ操作が非同期であることから、実際のエンティティ数と異なる場合があります。

  • コレクションの Metrics タブにある Entity Count 曲線が、エンティティを挿入または削除した後に変化しないのはなぜですか?

    Entity Count 曲線の値は、特定の時点で推定された値です。すべてのデータ操作は非同期であるため、曲線に反映されるまでに遅延が生じる場合があります。

  • コレクションの Partitions タブにある Entity Count (Approx.) 列に表示される値が、エンティティを挿入または削除した後に変化しないのはなぜですか?

    一覧表示されるパーティションの値はすべて推定値です。すべてのデータ操作は非同期であるため、曲線に反映されるまでに遅延が生じる場合があります。

  • コレクションの Overview タブに表示される Loaded Entities の値が、コレクション内の実際のエンティティ数を反映しないのはなぜですか?

    Loaded Entities に表示される値は正確です。この値と通常のクエリで取得したエンティティ数との間に差がある場合、コレクション内の一部のエンティティが同一のプライマリキーを持っている可能性があります。

    count(*) を出力フィールドとして指定したクエリは、同一のプライマリキーを持つエンティティを別々のエンティティとして扱います。一方、その他のクエリは、最終結果を返す前に同一のプライマリキーを持つエンティティを省略します。