メインコンテンツまでスキップ

コレクションの作成

スキーマ、インデックスパラメータ、メトリクスタイプ、作成時にロードするかどうかを定義してコレクションを作成できます。このページでは、コレクションをゼロから作成する方法を紹介します。

Notes

強力なデータ分離が必要で、管理するテナント数が少ない場合は、テナントごとに個別のコレクションを作成できます。

ただし、作成できるコレクションの最大数は、プロジェクトプランとクラスターのデプロイオプションに応じて 16,384 個までです。そのため、大規模なマルチテナンシーでは、ユースケースに応じて、パーティションベースやパーティションキーベースのマルチテナンシーなどの代替戦略の使用を検討してください。詳細については、マルチテナンシーの実装 を参照してください。

概要​

コレクションは、固定された列と可変の行を持つ二次元テーブルです。各列はフィールドを表し、各行はエンティティを表します。このような構造化データ管理を実現するにはスキーマが必要です。挿入するすべてのエンティティは、スキーマで定義された制約を満たしている必要があります。

スキーマ、インデックスパラメータ、メトリクスタイプ、作成時にロードするかどうかなど、コレクションのあらゆる要素を決定して、要件に完全に適合するコレクションを作成できます。

コレクションを作成するには、次の手順を実行します。

スキーマの作成​

スキーマはコレクションのデータ構造を定義します。コレクションを作成する際は、要件に基づいてスキーマを設計する必要があります。詳細については、スキーマの解説 を参照してください。

以下のコードスニペットは、動的フィールドを有効にし、my_id、my_vector、my_varchar という 3 つの必須フィールドを持つスキーマを作成します。

Notes

任意のスカラーフィールドにデフォルト値を設定し、nullable にすることができます。詳細については、Nullable フィールド を参照してください。

python
# 3. Create a collection in customized setup mode
from pymilvus import MilvusClient, DataType

client = MilvusClient(
uri="YOUR_CLUSTER_ENDPOINT",
token="YOUR_CLUSTER_TOKEN"
)

# 3.1. Create schema
schema = MilvusClient.create_schema(
auto_id=False,
enable_dynamic_field=True,
)

# 3.2. Add fields to schema
schema.add_field(field_name="my_id", datatype=DataType.INT64, is_primary=True)
schema.add_field(field_name="my_vector", datatype=DataType.FLOAT_VECTOR, dim=5)
schema.add_field(field_name="my_varchar", datatype=DataType.VARCHAR, max_length=512)

インデックスパラメータの設定(任意)​

特定のフィールドにインデックスを作成すると、そのフィールドに対する検索が高速化されます。インデックスは、コレクション内のエンティティの順序を記録します。以下のコードスニペットに示すように、metric_type と index_type を使用して、Zilliz Cloud がフィールドにインデックスを作成し、ベクトル埋め込み間の類似性を測定するための適切な方法を選択できます。

Zilliz Cloud では、すべてのベクトルフィールドのインデックスタイプとして AUTOINDEX を使用でき、ニーズに応じて COSINE、L2、IP のいずれかをメトリクスタイプとして使用できます。

上記のコードスニペットに示すように、ベクトルフィールドにはインデックスタイプとメトリクスタイプの両方を設定する必要があり、スカラーフィールドにはインデックスタイプのみを設定します。インデックスはベクトルフィールドでは必須であり、フィルタリング条件で頻繁に使用されるスカラーフィールドにはインデックスを作成することをお勧めします。

詳細については、Indexes を参照してください。

python
# 3.3. Prepare index parameters
index_params = client.prepare_index_params()

# 3.4. Add indexes
index_params.add_index(
field_name="my_id",
index_type="AUTOINDEX"
)

index_params.add_index(
field_name="my_vector",
index_type="AUTOINDEX",
metric_type="COSINE"
)

コレクションの作成​

インデックスパラメータを指定してコレクションを作成した場合、Zilliz Cloud はその作成時にコレクションを自動的にロードします。この場合、インデックスパラメータに記載されたすべてのフィールドにインデックスが作成されます。

以下のコードスニペットは、インデックスパラメータを指定してコレクションを作成し、そのロードステータスを確認する方法を示しています。

python
# 3.5. Create a collection with the index loaded simultaneously
client.create_collection(
collection_name="customized_setup_1",
schema=schema,
index_params=index_params
)

res = client.get_load_state(
collection_name="customized_setup_1"
)

print(res)

# Output
#
# {
# "state": "<LoadState: Loaded>"
# }

インデックスパラメータを指定せずにコレクションを作成し、後からパラメータを追加することもできます。この場合、Zilliz Cloud はその作成時にコレクションをロードしません。既存のコレクションにインデックスを作成する方法の詳細については、AUTOINDEX の解説 を参照してください。

以下のコードスニペットは、インデックスなしでコレクションを作成する方法を示しています。作成後、コレクションのロードステータスは未ロードのままです。

python
# 3.6. Create a collection and index it separately
client.create_collection(
collection_name="customized_setup_2",
schema=schema,
)

res = client.get_load_state(
collection_name="customized_setup_2"
)

print(res)

# Output
#
# {
# "state": "<LoadState: NotLoad>"
# }

コレクションプロパティの設定​

作成するコレクションには、サービスに適合させるためのプロパティを設定できます。適用可能なプロパティは次のとおりです。

シャード数の設定​

シャードはコレクションの水平方向のスライスであり、各シャードはデータ入力チャネルに対応します。デフォルトでは、すべてのコレクションに 1 つのシャードがあります。コレクションの作成時にシャード数を指定することで、データ量やワークロードにより適した構成にできます。

一般的なガイドラインとして、シャード数を設定する際は次の点を考慮してください。

  • データサイズ: 一般的な方法として、2 億エンティティごとに 1 つのシャードを設定します。総データサイズに基づいて見積もることもでき、たとえば挿入予定のデータ 100 GB ごとに 1 つのシャードを追加します。

以下のコードスニペットは、コレクションの作成時にシャード数を設定する方法を示しています。

python
# With shard number
client.create_collection(
collection_name="customized_setup_3",
schema=schema,
num_shards=1
)

mmap の有効化​

Zilliz Cloud では、デフォルトですべてのコレクションで mmap が有効になっており、フィールドの生データを完全にロードする代わりに、Zilliz Cloud がそれをメモリにマップできるようになっています。これにより、メモリフットプリントが削減され、コレクションの容量が増加します。mmap の詳細については、mmap を使用する を参照してください。

python
# With mmap
client.create_collection(
collection_name="customized_setup_4",
schema=schema,
enable_mmap=False
)

コレクション TTL の設定​

コレクション内のデータを一定期間後に削除する必要がある場合は、Time-To-Live(TTL)を秒単位で設定することを検討してください。TTL がタイムアウトすると、Zilliz Cloud はコレクション内のエンティティを削除します。削除は非同期で行われるため、削除が完了するまでの間も検索とクエリを実行できます。

以下のコードスニペットでは、TTL を 1 日(86400 秒)に設定しています。TTL は最低でも数日に設定することを推奨します。

python
# With TTL
client.create_collection(
collection_name="customized_setup_5",
schema=schema,
properties={
"collection.ttl.seconds": 86400
}
)

整合性レベルの設定​

コレクションの作成時に、そのコレクション内の検索とクエリに対する整合性レベルを設定できます。特定の検索またはクエリの実行中に、コレクションの整合性レベルを変更することもできます。

python
# With consistency level
client.create_collection(
collection_name="customized_setup_6",
schema=schema,
# highlight-next
consistency_level="Bounded",
)

整合性レベルの詳細については、整合性レベル を参照してください。

動的フィールドの有効化​

コレクションの動的フィールドは、&#36;meta という名前の予約済み JavaScript Object Notation(JSON)フィールドです。このフィールドを有効にすると、Zilliz Cloud は各エンティティに含まれるスキーマ未定義のすべてのフィールドとその値を、キーと値のペアとしてこの予約済みフィールドに保存します。

動的フィールドの使用方法の詳細については、Dynamic Field を参照してください。