NumPy ファイルからインポート
.npy 形式は、単一の配列を保存するための NumPy の標準バイナリ形式 であり、その shape と dtype 情報を含むため、異なるマシン上でも正しく再構築できます。 生データを Parquet ファイルに準備するには、BulkWriter ツール の使用を推奨します。以下の図は、生データを一連の .npy ファイルにどのようにマッピングできるかを示しています。
この機能は非推奨になりました。本番環境での使用は推奨されません。

-
AutoID を有効にするかどうか
id フィールドはコレクションのプライマリフィールドとして機能します。プライマリフィールドを自動インクリメントにするには、スキーマで AutoID を有効にできます。この場合、ソースデータの各行から id フィールドを除外する必要があります。
-
動的フィールドを有効にするかどうか
対象のコレクションで動的フィールドが有効になっている場合、事前定義されたスキーマに含まれていないフィールドを保存する必要があるときは、書き込み時に $meta 列を指定し、対応するキーと値のデータを提供できます。
-
大文字と小文字の区別
辞書のキーとコレクションのフィールド名は大文字と小文字を区別します。データ内の辞書キーが対象コレクションのフィールド名と完全に一致していることを確認してください。対象コレクションに id という名前のフィールドがある場合、各エンティティの辞書には id. という名前のキーが必要です。ID や Id を使用するとエラーになります。
ディレクトリ構造
データを NumPy ファイルとして準備するには、同じサブセットのすべてのファイルを 1 つのフォルダーに配置し、次に以下のツリー図に示すように、これらのフォルダーをソースフォルダー内にまとめます。
├── numpy-folders
│ ├── 1
│ │ ├── id.npy
│ │ ├── vector.npy
│ │ ├── scalar_1.npy
│ │ ├── scalar_2.npy
│ │ └── $meta.npy
│ └── 2
│ ├── id.npy
│ ├── vector.npy
│ ├── scalar_1.npy
│ ├── scalar_2.npy
│ └── $meta.npy
データのインポート
データの準備ができたら、以下のいずれかの方法を使用して、Zilliz Cloud のコレクションにインポートできます。
ファイルが比較的小さい場合は、フォルダーまたは複数パスの方法を使用して一度にすべてインポートすることを推奨します。この方法では、インポート処理中に内部最適化が可能になり、後続のリソース消費を抑えるのに役立ちます。
Milvus SDK を使用して Zilliz Cloud コンソール上でデータをインポートすることもできます。詳細については、データのインポート(コンソール) および データのインポート(SDK) を参照してください。
NumPy ファイルフォルダーのリストからファイルをインポート(推奨)
複数のパスからファイルをインポートする場合は、各 NumPy ファイルフォルダーのパスを個別のリストに含め、次に以下のコード例のように、すべてのリストを上位レベルのリストにまとめます。
curl --request POST \
--url "https://api.cloud.zilliz.com/v2/vectordb/jobs/import/create" \
--header "Authorization: Bearer ${TOKEN}" \
--header "Accept: application/json" \
--header "Content-Type: application/json" \
-d '{
"clusterId": "inxx-xxxxxxxxxxxxxxx",
"collectionName": "medium_articles",
"partitionName": "",
"objectUrls": [
["s3://bucket-name/numpy-folder-1/1/"],
["s3://bucket-name/numpy-folder-2/1/"],
["s3://bucket-name/numpy-folder-3/1/"]
],
"accessKey": "",
"secretKey": ""
}'
NumPy ファイルフォルダーからファイルをインポート
ソースフォルダーにインポート対象の NumPy ファイルフォルダーのみが含まれている場合は、以下のようにリクエストにそのソースフォルダーを含めるだけで済みます。
curl --request POST \
--url "https://api.cloud.zilliz.com/v2/vectordb/jobs/import/create" \
--header "Authorization: Bearer ${TOKEN}" \
--header "Accept: application/json" \
--header "Content-Type: application/json" \
-d '{
"clusterId": "inxx-xxxxxxxxxxxxxxx",
"collectionName": "medium_articles",
"partitionName": "",
"objectUrls": [
["s3://bucket-name/numpy-folder/1/"]
],
"accessKey": "",
"secretKey": ""
}'
フォルダーに複数形式のファイルが含まれている場合、リクエストは失敗します。
ストレージパス
Zilliz Cloud は、お使いのクラウドストレージからのデータインポートをサポートしています。以下の表に、データファイルで使用できるストレージパスを示します。
| Cloud | Quick Examples |
|---|---|
| AWS S3 | s3://bucket-name/numpy-folder/ |
| Google Cloud Storage | gs://bucket-name/numpy-folder/ |
| Azure Bolb | https://myaccount.blob.core.windows.net/bucket-name/numpy-folder/ |
制限事項
クラウドストレージから NumPy ファイルでデータをインポートする際には、守る必要がある制限がいくつかあります。
有効な NumPy ファイルのセットは、対象コレクションのスキーマ内のフィールドにちなんで命名する必要があり、それらのデータは対応するフィールド定義と一致している必要があります。
インポート方法 | クラスタープラン | インポートあたりの最大サブディレクトリ数 | サブディレクトリあたりの最大サイズ | インポートの最大合計サイズ |
|---|---|---|---|---|
ローカルファイルから | サポートされていません | |||
オブジェクトストレージから | Free | 1,000 サブディレクトリ | 1 GB | 1 GB |
Serverless & Dedicated | 1,000 サブディレクトリ | 10 GB | 1 TB | |
Prepare the data file を参照してデータを自分で再構築するか、BulkWriter ツール を使用してソースデータファイルを生成できます。上の図のスキーマに基づいて準備されたサンプルデータをダウンロードするには、ここをクリックしてください。