メインコンテンツまでスキップ

NumPy ファイルからインポート

.npy 形式は、単一の配列を保存するための NumPy の標準バイナリ形式 であり、その shape および dtype 情報を含むため、異なるマシン間でも正しく再構築できます。生データを Parquet ファイルに準備するには、BulkWriter tool の使用を推奨します。次の図は、生データを .npy ファイル一式にどのようにマッピングできるかを示しています。

🚧注意

この機能は非推奨になりました。本番環境での使用は推奨されません。

numpy_file_structure

📘
  • AutoID を有効にするかどうか

    id フィールドは collection の主フィールドとして機能します。主フィールドを自動インクリメントにするには、スキーマで AutoID を有効にします。この場合、ソースデータの各行から id フィールドを除外する必要があります。

  • 動的フィールドを有効にするかどうか

    対象 collection で動的フィールドが有効になっている場合、事前定義されたスキーマに含まれていないフィールドを保存する必要があるときは、書き込み操作中に $meta 列を指定し、対応するキーと値のデータを提供できます。

  • 大文字と小文字を区別

    辞書キーと collection のフィールド名では大文字と小文字が区別されます。データ内の辞書キーが、対象 collection のフィールド名と完全に一致していることを確認してください。対象 collection に id というフィールドがある場合、各エンティティ辞書には id. という名前のキーが必要です。IDId を使用するとエラーになります。

ディレクトリ構造

データを NumPy ファイルとして準備するには、同じサブセットのすべてのファイルを 1 つのフォルダに配置し、その後、以下のツリー図のようにそれらのフォルダをソースフォルダ内にまとめます。

bash
├── numpy-folders
│ ├── 1
│ │ ├── id.npy
│ │ ├── vector.npy
│ │ ├── scalar_1.npy
│ │ ├── scalar_2.npy
│ │ └── $meta.npy
│ └── 2
│ ├── id.npy
│ ├── vector.npy
│ ├── scalar_1.npy
│ ├── scalar_2.npy
│ └── $meta.npy

データをインポート

データの準備ができたら、以下のいずれかの方法を使用して Zilliz Cloud collection にインポートできます。

📘

ファイルが比較的小さい場合は、フォルダまたは複数パス方式を使用して一度にすべてをインポートすることを推奨します。この方法により、インポートプロセス中に内部最適化が行われ、後続のリソース消費を抑えるのに役立ちます。

Zilliz Cloud コンソールまたは Milvus SDKs を使用してデータをインポートすることもできます。詳細については、データのインポート(コンソール) および データのインポート(SDK) を参照してください。

複数のパスからファイルをインポートする場合は、各 NumPy ファイルフォルダのパスを個別のリストに含め、その後、以下のコード例のようにそれらすべてのリストを上位レベルのリストにまとめます。

bash
curl --request POST \
--url "https://api.cloud.zilliz.com/v2/vectordb/jobs/import/create" \
--header "Authorization: Bearer ${TOKEN}" \
--header "Accept: application/json" \
--header "Content-Type: application/json" \
-d '{
"clusterId": "inxx-xxxxxxxxxxxxxxx",
"collectionName": "medium_articles",
"partitionName": "",
"objectUrls": [
["s3://bucket-name/numpy-folder-1/1/"],
["s3://bucket-name/numpy-folder-2/1/"],
["s3://bucket-name/numpy-folder-3/1/"]
],
"accessKey": "",
"secretKey": ""
}'

NumPy ファイルフォルダからファイルをインポート

ソースフォルダにインポート対象の NumPy ファイルフォルダしか含まれていない場合は、以下のようにリクエストにそのソースフォルダを含めるだけでかまいません。

bash
curl --request POST \
--url "https://api.cloud.zilliz.com/v2/vectordb/jobs/import/create" \
--header "Authorization: Bearer ${TOKEN}" \
--header "Accept: application/json" \
--header "Content-Type: application/json" \
-d '{
"clusterId": "inxx-xxxxxxxxxxxxxxx",
"collectionName": "medium_articles",
"partitionName": "",
"objectUrls": [
["s3://bucket-name/numpy-folder/1/"]
],
"accessKey": "",
"secretKey": ""
}'
📘

フォルダに複数形式のファイルが含まれている場合、リクエストは失敗します。

ストレージパス

Zilliz Cloud は、クラウドストレージからのデータインポートをサポートしています。以下の表は、データファイルに使用できるストレージパスの例を示しています。

クラウド簡単な例
AWS S3s3://bucket-name/numpy-folder/
Google Cloud Storagegs://bucket-name/numpy-folder/
Azure Bolbhttps://myaccount.blob.core.windows.net/bucket-name/numpy-folder/

制限

クラウドストレージから NumPy ファイルでデータをインポートする際には、いくつか守るべき制限があります。

📘

有効な NumPy ファイル一式は、対象 collection のスキーマ内のフィールド名に従って命名されている必要があり、そこに含まれるデータは対応するフィールド定義と一致している必要があります。

インポート方法

インポートあたりの最大サブディレクトリ数

サブディレクトリあたりの最大サイズ

インポート総サイズの上限

ローカルファイルから

サポートされていません

オブジェクトストレージから

1,000 サブディレクトリ

10 GB

1 TB

データファイルの準備 を参照して自分でデータを再構築するか、BulkWriter tool を使用してソースデータファイルを生成できます。上図のスキーマに基づいて準備されたサンプルデータをダウンロードするには、ここをクリックしてください

Ctrl I