Spark PK 重複排除ジョブの作成 (V2)
この操作は、primary key に基づく重複排除ジョブを作成します。
https://api.cloud.zilliz.com
export BASE_URL="https://api.cloud.zilliz.com"
認証トークンには、適切な権限を持つ API key を使用してください。
作成リクエストを繰り返しても冪等となる一意のキーです。
プロジェクト ID。
ジョブの説明。
クラウドリージョン ID。
Spark ジョブのデータリソース (入力または出力) への参照。
データリソースの種類。
ボリューム名。
ボリューム内のデータパス。
データ形式。
書き込みモード。
データベース名。
コレクション名。
Spark ジョブのデータリソース (入力または出力) への参照。
データリソースの種類。
ボリューム名。
ボリューム内のデータパス。
データ形式。
書き込みモード。
データベース名。
コレクション名。
ジョブのリソースサイズ。
秒単位のタイムアウト。
primary key フィールド。
どの重複レコードを保持するか。
export TOKEN="YOUR_API_KEY"
export projectId="proj-xxxxxxxxxxxxxxxxxxxx"
curl --request POST \
--url "${BASE_URL}/v2/projects/${projectId}/jobs/dedup/pk" \
--header "Authorization: Bearer ${TOKEN}" \
--header "Idempotency-Key: spark-job-20260814-001" \
--header "Request-Timeout: 5" \
--header "Content-Type: application/json" \
-d '{
"description": "Daily vector processing job.",
"regionId": "aws-us-west-2",
"input": {
"type": "VOLUME",
"volumeName": "volume-xxxxxxxxxxxxxxxxxxx",
"path": "/input/data.parquet",
"format": "parquet"
},
"output": {
"type": "VOLUME",
"volumeName": "volume-xxxxxxxxxxxxxxxxxxx",
"path": "/output/results",
"format": "parquet",
"writeMode": "OVERWRITE"
},
"resourceSize": "medium",
"timeoutSeconds": 3600,
"primaryKeyField": "id",
"keepBy": "updated_at:max"
}'
作成された Spark ジョブを返します。
成功レスポンス。
レスポンスコード。
Spark バッチジョブの概要情報です。
コントロールプレーンのジョブ ID です。
ジョブが属するプロジェクトの ID。
ジョブタイプです。Sparkジョブの場合、値は SPARK です。
ジョブの説明。
Spark バッチジョブのステータスです。
Sparkジョブが実行されるクラウドリージョンです。
Sparkジョブに関連付けられた Zilliz Cloudクラスターです。
Sparkジョブが作成された時刻です。
Sparkジョブの実行が開始された時刻です。ジョブの開始前は、このフィールドが存在しない場合があります。
Sparkジョブが終了ステータスに達した時刻です。アクティブなジョブでは、このフィールドが存在しない場合があります。
経過実行時間(秒)です。アクティブなジョブの場合、この値は現在時刻までで計算されます。
失敗レスポンス。
レスポンスコード。
エラーメッセージ。
{
"code": 0,
"data": {
"jobId": "job-xxxxxxxxxxxxxxxxxx",
"sparkInstanceId": "sp-xxxxxxxxxxxxxxxxxx",
"type": "SPARK",
"jobName": "daily-vector-job",
"status": "PENDING",
"regionId": "aws-us-west-2",
"projectId": "proj-xxxxxxxxxxxxxxxxxxx"
}
}