メインコンテンツまでスキップ

データレジリエンス

Zilliz Cloud は、フルマネージドのベクトルデータベースサービスとして、エンタープライズグレードの**高可用性(HA)災害復旧(DR)**機能を提供し、さまざまな障害シナリオ下でミッションクリティカルなデータとサービスの継続的な可用性を確保します。

コア機能

  • 高可用性(HA): 自動障害検出と迅速なフェイルオーバーの仕組みにより、ノード、アベイラビリティゾーン(AZ)、またはリージョンレベルの停止時にもサービス運用を継続できます。

  • 災害復旧(DR): 包括的なバックアップおよびリストア戦略により、大規模インシデント後の迅速な事業復旧を可能にします。

  • 柔軟なレジリエンス階層: Standard からエンタープライズグレードのクロスリージョンデプロイメントまで、ビジネスシナリオごとの多様な RPO/RTO 要件を満たすように調整できます。

  • コスト最適化: ビジネス価値とリスク許容度に基づいて、最も費用対効果の高いレジリエンス戦略を選択できます。

主要概念

コア指標

  • 目標復旧時点(RPO): 許容可能な最大データ損失を時間で表したものです。たとえば、RPO が 5 分の場合、障害発生時に直近最大 5 分間のデータが失われる可能性があることを意味します。

  • 目標復旧時間(RTO): 障害発生からサービスの完全復旧までに許容される最大時間であり、障害検出、フェイルオーバー判断、実際の復旧を含みます。

  • サービスレベル契約(Uptime SLA): Zilliz Cloud のサービス可用性に関するコミットメントは通常、割合で表されます(たとえば、99.95% の稼働率は、毎月のダウンタイムが 21.6 分以下であることを意味します)。

耐障害性の範囲

  • ノードレベルの耐障害性: 単一のコンピューティングノードまたはストレージノードの障害

  • AZ レベルの耐障害性: AZ 全体の停止(例:データセンター障害)

  • リージョンレベルの耐障害性: リージョン全体のサービス中断(例:自然災害)

  • クラウドプロバイダーレベルの耐障害性: 単一のクラウドベンダーに起因するリスクを軽減するためのマルチクラウドデプロイメント

レジリエンスアーキテクチャ階層

高可用性(HA)階層

階層説明RPORTO書き込みレイテンシ / レプリケーション方式耐障害性SLA相対コスト
Standardマルチレプリカメカニズムを備えた単一リージョン、単一 AZ デプロイメント0 秒≤1 分単一 AZ 内で書き込み。WAL は Quorum によりレプリケートノードレベルの障害
AZs: 1
Regions: 1
SLA 保証なし
Enterprise3 つの AZ にまたがる単一リージョンデプロイメント、自動フェイルオーバー対応0 秒≤1 分クロス AZ 書き込み。WAL は Quorum によりレプリケートAZ レベルの障害
AZs: 3
Regions: 1
99.95%
Enterprise Multi-Replicaリージョン内のアクティブ-アクティブのマルチレプリカアーキテクチャ。高速フェイルオーバーを備えた読み取り/書き込み分離0 秒≤10 秒クロス AZ 書き込み。レプリカ間同期は WAL 経由AZ レベルの障害
AZs: 3
Regions: 1
99.99%中〜高
Cross-Region HAグローバルロードバランシングを備えたマルチリージョン/マルチクラウドデプロイメント≤10 秒手動または自動フェイルオーバー:
自動:≤3 分
AZ 間の同期書き込み。他のリージョン/クラウドへの非同期レプリケーションリージョンレベルの障害
AZs: ≥3
Regions: ≥2
99.99%
📘Notes

Cross-region HA は 2025 年 11 月に利用可能になる予定です。

災害復旧(DR)階層

階層説明RPOリストア速度バックアップ戦略ユースケース追加コスト
Local Backup同一リージョンのオブジェクトストレージ。スケジュールされたフルバックアップ1 時間ごと数分〜数時間フルバックアップ誤削除、論理エラーからの復旧
Cross-Region Backup異なるリージョンに保存されたバックアップデータ。地域災害から保護1 時間ごと数分〜数時間リージョン/クラウド間でレプリケートされたフルバックアップ地域災害、コンプライアンス要件

クイック選択ガイド

ビジネス階層化とレジリエンス推奨事項

Tier 1 – ミッションクリティカルなワークロード

  • 特徴: 24/7 運用。数分のダウンタイムでも大きな損失が発生。ビジネス価値が非常に高い

  • 推奨: Cross-region HA + Enterprise Multi-Replica + Continuous Data Protection

  • 目標: RPO = 0s、RTO < 30s、クロスクラウド/クロスリージョン DR

  • 想定コスト:

Tier 2 – 重要なビジネスシステム

  • 特徴: 24/7 運用。高い安定性要件

  • 推奨: Enterprise Multi-Replica + Cross-region Backup

  • 目標: RPO = 0s、RTO < 30s

  • 想定コスト: 中〜高

Tier 3 – 一般的なアプリケーション

  • 特徴: 営業時間中に稼働。コスト重視。一定の復旧時間を許容

  • 推奨: Enterprise + Local Backup

  • 目標: RPO = 0s、RTO < 3 分

  • 想定コスト: 低〜中

Tier 4 – 非クリティカルなワークロード

  • 特徴: 必須ではないシステム。コスト重視。計画メンテナンスウィンドウを許容

  • 推奨: Standard + Local Backup

  • 目標: RPO = 0s、RTO < 3 分

  • 想定コスト: 低〜中

コスト最適化の判断マトリクス

ビジネス影響データ価値コンプライアンス要件推奨ソリューションコストレベル
非常に高い非常に高い厳格Cross-region HA + Full DR
高い高い中程度Enterprise Multi-Replica + Cross-region Backup中〜高
中程度中程度基本Enterprise + Local Backup
低い低いなしStandard + Basic Backup

よくある質問(FAQ)

Q1: Standard および Enterprise プランはどのように高可用性を実現しますか?

アーキテクチャ設計

Zilliz Cloud は、3 つのデータタイプを持つコンピューティングとストレージを分離したアーキテクチャを使用します。

  • Metadata: etcd に保存(3 レプリカ、RAFT プロトコル)

  • Log Data: 独自の Woodpecker に保存(Quorum プロトコル)

  • Raw & Index Data: オブジェクトストレージに保存され、クラウドストレージのネイティブ HA を継承

Compute Node HA

  • Kubernetes による自動スケジューリングで管理

  • 単一ノードまたは単一 AZ の障害時に Pod が自動的に再起動

  • Coordinator がセグメントを他の QueryNodes に再割り当て

  • インデックスとデータはストレージから再ロードされ、復旧時間は 1 分未満

コスト最適化

  • 複数の永続レプリカ + 動的なインメモリロードを使用

    • 複数のインメモリレプリカを維持することによるコスト急増を回避

    • DR アーキテクチャを簡素化

    • ログおよびオブジェクトストレージの帯域幅を活用して復旧を高速化

Q2: マルチレプリカメカニズムはどのように機能しますか?

コアメカニズム

  • Shard レベル: 複数の StreamNodes が primary/standby ロールで同じシャードをロード

  • Segment レベル: 複数の QueryNodes が同じセグメントをロード。データは単一コピーとして永続化

読み取り/書き込み分離

  • 書き込み: primary StreamNode が処理

  • 読み取り: 任意の standby StreamNode または QueryNode が提供

主なメリット

  • 高速フェイルオーバー: Proxy がトラフィックを standby nodes に自動的にリダイレクト

  • より高い QPS: 複数のインメモリレプリカにより読み取りスループットが向上

  • スムーズなアップグレード: ローリングアップデートによりサービスのジッターを低減し、安定性を向上

Q3: Global Database はどのようにクロスリージョン高可用性を実現しますか?

CDC 同期

  • Change Data Capture (CDC) が DDL、DML、bulk import 操作を同期

  • 一般的な同期レイテンシは 10 秒未満

  • 非常に低い RPO でクロスリージョン/クロスクラウド DR を実現

データ書き込み戦略

  • データは同一リージョン内の複数 AZ に同期的に書き込まれる

  • 書き込みレイテンシは AZ 間のレベル

  • 極端なフェイルオーバーシナリオでは、データ損失は 10 秒未満

📘Notes:

2026 年のロードマップ: cross-region Woodpecker により RPO = 0 を実現

フェイルオーバーモード

  • 手動: OpenAPI または Web Console 経由

  • 自動: Zilliz ヘルスチェックサービスが障害を検出し、1〜3 分でフェイルオーバーを完了

アクセスパターン

モード特徴ユースケース
Active-Standby DRPrimary が読み取り/書き込みを処理。standby はフェイルオーバー時のみアクティブ化標準的な災害復旧
Active-Active (Multi-Read)Primary が書き込み。複数のリージョンが読み取りを提供(最寄りリージョンでの読み取り)グローバルな読み取り中心、低書き込みワークロード
Multi-Primary (2026 年提供予定)両方のリージョンが書き込みを受け付ける。ユーザーはデータ競合を回避する必要があるセルベースまたはシャーディングされたデプロイメント

最新の機能アップデートまたは技術サポートについては、Zilliz Cloud サポートにお問い合わせください。

Ctrl I