メインコンテンツまでスキップ

ランダムサンプリング

大規模データセットを扱う際、インサイトを得たりフィルタリングロジックをテストしたりするために、必ずしもすべてのデータを処理する必要はありません。ランダムサンプリングは、データの統計的に代表性のあるサブセットを使用できるようにすることで、この課題に対する解決策を提供し、クエリ時間とリソース消費を大幅に削減します。

ランダムサンプリングはセグメントレベルで動作し、コレクションのデータ分布全体にわたってサンプルのランダム性を維持しながら、高いパフォーマンスを確保します。

主なユースケース:

  • データ探索: 最小限のリソース使用でコレクションの構造と内容をすばやくプレビュー

  • 開発テスト: 本番デプロイ前に、扱いやすいデータサンプルで複雑なフィルタリングロジックをテスト

  • リソース最適化: 探索的クエリや統計分析の計算コストを削減

構文

python
filter = "RANDOM_SAMPLE(sampling_factor)"

パラメータ:

  • sampling_factor: 境界値を含まない (0, 1) の範囲のサンプリング係数です。たとえば、RANDOM_SAMPLE(0.001) は結果のおよそ 0.1% を選択します。

重要なルール:

  • この式は大文字と小文字を区別しません(RANDOM_SAMPLE または random_sample

  • サンプリング係数は、境界値を含まない (0, 1) の範囲でなければなりません

他のフィルタとの組み合わせ

ランダムサンプリング演算子は、論理 AND を使用して他のフィルタリング式と組み合わせる必要があります。フィルタを組み合わせる場合、Milvus はまず他の条件を適用し、その後で結果セットに対してランダムサンプリングを実行します。

python
# Correct: Filter first, then sample
filter = 'color == "red" AND RANDOM_SAMPLE(0.001)'
# Processing: Find all red items → Sample 0.1% of those red items

# Incorrect: OR doesn't make logical sense
filter = 'color == "red" OR RANDOM_SAMPLE(0.001)' # ❌ Invalid logic
# This would mean: "Either red items OR sample everything" - which is meaningless

例 1: データ探索

コレクションの構造をすばやくプレビューします。

python
from pymilvus import MilvusClient

client = MilvusClient(uri="YOUR_CLUSTER_ENDPOINT")

# Sample approximately 1% of the entire collection
result = client.query(
collection_name="product_catalog",
filter="RANDOM_SAMPLE(0.01)",
output_fields=["id", "product_name"],
limit=10
)

print(f"Sampled {len(result)} products from collection")

例 2: ランダムサンプリングを使用した複合フィルタリング

扱いやすいサブセットでフィルタリングロジックをテストします。

python
# First filter by category and price, then sample 0.5% of results
filter_expression = 'category == "electronics" AND price > 100 AND RANDOM_SAMPLE(0.005)'

result = client.query(
collection_name="product_catalog",
filter=filter_expression,
output_fields=["product_name", "price", "rating"],
limit=10
)

print(f"Found {len(result)} electronics products in sample")

例 3: クイック分析

フィルタリングされたデータに対して高速な統計分析を実行します。

python
# Get insights from ~0.1% of premium customer data
filter_expression = 'customer_tier == "premium" AND region == 'North America' AND RANDOM_SAMPLE(0.001)'

result = client.query(
collection_name="customer_profiles",
filter=filter_expression,
output_fields=["purchase_amount", "satisfaction_score", "last_purchase_date"],
limit=10
)

# Analyze sample for quick insights
if result:
average_purchase = sum(r["purchase_amount"] for r in result) / len(result)
average_satisfaction = sum(r["satisfaction_score"] for r in result) / len(result)

print(f"Sample size: {len(result)}")
print(f"Average purchase amount: ${average_purchase:.2f}")
print(f"Average satisfaction score: {average_satisfaction:.2f}")

フィルタリングされた検索シナリオでランダムサンプリングを使用します。

python
# Search for similar products within a sampled subset
search_results = client.search(
collection_name="product_catalog",
data=[[0.1, 0.2, 0.3, 0.4, 0.5]], # query vector
filter='category == "books" AND RANDOM_SAMPLE(0.01)',
search_params={"params": {}},
output_fields=["title", "author", "price"],
limit=10
)

print(f"Found {len(search_results[0])} similar books in sample")

ベストプラクティス

  • 小さく始める: 初期の探索では、小さいサンプリング係数(0.001-0.01)から始めます

  • 開発ワークフロー: 開発中はサンプリングを使用し、本番クエリでは削除します

  • 統計的妥当性: より大きなサンプルほど、より正確な統計表現を提供します

  • パフォーマンステスト: クエリパフォーマンスを監視し、必要に応じてサンプリング係数を調整します

Ctrl I