メインコンテンツまでスキップ

中国語

chinese analyzer は中国語テキストを処理するために特別に設計されており、効果的なセグメンテーションとトークン化を提供します。

定義​

chinese analyzer は次のコンポーネントで構成されています。

  • Tokenizer: jieba tokenizer を使用して、語彙と文脈に基づいて中国語テキストをトークンに分割します。詳細については、Jieba を参照してください。

  • Filter: cnalphanumonly filter を使用して、中国語以外の文字を含むトークンを削除します。詳細については、Cnalphanumonly を参照してください。

chinese analyzer の機能は、次のカスタム analyzer 設定と同等です。

Notes

組み込みの chinese analyzer は Pinyin トークンを出力しません。中国語テキストを Pinyin クエリ用語と一致させるには、jieba tokenizer と Pinyin filter を使用したカスタム analyzer を使用してください。

python
analyzer_params = {
"tokenizer": "jieba",
"filter": ["cnalphanumonly"]
}

設定​

フィールドに chinese analyzer を適用するには、analyzer_params の type を chinese に設定するだけです。

python
analyzer_params = {
"type": "chinese",
}
Notes

chinese analyzer はオプションのパラメーターを受け付けません。

例​

analyzer 設定をコレクションスキーマに適用する前に、run_analyzer メソッドを使用してその動作を確認してください。

Analyzer 設定​

python
analyzer_params = {
"type": "chinese",
}

run_analyzer を使用した検証​

python
from pymilvus import (
MilvusClient,
)

client = MilvusClient(
uri="YOUR_CLUSTER_ENDPOINT",
token="YOUR_CLUSTER_TOKEN"
)

# Sample text to analyze
sample_text = "Milvus 是一个高性能、可扩展的向量数据库!"

# Run the standard analyzer with the defined configuration
result = client.run_analyzer(sample_text, analyzer_params)
print("English analyzer output:", result)

期待される出力​

python
Chinese analyzer output: ['Milvus', '是', '一个', '高性', '性能', '高性能', '可', '扩展', '的', '向量', '数据', '据库', '数据库']