メインコンテンツまでスキップ

Cncharonly

cncharonly フィルターは、中国語以外の文字を含むトークンを削除します。このフィルターは、中国語テキストのみに焦点を当て、他の文字体系、数字、記号を含むトークンを除外したい場合に役立ちます。

Configuration

cncharonly フィルターは Zilliz Cloud に組み込まれています。これを使用するには、analyzer_params 内の filter セクションでその名前を指定するだけです。

python
analyzer_params = {
"tokenizer": "jieba",
"filter": ["cncharonly"],
}

cncharonly フィルターは tokenizer によって生成された用語に対して動作するため、tokenizer と組み合わせて使用する必要があります。Zilliz Cloud で利用可能な tokenizer の一覧については、Jieba およびその関連ページを参照してください。

analyzer_params を定義した後、collection schema の定義時にそれらを VARCHAR フィールドへ適用できます。これにより Zilliz Cloud は、指定された analyzer を使用してそのフィールド内のテキストを処理し、効率的な tokenization とフィルタリングを行えます。詳細については、使用例 を参照してください。

Examples

analyzer 設定を collection schema に適用する前に、run_analyzer メソッドを使用してその動作を確認してください。

Analyzer configuration

python
analyzer_params = {
"tokenizer": "jieba",
"filter": ["cncharonly"],
}

Verification using run_analyzer

python
from pymilvus import (
MilvusClient,
)

client = MilvusClient(uri="YOUR_CLUSTER_ENDPOINT")

# Sample text to analyze
sample_text = "Milvus 是 LF AI & Data Foundation 下的一个开源项目,以 Apache 2.0 许可发布。"

# Run the jieba tokenizer with the defined configuration
result = client.run_analyzer(sample_text, analyzer_params)
print("Analyzer output:", result)

Expected output

python
['是', '下的一个开源项目', '以', '许可发布']