Language Identifier
language_identifier は、言語分析プロセスを自動化することで Zilliz Cloud のテキスト検索機能を強化するために設計された専用のトークナイザーです。主な機能は、テキストフィールドの言語を検出し、その言語に最も適した事前設定済みのアナライザーを動的に適用することです。これは、さまざまな言語を扱うアプリケーションにとって特に有用であり、入力ごとに手動で言語を割り当てる必要をなくします。
テキストデータを適切な処理パイプラインへインテリジェントに振り分けることで、language_identifier は多言語データの取り込みを効率化し、その後の検索および取得処理に向けた正確なトークン化を実現します。
言語検出ワークフロー
language_identifier は、テキスト文字列を処理するために一連のステップを実行します。このワークフローは、正しく設定する方法を理解するうえで重要です。

-
入力: ワークフローは、入力としてテキスト文字列から開始します。
-
言語検出: この文字列はまず言語検出エンジンに渡され、言語の識別が試みられます。Zilliz Cloud は
whatlangとlinguaの 2 つのエンジンをサポートしています。 -
アナライザーの選択:
-
成功: 言語が正常に検出された場合、システムは検出された言語名に対応するアナライザーが
analyzers辞書内に設定されているかを確認します。一致が見つかると、システムは指定されたアナライザーを入力テキストに適用します。たとえば、"Mandarin" と検出されたテキストはjiebaトークナイザーにルーティングされます。 -
フォールバック: 検出に失敗した場合、または言語の検出には成功したもののその言語向けの特定のアナライザーを設定していない場合、システムは事前設定された
defaultアナライザー を使用します。これは重要な補足点です。defaultアナライザーは、検出失敗時と一致するアナライザーが存在しない場合の両方に対するフォールバックです。
-
適切なアナライザーが選択された後、テキストはトークン化および処理され、ワークフローが完了します。
利用可能な言語検出エンジン
Zilliz Cloud では、2 つの言語検出エンジンから選択できます。
選択は、アプリケーションに求められる具体的な性能と精度の要件によって決まります。
| エンジン | 速度 | 精度 | 出力形式 | 最適な用途 |
|---|---|---|---|---|
whatlang | 高速 | ほとんどの言語で良好 | 言語名(例: "English", "Mandarin", "Japanese")参考: サポートされる言語テーブルの Language 列 | 速度が重要なリアルタイムアプリケーション |
lingua | 低速 | より高精度、特に短いテキストで有効 | 英語の言語名(例: "English", "Chinese", "Japanese")参考: サポート言語一覧 | 速度よりも精度が重要なアプリケーション |
重要な考慮点は、エンジンの命名規則です。両エンジンとも英語の言語名を返しますが、一部の言語では異なる用語を使用します(例: whatlang は Mandarin を返し、lingua は Chinese を返します)。アナライザーのキーは、選択した検出エンジンが返す名前と完全に一致している必要があります。
設定
language_identifier トークナイザーを正しく使用するには、その設定を定義して適用するために次の手順を実行する必要があります。
ステップ 1: 使用する言語とアナライザーを選択する
language_identifier の設定の中核は、サポートする予定の言語に合わせてアナライザーを調整することです。システムは検出された言語を正しいアナライザーと照合して動作するため、このステップは正確なテキスト処理に不可欠です。
以下は、言語と適切な Zilliz Cloud アナライザーの推奨マッピングです。この表は、言語検出エンジンの出力と、目的に最適なツールとをつなぐためのものです。
| 言語(検出エンジンの出力) | 推奨アナライザー | 説明 |
|---|---|---|
English | type: english | ステミングとストップワードフィルタリングを備えた標準的な英語トークン化。 |
Mandarin (via whatlang) or Chinese (via lingua) | tokenizer: jieba | スペースで区切られないテキストに対する中国語の単語分割。 |
Japanese | tokenizer: icu | 日本語を含む複雑な文字体系に対応する堅牢なトークナイザー。 |
French | type: standard, filter: ["lowercase", "asciifolding"] | フランス語のアクセントや文字を処理するカスタム設定。 |
-
一致が重要: アナライザーの名前は、検出エンジンの出力と完全に一致していなければなりません。たとえば、
whatlangを使用している場合、中国語テキスト用のキーはMandarinである必要があります。 -
ベストプラクティス: 上記の表は、いくつかの一般的な言語に対する推奨設定を示していますが、網羅的な一覧ではありません。アナライザーの選び方に関するより包括的なガイドについては、ユースケースに適したアナライザーの選択 を参照してください。
-
検出エンジンの出力: 検出エンジンが返す言語名の完全な一覧については、Whatlang supported languages table および Lingua supported languages list を参照してください。
ステップ 2: analyzer_params を定義する
Zilliz Cloud で language_identifier トークナイザーを使用するには、以下の主要コンポーネントを含む辞書を作成します。
必須コンポーネント:
-
analyzers設定セット – すべてのアナライザー設定を含む辞書で、次を含める必要があります。-
default– 言語検出に失敗した場合、または一致するアナライザーが見つからない場合に使用されるフォールバックアナライザー -
言語固有のアナライザー – それぞれ
<analyzer_name>: <analyzer_config>として定義されます。ここで:-
analyzer_nameは、選択した検出エンジンの出力と一致します(例:"English","Japanese") -
analyzer_configは標準のアナライザーパラメータ形式に従います(アナライザーの概要 を参照)
-
-
オプションコンポーネント:
-
identifier– 使用する言語検出エンジンを指定します(whatlangまたはlingua)。指定しない場合のデフォルトはwhatlangです -
mapping– アナライザーのカスタムエイリアスを作成し、検出エンジンの厳密な出力形式の代わりに説明的な名前を使用できるようにします
このトークナイザーは、まず入力テキストの言語を検出し、その後設定から適切なアナライザーを選択して動作します。検出に失敗した場合、または一致するアナライザーが存在しない場合は、自動的に default アナライザーにフォールバックします。
推奨: 名前を直接一致させる
アナライザー名は、選択した言語検出エンジンの出力と正確に一致させるべきです。この方法はよりシンプルで、混乱の可能性を避けられます。
whatlang と lingua の両方について、それぞれのドキュメントに記載されている言語名を使用してください。
-
whatlang supported languages("Language" 列を使用)
analyzer_params = {
"tokenizer": {
"type": "language_identifier", # Must be `language_identifier`
"identifier": "whatlang", # or `lingua`
"analyzers": { # A set of analyzer configs
"default": {
"tokenizer": "standard" # fallback if language detection fails
},
"English": { # Analyzer name that matches whatlang output
"type": "english"
},
"Mandarin": { # Analyzer name that matches whatlang output
"tokenizer": "jieba"
}
}
}
}
代替アプローチ: mapping を使用したカスタム名
カスタムアナライザー名を使用したい場合や、既存の設定との互換性を維持する必要がある場合は、mapping パラメータを使用できます。これによりアナライザーのエイリアスが作成され、元の検出エンジン名とカスタム名の両方が機能するようになります。
analyzer_params = {
"tokenizer": {
"type": "language_identifier",
"identifier": "lingua",
"analyzers": {
"default": {
"tokenizer": "standard"
},
"english_analyzer": { # Custom analyzer name
"type": "english"
},
"chinese_analyzer": { # Custom analyzer name
"tokenizer": "jieba"
}
},
"mapping": {
"English": "english_analyzer", # Maps detection output to custom name
"Chinese": "chinese_analyzer"
}
}
}
analyzer_params を定義した後、コレクションスキーマを定義する際にそれらを VARCHAR フィールドへ適用できます。これにより Zilliz Cloud は、そのフィールド内のテキストを指定されたアナライザーで処理し、効率的なトークン化とフィルタリングを実現できます。詳細については、使用例 を参照してください。
例
以下は、一般的なシナリオ向けのすぐに使える設定例です。各例には設定と検証用コードの両方が含まれているため、すぐにセットアップをテストできます。
英語と中国語の検出
from pymilvus import MilvusClient
# Configuration
analyzer_params = {
"tokenizer": {
"type": "language_identifier",
"identifier": "whatlang",
"analyzers": {
"default": {"tokenizer": "standard"},
"English": {"type": "english"},
"Mandarin": {"tokenizer": "jieba"}
}
}
}
# Test the configuration
client = MilvusClient(
uri="YOUR_CLUSTER_ENDPOINT",
token="YOUR_CLUSTER_TOKEN"
)
# English text
result_en = client.run_analyzer("The Milvus vector database is built for scale!", analyzer_params)
print("English:", result_en)
# Output:
# English: ['The', 'Milvus', 'vector', 'database', 'is', 'built', 'for', 'scale']
# Chinese text
result_cn = client.run_analyzer("Milvus向量数据库专为大规模应用而设计", analyzer_params)
print("Chinese:", result_cn)
# Output:
# Chinese: ['Milvus', '向量', '数据', '据库', '数据库', '专', '为', '大规', '规模', '大规模', '应用', '而', '设计']
アクセント正規化を伴うヨーロッパ言語
# Configuration for French, German, Spanish, etc.
analyzer_params = {
"tokenizer": {
"type": "language_identifier",
"identifier": "lingua",
"analyzers": {
"default": {"tokenizer": "standard"},
"English": {"type": "english"},
"French": {
"tokenizer": "standard",
"filter": ["lowercase", "asciifolding"]
}
}
}
}
# Test with accented text
result_fr = client.run_analyzer("Café français très délicieux", analyzer_params)
print("French:", result_fr)
# Output:
# French: ['cafe', 'francais', 'tres', 'delicieux']
使用上の注意
-
フィールドごとに単一言語: これは、フィールドを単一で均質なテキスト単位として扱います。たとえば、あるレコードには英語の文が含まれ、次のレコードにはフランス語の文が含まれるといったように、異なるデータレコード間で異なる言語を扱うよう設計されています。
-
言語が混在する文字列には非対応: これは、複数の言語を含む単一の文字列を処理するようには設計されていません。たとえば、英語の文と引用された日本語のフレーズの両方を含む単一の
VARCHARフィールドは、単一言語として処理されます。 -
支配的な言語の処理: 混在言語のシナリオでは、検出エンジンは支配的な言語を識別する可能性が高く、対応するアナライザーがテキスト全体に適用されます。その結果、埋め込まれた外国語テキストに対してはトークン化の品質が低下するか、まったく行われない可能性があります。