なぜAIはあなたの言語でうまく機能しないのか
AIの英語以外の言語における性能差は、言語の難しさではなく、学習データの割合、トークナイザーの効率、命令チューニングのカバレッジの3つの要因によるものです。そのうち2つは修正可能であり、トークナイザーの非効率性により非英語の使用コストが3~4倍高くなっています。
人工知能が英語以外の言語でうまく機能しない理由は、長らく言語自体の複雑さに帰せられてきましたが、実際にはもっと単純で修正可能な問題です。性能低下の主な原因は3つあります。学習データにおけるその言語の割合、トークナイザーがその文字を処理する効率、そして命令チューニングがその言語をカバーしているかどうかです。このうち2つはシステム構築時の偶然の結果であり、言語の特性ではなく、修正可能です。残る1つは、非英語の使用を3~4倍高コストにしています。
具体的な数字で見ると、企業向け検索タスクでは、同じ文書に対する英語以外のクエリの精度が最大29%低下します。これは、英語では10回中9回正答するシステムが、他の言語では6~7回しか正答しないことを意味します。最もリソースの少ない言語では、差はほぼ消えます。アメリカ先住民言語の評価では、3値分類タスクの精度が38%で、偶然の33%に近い値でした。モデルはこれらの言語でほぼ当てずっぽうに近い性能です。
ほとんどの言語はこの両極端の間に位置します。性能はリソースの利用可能性に比例し、リソースの利用可能性は公開ウェブ上のテキスト量に依存します。これは富裕層や植民地の歴史と相関し、話者人口とは相関しません。ベンガル語はドイツ語より多くの話者がいるにもかかわらず、デジタルフットプリントははるかに小さいです。
見落とされがちなのは、多言語社会では、人々が話す言語と書く言語が異なることが多く、あるいは自国語をローマ字で書くため、標準的なコーパスが認識できないことです。デジタル記録は人々が実際に話す言語を系統的に過小評価し、モデルはその過小評価を継承します。
性能を予測する3つの要因のうち、言語の複雑さは含まれません。フィンランド語やトルコ語は形態的に複雑ですが、テキストが十分にあるため、モデルはそれらを適切に処理します。これは言語学のコスチュームをまとったデータ問題です。
トークナイザーの効率は最も理解されておらず、最も直接的にコストに影響します。モデルは文字を読まず、トークン(サブワード単位)を読みます。マージルールは主に英語のテキストから学習されるため、語彙は英語を効率的にエンコードし、他の言語は断片化されます。同じ意味の文でも、使用するトークン数が3~4倍になることがあります。非ラテン文字、膠着語、ローマ字化テキストが最も大きな影響を受けます。
コストは3方向で積み重なります。リクエストごとの支払い増加、有効なコンテキストウィンドウの縮小、そして性能自体の低下です。系統的な評価では、トークナイザーの品質が下流タスクの性能の強い予測因子であることが示されています。
それでもなお、言語横断的な性能は驚くほど良好です。モデルは部分的に共有された表現空間を発展させます。異なる言語で意味的に同等な文がモデル内部の類似した領域に集まります。実用的な教訓として、英語でプロンプトし、目的の言語で出力を要求する方が、目的言語で直接プロンプトするよりも効果的な場合が多いです。
失敗は特定の領域に集中します。文化的・地域的知識の欠如、推論タスクでの大きなギャップ(知識よりも内部推論が英語に偏っているため)、流暢だが不正確な出力、安全ガードレールの不完全な転移などです。
評価問題がすべての主張の背後にあります。多言語ベンチマークのほとんどは英語から翻訳されており、モデルが言語を処理できるかどうかのみをテストし、その言語が話される世界についての知識はテストできません。結果として、モデルは翻訳ベンチマークでそこそこのスコアを獲得しながら、その言語の文脈については無知であるという系統的な盲点が生じます。