ローカルLLM機械翻訳におけるプロンプトスコープとデモンストレーション類似性の評価
この研究では、ローカル大規模言語モデル(LLM)の機械翻訳において、プロンプトスコープとデモンストレーション選択を実験変数として調査する。3つのローカル命令チューニング済みLLMを専用MTベースラインと比較した結果、専用システムが特にゲルマン語派で依然として最も強力であることがわかった。少数ショットプロンプトは一部のモデルに有効だが、他のモデルには有害であり、ファミリースコーププロンプトは小規模モデルで構造化出力の失敗を露呈する。これらの結果は、言語ペアや指標だけでなく、プロンプトスコープ、検索戦略、マルチターゲット準拠も考慮したLLM翻訳の評価を促す。
大規模言語モデル(LLM)は汎用翻訳システムとしてますます使用されているが、その振る舞いは通常、1つのソース文を1つのターゲット言語に翻訳するという単一のプロンプト形状で評価される。しかし実際のユースケースでは、ユーザーは1つのターゲット言語、複数の関連言語を同時に、または例に基づく翻訳を要求する可能性がある。このような現実と評価のギャップを埋めるため、本研究ではローカルLLM機械翻訳におけるプロンプトスコープとデモンストレーション選択を実験変数として調査した。
本論文はMihael Arcanらによって2026年7月28日にarXivに提出された。研究者は英語からロマンス語派(フランス語、イタリア語、スペイン語など)およびゲルマン語派(ドイツ語、オランダ語、スウェーデン語など)への翻訳を、9つのEU公用語を含む完全なFLORES開発テストセットを用いて評価した。3つのローカル命令チューニング済みLLM(llama3.2:3b、mistral:latest、qwen2.5:14b)を、OPUS-MTおよびNLLB-200からの専用MTベースラインと比較した。ゼロショットプロンプトと、ランダム、語彙類似性、埋め込み類似性のデモンストレーション選択を用いたk=5の少数ショットプロンプトをテストした。さらに、単一ターゲットプロンプト(各ターゲット言語を個別に翻訳)と、JSON形式でファミリー内のすべての言語を一度に要求するファミリースコーププロンプトを比較した。
結果は、専用MTシステムが特にゲルマン語派で依然として全体的に最強であることを示した。少数ショットプロンプトはmistral:latestとqwen2.5:14bに有効だったが、llama3.2:3bには有害だった。強力なLLMに対して、埋め込み検索は平均的に最良の結果をもたらしたが、ランダムおよび語彙例に対するその利点は控えめだった。ファミリースコーププロンプトは強力なローカルLLMには実行可能だったが、小規模モデルではJSON形式の構造化出力に失敗する問題が明らかになった。
これらの発見は、LLM翻訳の評価を言語ペアと自動指標だけでなく、プロンプトスコープ、検索戦略、マルチターゲット準拠も考慮して行う必要性を強く示唆している。これは将来のLLM翻訳システムの設計と評価に新たな方向性を提供するものである。