提示語言影響大型語言模型的診斷推理與準確性
一項新研究評估了五種大型語言模型(LLM)在英語和法語提示下的診斷推理表現,發現除o3外,其餘模型在英語環境下表現更優,提示語言成為LLM臨牀性能的關鍵決定因素。
來源arXiv Computational Linguistics作者: Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud
大型語言模型(LLM)在臨牀決策支持中的應用日益廣泛,但多數評估僅以英語進行,其在其他語言中的可靠性尚不明確。一項由Adrien Bazoge等人發表於arXiv(ID: 2605.19173)的最新研究系統比較了英語與法語提示對五種LLM診斷推理能力的影響,揭示了語言因素在臨牀AI性能中的關鍵作用。
研究團隊選取了o3、DeepSeek-R1、GPT-4-Turbo、Llama-3.1-405B-Instruct及BioMistral-7B共五款模型,使用180個覆蓋16個醫學專科的臨牀案例進行測試。兩名醫生採用18分量表,從診斷準確性和推理質量兩個維度對模型輸出進行評分。結果顯示,除o3外,其餘四款模型在英語提示下的得分顯著高於法語,平均差異介於0.37至0.91分(調整後p值<0.05)。這種語言差異體現在推理的多個方面,包括鑑別診斷的全面性、邏輯結構的嚴謹性以及內部一致性。
值得注意的是,o3是唯一未表現出語言效應的模型,提示其可能具備更強的跨語言推理能力。研究人員指出,當前LLM的訓練數據仍以英語為主,這可能導致非英語提示下性能下降。該發現對全球範圍內LLM的公平部署具有重要啓示:若僅依據英語評估結果推廣至其他語言地區,可能高估模型的實際臨牀價值,尤其是在醫學專業術語和表達方式差異顯著的語境中。
研究建議未來LLM的臨牀評估應納入多語言測試,並開發針對特定語言優化的提示策略。此外,模型開發者也應關注訓練數據的語言多樣性,以提升跨語言臨牀決策支持的可靠性。該項工作為AI在醫療領域的語言公平性研究提供了關鍵實證。