AI News HubLIVE
站内改写1 分钟阅读

提示语言影响大型语言模型的诊断推理与准确性

一项新研究评估了五种大型语言模型(LLM)在英语和法语提示下的诊断推理表现,发现除o3外,其余模型在英语环境下表现更优,提示语言成为LLM临床性能的关键决定因素。

来源arXiv Computational Linguistics作者: Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud

大型语言模型(LLM)在临床决策支持中的应用日益广泛,但多数评估仅以英语进行,其在其他语言中的可靠性尚不明确。一项由Adrien Bazoge等人发表于arXiv(ID: 2605.19173)的最新研究系统比较了英语与法语提示对五种LLM诊断推理能力的影响,揭示了语言因素在临床AI性能中的关键作用。

研究团队选取了o3、DeepSeek-R1、GPT-4-Turbo、Llama-3.1-405B-Instruct及BioMistral-7B共五款模型,使用180个覆盖16个医学专科的临床案例进行测试。两名医生采用18分量表,从诊断准确性和推理质量两个维度对模型输出进行评分。结果显示,除o3外,其余四款模型在英语提示下的得分显著高于法语,平均差异介于0.37至0.91分(调整后p值<0.05)。这种语言差异体现在推理的多个方面,包括鉴别诊断的全面性、逻辑结构的严谨性以及内部一致性。

值得注意的是,o3是唯一未表现出语言效应的模型,提示其可能具备更强的跨语言推理能力。研究人员指出,当前LLM的训练数据仍以英语为主,这可能导致非英语提示下性能下降。该发现对全球范围内LLM的公平部署具有重要启示:若仅依据英语评估结果推广至其他语言地区,可能高估模型的实际临床价值,尤其是在医学专业术语和表达方式差异显著的语境中。

研究建议未来LLM的临床评估应纳入多语言测试,并开发针对特定语言优化的提示策略。此外,模型开发者也应关注训练数据的语言多样性,以提升跨语言临床决策支持的可靠性。该项工作为AI在医疗领域的语言公平性研究提供了关键实证。