AI News HubLIVE
站内改写1 分钟阅读

评估个人健康记录在个性化健康AI中的效用

该研究评估了大型语言模型(Gemini 3.0 Flash)在提供个人健康记录(PHR)上下文时回答用户健康查询的能力。使用了2257个查询和1945份去标识化的PHR,比较了无上下文、基本摘要和完整临床笔记三种条件下的回答。结果表明,使用PHR数据后,所有类型查询的回答帮助性显著提高,并在安全性、准确性、相关性和个性化方面有所提升。同时,新开发的评估框架发现了LLM在理解复杂PHR时的不足,如时间混淆和罕见但重要的幻觉。

来源arXiv AI作者: Rory Sayres, Kejia Chen, Ayush Jain, Matthew Thompson, Jonathan Richina, Xiang Yin, Jimmy Hu, Fan Zhang, Bob Lou, Mike Sanchez, Ines Mezerreg, Meredith Schreier, Hamsa Subramaniam, I-Ching Lee, Yugang Jia, Daniel Mcduff, Yossi Matias, Avinatan Hassidim, Dale Webster, Yun Liu, Jackie Barr, Quang Duong

近年来,患者管理的个人健康记录(PHR)被视为赋予患者更好理解自身健康状况的途径。然而,记录中的信息复杂,可能阻碍患者获取有用见解。一项新研究评估了大型语言模型(LLM,特别是Gemini 3.0 Flash)在提供PHR上下文时回答用户健康查询的潜力。研究人员从三种不同分布中抽取了2257个用户查询,以代表患者的典型问题:较短的网络搜索查询、基于聊天机器人模板的较长问题,以及患者向医疗团队提出的问题。这些查询与1945份去标识化的PHR进行匹配。Gemini在三种条件下生成回答:无PHR上下文、仅基本人口统计学和药物摘要、以及完整临床笔记。评估采用现有的SHARP评分框架,并开发了新框架来识别解释PHR时的特定错误模式。全部回答由自动评级器评估,子集(n=95)由临床医生评级,所有评级者知晓完整PHR上下文。结果显示,所有类型的查询在使用PHR数据后回答的帮助性显著提高(p<0.001,配对t检验)。此外,观察到了潜在的安全性、准确性、相关性和个性化提升。新的PHR评估框架进一步识别了LLM在理解复杂PHR特定方面的不足,如时间混淆和罕见但有意义的幻觉。这些结果表明PHR数据有助于满足广泛用户需求,并为监控基于PHR上下文的LLM回答中的差距提供了框架。该研究鼓励进一步工作以评估和实现用户从理解其健康记录中获得的潜在益处。总体而言,本研究为将个人健康记录整合到基于AI的健康助手提供了重要证据,同时也指出了需要关注的局限性,为未来的产品开发和研究方向奠定了基础。