AI News HubLIVE
站内改写2 分钟阅读

利用微调大型语言模型识别英国警方事件日志中的脆弱性指标

该研究探讨如何将基于美国警方数据开发的LLM分类流程应用于英国警方事件叙述,以估计精神健康问题、药物滥用、酒精依赖和无家可归四种脆弱性指标的发生率。通过对近3000条脱敏事件日志的分析,研究发现LLM可以大规模提供有意义的患病率估计,但直接使用不可靠,需要大量人工干预和统计校正。研究强调,尽管LLM有潜力,但其输出不能轻易被视为有效测量,尤其是在个体层面。

来源arXiv Computational Linguistics作者: Sam Relins, Daniel Birks

一项由Sam Relins等人进行的最新研究,探索了利用微调大型语言模型(LLM)识别英国警方事件日志中脆弱性指标的可行性,揭示了该技术在大规模分析中的潜力与局限。该研究旨在回答一个关键问题:日常警务活动中涉及脆弱人群的比例有多大?这可以为资源分配、培训和多机构联合响应提供重要参考,但传统的行政数据往往无法提供足够深入的洞察。

研究团队首先基于公开的美国警方数据开发了一个LLM分类流程,然后将其适配到英国语境。他们分析了来自英国某警察部队的近3000条脱敏事件记录,目标是估计四种脆弱性指标的普遍程度:精神健康问题、药物滥用、酒精依赖和无家可归。为了确保数据安全,整个流程运行在本地托管的开源LLM上,符合警方严格的保密要求。

该分类流程采用了多阶段设计:包括重复模型推理、标签聚合、结构化人工审核和统计校正。这种复杂的设计旨在弥补单一模型推理的不稳定性。研究结果显示,LLM能够大规模产生有意义的患病率估计,但远非完美。具体而言,精神健康问题指标出现在大约五分之一的警情中,而药物滥用、酒精依赖和无家可归的发生率则相对较低。

然而,研究也发现了显著的问题。直接使用LLM进行单次分类的结果非常不可靠:分类结果在不同推理之间波动较大。更糟糕的是,即使经过聚合,输出结果也系统性地高估了脆弱性指标的存在,与人工判断相比存在明显偏差。为了纠正这些系统性的高估,研究人员不得不投入大量人工进行审核和标注,并结合统计调整,即便如此,仍然留下了相当大的不确定性。

研究团队由此得出结论:尽管LLM能够从非结构化的警方数据中提取信息,但其输出在缺乏谨慎方法论支持的情况下,绝不能被视为有效的测量结果。在人群层面上,通过投入大量资源,可以获得具有一定可信度的估计值;但在个体层面上,错误仍然频繁且不可预测,这严重限制了LLM在操作决策中的应用。这项研究生动地展示了基于LLM的测量在实际应用中的潜力与约束,为未来在警务数据处理中负责任地使用人工智能提供了重要的参考和警示。