利用微調大型語言模型識別英國警方事件日誌中的脆弱性指標
該研究探討如何將基於美國警方資料開發的LLM分類流程應用於英國警方事件敘述,以估計精神健康問題、藥物濫用、酒精依賴和無家可歸四種脆弱性指標的發生率。透過對近3000條脫敏事件日誌的分析,研究發現LLM可以大規模提供有意義的患病率估計,但直接使用不可靠,需要大量人工干預和統計校正。研究強調,儘管LLM有潛力,但其輸出不能輕易被視為有效測量,尤其是在個體層面。
一項由Sam Relins等人進行的最新研究,探索了利用微調大型語言模型(LLM)識別英國警方事件日誌中脆弱性指標的可行性,揭示了該技術在大規模分析中的潛力與侷限。該研究旨在回答一個關鍵問題:日常警務活動中涉及脆弱人群的比例有多大?這可以為資源分配、培訓和多機構聯合響應提供重要參考,但傳統的行政資料往往無法提供足夠深入的洞察。
研究團隊首先基於公開的美國警方資料開發了一個LLM分類流程,然後將其適配到英國語境。他們分析了來自英國某警察部隊的近3000條脫敏事件記錄,目標是估計四種脆弱性指標的普遍程度:精神健康問題、藥物濫用、酒精依賴和無家可歸。為了確保資料安全,整個流程執行在本地託管的開源LLM上,符合警方嚴格的保密要求。
該分類流程採用了多階段設計:包括重複模型推理、標籤聚合、結構化人工稽核和統計校正。這種複雜的設計旨在彌補單一模型推理的不穩定性。研究結果顯示,LLM能夠大規模產生有意義的患病率估計,但遠非完美。具體而言,精神健康問題指標出現在大約五分之一的警情中,而藥物濫用、酒精依賴和無家可歸的發生率則相對較低。
然而,研究也發現了顯著的問題。直接使用LLM進行單次分類的結果非常不可靠:分類結果在不同推理之間波動較大。更糟糕的是,即使經過聚合,輸出結果也系統性地高估了脆弱性指標的存在,與人工判斷相比存在明顯偏差。為了糾正這些系統性的高估,研究人員不得不投入大量人工進行稽核和標註,並結合統計調整,即便如此,仍然留下了相當大的不確定性。
研究團隊由此得出結論:儘管LLM能夠從非結構化的警方資料中提取資訊,但其輸出在缺乏謹慎方法論支援的情況下,絕不能被視為有效的測量結果。在人群層面上,透過投入大量資源,可以獲得具有一定可信度的估計值;但在個體層面上,錯誤仍然頻繁且不可預測,這嚴重限制了LLM在操作決策中的應用。這項研究生動地展示了基於LLM的測量在實際應用中的潛力與約束,為未來在警務資料處理中負責任地使用人工智慧提供了重要的參考和警示。