湯森路透自研AI模型Thomson躋身全球頂尖行列
湯森路透發佈自研AI模型Thomson,早期基準測試顯示其性能與Claude Opus 4.8等最強前沿模型相當,並領先於GPT-5.5、Claude Sonnet 5和Gemini 3.1 Pro。該模型基於開源基礎,利用Westlaw、Practical Law等專有內容訓練,首個集成將於8月在CoCounsel Legal的Tabular Analysis上線。
湯森路透(Thomson Reuters)7月31日宣佈,其自主研發的AI模型“Thomson”在早期基準測試中表現出色,已躋身全球最有能力的模型之列。公司首席技術官Joel Hron與AI研究負責人Jonathan Schwarz在公告中稱,Thomson是同類中首款模型,在評估法律和通用能力的多項測試中,性能與市場上最強的前沿模型(包括Claude Opus 4.8)相當,並領先於GPT-5.5、Claude Sonnet 5和Gemini 3.1 Pro。
Thomson將於今年夏末正式推出,成為湯森路透AI戰略的最新一層。2024年,公司收購了AI研究公司Safe Sign Technologies。當時市場普遍認為,接入越來越強的通用模型就夠了,但湯森路透認為,專業AI需要針對特定領域、標準和後果打造的模型。Thomson正是這一判斷的產物。
Thomson以強大的開源模型為基礎,採用先進的中間訓練和後訓練技術,使用Westlaw、Practical Law、Checkpoint和Reuters數十年積累的高可信內容進行訓練。數百名領域專家參與了評估,確保模型按法律專業人士的實際工作方式推理。客户數據不會用於訓練模型。儘管Thomson的規模和訓練/運營成本遠小於許多前沿模型,但在法律、編程、税務、會計、多語言、新聞、智能體任務、安全、長上下文、推理和指令遵循等類別上均具有競爭力。
在引入湯森路透專有數據後,Thomson的優勢更加明顯。在53個由內部專家撰寫的法律研究查詢測試中,Thomson通過專有智能體框架接入Westlaw和Practical Law,與允許訪問網絡的領先前沿模型相比,在完整性和事實性(即可通過準確引用可靠來源支撐論點)方面表現更優。內部評估還包括數萬條真實專家查詢、端到端深度研究訓練以及人工和自動紅隊壓力測試。目前,Thomson的訓練僅使用了不到10%的湯森路透內容,未來仍有很大擴展空間。
Thomson的首個集成將在8月上線,用於CoCounsel Legal的Tabular Analysis(表格分析)。該功能進行大批量、結構化文檔審查,有清晰、可衡量的準確性標準,能直接展示專用模型的優勢。Thomson將成為該功能的默認模型,並將在未來一年內集成到法律和税務的更多產品中。湯森路透表示,內容、專業知識、工具加上模型,構成了公司Fiduciary-Grade AI承諾的完整支柱——這種AI面向負有注意和問責義務的專業人士,對他們來説,差不多正確並不足夠。