AI News HubLIVE
站内改写2 分钟阅读

汤森路透自研AI模型Thomson跻身全球顶尖行列

汤森路透发布自研AI模型Thomson,早期基准测试显示其性能与Claude Opus 4.8等最强前沿模型相当,并领先于GPT-5.5、Claude Sonnet 5和Gemini 3.1 Pro。该模型基于开源基础,利用Westlaw、Practical Law等专有内容训练,首个集成将于8月在CoCounsel Legal的Tabular Analysis上线。

来源Hacker News AI作者: doener

汤森路透(Thomson Reuters)7月31日宣布,其自主研发的AI模型“Thomson”在早期基准测试中表现出色,已跻身全球最有能力的模型之列。公司首席技术官Joel Hron与AI研究负责人Jonathan Schwarz在公告中称,Thomson是同类中首款模型,在评估法律和通用能力的多项测试中,性能与市场上最强的前沿模型(包括Claude Opus 4.8)相当,并领先于GPT-5.5、Claude Sonnet 5和Gemini 3.1 Pro。

Thomson将于今年夏末正式推出,成为汤森路透AI战略的最新一层。2024年,公司收购了AI研究公司Safe Sign Technologies。当时市场普遍认为,接入越来越强的通用模型就够了,但汤森路透认为,专业AI需要针对特定领域、标准和后果打造的模型。Thomson正是这一判断的产物。

Thomson以强大的开源模型为基础,采用先进的中间训练和后训练技术,使用Westlaw、Practical Law、Checkpoint和Reuters数十年积累的高可信内容进行训练。数百名领域专家参与了评估,确保模型按法律专业人士的实际工作方式推理。客户数据不会用于训练模型。尽管Thomson的规模和训练/运营成本远小于许多前沿模型,但在法律、编程、税务、会计、多语言、新闻、智能体任务、安全、长上下文、推理和指令遵循等类别上均具有竞争力。

在引入汤森路透专有数据后,Thomson的优势更加明显。在53个由内部专家撰写的法律研究查询测试中,Thomson通过专有智能体框架接入Westlaw和Practical Law,与允许访问网络的领先前沿模型相比,在完整性和事实性(即可通过准确引用可靠来源支撑论点)方面表现更优。内部评估还包括数万条真实专家查询、端到端深度研究训练以及人工和自动红队压力测试。目前,Thomson的训练仅使用了不到10%的汤森路透内容,未来仍有很大扩展空间。

Thomson的首个集成将在8月上线,用于CoCounsel Legal的Tabular Analysis(表格分析)。该功能进行大批量、结构化文档审查,有清晰、可衡量的准确性标准,能直接展示专用模型的优势。Thomson将成为该功能的默认模型,并将在未来一年内集成到法律和税务的更多产品中。汤森路透表示,内容、专业知识、工具加上模型,构成了公司Fiduciary-Grade AI承诺的完整支柱——这种AI面向负有注意和问责义务的专业人士,对他们来说,差不多正确并不足够。