OpenAI 于 2026 年 10 月 6 日发布公司文章,介绍其与 AI 合同管理企业 Ironclad 的研究合作:双方在复杂的合同工作流上训练和评估 AI 代理,以推进专业工作中的计算机使用能力。
在发布 GPT-6 Astra 时,OpenAI 已经展示了模型在专业场景中使用计算机的进展,从准备文档到测试网站。其下一步目标,是让代理更有能力、更高效地使用专业软件解决复杂业务问题。OpenAI 正在探索如何训练模型理解企业的业务规则、执行多步骤工作流,并验证所做的工作是否满足最初的要求。
为了加速这项研究,OpenAI 直接与少数最了解这类工作流的软件公司合作,共同识别具有挑战性且高价值的任务,并将其转化为用于训练和评估模型的研究问题,最终让模型在真实商业应用中更有能力、更有用。首个合作伙伴是 AI 合同领域的领导者 Ironclad。双方共同开发了要求代理配置协议、审批流程和可复用法律条款的任务,并在这些复杂工作流上取得进展。Ironclad 的专业知识在定义成功标准、把真实客户需求直接带入前沿模型开发方面起到了关键作用。
GPT-6 Astra 是首个在 Ironclad 任务上训练的前沿模型。在 OpenAI 的研究评估中,其平均得分比 GPT-5.6 Sol 高 32%,而每次尝试的预估时间低 48%。
一个具体场景是法务运营团队搭建软件采购流程:财务可能需要审批超过一定金额的采购,安全团队可能需要审查某些请求,法务团队可能需要审查非标准条款。搭建流程的人要把这份简短清单转化为录入表单、文档模板、审批规则以及最终协议的记录。
执行同样工作的 AI 代理,必须在操作软件的过程中始终顾及这些要求。例如,它需要配置财务在支出阈值以上的审批,并检查阈值上下方的请求是否都走了正确路径。把单个步骤做对还不够:最终完成的流程必须在它被设计处理的各种情境下都能正常工作。
Ironclad 的员工以及在 OpenAI 内部使用 Ironclad 的人员,帮助研究人员确定了横跨法律、商业和采购工作的 11 项任务。这些任务包括设置保密协议(NDA)、创建采购审批流程,以及更新可复用法律条款以反映请求者所选择的司法管辖区。OpenAI 估计,有经验的用户平均每项任务大约需要 30 到 40 分钟。
每项任务依据其复杂程度用 8 到 50 条标准进行评估,从而可以看出模型哪些部分做对了、哪些地方仍然不足。Ironclad 还提供了其产品的托管软件环境,让模型可以练习这些任务。研究人员围绕有代表性的工作流开发了合成训练任务,并使用强化学习帮助模型通过练习和反馈不断改进。这种组合——由熟悉工作的人选定任务、细致的评估标准,以及可供模型练习的环境——确保改进的是对客户最重要的真实任务。
在模型对比中,Astra 使用 Max reasoning,GPT-5.6 Sol 使用 High reasoning,即各自得分最高的设置。在 11 项研究任务上,Astra 的平均得分为 55.0%,GPT-5.6 Sol 为 41.6%;每次尝试的预估平均时间从 Sol 的 37.0 分钟降至 Astra 的 19.2 分钟。用于开发 Astra 的内部模型在这些任务上达到更高的 63.7%,OpenAI 希望把这些增益带到未来的模型中。OpenAI 还展示了两段对比视频:Astra 在约 20 分钟内满足约 94% 的任务标准,而 GPT-5.6 Sol 在约 32 分钟内满足约 85%。
Ironclad 在这项工作中的角色,也反映出其客户非常熟悉的挑战:合同流程必须在保留企业所依赖规则的同时处理例外情况。如果代理在任务中途失去对某条规则的跟踪,软件公司能放心交给它做的事情就会受到限制。这也说明,随着代理在复杂合同任务上越来越强,人工监督依然重要,完整的合同平台也仍然不可或缺。与 OpenAI 研究人员合作,让 Ironclad 可以把这些问题带入底层模型的开发过程,在其中共同研究。随着模型能力提升,Ironclad 也有机会在自家更多产品中使用它们;对法务和业务团队而言,这可能意味着 AI 承担更多复杂合同工作中的负担,同时保留这些团队所依赖的控制措施。
Ironclad 首席技术官 Sunita Verma 表示,AI 要在复杂的合同领域真正有用,就不能只完成单个动作;代理需要理解完整的合同生命周期,包括业务工作流如何衔接,同时保留团队所依赖的控制措施。与 OpenAI 的合作把这些现实挑战带入了研究过程,推动技术前进。
OpenAI 正在邀请少数软件公司与其研究和工程团队直接合作,攻克当今代理仍无法可靠完成的重要专业任务。如果团队有这类任务,OpenAI 希望看到具体案例:要求代理做什么、它在哪里失败的证据,以及如何判断结果是否成功。合作伙伴还应能提供深入了解该工作的人员、安全的测试环境,以及可安全用于研究的数据。这为调查失败并衡量模型是否改进提供了起点。OpenAI 同时说明,用于训练和评估的模拟任务来自 SEC 的 EDGAR 数据库中公开的合同,并经过过滤以去除个人信息;未使用 OpenAI 客户数据、OpenAI 内部合同,或非公开的 Ironclad 客户数据与合同。