OpenAI 於 2026 年 10 月 6 日發佈公司文章,介紹其與 AI 合同管理企業 Ironclad 的研究合作:雙方在複雜的合同工作流上訓練和評估 AI 代理,以推進專業工作中的計算機使用能力。
在發佈 GPT-6 Astra 時,OpenAI 已經展示了模型在專業場景中使用計算機的進展,從準備文檔到測試網站。其下一步目標,是讓代理更有能力、更高效地使用專業軟件解決複雜業務問題。OpenAI 正在探索如何訓練模型理解企業的業務規則、執行多步驟工作流,並驗證所做的工作是否滿足最初的要求。
為了加速這項研究,OpenAI 直接與少數最瞭解這類工作流的軟件公司合作,共同識別具有挑戰性且高價值的任務,並將其轉化為用於訓練和評估模型的研究問題,最終讓模型在真實商業應用中更有能力、更有用。首個合作伙伴是 AI 合同領域的領導者 Ironclad。雙方共同開發了要求代理配置協議、審批流程和可複用法律條款的任務,並在這些複雜工作流上取得進展。Ironclad 的專業知識在定義成功標準、把真實客户需求直接帶入前沿模型開發方面起到了關鍵作用。
GPT-6 Astra 是首個在 Ironclad 任務上訓練的前沿模型。在 OpenAI 的研究評估中,其平均得分比 GPT-5.6 Sol 高 32%,而每次嘗試的預估時間低 48%。
一個具體場景是法務運營團隊搭建軟件採購流程:財務可能需要審批超過一定金額的採購,安全團隊可能需要審查某些請求,法務團隊可能需要審查非標準條款。搭建流程的人要把這份簡短清單轉化為錄入表單、文檔模板、審批規則以及最終協議的記錄。
執行同樣工作的 AI 代理,必須在操作軟件的過程中始終顧及這些要求。例如,它需要配置財務在支出閾值以上的審批,並檢查閾值上下方的請求是否都走了正確路徑。把單個步驟做對還不夠:最終完成的流程必須在它被設計處理的各種情境下都能正常工作。
Ironclad 的員工以及在 OpenAI 內部使用 Ironclad 的人員,幫助研究人員確定了橫跨法律、商業和採購工作的 11 項任務。這些任務包括設置保密協議(NDA)、創建採購審批流程,以及更新可複用法律條款以反映請求者所選擇的司法管轄區。OpenAI 估計,有經驗的用户平均每項任務大約需要 30 到 40 分鐘。
每項任務依據其複雜程度用 8 到 50 條標準進行評估,從而可以看出模型哪些部分做對了、哪些地方仍然不足。Ironclad 還提供了其產品的託管軟件環境,讓模型可以練習這些任務。研究人員圍繞有代表性的工作流開發了合成訓練任務,並使用強化學習幫助模型通過練習和反饋不斷改進。這種組合——由熟悉工作的人選定任務、細緻的評估標準,以及可供模型練習的環境——確保改進的是對客户最重要的真實任務。
在模型對比中,Astra 使用 Max reasoning,GPT-5.6 Sol 使用 High reasoning,即各自得分最高的設置。在 11 項研究任務上,Astra 的平均得分為 55.0%,GPT-5.6 Sol 為 41.6%;每次嘗試的預估平均時間從 Sol 的 37.0 分鐘降至 Astra 的 19.2 分鐘。用於開發 Astra 的內部模型在這些任務上達到更高的 63.7%,OpenAI 希望把這些增益帶到未來的模型中。OpenAI 還展示了兩段對比視頻:Astra 在約 20 分鐘內滿足約 94% 的任務標準,而 GPT-5.6 Sol 在約 32 分鐘內滿足約 85%。
Ironclad 在這項工作中的角色,也反映出其客户非常熟悉的挑戰:合同流程必須在保留企業所依賴規則的同時處理例外情況。如果代理在任務中途失去對某條規則的跟蹤,軟件公司能放心交給它做的事情就會受到限制。這也説明,隨着代理在複雜合同任務上越來越強,人工監督依然重要,完整的合同平台也仍然不可或缺。與 OpenAI 研究人員合作,讓 Ironclad 可以把這些問題帶入底層模型的開發過程,在其中共同研究。隨着模型能力提升,Ironclad 也有機會在自家更多產品中使用它們;對法務和業務團隊而言,這可能意味着 AI 承擔更多複雜合同工作中的負擔,同時保留這些團隊所依賴的控制措施。
Ironclad 首席技術官 Sunita Verma 表示,AI 要在複雜的合同領域真正有用,就不能只完成單個動作;代理需要理解完整的合同生命週期,包括業務工作流如何銜接,同時保留團隊所依賴的控制措施。與 OpenAI 的合作把這些現實挑戰帶入了研究過程,推動技術前進。
OpenAI 正在邀請少數軟件公司與其研究和工程團隊直接合作,攻克當今代理仍無法可靠完成的重要專業任務。如果團隊有這類任務,OpenAI 希望看到具體案例:要求代理做什麼、它在哪裏失敗的證據,以及如何判斷結果是否成功。合作伙伴還應能提供深入瞭解該工作的人員、安全的測試環境,以及可安全用於研究的數據。這為調查失敗並衡量模型是否改進提供了起點。OpenAI 同時説明,用於訓練和評估的模擬任務來自 SEC 的 EDGAR 數據庫中公開的合同,並經過過濾以去除個人信息;未使用 OpenAI 客户數據、OpenAI 內部合同,或非公開的 Ironclad 客户數據與合同。