本文にスキップ
AI News HubLIVE
サイト内リライト4 分で読了

Ironclad と進めるコンピュータ利用の研究

記事の要約

OpenAI と Ironclad は複雑な契約ワークフロー上で AI エージェントを訓練・評価し、専門業務におけるコンピュータ利用を前進させている。11 の研究タスクで GPT-6 Astra は平均 55.0% を記録し、GPT-5.6 Sol の 41.6% を上回った。試行あたりの推定時間は 37.0 分から 19.2 分に短縮された。

ソースOpenAI News
Ironclad と進めるコンピュータ利用の研究
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

OpenAI は 2026 年 10 月 6 日、AI 契約管理企業 Ironclad との研究協力を紹介する企業ブログ記事を公開した。両社は複雑な契約ワークフロー上で AI エージェントを訓練・評価し、専門業務におけるコンピュータ利用を前進させることを目指している。

GPT-6 Astra の発表時点で、OpenAI は文書作成から Web サイトのテストまで、専門業務でモデルがコンピュータを使いこなす能力がどこまで進んだかを示していた。次の目標は、専門ソフトウェアを使って複雑な業務課題を解くエージェントを、より有能かつ効率的にすることである。OpenAI は、企業の業務ルールを理解し、多段階のワークフローを実行し、その作業が当初の要件を満たしているかを検証できるようモデルを訓練する方法を探っている。

研究を加速するため、OpenAI はこうしたワークフローを最もよく理解する少数のソフトウェア企業と直接協力している。両者は困難で価値の高いタスクを特定し、モデルの訓練と評価のための研究課題に変換し、最終的にモデルを実務でより有能で有用なものにしようとしている。最初のパートナーは AI 契約分野のリーダーである Ironclad だ。契約、承認、再利用可能な法務条項をエージェントが設定するタスクを共同で開発し、複雑なワークフローでの進展を示した。Ironclad の専門知識は、成功の定義と実顧客のニーズを最先端モデルの開発に直接取り込むうえで重要な役割を果たした。

GPT-6 Astra は Ironclad のタスクで訓練された最初のフロンティアモデルである。研究評価では、平均スコアが GPT-5.6 Sol より 32% 高く、試行あたりの推定所要時間は 48% 短かった。

具体例として、法務オペレーション部門がソフトウェア購入プロセスを構築する場合を考える。一定額を超える購入には財務の承認が必要かもしれず、特定の申請はセキュリティが審査し、非標準条項は法務が確認する必要があるかもしれない。プロセスを設定する担当者は、この短いリストを申請フォーム、文書テンプレート、承認ルール、最終契約の記録に変換しなければならない。

同じ作業を行う AI エージェントは、ソフトウェアを操作しながらこれらの要件を常に意識し続ける必要がある。たとえば支出しきい値以上の財務承認を設定し、しきい値の上下の申請が正しい経路を通るかを確認する。個々のステップを正しくこなすだけでは不十分であり、完成したプロセスは想定された状況すべてで機能しなければならない。

Ironclad の従業員と、OpenAI 社内で Ironclad を使う人々の協力により、法務、商務、調達にまたがる 11 のタスクが特定された。秘密保持契約(NDA)の設定、調達承認プロセスの作成、依頼者が選んだ法域を反映するよう再利用可能な法務条項を更新する、といったタスクが含まれる。経験あるユーザーなら 1 タスクあたり平均およそ 30〜40 分かかると推定されている。

各タスクは複雑さに応じて 8〜50 の評価基準で採点され、モデルがどこを正しく行い、どこで不足したかを把握できるようにした。Ironclad はモデルが練習できるよう、自社製品のホスト型ソフトウェア環境も提供した。研究者は代表的なワークフローに基づく合成訓練タスクを作成し、強化学習によってモデルが実践とフィードバックを通じて改善できるようにした。作業を知る人とともに選んだタスク、詳細な評価基準、モデルが練習できる環境という組み合わせが、顧客にとって最も重要な実務タスクでの改善を確実にする。

比較では Astra に Max reasoning、Sol に High reasoning を用い、それぞれ最も高得点となる設定を使った。11 の研究タスクで Astra の平均スコアは 55.0%、GPT-5.6 Sol は 41.6% だった。試行あたりの推定平均時間は Sol の 37.0 分から Astra の 19.2 分に短縮された。Astra の開発に用いられた社内モデルはこれらのタスクでさらに高い 63.7% を達成し、OpenAI はこの利得を将来のモデルに取り込みたいとしている。公開された 2 本の映像では、Astra が推定 20 分でタスク基準の約 94% を満たし、GPT-5.6 Sol は推定 32 分で約 85% を満たした。

Ironclad の役割は、顧客がよく知る課題を反映している。契約プロセスは、企業が依存するルールを保ちながら例外に対応しなければならない。エージェントが作業の途中でルールを見失えば、ソフトウェア企業が安心して任せられる範囲は限られてしまう。これは、エージェントが複雑な契約タスクで向上しても人間の監督が依然として重要であること、そして完全な契約プラットフォームが不可欠であることを示している。研究者との協力は、こうした問題を基盤モデルの開発に持ち込み、ともに研究する手段となる。モデルがより有能になれば、Ironclad は自社製品のより多くでモデルを活用する機会を得る。法務・業務チームにとっては、依拠する統制を保ちながら、複雑な契約作業の負担を AI がより多く担うことを意味しうる。

Ironclad 最高技術責任者(CTO)の Sunita Verma 氏は、AI が契約の複雑な領域で真に役立つには個々の操作をこなすだけでは不十分であり、エージェントは業務ワークフローのつながりやチームが依拠する統制を保つことを含め、契約ライフサイクル全体を理解する必要があると述べた。OpenAI との協力は、こうした現実の課題を研究プロセスに取り込み、技術を前進させるものだという。

OpenAI は、現在のエージェントがまだ確実に完了できない重要な専門タスクについて、研究・エンジニアリングチームと直接協力する少数のソフトウェア企業を募集している。エージェントに何をさせたいのか、どこで失敗するかの証拠、成功をどう判断するかという具体例を示してほしいとしている。パートナーには、その作業を深く知る人材、安全なテスト環境、研究に安全に使えるデータも求められる。これが失敗の調査とモデル改善の測定の出発点になる。なお、訓練と評価に用いる模擬タスクは SEC の EDGAR データベースで公開されている契約から作成し、個人情報を除去するフィルターを適用したものであり、OpenAI の顧客データ、OpenAI の内部契約、非公開の Ironclad 顧客データや契約は使用していない。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • OpenAI と Ironclad は法務・商務・調達にまたがる 11 の契約タスクを定め、AI エージェントの訓練と評価に用いた。
  • GPT-6 Astra は平均 55.0% で GPT-5.6 Sol の 41.6% を上回り、試行あたりの推定時間は 37.0 分から 19.2 分に短縮された。
  • Ironclad はホスト型ソフトウェア環境と専門知識を提供し、訓練には SEC の EDGAR で公開された契約から作った合成タスクを使用した。
  • OpenAI は、エージェントがまだ確実にこなせない業務の具体例・失敗の証拠・成功基準を示せるソフトウェア企業を募集している。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。