OpenAIがアナリティクスを10倍安くした
OpenAIがGPT 5.6 Lunaを80%値下げし、AI支援アナリティクスのコストを劇的に削減しました。小型モデルは旧世代フラッグシップ並みの知能を持ち、高速な分析DBと組み合わせると1回答あたり0.5セント未満の低遅延エージェント型ワークフローが実現できます。Lunaをmax effortで使い、評価の頻度を上げ、コンテキスト層への投資を増やすことを推奨しています。
かつて分析タスクには最も賢いAIモデルが必要でした。しかし現在では、小型モデルでも旧世代のフラッグシップ並みの知能を持つようになり、エージェント型アナリティクスに新たな戦略が開けています。生の知能よりも速度とコストを重視することで、ユーザー体験は向上します。最新の小型モデルと高速な分析データベースエンジンを組み合わせれば、AIとDBのコストを合計しても、1回答あたり0.5セント未満で低遅延なAI回答が実現できます。
今週、OpenAIがGPT 5.6 Lunaの価格を80%引き下げたことは、私たちの評価でもすぐに確認できました。最初は何かの間違いではないかと思ったほどです。Agentic SQLベンチマークでは、max effort設定のLunaが、低effort設定のGemini-3-Flashに代わって首位となり、5分の1の価格で99.8%の精度を維持しました。セマンティックモデリングのベンチマークではコストがさらに下がり、先週のLunaと比べて10倍安くなりました。これはモデルキャッシュの改善による2倍の追加効果だと考えています。
Opus 4.5の登場は、プロフェッショナル規模のコーディングにおいてAIモデルが実用的な敷居を越えた転換点でした。GPT 5.6 Lunaは、パレートフロンティア上の別の位置で、それと同じ規模の変化をもたらしました。LunaはSQLに優れているだけでなく、非常に高速で安価です。正確なSQLをこれほど手軽に生成できる時代はかつてありませんでした。DeepSWEでは、LunaはFableより3%低いスコアでありながら、価格は10分の1以下です。
この変化を最大限に活かすには、小さな変更と大きな発想の転換の両方が必要です。まず、大規模モデルを低effortで使っていたなら、Lunaをmax effortで試す価値があります。最大限の知能を必要としないタスクには非常に効率的です。また、単純にもっと多くの質問をすることも有効です。これはジェボンズのパラドックスそのものであり、技術の改善はすぐに新たな応用を生みます。たとえば、エージェントからの返答を待つ間に5つの仮説を同時に検証したり、顧客がリストから選ぶ前に回答をプリフェッチしたりできるようになります。
AIが高速になると、低遅延データプラットフォームへの投資収益率は急上昇します。これまでエージェントワークフローでは、LLMへのリクエストが全体の時間ボトルネックであり、データベースを速くしても効果は限られていました。しかし、Lunaの新バージョンにより、今度はトランザクショナルデータベースがユーザー体験のボトルネックになります。分析系のワークロードでは、分析データベースはトランザクショナルデータベースより1000倍高速な場合があります。エージェントの質問の多くは分析系です。分析ストアの起動に30秒かかるなら、その間に低遅延DBは10のエージェント質問に回答できます。エージェントワークロードはバースト性が高いため、低遅延なサーバーレス構成が合理的です。
モデルは与えられたコンテキストの質に左右されます。特定のビジネスやドメインの詳細を含むコンテキスト層を構築することは、依然として非常に効果的です。かつて弱いモデルが正確なSQLを書けなかった時代は、最強モデルにとって十分なコンテキストがあればよかったのですが、今はドメインを詳細に文書化することで、より弱いモデルでも正確に解釈でき、コスト削減と回答高速化につながります。
データチームには、より多くの評価が必要です。従来のデータテストは品質チェックであり、顧客IDの重複がないか、注文価格がNULLでないか、外部キーが有効かといった検証が中心でした。エージェント型分析では、自然言語の質問とデータに基づく正解を用意し、エージェントがビジネスコンテキストとデータベース接続を使って正しく回答できるかを評価する必要があります。そして、この評価の実行コストはちょうど5倍安くなりました。
その節約分を使って、評価をより頻繁に実行できます。新しいモデルの性能を探求し、モデル内の設定を調整することも可能です。さらに、モデルの知能が変動するケースも検出できます。モデルの性能は重みだけでなく、それを提供するインフラにも依存します。キャパシティが逼迫すると知能は低下するため、適切に調整された評価システムがあれば、新モデルリリース前やトラフィックピーク時に、より最適なモデルへ切り替えられます。
モデルだけが要因ではありません。新しい組織コンテキストが本当に役立つかどうかを測定することも重要です。OpenAIのデータチームは、コンテキスト層のリグレッションを検出することが評価フレームワークの大きな価値だと発見しました。毎週の評価では、正確な組織知識を構築するのに十分なシグナルは得られません。ビジネス自体も常に変化しています。新しい割引プログラムを追加すると、エージェントが売上を正しく計算できなくなるかもしれません。取締役会にグラフを提出する前に、そうした論理バグを発見してください。
また、評価ワークフローはフロンティアラボに依存しない設計が重要です。私たちはカスタムハーネスでOpenRouterを使用しており、新モデルのリリースから数時間以内に、すべての主要ラボの最新モデルをテストできます。現代的AI経済では、ハーネスやコンテキスト層に知的財産を構築し、モデルをコモディティとして扱うことで最大の利益が得られます。切り替えコストを低く保ち、ロックインを避けることで、次のトップモデルがROIを生み出した時点ですぐに移行できます。
OpenAIや他のラボは、计量不要なほど安い知能を提供する競争を続けてきました。データの質問に関しては、GPT 5.6 Lunaはまさにその目標を達成したように見えます。今こそ、モデルの周りにシステムを構築し、生の知能を顧客への正確で関連性のある回答に変換するときです。十分に文書化されたコンテキスト、厳格な評価、そして高速な分析エンジンが、今後を左右する要素になります。