AI News HubLIVE
サイト内リライト2 分で読了

AIの幻覚を止めるにはモデルではなくシステム設計を変える

AIが幻覚を起こすのは、反証できるものが何もないからです。BlazePhoenixプロトコルは不変駆動設計を提案します:すべての主張に反証コマンドが付随し、証明できない場合は推測せず拒否します。このエンジニアリングパターンは任意のシステムに適用可能で、AIが推測ではなく検証可能な事実に基づいて回答できるようにします。

ソースHacker News AI著者: mitraxyz

AIモデルが幻覚を起こすのは、それが不注意だからではありません。答える瞬間に、何もそれを反証できないからです。BlazePhoenixプロトコルが提唱する不変駆動設計(Invariant-Driven Design)は、モデル自体ではなくシステムの構造を変えることでこの問題に対処します。

核となる考え方は、すべての主張に反証手順を組み込むことです。例えば、見積もりはサーバーが選んだ数字ではなく、公開コントラクト上のpreviewPlan関数の出力であり、誰でも任意のブロックで再実行して同じ答えを得るか、嘘を暴くことができます。ステーキングエンジンはソルベンシーレポートを公開せず、isSolvent()関数を公開し、誰でもいつでもコントラクトストレージから読み取れます。これにより、主張とそのテストは同じオブジェクトとなり、モデルがデータを引用する際に検証方法も提供できるため、読者は誰も信頼する必要がありません。

Fail-Closed原則はこのパターンの最も厳格なバージョンです。システムが何かを証明できない場合、推測せずに拒否します。具体的には、見積もりを行う際、プールが報告する数字を信用せず、実際の残高を直接読み取ります。本当の残高が確認できない場合、そのプールはルートから完全に除外されます。これはまさに幻覚の本質です——システムが情報のギャップをもっともらしい答えで埋めること。Fail-Closedはそのようなギャップを表現不可能にします。

不変条件(Invariants)はチェックよりも強力です。チェックは呼び出し忘れる可能性のあるコード行ですが、不変条件はシステムが違反できないプロパティです。例えば、ステーキングエンジンの保護メカニズムは破産状態を到達不可能にします:破産で終わるトランザクションはロールバックされるため、プロパティは観測可能なすべての瞬間に成立します。AIにとって、不変条件は100ページのドキュメントよりも価値があります。なぜなら、振る舞いに関する質問を状態に関する質問に変換するからです。

もう一つの重要な原則は、信頼できる情報源が存在する場合、それを再実装するのではなく直接呼び出すことです。例えば、プロトコルのルーターは複数の自動マーケットメーカーをカバーし、CurveやSolidlyなどについては、それら自身の関数を直接呼び出します。再実装は第二の真実源であり、第二の真実源は相違を生みます。

この設計はAIに三つのものを提供します:検証可能な表面(すべての数字に再現可能な呼び出しが付随)、正直な否定(システムは推測せず拒否するため、「ルートなし」や「データ不足」が真実の答えとなる)、安定したグラウンドトゥルース(不変条件はドキュメントの更新に影響されない)。これらはいずれもモデルを賢くする必要はなく、推測の真空を取り除くことで実現します。

このパターンはブロックチェーンに依存しません。任意のコンポーネントに対して三つの質問をすることができます:この主張が間違っている場合、どうすれば発見できるか?何かを確立できない場合、システムは拒否するか埋めるか?このプロパティはチェックされるのか、違反不可能なのか?可能な限り多くのプロパティを前者から後者に移すことで、ユーザーとAIは信仰の行為を一つ減らせます。

結論として、AIの幻覚を止めることは主にAIの問題ではなく、エンジニアリングの問題です。チェック不可能なシステムは推測によって記述されるしかありません。チェック可能なシステムを構築すれば、推測は止まります——モデルが変わったからではなく、真空が消えたからです。