AI News HubLIVE
サイト内リライト3 分で読了

LLM内部の「作業スペース」に関する論文が、我々のプロンプトのバグを見つけた

2026年7月の解釈可能性論文により、言語モデルが大量の自動処理の上に小さな報告可能な「作業スペース」を保持していることが判明しました——この構造は誰も設計しておらず、訓練から出現したものです。Hamo AIの創業者Chris Chengは、この発見が自社のアーキテクチャやセラピーそのものと三重に対応していることを分析し、プロンプトの改善(禁止から肯定的範囲への変更、臨床判断と文言の分離、モデルの異議の記録など)につなげました。また、論文は「洞察の瞬間」を追跡するための操作的定義を提供しています。

ソースHacker News AI著者: chrischengzh

2026年7月、Anthropicは解釈可能性に関する論文「言語モデルにおける言語化可能な表現はグローバルワークスペースを構成する」を発表しました。この論文は、言語モデル内部でどの内部表現が報告・操作・推論可能であり、どの表現が不可視のまま自動処理されるのかという機械的な問いを扱っています。答えは、膨大な自動処理層の上に、小さな特権的な「作業スペース」が存在するというものでした。機能的には、これは意識科学でいう「アクセス意識」に相当します。この構造は人間が設計したものではなく、訓練から自然に出現しました。

Hamo AIの創業者兼CEOであるChris Chengは、この論文を自分たちの設計が確認されるか、あるいは欠陥を曝露されるかを期待して読んだと述べています。結果として、論文が明らかにした構造は、Hamoのシステムとセラピーそのものに三重に対応していることがわかりました。第一に、論文が発見した作業スペースは、Hamoがクライアントのリアルタイム状態に対して構築する読み取り可能なモデルに類似しています。第二に、セラピー自体の役割はクライアント自身の作業スペースを拡大すること、すなわち行動としてのみ現れていたパターンを見えるようにして名前を付けられるようにすることです。

論文内の実験の一つは、セラピストの質問の実験室版に近いものです。同じテキストを使用して、モデルに次の単語を予測させる場合、時制などの属性は使用されるものの作業スペースには入りません。一方、モデルに直接テキストの時制を尋ねると、その属性は報告可能になります。これはセラピストの質問と似ています。クライアントは常に行動でパターンを示していますが、セラピストの質問はそのパターンを作り出すのではなく、クライアント自身の作業スペースに引き込み、処理可能にします。

これらの発見に基づき、Hamo AIはシステムに具体的な改善を施しました。まず、プロンプト内の禁止ルールを書き換えました。論文の「白熊効果」は、システムに「Xをするな」と指示すると、Xが作業スペースに存在してしまうことを示しています。そのため、肯定的な範囲宣言に変更しました。例えば「このターンの仕事はグラウンディングとバリデーションであり、それ以上深い内容は後のフェーズに属する」とし、禁止されるものを最初から言及しないようにしました。第二に、臨床判断と文言をさらに分離しました。まずプライベートな推論パスで状態を読み取り臨床的に適切な動作を選択し、次に狭い生成パスで単に言葉を書くだけにします。これにより、モデルの注意がルールの調整に費やされる負荷が減ります。第三に、固定ルールがモデルの本来の判断を上書きする場合、モデルが異議を記録できるようにしました。異議は一方的に行動には移されませんが、可視化され、監査可能であり、次のターンでシステムが自身をチェックするための候補信号となります。最後に、生成パスからトーンを診断的に傾ける可能性のある臨床ラベルを削除し、行動の記述のみを残しました。

論文はまた、「洞察の瞬間」を追跡するための操作的定義を提供しています。クライアントが初めて自分の言葉で、それまで行動としてのみ現れていたパターンを表現したとき、真の変化が起こります。これは現在、特定の追跡可能なシグナルとなっています。

Chris Chengは次のように総括しています。「外部の論文が私たちに与える最も有用なものは、新しいアイデアではなく、私たちが既に公にコミットしたアイデアが正しかったかどうかを、偽造できない方向から教えてくれることです。今回の論文はそれをやってくれました。言語モデルの中で見つかった作業スペースは、私たちがクライアントの状態のために構築した形状と同じであり、セラピーが常に拡大しようとしてきた形状と同じです。それは比喩ではありません。三つの異なる部屋から見た同じメカニズムなのです。」