AIが小説を書けるのに50まで数えられない理由
本記事は、LLMが複雑なタスクに優れている一方で単純なカウントに失敗するパラドックスを探り、その原因が確率的な性質にあると説明する。3つの幻覚タイプと、精度と監査可能性を向上させるKISプロトコルを紹介する研究を紹介する。
私たちは奇妙な技術的パラドックスの中に生きている。司法試験に合格し、稀な病気を診断し、数秒で数千行のレガシーコードをリファクタリングできる機械を構築した。しかし、これらのデジタル巨人は、単語リストを数えるような単純なタスクでしばしばつまずく。もし最先端のLLMに、何千行ものアンケート回答をまとめたスプレッドシートを要約するよう頼めば、見事な分析を提供する一方で、実際の回答者数を幻覚で作り出すかもしれない。
これは単なる小さな不具合ではない。現代のソフトウェアアーキテクチャが、過去の確固たる確実性から流動的な確率的未来へと移行したことを示す根本的な窓である。内部では、AIが「数える」方法は、従来のデータベースや人間の脳が同じタスクを実行する方法とは根本的に異なる。この期待と性能のギャップにより、データ処理タスクにおける幻覚の定量的分析という新しい研究分野が生まれた。
カウントの欺瞞的な単純さ:日常用語では、数えることはデジタル労働の最も基本的な単位に感じられる。コンピュータは本質的に高級計算機であるため、数値の正確性は当然だと思い込む。しかし、LLMは計算機ではなく、洗練された予測エンジンである。Gemini 3 FlashやGPT-5.3 Instantのようなモデルに「はい/いいえ/保留中」の長いリストを与えて合計を求めると、モデルはループ内の変数をインクリメントするわけではない。注意メカニズムを通じてテキスト全体を処理し、内部の神経経路全体でカウントの「状態」を維持しようとする。
ユーザー視点では、この体験はしばしば苛立たしい。AIアシスタントが最初の数行は正しいが、400行目あたりで位置を見失うことに気づくかもしれない。研究者はこれを内部注意制限と呼ぶ。皮肉なことに、モデルが会話的で「人間的」になればなるほど、私たちが誰かにランダムな数字を叫ばれながら瓶の中のペニー硬貨を数えるのと同じような認知の欠落を起こしやすくなる。
新しい分類法:幻覚の3つの顔:Mirairzu Lab Koboによる最近の探索的研究は、異なるモデルがこれらのタスクで失敗する方法に興味深い変化があることを明らかにした。LLMは単に「間違いを犯す」のではなく、さまざまなタイプのソフトウェア摩擦を反映する明確な行動パターンを示す。
最初は捏造型で、Gemini 3 Flashに代表される。ベースラインテストで、Geminiは研究者が「ハーモニック幻覚」と呼ぶものを示した。あるカテゴリーを過大評価し、別のカテゴリーを過小評価することで、分布が完全な捏造であっても最終的な合計を数学的に完璧に保つ。同時に、回避型がGPT-5.3 Instantに見られる。処理負荷が一定のしきい値を超えると、ソフトウェアは単純に諦め、「これだけ多くのアイテムを数えられません」という丁寧なメッセージを返す。
最後に、プロセス不透明型で、Claude Sonnet 4.6によく見られる。Claudeは最大2000アイテムまで驚くほど正確だが、その方法論はブラックボックスのままである。開発者の立場からは、これは諸刃の剣である。正しい答えは得られるが、モデルがいつ、なぜ「崩壊点」に達するかを知る方法がない。
従来のプロンプティングの失敗:歴史的に、テック業界のAIの不正確さに対する答えは「Chain-of-Thought」(CoT) プロンプティング、つまり「ステップバイステップで考えよ」という単純な指示だった。しかし、ソフトウェアが複雑になるにつれ、このかつて汎用的だった解決策は技術的負債の兆候を示している。Mirairzu Labの実験では、ChatGPTにCoTを単独で適用することは実際に逆効果だった。200アイテムのデータセットについて推論を書き出すよう求めると、モデルの精度は実際に低下した。生成しなければならない余分な単語が処理ノイズとして機能し、モデルを主要なタスクから気を散らす。
外部足場:KISプロトコルの設計:単純なプロンプティングが失敗する場合、業界はより堅牢な独自プロトコルに移行している。そのようなフレームワークの1つが知識イノベーションシステム(KIS)であり、AIの「外部足場」として機能する。モデルの内部記憶に頼る代わりに、KISはAIに中間ステップを構造化ログに外部化させる。
本質的に、KISはLLMを全知の預言者ではなく、より大きな機械のコンポーネントとして扱う。「Level 4 / Logic: Strict」のようなプロトコルを強制することで、システムはカウントフェーズ、検証フェーズ、レポートフェーズを分離する。この構造的制約はデジタル設計図のように機能し、モデルが前のステップを検証するまで次のステップに進むことを防ぐ。
画面の裏側では、このアプローチは「ハーモニック幻覚」問題を解決する。GeminiをKISプロトコルで実行すると、精度は全体で100%に跳ね上がった。モデルはもっともらしい分布を推測することを許されず、検証可能な監査トレイルとして機能する「log: full」出力を提供するよう強制された。
精度から監査可能性へ:パラダイムシフト:業界レベルにズームアウットすると、この研究はソフトウェアを評価する方法の深い変化を浮き彫りにする。長年、ゴールドスタンダードは精度だった。アプリは正しい答えを出したか?しかし、AIを法律、金融、医療のワークフローに統合するにつれ、精度だけではもはや十分ではない。私たちは監査可能性の時代に入っている。
Claudeの性能が示すように、「通常は正しい」モデルは、なぜ正しいのかが分からなければリスクである。人間の監査人が生データから最終合計までの経路を追跡できない場合、ソフトウェアはリスクのままである。KISのようなプロトコルは、Webの次の段階を表す。初期のチャットボットの断片的で「雰囲気ベース」の出力から、プロセスが結果と同じくらい重要な、より弾力的で透明なアーキテクチャへの移行である。
デジタル設計図の奪還:最終的に、テクノロジーとの関係は、「どのように動作するか」のどれだけをアウトソースするかによって定義される。LLMを使ってカウント、要約、分析するとき、私たちは従来のコードの機械的な確実性を、ニューラルネットワークの機敏な直感と交換している。
一般ユーザーにとっての教訓は実用的である。モデルの流暢さを数値計算能力の代用と仮定してはならない。次にAIにデータ負荷の高いタスクを依頼するときは、「足場」を探せ。モデルは作業過程を示すか?ステップのログを提供するか?もし提供しないなら、会話を続けるためだけに数字を夢見ているかもしれないブラックボックスを見ていることになる。
ソフトウェア設計のこの静かな変化を進む中で、最も重要なスキルは透明性に対する「UXの目」を養うことだ。答えを出すだけでなく、それを証明するために必要な監査トレイルを提供するツールを要求すべきである。ハーモニック幻覚の世界で、ソフトウェアが提供できる最も破壊的な機能は、検証可能なログという単純で謙虚な真実である。