為何你的AI能寫小說卻數不到五十
本文探討了一個悖論:大型語言模型(LLM)能透過律師考試、診斷罕見疾病,卻連簡單的數數任務都頻頻出錯。這源於其機率預測的本質,而非傳統計算。研究識別出三種幻覺型別:虛構型、迴避型和過程不透明型。知識創新系統(KIS)透過將推理步驟外部化,實現了100%的計數準確率,並提供了可審計的軌跡。未來AI的可靠性關鍵在於可審計性,而非僅僅是準確性。
我們正生活在一個奇怪的技術悖論中。我們建造的機器能透過律師資格考試、診斷罕見疾病、在幾秒內重構數千行遺留程式碼——但這些數字巨人在統計一個單詞列表這樣簡單的任務上卻經常絆倒。如果你讓一個尖端的LLM總結一個包含上千行調查回覆的電子表格,它可能提供深刻的分析,同時卻把實際受訪人數憑空編造出來。
這不僅僅是矩陣中的小故障;它揭示了現代軟體架構如何從過去的確定性轉向了機率性的未來。在幕後,AI“計數”的方式與傳統資料庫或人腦完全不同。這種期望與效能之間的差距催生了一個新研究領域:資料處理任務中幻覺的定量分析。
計數的簡單假象:在日常用語中,計數感覺是最基本的數字勞動。我們認為因為計算機本質上是高階計算器,數值準確性是理所當然的。然而,LLM不是計算器;它們是複雜的預測引擎。當你向Gemini 3 Flash或GPT-5.3 Instant這樣的模型提供一長串“是/否/待定”響應並要求總數時,模型不會在迴圈中遞增變數。它透過注意力機制處理整個文本,試圖在其內部神經路徑中維持計數的“狀態”。
從使用者角度看,體驗往往令人沮喪。你可能會注意到AI助手在開頭幾行正確,但在第400行左右就丟失了位置。研究人員稱之為內部注意力限制。矛盾的是,模型越會話式和“人性化”,就越容易出現同樣的認知失誤。
幻覺的新分類:Mirairzu Lab Kobo最近的探索性研究發現了一個有趣的轉變:不同模型在這些任務中失敗的方式不同。LLM不只是“犯錯”;它們表現出反映不同型別軟體摩擦的獨特行為模式。
首先是虛構型,以Gemini 3 Flash為代表。在基線測試中,Gemini表現出所謂的“和諧幻覺”。它可能高估一個類別而低估另一個類別,確保最終總數在數學上完美,即使分佈完全是捏造的。同時,我們看到迴避型,如GPT-5.3 Instant——當處理負載超過一定閾值時,軟體直接放棄,返回禮貌的“我無法計數這麼多項”。
最後是過程不透明型,常見於Claude Sonnet 4.6。Claude即使面對2000個專案也相當準確,但其方法仍是一個黑箱。從開發者角度看,這是雙刃劍:你得到正確答案,但無法知道模型何時或為何最終達到“崩潰點”。
傳統提示的失敗:歷史上,科技行業對AI不準確的回答是“思維鏈”(CoT)提示——簡單的“一步步思考”指令。但隨著軟體日益複雜,這個一度普遍的解決方案顯示出技術債務的跡象。在Mirairzu Lab實驗中,僅對ChatGPT應用CoT實際上適得其反。當要求寫出對200個資料集的推理時,模型準確率反而下降。它必須生成的額外詞語充當了處理噪聲,分散了模型主要任務的注意力。
外部支架:設計KIS協議:如果簡單提示失敗,行業正在轉向更健壯的專有協議。其中一個框架是知識創新系統(KIS),它充當AI的“外部支架”。KIS不依賴模型內部記憶,而是迫使AI將中間步驟外部化為結構化日誌。
本質上,KIS將LLM視為更大機器中的一個元件,而不是全知的預言機。透過強制實施“Level 4 / Logic: Strict”協議,系統分離了計數階段、驗證階段和報告階段。這種結構約束像一個數字藍圖,確保模型在驗證前一步之前不能進入下一步。
在幕後,這種方法解決了“和諧幻覺”問題。當Gemini透過KIS協議執行時,其準確率躍升至100%。模型不被允許猜測可能的分佈;它必須提供可作為可驗證審計軌跡的“log: full”輸出。
從準確性到可審計性:正規化轉變:放眼行業層面,這項研究凸顯了評判軟體方式的深刻轉變。多年來,黃金標準一直是準確性——應用是否給出正確答案?但隨著我們將AI整合到法律、金融和醫療工作流中,僅靠準確性已經不夠。我們正在進入可審計性時代。
正如Claude的表現所示,一個“通常正確”的模型如果不知道正確的原因,就是一項負擔。如果人類審計員無法追蹤從原始資料到最終總數的路徑,軟體仍存在風險。像KIS這樣的協議代表了網路發展的下一階段:從早期聊天機器人碎片化的、基於“感覺”的輸出,轉向更有彈性、更透明的架構,其中過程與結果同等重要。
重新奪取數字藍圖:最終,我們與技術的關係取決於我們願意將多少“如何運作”外包出去。當我們使用LLM來計數、總結或分析時,我們是用傳統程式碼的機械確定性換取神經網路敏捷的直覺。
對於普通使用者,結論是實用的:不要假設模型的流暢性是其計算能力的代理。下次讓AI幫忙處理資料密集型任務時,尋找“支架”。模型是否展示其工作過程?是否提供步驟日誌?如果不,你面對的是一個可能為了保持對話流暢而編造數字的黑箱。
在我們在軟體設計的無聲轉變中導航時,最重要的技能是培養對透明度的“使用者體驗眼”。我們應該要求不僅給出答案,而且提供證明答案所需的審計軌跡。在一個充滿和諧幻覺的世界裡,軟體能提供的最具顛覆性的功能就是簡單、謙遜的可驗證日誌。