個性化語言智慧體需要根據每個使用者的歷史互動來調整自己的行為,這種能力很大程度上取決於系統在推理時如何把“使用者是誰”放進上下文。目前主流方案可以分成檢索式和蒸餾式兩類。檢索式記憶會從使用者過去的記錄中挑出與當前請求最相關的若干條,再拼接到提示詞中。這一策略通常準確,但存在一個持續的代價:每一次新請求都要在越來越長的歷史上重新執行選擇,而且被選入上下文的片段本身也會增加計算負擔。蒸餾式記憶則不同,它只對整段歷史做一次壓縮,產出一個有固定邊界的自然語言人格。這樣的人格與具體查詢無關,具備可解釋性,但由於資訊被高度壓縮,研究者長期預設它會犧牲準確率。蒸餾人格到底能不能追上檢索?如果能,又是在哪些任務上能追上?論文作者指出,這些問題在以往並沒有被幹淨地刻畫出來。
為了回答這些問題,論文引入了 PersonaLink。這是一個完全不需要訓練的方法,它先把使用者歷史蒸餾成一個三欄位的有界人格,然後採用遞迴修正流程進行提煉。具體來說,每一輪都會從使用者自己的帶標籤歷史中劃出一段留出切片,讓同一個凍結的 7B 智慧體用當前人格在這段切片上做預測;接下來根據模型在錯誤樣本上的反饋重寫人格;只有重寫後的版本在留出切片上沒有造成效能回退,它才會被保留下來並進入下一輪。這套流程不使用額外的梯度更新,也沒有改動底層的 7B 模型。
實驗設計最值得注意的地方在於,作者讓所有對照方法共用同一個凍結的 7B 主幹網路,唯一不同之處只是放入上下文的歷史表徵形式。這樣一來,觀察到的效果差異就不能歸因於模型本身,而應當歸因於歷史是如何被表示和放置到 prompt 中的。這為比較檢索與蒸餾提供了一個相對乾淨的平臺。
實驗結果呈現出清晰的任務型別不對稱性。在 LaMP-2 資料集的 200 個使用者上執行 15 類新聞分類時,PersonaLink 達到 0.745 至 0.755 的準確率,而 BM25 檢索的準確率為 0.760 至 0.765。統計檢驗顯示二者沒有顯著性差異,也就是說作者證明了蒸餾出來的人格在分類任務上確實可以與檢索式記憶打成平手。但論文標題也明確劃出了邊界:這一結論不適用於迴歸任務。對於凍結智慧體而言,當目標變成數值型迴歸時,有界人格的表現仍然不如檢索式表徵。論文作者把這種現象稱為任務型別不對稱性,並提醒讀者不要把“人格可替代檢索”的說法推廣到分類之外。
這篇論文由 JaeHa Yoon 與其他五位作者共同完成,2026 年 6 月 25 日提交至 arXiv,分屬於計算與語言(cs.CL),編號為 arXiv:2609.02890。後續若要在實際產品中決定使用檢索還是蒸餾人格,本文提供了一個非常關鍵的參考依據:如果面對的是一組分類問題,蒸餾人格也許已經足夠;如果包含迴歸任務,那麼檢索仍然值得保留。