你不需要LLM來聚類LLM追蹤記錄
一種使用合約塊雜湊和確定性特徵而非LLM摘要來聚類LLM追蹤記錄的技術,以極低的模型成本實現了近乎完美的精確率和召回率。Seldon的Trace Audit透過硬合約塊和塊內DBSCAN,按程式身份而非主題聚類,並識別可編譯的工作流以替換為更便宜的確定性流水線。
如果你執行一個相容OpenAI的閘道器足夠長時間,你會淹沒在看似不同實則相同的追蹤記錄中。相同的JSON schema、相同的“返回答案跨度”、相同的“規範化此發行人名稱”——不同的公司、金額和句子,但合同完全一致。這正是Seldon背後的邏輯:找出這些程式,然後將重複的編譯為更便宜的確定性流水線。本文介紹這一迴圈的前半部分——Trace Audit——以及我們在大規模壓力測試中學到的經驗。
編譯只有在能夠先回答一個精確問題時才有效:哪些追蹤是相同的可替換程式,而不僅僅是相同的話題?我們為Trace Audit v0構建了答案,在12,517條追蹤上進行了測量,並保留了那些教會我們比模型更多知識的錯誤。審計只是故事的一半:一旦聚類存在,Seldon將其視為受限程式合成的規範。我們簡要描述編譯步驟;專門的後續文章將深入探討合成器。
簡而言之:首先進行硬合約塊,然後在確定性特徵字串(embedding_text)上進行塊內DBSCAN。我們達到了1.000/0.9999/1.000的配對精確率/召回率/純度——模型成本幾乎為零。即時摘要器(GPT-4.1、GPT-5.6-luna、Phi-4)無助於聚類;它們降低了純度。在聚類後使用LLM進行標籤和檔案,而非作為聚類訊號。
為什麼這對交付LLM產品的團隊很重要?大多數團隊從前沿模型開始,因為它是原型提取、分類和規範化的最快方式。然後量出現了,大部分呼叫變成了相同的形狀:文件/工單/記錄→相同的提示模板→相同的響應格式/輸出形狀→不同的有效載荷。你正在為披著提示外衣的ETL支付推理價格——通常沒有血緣關係、沒有哪些工作流主導花費的排名檢視、也沒有安全脫離模型的道路。
Seldon的迴圈刻意簡單:檢視(閘道器流量→合約相容聚類→按節省排序的工作流地圖)、編譯(搜尋型別化運算子庫以找到複製該聚類的更便宜流水線)、信任(在你追蹤上進行影子驗證;自動LLM後備;質量下降時降級)。Trace Audit是第一步。桶搞錯了,下游一切都將是虛構的。
錯誤的直覺(以及為什麼它無處不在)是:使用嵌入和LLM摘要來理解LLM流量。對於編譯器,這是錯誤的目標函式。我們不想要“這些追蹤談論發票”,而是“這些追蹤是相同的可編譯提取程式”。程式身份≠文件相似性。
Trace Audit v0的工作原理:在合成之前,審計必須將流量劃分為合約相容的聚類。錯誤合併毒害合成——你會針對混合規範進行搜尋。錯誤分裂隱藏節省——你永遠不會注意到量。
流水線:首先定義合約塊(雜湊工作區、角色序列、響應模式、schema、工具簽名、輸出形狀、JSON鍵、IO合約桶)。我們故意不將原始提示長度放入塊鍵中。長度是有效載荷屬性,而非可替換性約束。然後我們在塊內對embedding_text(任務簽名|角色=…|模式=…|形狀=…|鍵=…|提示=…,變數實體被摺疊)進行DBSCAN。這是聚類程式,而非文件。
我們在約10%的每個公開訓練分割加上小型策展系列上構建了真實的OpenAI形狀套件:Banking77(意圖)1000、SQuAD(跨度提取)8759、CoNLL-2003(實體→ID)1404、STS-B(對相似性)574、GSM8K(數值答案)747、策展發票/發行人/散文各10、對抗性“橋樑”追蹤3。總計12,517條,其中12,504條在跳過微小/全散文塊後符合條件。
我們比較了相同塊、資格守衛和餘弦截止值(約0.82/eps=0.18)下的四種方法:embedding_text + 塊內DBSCAN、確定性摘要 + DBSCAN、GPT-4.1摘要 + DBSCAN、GPT-5.6-luna摘要 + DBSCAN、Phi-4摘要 + DBSCAN。結果:embedding_text + DBSCAN 以1.000/0.9999/1.000獲勝。LLM摘要降低了純度(GPT-4.1 0.920,Luna 0.920,Phi-4 1.000但召回率低至0.771)。
兩個比模型更重要的錯誤:輸入長度桶將相同工作流按提示長度拆分,已移除;數字作為跨度提取過於激進,僅在提示指示提取且數字作為完整標記出現在輸入中時才重新分類。修復後,召回率躍升至約0.999,精確率無損失。
我們也在相同相似度截止值下比較了密度聚類與互kNN連通元件。DBSCAN恢復了更多召回率;互kNN在緊塊下連線不足,除非新增詞彙/模板邊——但這產生了合併錯誤,降低了純度。合約塊內的密度是正確的歸納偏差。
Seldon如何保持誠實:拒絕不可編譯的,驗證可編譯的,質量下降時回退。下一步:叢集檔案→家族標籤A–G/不可編譯→排名節省地圖→移交合成。LLM屬於檔案/提案步驟,而非分割槽。
開發者應該關心:如果你正在構建LLM閘道器/路由器、評估或可觀測性堆疊、或內部“從追蹤自動ETL”原型,預設的ML直覺(嵌入提示/摘要)最佳化了錯誤的相似性。合約優先的Trace Audit是Seldon將閘道器流量轉換為可編譯節省的排名地圖的方式。
注意事項:標籤是工作量ID,與合約家族對齊——部分自我實現。策展行是模板迴圈的。Phi-4被截斷用於AI成本控制。