AI News HubLIVE
站内改写3 分钟阅读

你不需要LLM来聚类LLM追踪记录

一种使用合约块哈希和确定性特征而非LLM摘要来聚类LLM追踪记录的技术,以极低的模型成本实现了近乎完美的精确率和召回率。Seldon的Trace Audit通过硬合约块和块内DBSCAN,按程序身份而非主题聚类,并识别可编译的工作流以替换为更便宜的确定性流水线。

来源Hacker News AI作者: nlpnerd

如果你运行一个兼容OpenAI的网关足够长时间,你会淹没在看似不同实则相同的追踪记录中。相同的JSON schema、相同的“返回答案跨度”、相同的“规范化此发行人名称”——不同的公司、金额和句子,但合同完全一致。这正是Seldon背后的逻辑:找出这些程序,然后将重复的编译为更便宜的确定性流水线。本文介绍这一循环的前半部分——Trace Audit——以及我们在大规模压力测试中学到的经验。

编译只有在能够先回答一个精确问题时才有效:哪些追踪是相同的可替换程序,而不仅仅是相同的话题?我们为Trace Audit v0构建了答案,在12,517条追踪上进行了测量,并保留了那些教会我们比模型更多知识的错误。审计只是故事的一半:一旦聚类存在,Seldon将其视为受限程序合成的规范。我们简要描述编译步骤;专门的后续文章将深入探讨合成器。

简而言之:首先进行硬合约块,然后在确定性特征字符串(embedding_text)上进行块内DBSCAN。我们达到了1.000/0.9999/1.000的配对精确率/召回率/纯度——模型成本几乎为零。实时摘要器(GPT-4.1、GPT-5.6-luna、Phi-4)无助于聚类;它们降低了纯度。在聚类后使用LLM进行标签和档案,而非作为聚类信号。

为什么这对交付LLM产品的团队很重要?大多数团队从前沿模型开始,因为它是原型提取、分类和规范化的最快方式。然后量出现了,大部分调用变成了相同的形状:文档/工单/记录→相同的提示模板→相同的响应格式/输出形状→不同的有效载荷。你正在为披着提示外衣的ETL支付推理价格——通常没有血缘关系、没有哪些工作流主导花费的排名视图、也没有安全脱离模型的道路。

Seldon的循环刻意简单:查看(网关流量→合约兼容聚类→按节省排序的工作流地图)、编译(搜索类型化操作符库以找到复制该聚类的更便宜流水线)、信任(在你追踪上进行影子验证;自动LLM后备;质量下降时降级)。Trace Audit是第一步。桶搞错了,下游一切都将是虚构的。

错误的直觉(以及为什么它无处不在)是:使用嵌入和LLM摘要来理解LLM流量。对于编译器,这是错误的目标函数。我们不想要“这些追踪谈论发票”,而是“这些追踪是相同的可编译提取程序”。程序身份≠文档相似性。

Trace Audit v0的工作原理:在合成之前,审计必须将流量划分为合约兼容的聚类。错误合并毒害合成——你会针对混合规范进行搜索。错误分裂隐藏节省——你永远不会注意到量。

流水线:首先定义合约块(哈希工作区、角色序列、响应模式、schema、工具签名、输出形状、JSON键、IO合约桶)。我们故意不将原始提示长度放入块键中。长度是有效载荷属性,而非可替换性约束。然后我们在块内对embedding_text(任务签名|角色=…|模式=…|形状=…|键=…|提示=…,变量实体被折叠)进行DBSCAN。这是聚类程序,而非文档。

我们在约10%的每个公开训练分割加上小型策展系列上构建了真实的OpenAI形状套件:Banking77(意图)1000、SQuAD(跨度提取)8759、CoNLL-2003(实体→ID)1404、STS-B(对相似性)574、GSM8K(数值答案)747、策展发票/发行人/散文各10、对抗性“桥梁”追踪3。总计12,517条,其中12,504条在跳过微小/全散文块后符合条件。

我们比较了相同块、资格守卫和余弦截止值(约0.82/eps=0.18)下的四种方法:embedding_text + 块内DBSCAN、确定性摘要 + DBSCAN、GPT-4.1摘要 + DBSCAN、GPT-5.6-luna摘要 + DBSCAN、Phi-4摘要 + DBSCAN。结果:embedding_text + DBSCAN 以1.000/0.9999/1.000获胜。LLM摘要降低了纯度(GPT-4.1 0.920,Luna 0.920,Phi-4 1.000但召回率低至0.771)。

两个比模型更重要的错误:输入长度桶将相同工作流按提示长度拆分,已移除;数字作为跨度提取过于激进,仅在提示指示提取且数字作为完整标记出现在输入中时才重新分类。修复后,召回率跃升至约0.999,精确率无损失。

我们也在相同相似度截止值下比较了密度聚类与互kNN连通组件。DBSCAN恢复了更多召回率;互kNN在紧块下连接不足,除非添加词汇/模板边——但这产生了合并错误,降低了纯度。合约块内的密度是正确的归纳偏差。

Seldon如何保持诚实:拒绝不可编译的,验证可编译的,质量下降时回退。下一步:集群档案→家族标签A–G/不可编译→排名节省地图→移交合成。LLM属于档案/提案步骤,而非分区。

开发者应该关心:如果你正在构建LLM网关/路由器、评估或可观测性堆栈、或内部“从追踪自动ETL”原型,默认的ML直觉(嵌入提示/摘要)优化了错误的相似性。合约优先的Trace Audit是Seldon将网关流量转换为可编译节省的排名地图的方式。

注意事项:标签是工作量ID,与合约家族对齐——部分自我实现。策展行是模板循环的。Phi-4被截断用于AI成本控制。