你不需要LLM来聚类LLM追踪记录
一种使用合约块哈希和确定性特征而非LLM摘要来聚类LLM追踪记录的技术,以极低的模型成本实现了近乎完美的精确率和召回率。Seldon的Trace Audit通过硬合约块和块内DBSCAN,按程序身份而非主题聚类,并识别可编译的工作流以替换为更便宜的确定性流水线。
- Seldon的Trace Audit使用硬合约块和基于确定性特征字符串的块内DBSCAN按程序身份而非主题聚类追踪记录。
- LLM生成的摘要会降低纯度并增加不必要成本;最好在聚类后用于标签。
日报
2026-07-24 精选 10 条,按主题聚合。其余新闻折叠归档。
一种使用合约块哈希和确定性特征而非LLM摘要来聚类LLM追踪记录的技术,以极低的模型成本实现了近乎完美的精确率和召回率。Seldon的Trace Audit通过硬合约块和块内DBSCAN,按程序身份而非主题聚类,并识别可编译的工作流以替换为更便宜的确定性流水线。
Jefferies 使用 Strands Agents、Amazon Bedrock 和 MCP 工具构建了代理型 AI 交易助手,使交易员能够通过自然语言查询数据,减少对 IT 的依赖并加速洞察。
Motorway与AWS合作构建了端到端评估管道,将错误结果从每8次查询1次减少到每50次1次,并将问题检测时间从几小时缩短到几分钟。该管道结合了Strands Agents SDK与Amazon Bedrock AgentCore,本文介绍了如何为您的代理构建此管道。
Amazon Bedrock AgentCore优化能够发现生产环境中AI代理的静默行为故障——那些通过所有健康检查但产生错误结果的故障。了解如何通过洞察发现、解释和排序跨会话的故障模式,从而优先修复影响最大的问题。
经典检索在应对多部分、比较性和探索性问题时表现不佳,而智能检索通过规划循环分解查询、逐意图检索并评估充分性,提供更精准的结果。本文深入探讨智能检索的工作原理、API使用方法及适用场景。
本文介绍了一套评估AI模型是否会执行来自不可信文档的伪造值的基准测试。在十项关键工作流中,所有被测试的模型(从四个提供商)均表现出程度不同的脆弱性,且防护措施ActionRail成功阻止了所有被污染的操作,且无误报。
本文分析Linus Torvalds关于AI在Linux内核开发中的立场的邮件,指出Linus将AI视为工具并强调技术至上,作者认为这是合理的,但批评了AI炒作机器对Linus言论的利用和断章取义。文章深入探讨了修辞手法、文本分析中的“解经”与“强解”,以及如何识别对权威话语的武器化。
OpenAI 于周四在美国向所有用户推出 ChatGPT Health,允许用户连接医疗记录和健康追踪数据。该公司高管称模型推理能力已超越临床医生水平,但随后又对声明进行缓和。与此同时,一位牧师因 ChatGPT 提供“极其危险的医疗建议”而提起诉讼。
Centrica首席执行官Chris O'Shea为公司计划辩护,称大多数客户更愿意与AI聊天机器人互动。公司计划裁减1300个呼叫中心岗位,其中800个与AI工具部署直接相关。
本文介绍如何使用Highcharts自定义可视化在QuickSight中构建多区域运营商绩效仪表板,克服原生图表限制,同时通过QuickSight联合数据集能力维护跨AWS区域的数据主权。解决方案包括生产就绪的图表配置,并满足安全、合规和可扩展性要求。