你不需要LLM來聚類LLM追蹤記錄
一種使用合約塊雜湊和確定性特徵而非LLM摘要來聚類LLM追蹤記錄的技術,以極低的模型成本實現了近乎完美的精確率和召回率。Seldon的Trace Audit透過硬合約塊和塊內DBSCAN,按程式身份而非主題聚類,並識別可編譯的工作流以替換為更便宜的確定性流水線。
- Seldon的Trace Audit使用硬合約塊和基於確定性特徵字串的塊內DBSCAN按程式身份而非主題聚類追蹤記錄。
- LLM生成的摘要會降低純度並增加不必要成本;最好在聚類後用於標籤。
日報
2026-07-24 精選 10 條,按主題聚合。其餘新聞折疊歸檔。
一種使用合約塊雜湊和確定性特徵而非LLM摘要來聚類LLM追蹤記錄的技術,以極低的模型成本實現了近乎完美的精確率和召回率。Seldon的Trace Audit透過硬合約塊和塊內DBSCAN,按程式身份而非主題聚類,並識別可編譯的工作流以替換為更便宜的確定性流水線。
Jefferies 使用 Strands Agents、Amazon Bedrock 和 MCP 工具構建了代理型 AI 交易助手,使交易員能夠透過自然語言查詢資料,減少對 IT 的依賴並加速洞察。
Motorway與AWS合作構建了端到端評估管道,將錯誤結果從每8次查詢1次減少到每50次1次,並將問題檢測時間從幾小時縮短到幾分鐘。該管道結合了Strands Agents SDK與Amazon Bedrock AgentCore,本文介紹瞭如何為您的代理構建此管道。
Amazon Bedrock AgentCore最佳化能夠發現生產環境中AI代理的靜默行為故障——那些透過所有健康檢查但產生錯誤結果的故障。瞭解如何透過洞察發現、解釋和排序跨會話的故障模式,從而優先修復影響最大的問題。
經典檢索在應對多部分、比較性和探索性問題時表現不佳,而智慧檢索透過規劃迴圈分解查詢、逐意圖檢索並評估充分性,提供更精準的結果。本文深入探討智慧檢索的工作原理、API使用方法及適用場景。
本文介紹了一套評估AI模型是否會執行來自不可信文件的偽造值的基準測試。在十項關鍵工作流中,所有被測試的模型(從四個提供商)均表現出程度不同的脆弱性,且防護措施ActionRail成功阻止了所有被汙染的操作,且無誤報。
本文分析Linus Torvalds關於AI在Linux核心開發中的立場的郵件,指出Linus將AI視為工具並強調技術至上,作者認為這是合理的,但批評了AI炒作機器對Linus言論的利用和斷章取義。文章深入探討了修辭手法、文本分析中的“解經”與“強解”,以及如何識別對權威話語的武器化。
OpenAI 於週四在美國向所有使用者推出 ChatGPT Health,允許使用者連線醫療記錄和健康追蹤資料。該公司高管稱模型推理能力已超越臨床醫生水平,但隨後又對宣告進行緩和。與此同時,一位牧師因 ChatGPT 提供“極其危險的醫療建議”而提起訴訟。
Centrica執行長Chris O'Shea為公司計劃辯護,稱大多數客戶更願意與AI聊天機器人互動。公司計劃裁減1300個呼叫中心崗位,其中800個與AI工具部署直接相關。
本文介紹如何使用Highcharts自定義視覺化在QuickSight中構建多區域運營商績效儀表板,克服原生圖表限制,同時透過QuickSight聯合資料集能力維護跨AWS區域的資料主權。解決方案包括生產就緒的圖表配置,並滿足安全、合規和可擴充套件性要求。