Show HN:Setoku – 面向AI代理的自託管知識伺服器
Setoku 是一個開源的、自託管的 MCP 知識伺服器,為 AI 代理提供對公司資料的只讀訪問、指標定義和陷阱的記憶,以及構建和共享儀表板的能力。它執行在廉價 VPS 上,無需模型推理成本,並強調安全性——知識更新需要人工批准。
- Setoku 是一個自託管 MCP 伺服器,讓 AI 代理查詢公司資料,同時理解其含義。
- 提供只讀查詢、上下文工具和應用釋出功能,支援人類稽核知識變更。
評估AI代理:使用Strands和AgentCore的生產藍圖
Motorway與AWS合作構建了端到端評估管道,將錯誤結果從每8次查詢1次減少到每50次1次,並將問題檢測時間從幾小時縮短到幾分鐘。該管道結合了Strands Agents SDK與Amazon Bedrock AgentCore,本文介紹瞭如何為您的代理構建此管道。
- Motorway與AWS合作構建AI驅動的經銷商庫存搜尋代理,將自然語言查詢轉化為搜尋結果。
- 兩階段評估策略:構建時測試(strands-agents-evals)和生產監控(Amazon Bedrock AgentCore Evaluations)。
使用Amazon Bedrock AgentCore最佳化檢測靜默代理故障
Amazon Bedrock AgentCore最佳化能夠發現生產環境中AI代理的靜默行為故障——那些透過所有健康檢查但產生錯誤結果的故障。瞭解如何透過洞察發現、解釋和排序跨會話的故障模式,從而優先修復影響最大的問題。
- 靜默故障不會產生錯誤訊號,但會導致錯誤結果,如訂單未執行或庫存狀態錯誤。
- AgentCore透過分析會話跟蹤資料,發現11種行為故障型別,包括幻覺、錯誤操作等。
面向Amazon Bedrock託管知識庫的智慧檢索
經典檢索在應對多部分、比較性和探索性問題時表現不佳,而智慧檢索透過規劃迴圈分解查詢、逐意圖檢索並評估充分性,提供更精準的結果。本文深入探討智慧檢索的工作原理、API使用方法及適用場景。
- 單次檢索在多意圖查詢中難以有效工作。
- 智慧檢索使用基礎模型分解查詢、迭代檢索並判斷是否足夠。
針對智慧體關鍵行動的價值投毒基準測試
本文介紹了一套評估AI模型是否會執行來自不可信文件的偽造值的基準測試。在十項關鍵工作流中,所有被測試的模型(從四個提供商)均表現出程度不同的脆弱性,且防護措施ActionRail成功阻止了所有被汙染的操作,且無誤報。
- 針對AI智慧體在實際行動中執行偽造值的風險提出了新的基準測試方法。
- 測試了來自四個提供商的八種模型,發現所有模型均存在脆弱性,脆弱率從1.7%到63.3%不等。
為什麼Linus是對的而AI是錯的
本文分析Linus Torvalds關於AI在Linux核心開發中的立場的郵件,指出Linus將AI視為工具並強調技術至上,作者認為這是合理的,但批評了AI炒作機器對Linus言論的利用和斷章取義。文章深入探討了修辭手法、文本分析中的“解經”與“強解”,以及如何識別對權威話語的武器化。
- Linus Torvalds明確表示Linux核心專案不反對AI,反對者可以分支或離開。
- 作者認為Linus的立場合理,但警告AI支持者不應濫用其言論壓制批評者。