Show HN:Setoku – 面向AI代理的自托管知识服务器
Setoku 是一个开源的、自托管的 MCP 知识服务器,为 AI 代理提供对公司数据的只读访问、指标定义和陷阱的记忆,以及构建和共享仪表板的能力。它运行在廉价 VPS 上,无需模型推理成本,并强调安全性——知识更新需要人工批准。
- Setoku 是一个自托管 MCP 服务器,让 AI 代理查询公司数据,同时理解其含义。
- 提供只读查询、上下文工具和应用发布功能,支持人类审核知识变更。
评估AI代理:使用Strands和AgentCore的生产蓝图
Motorway与AWS合作构建了端到端评估管道,将错误结果从每8次查询1次减少到每50次1次,并将问题检测时间从几小时缩短到几分钟。该管道结合了Strands Agents SDK与Amazon Bedrock AgentCore,本文介绍了如何为您的代理构建此管道。
- Motorway与AWS合作构建AI驱动的经销商库存搜索代理,将自然语言查询转化为搜索结果。
- 两阶段评估策略:构建时测试(strands-agents-evals)和生产监控(Amazon Bedrock AgentCore Evaluations)。
使用Amazon Bedrock AgentCore优化检测静默代理故障
Amazon Bedrock AgentCore优化能够发现生产环境中AI代理的静默行为故障——那些通过所有健康检查但产生错误结果的故障。了解如何通过洞察发现、解释和排序跨会话的故障模式,从而优先修复影响最大的问题。
- 静默故障不会产生错误信号,但会导致错误结果,如订单未执行或库存状态错误。
- AgentCore通过分析会话跟踪数据,发现11种行为故障类型,包括幻觉、错误操作等。
面向Amazon Bedrock托管知识库的智能检索
经典检索在应对多部分、比较性和探索性问题时表现不佳,而智能检索通过规划循环分解查询、逐意图检索并评估充分性,提供更精准的结果。本文深入探讨智能检索的工作原理、API使用方法及适用场景。
- 单次检索在多意图查询中难以有效工作。
- 智能检索使用基础模型分解查询、迭代检索并判断是否足够。
针对智能体关键行动的价值投毒基准测试
本文介绍了一套评估AI模型是否会执行来自不可信文档的伪造值的基准测试。在十项关键工作流中,所有被测试的模型(从四个提供商)均表现出程度不同的脆弱性,且防护措施ActionRail成功阻止了所有被污染的操作,且无误报。
- 针对AI智能体在实际行动中执行伪造值的风险提出了新的基准测试方法。
- 测试了来自四个提供商的八种模型,发现所有模型均存在脆弱性,脆弱率从1.7%到63.3%不等。
为什么Linus是对的而AI是错的
本文分析Linus Torvalds关于AI在Linux内核开发中的立场的邮件,指出Linus将AI视为工具并强调技术至上,作者认为这是合理的,但批评了AI炒作机器对Linus言论的利用和断章取义。文章深入探讨了修辞手法、文本分析中的“解经”与“强解”,以及如何识别对权威话语的武器化。
- Linus Torvalds明确表示Linux内核项目不反对AI,反对者可以分支或离开。
- 作者认为Linus的立场合理,但警告AI支持者不应滥用其言论压制批评者。