AI News HubLIVE
站内改写2 分钟阅读

企业AI投资回报率的瓶颈在于反馈循环

本文指出,企业AI投资回报率的主要瓶颈是用于改进专业智能体的反馈循环。目前团队使用即兴流程(如电子表格和工单)进行改进,效率低下。作者介绍了Kinesthetic,一种无需权重更新即可将专家修正转化为智能体行为的解决方案,从而形成闭环。

来源Hacker News AI作者: ant-kinesthetic

在构建生产级专业智能体的团队中,我们不断发现相同的流程:来自可观测性平台的跟踪数据被导出到电子表格,由领域专家注释,然后转换为Linear问题或Jira工单,最终由未参与任何相关对话的工程师进行几乎未经测试的提示编辑。这条流水线是目前大多数垂直AI智能体改进的实际发生方式——它复制了适用于软件开发的即兴流程,但在处理机器学习模型时并不适用。

AI并非炒作。编码智能体(如Claude Code、Codex、Cursor)已经证明了它们的工作价值。然而,在审计、法律、金融等白领工作中,情况截然不同。这些领域没有现成的开放测试套件或基准。正确性取决于主观判断和专业判断,而非逻辑执行和观察。因此,一个关键问题浮现:在无法验证奖励的领域,训练信号从何而来?

大多数团队的回答是:来自人。尽管智能体评判已成为标准,但可靠的真实来源仍然是审查智能体工作并注释错误及原因的专家(通常是内部人员)。在这些不可验证的垂直领域,领域专家就是梯度。

因此,修正循环成为整个问题的核心。如果专家的注释是学习信号(梯度),那么从导出到改进智能体的路径就是学习率。当前,这条路径是一场从领域专家到产品经理再到工程师的传话游戏,产生有损修正,往往导致不稳定或不完整的改进,迫使新一轮注释、分类和开发。

我们与数十个构建智能体的团队交流,意识到运营效率低下是结构性的,而非文化性的。工程师不希望产品经理更新提示,因为他们不了解提示或知识如何在系统中检索和使用;产品经理希望与领域专家确认工程师做出的看起来不合理的任意决策;领域专家产生了大量反馈,而工程团队根本不知道如何优先处理。修正被导出到电子表格,重新编码为工单,在三个需要落地的位置中只实现了其中一个,两周后发布,且未检查是否真正改变了预期行为。

反馈循环没有闭环,也没有基础设施来关闭它。现有的工具(如智能体SDK和可观测性平台)只能帮助快速启动智能体或查看跟踪,但查看跟踪并非难点。难点在于教导智能体,而目前没有基础设施拥有从专家修正到验证行为变更的完整路径。

我们认为,解决之道不在于让领域专家更懂技术或让工程师更懂领域,这两者都是上下文切换的负担。领域专家应该能够直接用其领域语言教导智能体,而工程师则应拥有将修正转化为行为的系统。通过评估而非记忆来关闭循环。

研究方面,后训练似乎是明显的答案,但对大多数团队而言并非正确的第一步。构建强化学习环境、满足数据需求、承担训练成本以及处理治理问题都是挑战。即便解决了这些,持续学习问题仍未解决。权重空间方法仍需应对熵崩溃和灾难性遗忘,近期研究还暴露了知识保留、蕴含差距等更细微的失败。同样,在令牌空间(上下文学习)中,提示学习存在过拟合和退化问题。

我们认为解决方案存在于两者之间。Kinesthetic正在构建一个无需权重更新即可将专家修正转化为智能体行为的层。具体来说,我们获取已解决和修正的轨迹,将其包含的通用程序性指导(元梯度)提炼为令牌空间,并在测试时检索,从而使改进成为领域专家可阅读、可争论、可批准的文本工件,工程师可对其进行版本控制和评估。我们已在Harvey LAB和Sierra τ³-Banking基准上展示了显著改进。

我们的解决方案有两个不可妥协的特性:每项改进都可读可解释,你可以指出改变行为的工件;循环在数据所在的地方运行,轨迹和修正无需离开合作伙伴的环境。我们相信,教导智能体最终应像 onboarding 新员工一样:展示工作,纠正判断,智能体逐渐进步。我们离这个目标还有很长的路,但我们认为差距不会通过等待下一个模型而缩小。