Similarweb如何使用LangSmith评估Agent报告
了解Similarweb如何使用LangSmith通过评分标准、忠实度检查、追踪和基线比较来评估长篇Agent研究报告。
Similarweb是一家测量数字世界的公司,它推出了Data Studio,一个基于代理的系统,允许用户用自然语言提问,代理自动规划工作、调用数据工具并返回结果。为了确保代理更新的质量,Similarweb采用了两种评估方法:确定性检查和LLM-as-judge。确定性检查用于验证代理是否调用了正确的工具,而LLM-as-judge则用于评估输出质量。
对于常规聊天,如快速查询,评估相对简单:使用黄金答案与代理输出进行语义比较。然而,对于深度研究任务,输出是长篇报告,没有唯一正确答案,因此Similarweb采用了评分标准(rubrics)方法。每个质量维度(如来源整合)都有明确的评分锚点,LLM作为法官给出分数和解释。此外,还运行忠实度检查,确保每个主张都基于检索的数据。
Similarweb使用LangSmith平台将评估分数与追踪和基线比较关联起来。每次运行都在固定数据集上进行,分数作为反馈列在实验中,可以点击查看评估推理和代理追踪。这使得团队能够超越平均分数,深入分析哪些案例发生了变化。
Similarweb还发现,如果评分标准未校准,可能会导致误导。例如,他们最初奖励“来源整合”得分给提及外部来源的报告,但忽视了来源的质量。这导致一个好的变化看起来像回归。通过调整评分标准,优先考虑有具体名称和日期的高质量来源,他们使分数与实际质量一致。
最终,Similarweb强调,评估不仅仅是记分牌,而是工程工作流。正确的评估方法需要根据输出类型定制,并且评分标准必须经过校准才能信任。