AI News HubLIVE
站內改寫1 分鐘閱讀

Similarweb如何使用LangSmith評估Agent報告

瞭解Similarweb如何使用LangSmith透過評分標準、忠實度檢查、追蹤和基線比較來評估長篇Agent研究報告。

Similarweb是一家測量數字世界的公司,它推出了Data Studio,一個基於代理的系統,允許使用者用自然語言提問,代理自動規劃工作、呼叫資料工具並返回結果。為了確保代理更新的質量,Similarweb採用了兩種評估方法:確定性檢查和LLM-as-judge。確定性檢查用於驗證代理是否呼叫了正確的工具,而LLM-as-judge則用於評估輸出質量。

對於常規聊天,如快速查詢,評估相對簡單:使用黃金答案與代理輸出進行語義比較。然而,對於深度研究任務,輸出是長篇報告,沒有唯一正確答案,因此Similarweb採用了評分標準(rubrics)方法。每個質量維度(如來源整合)都有明確的評分錨點,LLM作為法官給出分數和解釋。此外,還執行忠實度檢查,確保每個主張都基於檢索的資料。

Similarweb使用LangSmith平臺將評估分數與追蹤和基線比較關聯起來。每次執行都在固定資料集上進行,分數作為反饋列在實驗中,可以點選檢視評估推理和代理追蹤。這使得團隊能夠超越平均分數,深入分析哪些案例發生了變化。

Similarweb還發現,如果評分標準未校準,可能會導致誤導。例如,他們最初獎勵“來源整合”得分給提及外部來源的報告,但忽視了來源的質量。這導致一個好的變化看起來像迴歸。透過調整評分標準,優先考慮有具體名稱和日期的高質量來源,他們使分數與實際質量一致。

最終,Similarweb強調,評估不僅僅是記分牌,而是工程工作流。正確的評估方法需要根據輸出型別定製,並且評分標準必須經過校準才能信任。