雲原生評估即服務:一種具有保形保證的可擴展AI監控微服務架構
本文介紹EaaS,一種雲原生參考架構,將AI評估方法實現為六個無狀態Kubernetes微服務。實驗驗證了保形預測、漂移檢測、公平性監控等方面的有效性,性能表現優異。
近日,一篇題為《Cloud-Native Evaluation-as-a-Service: A Microservices Architecture for Scalable AI Monitoring with Conformal Guarantees》的論文在arXiv上發佈,作者Lei Yang提出了一種名為EaaS(Evaluation-as-a-Service)的雲原生參考架構。該架構將AI評估方法操作化為六個無狀態的Kubernetes微服務,旨在提供可擴展的AI監控,並具備保形保證。
EaaS架構的核心組件包括:有限樣本校正自適應預測集的保形預測、校準評估、基於RFF近似最大均值差異(MMD)的漂移檢測、帶有自舉置信區間的公平性監控、基於有向無環圖(DAG)的管道編排器以及結果存儲API。這些微服務協同工作,為AI系統的可靠性、公平性和漂移檢測提供統一解決方案。
論文通過四個關鍵方法論驗證了EaaS的有效性。首先,經驗覆蓋率與邊際保形保證一致,在K=50次隨機校準/測試分割中,平均覆蓋率與名義目標相差1.4個百分點以內。其次,所有四個MMLU(Massive Multitask Language Understanding)答案標記出現在前20個logprobs中,無需插補;模擬10%插補僅產生不到1.5%的覆蓋率影響。第三,RFF-MMD在中位數啓發式帶寬下對輕度和重度漂移實現了100%的檢測功率,類型I錯誤率在5-8.5%之間。第四,在UCI成人收入數據集上的公平性監控揭示了顯著的種族人口統計差異(DP差距=0.33),並在連續批次中保持穩定警報。
性能方面,保形預測和校準服務在批大小為100時實現了亞2毫秒的p99延遲;RFF-MMD需要約500毫秒,適合定期批處理監控。與四種開源工具的比較表明,據作者所知,目前沒有任何平台能夠將保形預測即服務、微服務分解和DAG編排相結合。
這一架構為AI監控提供了一種可擴展、模塊化的解決方案,尤其適用於需要嚴格保證和實時性能的生產環境。未來工作可能涉及進一步優化微服務間的通信延遲和擴展至更多類型的AI評估任務。