AI News HubLIVE
站内改写1 分钟阅读

云原生评估即服务:一种具有保形保证的可扩展AI监控微服务架构

本文介绍EaaS,一种云原生参考架构,将AI评估方法实现为六个无状态Kubernetes微服务。实验验证了保形预测、漂移检测、公平性监控等方面的有效性,性能表现优异。

来源arXiv Machine Learning作者: Lei Yang

近日,一篇题为《Cloud-Native Evaluation-as-a-Service: A Microservices Architecture for Scalable AI Monitoring with Conformal Guarantees》的论文在arXiv上发布,作者Lei Yang提出了一种名为EaaS(Evaluation-as-a-Service)的云原生参考架构。该架构将AI评估方法操作化为六个无状态的Kubernetes微服务,旨在提供可扩展的AI监控,并具备保形保证。

EaaS架构的核心组件包括:有限样本校正自适应预测集的保形预测、校准评估、基于RFF近似最大均值差异(MMD)的漂移检测、带有自举置信区间的公平性监控、基于有向无环图(DAG)的管道编排器以及结果存储API。这些微服务协同工作,为AI系统的可靠性、公平性和漂移检测提供统一解决方案。

论文通过四个关键方法论验证了EaaS的有效性。首先,经验覆盖率与边际保形保证一致,在K=50次随机校准/测试分割中,平均覆盖率与名义目标相差1.4个百分点以内。其次,所有四个MMLU(Massive Multitask Language Understanding)答案标记出现在前20个logprobs中,无需插补;模拟10%插补仅产生不到1.5%的覆盖率影响。第三,RFF-MMD在中位数启发式带宽下对轻度和重度漂移实现了100%的检测功率,类型I错误率在5-8.5%之间。第四,在UCI成人收入数据集上的公平性监控揭示了显著的种族人口统计差异(DP差距=0.33),并在连续批次中保持稳定警报。

性能方面,保形预测和校准服务在批大小为100时实现了亚2毫秒的p99延迟;RFF-MMD需要约500毫秒,适合定期批处理监控。与四种开源工具的比较表明,据作者所知,目前没有任何平台能够将保形预测即服务、微服务分解和DAG编排相结合。

这一架构为AI监控提供了一种可扩展、模块化的解决方案,尤其适用于需要严格保证和实时性能的生产环境。未来工作可能涉及进一步优化微服务间的通信延迟和扩展至更多类型的AI评估任务。