AI News HubLIVE
站内改写2 分钟阅读

使用 Amazon Quick 为 Amazon SageMaker AI 端点构建推理元监控系统

了解如何使用 Amazon Quick 为 Amazon SageMaker AI 端点构建推理元监控系统。这一治理层位于生产机器学习推理管道之上,持续跟踪预测和数据质量、检测漂移、整合延迟的真实值,并提供自动化的性能仪表板。

来源AWS Machine Learning Blog作者: Sunita Koppar

在机器学习(ML)模型部署到生产环境后,如果没有持续监控,组织往往只能通过客户投诉或临时抽查才发现问题,这会损害客户信任。本文介绍了一种用于 Amazon SageMaker AI 端点的推理元监控系统,它提供了一个治理层,位于生产 ML 推理管道之上,用于持续跟踪预测和数据质量指标并可视化趋势。

推理监控缺口

开发预测性 ML 模型通常是一个资源密集型过程。团队投入数月构建训练管道,以在欺诈检测、信用评分或需求预测等用例中获得强大的验证准确性。然而,部署后的模型性能可能会无声地退化,而团队可能在数周后才注意到。欺诈处理人员会看到误报激增,信贷员会看到更多本应被标记的申请,企业资源规划人员则会因需求预测过高而面临库存过剩。

因此,ML 团队需要一个能够持续反馈生产模型性能的系统。该系统应在检测到模型质量或数据漂移时立即发出警报,使团队能够及早采取行动,保持模型性能的一致性,从而维持客户信任。

解决方案概述

此推理元监控解决方案结合了 AWS 托管服务(Amazon SageMaker AI、Amazon Athena、AWS Lambda、Amazon EventBridge、Amazon Quick)和开源 ML 工具(SageMaker AI MLflow Apps、Evidently AI)。

前提条件

您需要一个 AWS 账户。使用存储库中提供的 CloudFormation 模板创建虚拟私有云(VPC)、子网、SageMaker AI 域、用户配置文件和 JupyterLab 空间。该模板还会克隆 Git 存储库并更新 .env 文件中的实际值。

设置

CloudFormation 模板自动完成整个设置。如果您打算使用现有域,可以克隆存储库,更新 env 值并按顺序运行笔记本。

架构

该系统实现了集成的训练、推理和监控管道,通过中央 Athena Iceberg 表、Amazon Quick 和 SageMaker AI MLflow Apps 统一起来。

训练管道(1_training_pipeline.ipynb)

训练管道包括在 MLflow 中的实验跟踪。它设置端到端模型训练:从 Kaggle 下载信用卡欺诈数据集,将数据摄入到 S3 并加载到训练数据中。架构使用五个 Athena Iceberg 表形成中央数据湖。training_data 表存储用于拟合模型的 80% 数据,evaluation_data 表是冻结的 20% 保留切片,用于评分模型。evaluation_data 是漂移监控的基线,因为保留切片是衡量每个注册模型指标的标准。两个表通过确定性哈希分割 transaction_id 从相同的预测 CSV 填充,确保行分区在不同管道运行之间保持稳定。

模型部署(2_deployment.ipynb)

部署步骤将自定义处理程序部署到 SageMaker AI 推理端点。推理处理程序将所有推理写入 Amazon Simple Queue Service(Amazon SQS),然后由 inference-logger Lambda 函数处理。该 Lambda 函数最多批量处理 10 个预测,或 30 秒内到达的预测数,并写入 Athena Iceberg 表。

推理监控(3_inference_monitoring.ipynb)

监控步骤包括真实值模拟和漂移计算。首先,通过调用模型并注入漂移输入特征来模拟数据漂移。在实际环境中,这对应于业务应用程序随时间发送具有漂移输入的推理请求。然后,模拟真实值:随机翻转实际字段为欺诈/非欺诈,注入 15% 的不准确性以诱导模型漂移。

接下来,将推理响应表中的预测与真实值更新表中的异步标签确认合并。合并后,系统计算数据漂移和模型漂移。对于数据漂移,使用训练数据的冻结切片作为参考分布,将近期推理输入特征与基线比较。对于模型漂移,使用评估数据的冻结切片,将近期推理(已加入真实值)与基线比较,跟踪 ROC-AUC、精确率、召回率和 F1 的退化。

漂移 Lambda 函数解析当前端点服务的模型,加载其注册的 baseline.json,并独立运行两项检查。每次运行的输出存储在 monitoring_responses 表中,包括模型包 ARN 和 Iceberg 快照 ID,从而可按模型版本切片趋势。

每个注册模型都携带一个冻结的 baseline.json 工件,记录其在 evaluation_data 上获得的指标、该数据切片的 Iceberg 快照 ID 以及生成它的代码提交 SHA。漂移 Lambda 在每次运行时解析这些指针,确保监控系统始终将生产环境与部署模型对应的精确数据版本进行比较,避免引用过时或错误版本。

通过这种元监控系统,ML 团队可以在模型质量或数据漂移发生时立即获得警报,从而保持模型性能的一致性并维护客户信任。