使用 Amazon Quick 為 Amazon SageMaker AI 端點構建推理元監控系統
瞭解如何使用 Amazon Quick 為 Amazon SageMaker AI 端點構建推理元監控系統。這一治理層位於生產機器學習推理管道之上,持續跟蹤預測和數據質量、檢測漂移、整合延遲的真實值,並提供自動化的性能儀表板。
在機器學習(ML)模型部署到生產環境後,如果沒有持續監控,組織往往只能通過客户投訴或臨時抽查才發現問題,這會損害客户信任。本文介紹了一種用於 Amazon SageMaker AI 端點的推理元監控系統,它提供了一個治理層,位於生產 ML 推理管道之上,用於持續跟蹤預測和數據質量指標並可視化趨勢。
推理監控缺口
開發預測性 ML 模型通常是一個資源密集型過程。團隊投入數月構建訓練管道,以在欺詐檢測、信用評分或需求預測等用例中獲得強大的驗證準確性。然而,部署後的模型性能可能會無聲地退化,而團隊可能在數週後才注意到。欺詐處理人員會看到誤報激增,信貸員會看到更多本應被標記的申請,企業資源規劃人員則會因需求預測過高而面臨庫存過剩。
因此,ML 團隊需要一個能夠持續反饋生產模型性能的系統。該系統應在檢測到模型質量或數據漂移時立即發出警報,使團隊能夠及早採取行動,保持模型性能的一致性,從而維持客户信任。
解決方案概述
此推理元監控解決方案結合了 AWS 託管服務(Amazon SageMaker AI、Amazon Athena、AWS Lambda、Amazon EventBridge、Amazon Quick)和開源 ML 工具(SageMaker AI MLflow Apps、Evidently AI)。
前提條件
您需要一個 AWS 賬户。使用存儲庫中提供的 CloudFormation 模板創建虛擬私有云(VPC)、子網、SageMaker AI 域、用户配置文件和 JupyterLab 空間。該模板還會克隆 Git 存儲庫並更新 .env 文件中的實際值。
設置
CloudFormation 模板自動完成整個設置。如果您打算使用現有域,可以克隆存儲庫,更新 env 值並按順序運行筆記本。
架構
該系統實現了集成的訓練、推理和監控管道,通過中央 Athena Iceberg 表、Amazon Quick 和 SageMaker AI MLflow Apps 統一起來。
訓練管道(1_training_pipeline.ipynb)
訓練管道包括在 MLflow 中的實驗跟蹤。它設置端到端模型訓練:從 Kaggle 下載信用卡欺詐數據集,將數據攝入到 S3 並加載到訓練數據中。架構使用五個 Athena Iceberg 表形成中央數據湖。training_data 表存儲用於擬合模型的 80% 數據,evaluation_data 表是凍結的 20% 保留切片,用於評分模型。evaluation_data 是漂移監控的基線,因為保留切片是衡量每個註冊模型指標的標準。兩個表通過確定性哈希分割 transaction_id 從相同的預測 CSV 填充,確保行分區在不同管道運行之間保持穩定。
模型部署(2_deployment.ipynb)
部署步驟將自定義處理程序部署到 SageMaker AI 推理端點。推理處理程序將所有推理寫入 Amazon Simple Queue Service(Amazon SQS),然後由 inference-logger Lambda 函數處理。該 Lambda 函數最多批量處理 10 個預測,或 30 秒內到達的預測數,並寫入 Athena Iceberg 表。
推理監控(3_inference_monitoring.ipynb)
監控步驟包括真實值模擬和漂移計算。首先,通過調用模型並注入漂移輸入特徵來模擬數據漂移。在實際環境中,這對應於業務應用程序隨時間發送具有漂移輸入的推理請求。然後,模擬真實值:隨機翻轉實際字段為欺詐/非欺詐,注入 15% 的不準確性以誘導模型漂移。
接下來,將推理響應表中的預測與真實值更新表中的異步標籤確認合併。合併後,系統計算數據漂移和模型漂移。對於數據漂移,使用訓練數據的凍結切片作為參考分佈,將近期推理輸入特徵與基線比較。對於模型漂移,使用評估數據的凍結切片,將近期推理(已加入真實值)與基線比較,跟蹤 ROC-AUC、精確率、召回率和 F1 的退化。
漂移 Lambda 函數解析當前端點服務的模型,加載其註冊的 baseline.json,並獨立運行兩項檢查。每次運行的輸出存儲在 monitoring_responses 表中,包括模型包 ARN 和 Iceberg 快照 ID,從而可按模型版本切片趨勢。
每個註冊模型都攜帶一個凍結的 baseline.json 工件,記錄其在 evaluation_data 上獲得的指標、該數據切片的 Iceberg 快照 ID 以及生成它的代碼提交 SHA。漂移 Lambda 在每次運行時解析這些指針,確保監控系統始終將生產環境與部署模型對應的精確數據版本進行比較,避免引用過時或錯誤版本。
通過這種元監控系統,ML 團隊可以在模型質量或數據漂移發生時立即獲得警報,從而保持模型性能的一致性並維護客户信任。