使用 Amazon Quick 為 Amazon SageMaker AI 端點構建推理元監控系統
瞭解如何使用 Amazon Quick 為 Amazon SageMaker AI 端點構建推理元監控系統。這一治理層位於生產機器學習推理管道之上,持續跟蹤預測和資料質量、檢測漂移、整合延遲的真實值,並提供自動化的效能儀表板。
在機器學習(ML)模型部署到生產環境後,如果沒有持續監控,組織往往只能透過客戶投訴或臨時抽查才發現問題,這會損害客戶信任。本文介紹了一種用於 Amazon SageMaker AI 端點的推理元監控系統,它提供了一個治理層,位於生產 ML 推理管道之上,用於持續跟蹤預測和資料質量指標並視覺化趨勢。
推理監控缺口
開發預測性 ML 模型通常是一個資源密集型過程。團隊投入數月構建訓練管道,以在欺詐檢測、信用評分或需求預測等用例中獲得強大的驗證準確性。然而,部署後的模型效能可能會無聲地退化,而團隊可能在數週後才注意到。欺詐處理人員會看到誤報激增,信貸員會看到更多本應被標記的申請,企業資源規劃人員則會因需求預測過高而面臨庫存過剩。
因此,ML 團隊需要一個能夠持續反饋生產模型效能的系統。該系統應在檢測到模型質量或資料漂移時立即發出警報,使團隊能夠及早採取行動,保持模型效能的一致性,從而維持客戶信任。
解決方案概述
此推理元監控解決方案結合了 AWS 託管服務(Amazon SageMaker AI、Amazon Athena、AWS Lambda、Amazon EventBridge、Amazon Quick)和開源 ML 工具(SageMaker AI MLflow Apps、Evidently AI)。
前提條件
您需要一個 AWS 賬戶。使用儲存庫中提供的 CloudFormation 模板建立虛擬私有云(VPC)、子網、SageMaker AI 域、使用者配置檔案和 JupyterLab 空間。該模板還會克隆 Git 儲存庫並更新 .env 檔案中的實際值。
設定
CloudFormation 模板自動完成整個設定。如果您打算使用現有域,可以克隆儲存庫,更新 env 值並按順序執行筆記本。
架構
該系統實現了整合的訓練、推理和監控管道,透過中央 Athena Iceberg 表、Amazon Quick 和 SageMaker AI MLflow Apps 統一起來。
訓練管道(1_training_pipeline.ipynb)
訓練管道包括在 MLflow 中的實驗跟蹤。它設定端到端模型訓練:從 Kaggle 下載信用卡欺詐資料集,將資料攝入到 S3 並載入到訓練資料中。架構使用五個 Athena Iceberg 表形成中央資料湖。training_data 表儲存用於擬合模型的 80% 資料,evaluation_data 表是凍結的 20% 保留切片,用於評分模型。evaluation_data 是漂移監控的基線,因為保留切片是衡量每個註冊模型指標的標準。兩個表透過確定性雜湊分割 transaction_id 從相同的預測 CSV 填充,確保行分割槽在不同管道執行之間保持穩定。
模型部署(2_deployment.ipynb)
部署步驟將自定義處理程序部署到 SageMaker AI 推理端點。推理處理程序將所有推理寫入 Amazon Simple Queue Service(Amazon SQS),然後由 inference-logger Lambda 函式處理。該 Lambda 函式最多批次處理 10 個預測,或 30 秒內到達的預測數,並寫入 Athena Iceberg 表。
推理監控(3_inference_monitoring.ipynb)
監控步驟包括真實值模擬和漂移計算。首先,透過呼叫模型並注入漂移輸入特徵來模擬資料漂移。在實際環境中,這對應於業務應用程式隨時間傳送具有漂移輸入的推理請求。然後,模擬真實值:隨機翻轉實際欄位為欺詐/非欺詐,注入 15% 的不準確性以誘導模型漂移。
接下來,將推理響應表中的預測與真實值更新表中的非同步標籤確認合併。合併後,系統計算資料漂移和模型漂移。對於資料漂移,使用訓練資料的凍結切片作為參考分佈,將近期推理輸入特徵與基線比較。對於模型漂移,使用評估資料的凍結切片,將近期推理(已加入真實值)與基線比較,跟蹤 ROC-AUC、精確率、召回率和 F1 的退化。
漂移 Lambda 函式解析當前端點服務的模型,載入其註冊的 baseline.json,並獨立執行兩項檢查。每次執行的輸出儲存在 monitoring_responses 表中,包括模型包 ARN 和 Iceberg 快照 ID,從而可按模型版本切片趨勢。
每個註冊模型都攜帶一個凍結的 baseline.json 工件,記錄其在 evaluation_data 上獲得的指標、該資料切片的 Iceberg 快照 ID 以及生成它的程式碼提交 SHA。漂移 Lambda 在每次執行時解析這些指標,確保監控系統始終將生產環境與部署模型對應的精確資料版本進行比較,避免引用過時或錯誤版本。
透過這種元監控系統,ML 團隊可以在模型質量或資料漂移發生時立即獲得警報,從而保持模型效能的一致性並維護客戶信任。