EMA:面向學習型系統的高效模型適配方法
EMAF系統是首個支持學習型系統在動態環境中以最小開銷進行模型適配的方案。通過狀態變換器實現跨環境狀態對齊,並採用高效用數據優先標註策略,EMA在八個代表性系統上降低了14.9%-42.4%的適配成本(如GPU訓練時間),同時將系統性能(如網絡吞吐量)提升了6.9%-31.3%。
機器學習(ML)越來越多地被用於優化系統性能,例如資源管理和網絡仿真。然而,與傳統ML任務(如圖像分類)不同,網絡化系統通常在異構、長期運行且動態變化的環境中運行,輸入條件(如網絡負載)和操作目標會隨時間或設置發生變化。現有的學習型系統對適配的支持很少,導致模型訓練成本高昂、數據收集規模龐大、系統性能下降以及響應緩慢。
為了解決這些挑戰,來自多所機構的研究人員提出了EMA,這是首個支持學習型系統在演化環境中以最小操作開銷進行模型適配的系統。EMA採用系統驅動、數據為中心的方法,兼容多種系統和模型設計,同時應對兩個關鍵部署挑戰。首先,通過引入狀態變換器,將新環境的輸入狀態與之前相似的狀態對齊,使模型能夠熱身啓動適配過程,從而減少昂貴的模型訓練。狀態變換器學習一個映射函數,能夠將不同環境下的狀態空間進行對齊,使得在新環境中,模型可以重用之前學習到的知識,避免從頭開始訓練。其次,針對常被忽視但成本高昂的數據標註過程——即為探索和訓練各種系統決策收集地面實況——EMA優先標註高價值數據,同時平衡訓練成本與標註成本之間的權衡。具體來説,EMA使用一個效用函數來評估每個未標註數據點的潛在價值,只標註那些對模型性能提升最大的數據,從而在不犧牲性能的前提下顯著降低標註開銷。
在八個代表性學習型系統(包括資源分配、網絡優化、流量工程等)上的評估表明,EMA將適配成本(如GPU訓練時間)降低了14.9%-42.4%,同時將系統性能(如網絡吞吐量)提升了6.9%-31.3%。這些結果證實了EMA在減少資源消耗和提升系統效率方面的有效性。該論文已被SIGCOMM 2026接收,作者包括Daiyang Yu、Xinyu Chen、Yihan Zhang、Yan Liang、Yaqi Qiao和Fan Lai。研究代碼和數據將在後續發佈。