AI News HubLIVE
站內改寫2 分鐘閱讀

可復現的日誌驅動AutoML框架:面向醫療風險預測的可解釋流水線最佳化

本研究提出yvsoucom-iterkit,一個確定性、日誌驅動的自動化機器學習框架,將流水線最佳化編碼為可追蹤的日誌實體,實現元件歸因、互動、相似性和跨種子魯棒性分析。在Pima印第安人糖尿病和中風資料集上的實驗(超過18,000種流水線配置)揭示了結構化且部分冗餘的搜尋空間,效能由少數互動元件主導。隨機森林重要性分析顯示,增強(0.454)、模型選擇(0.198)和不平衡處理(0.101)是Pima的關鍵驅動因素,而不平衡處理主導中風資料集(0.406)。元件相似性分析表明強冗餘性。整合模型取得了強勁穩定的效能(Pima上加權F1為0.89,宏F1為0.88;中風上加權F1為0.94),但中風上的宏F1較低(0.67)。跨種子分析揭示了效能-魯棒性權衡。結果表明有效的AutoML最佳化可以聚焦於少量高影響元件。

來源arXiv Machine Learning作者: Rui Huang, Lican Huang

準確的疾病風險預測在醫療領域至關重要,但由於特徵異質性、樣本有限和嚴重的類別不平衡,實現準確且可復現的預測仍然充滿挑戰。近日,一項研究提出了yvsoucom-iterkit,這是一個基於確定性日誌驅動的自動化機器學習(AutoML)框架,旨在透過完全可復現的方式最佳化資料流水線。該框架將每條流水線編碼為可追蹤的日誌實體,從而支援元件歸因、互動分析、相似性評估以及跨種子魯棒性分析。

研究人員在Pima印第安人糖尿病資料集和中風資料集上進行了廣泛實驗,探索了超過18,000種不同的流水線配置。結果表明,搜尋空間雖然結構複雜,但存在顯著的冗餘性,效能主要由少數互動元件決定。透過隨機森林重要性分析,研究團隊識別出在Pima資料集中,資料增強(重要性0.454)、模型選擇(0.198)和類別不平衡處理(0.101)是影響效能的關鍵因素;而在中風資料集中,類別不平衡處理的作用更為突出(0.406)。

進一步分析元件相似性時,發現不同元件之間存在高度冗餘。例如,特徵選擇變體之間的均方根距離僅為0.0252,mixup增強與無增強非常接近(0.0279),而TomekLinks與不處理不平衡的相似度也很高(0.0325)。相比之下,高斯噪聲與無增強的差異更大(0.10)。這些結果揭示了最佳化過程中許多元件組合可能產生相似效果。

在預測效能方面,整合模型表現穩定且優異:在Pima資料集上,加權F1得分為0.89,宏F1為0.88;在中風資料集上,加權F1高達0.94,但宏F1僅為0.67。宏F1較低的原因主要是中風資料集中嚴重的類別不平衡。跨種子分析還顯示,整合模型的效能變異性較低(0.023–0.026),優於支援向量機(SVM)的變異性。

總體而言,該研究強調了在醫療風險預測中,有效的AutoML最佳化不應盲目探索所有元件,而是應聚焦於少數高影響力元件。這一可復現的日誌驅動框架為臨床預測模型的構建提供了新的思路,有望提高模型在真實世界應用中的可靠性和可解釋性。