可復現的日誌驅動AutoML框架:面向醫療風險預測的可解釋流水線優化
本研究提出yvsoucom-iterkit,一個確定性、日誌驅動的自動化機器學習框架,將流水線優化編碼為可追蹤的日誌實體,實現組件歸因、交互、相似性和跨種子魯棒性分析。在Pima印第安人糖尿病和中風數據集上的實驗(超過18,000種流水線配置)揭示了結構化且部分冗餘的搜索空間,性能由少數交互組件主導。隨機森林重要性分析顯示,增強(0.454)、模型選擇(0.198)和不平衡處理(0.101)是Pima的關鍵驅動因素,而不平衡處理主導中風數據集(0.406)。組件相似性分析表明強冗餘性。集成模型取得了強勁穩定的性能(Pima上加權F1為0.89,宏F1為0.88;中風上加權F1為0.94),但中風上的宏F1較低(0.67)。跨種子分析揭示了性能-魯棒性權衡。結果表明有效的AutoML優化可以聚焦於少量高影響組件。
準確的疾病風險預測在醫療領域至關重要,但由於特徵異質性、樣本有限和嚴重的類別不平衡,實現準確且可復現的預測仍然充滿挑戰。近日,一項研究提出了yvsoucom-iterkit,這是一個基於確定性日誌驅動的自動化機器學習(AutoML)框架,旨在通過完全可復現的方式優化數據流水線。該框架將每條流水線編碼為可追蹤的日誌實體,從而支持組件歸因、交互分析、相似性評估以及跨種子魯棒性分析。
研究人員在Pima印第安人糖尿病數據集和中風數據集上進行了廣泛實驗,探索了超過18,000種不同的流水線配置。結果表明,搜索空間雖然結構複雜,但存在顯著的冗餘性,性能主要由少數交互組件決定。通過隨機森林重要性分析,研究團隊識別出在Pima數據集中,數據增強(重要性0.454)、模型選擇(0.198)和類別不平衡處理(0.101)是影響性能的關鍵因素;而在中風數據集中,類別不平衡處理的作用更為突出(0.406)。
進一步分析組件相似性時,發現不同組件之間存在高度冗餘。例如,特徵選擇變體之間的均方根距離僅為0.0252,mixup增強與無增強非常接近(0.0279),而TomekLinks與不處理不平衡的相似度也很高(0.0325)。相比之下,高斯噪聲與無增強的差異更大(0.10)。這些結果揭示了優化過程中許多組件組合可能產生相似效果。
在預測性能方面,集成模型表現穩定且優異:在Pima數據集上,加權F1得分為0.89,宏F1為0.88;在中風數據集上,加權F1高達0.94,但宏F1僅為0.67。宏F1較低的原因主要是中風數據集中嚴重的類別不平衡。跨種子分析還顯示,集成模型的性能變異性較低(0.023–0.026),優於支持向量機(SVM)的變異性。
總體而言,該研究強調了在醫療風險預測中,有效的AutoML優化不應盲目探索所有組件,而是應聚焦於少數高影響力組件。這一可復現的日誌驅動框架為臨牀預測模型的構建提供了新的思路,有望提高模型在真實世界應用中的可靠性和可解釋性。