AI News HubLIVE
站内改写2 分钟阅读

可复现的日志驱动AutoML框架:面向医疗风险预测的可解释流水线优化

本研究提出yvsoucom-iterkit,一个确定性、日志驱动的自动化机器学习框架,将流水线优化编码为可追踪的日志实体,实现组件归因、交互、相似性和跨种子鲁棒性分析。在Pima印第安人糖尿病和中风数据集上的实验(超过18,000种流水线配置)揭示了结构化且部分冗余的搜索空间,性能由少数交互组件主导。随机森林重要性分析显示,增强(0.454)、模型选择(0.198)和不平衡处理(0.101)是Pima的关键驱动因素,而不平衡处理主导中风数据集(0.406)。组件相似性分析表明强冗余性。集成模型取得了强劲稳定的性能(Pima上加权F1为0.89,宏F1为0.88;中风上加权F1为0.94),但中风上的宏F1较低(0.67)。跨种子分析揭示了性能-鲁棒性权衡。结果表明有效的AutoML优化可以聚焦于少量高影响组件。

来源arXiv Machine Learning作者: Rui Huang, Lican Huang

准确的疾病风险预测在医疗领域至关重要,但由于特征异质性、样本有限和严重的类别不平衡,实现准确且可复现的预测仍然充满挑战。近日,一项研究提出了yvsoucom-iterkit,这是一个基于确定性日志驱动的自动化机器学习(AutoML)框架,旨在通过完全可复现的方式优化数据流水线。该框架将每条流水线编码为可追踪的日志实体,从而支持组件归因、交互分析、相似性评估以及跨种子鲁棒性分析。

研究人员在Pima印第安人糖尿病数据集和中风数据集上进行了广泛实验,探索了超过18,000种不同的流水线配置。结果表明,搜索空间虽然结构复杂,但存在显著的冗余性,性能主要由少数交互组件决定。通过随机森林重要性分析,研究团队识别出在Pima数据集中,数据增强(重要性0.454)、模型选择(0.198)和类别不平衡处理(0.101)是影响性能的关键因素;而在中风数据集中,类别不平衡处理的作用更为突出(0.406)。

进一步分析组件相似性时,发现不同组件之间存在高度冗余。例如,特征选择变体之间的均方根距离仅为0.0252,mixup增强与无增强非常接近(0.0279),而TomekLinks与不处理不平衡的相似度也很高(0.0325)。相比之下,高斯噪声与无增强的差异更大(0.10)。这些结果揭示了优化过程中许多组件组合可能产生相似效果。

在预测性能方面,集成模型表现稳定且优异:在Pima数据集上,加权F1得分为0.89,宏F1为0.88;在中风数据集上,加权F1高达0.94,但宏F1仅为0.67。宏F1较低的原因主要是中风数据集中严重的类别不平衡。跨种子分析还显示,集成模型的性能变异性较低(0.023–0.026),优于支持向量机(SVM)的变异性。

总体而言,该研究强调了在医疗风险预测中,有效的AutoML优化不应盲目探索所有组件,而是应聚焦于少数高影响力组件。这一可复现的日志驱动框架为临床预测模型的构建提供了新的思路,有望提高模型在真实世界应用中的可靠性和可解释性。