AI News HubLIVE
站内改写1 分钟阅读

通过图柯尔莫哥洛夫复杂度进行逻辑语法归纳:一种用于自愈临床数据完整性的神经符号框架

本文提出Logic-GNN,一种神经符号框架,将临床记录视为由潜在逻辑游戏支配的“私人语言”,通过集成时序图神经网络和图柯尔莫哥洛夫复杂度归纳符号语法,将异常定义为导致临床图最小描述长度显著扩展的“语法违规”。在Sina System数据集(超过200万条记录)上,Logic-GNN达到了0.94的F1分数,在区分危及生命的医学异常和数据损坏方面比最先进的基线方法高出12%,并引入自愈机制以实时维护数据完整性。

来源arXiv Machine Learning作者: Abolfazl Zarghani, Amir Malekesfandiari

在医疗信息系统(HIS)中,人为输入错误是数据完整性的主要威胁之一。现有统计异常检测方法常常无法区分这些错误和真实的临床极端情况,导致误报或漏报。针对这一问题,来自研究人员Abolfazl Zarghani 等人提出了一种名为 Logic-GNN 的新型神经符号框架。该框架将临床记录视为一种由潜在逻辑游戏支配的“私人语言”,通过集成时序图神经网络(TGNN)和图柯尔莫哥洛夫复杂度(Graph Kolmogorov Complexity),自动归纳出表示医疗交互底层逻辑的符号语法。在这一框架中,异常被定义为导致临床图最小描述长度(MDL)显著扩展的“语法违规”。与传统方法依赖预定义规则或统计阈值不同,Logic-GNN 从临床数据中自适应学习模式,能够捕捉复杂的时间交互关系。

研究团队在 Sina System 数据集上进行了评估,该数据集包含超过200万条临床记录。实验结果显示,Logic-GNN 在区分危及生命的医学异常与数据损坏方面达到了0.94的F1分数,比当前最先进的基线方法高出12%。此外,该框架引入了一种自愈机制:当检测到“语法违规”时,系统会建议逻辑修正,从而在实时环境中维护数据完整性。这一能力对于HIS的可靠性至关重要,因为及时纠正输入错误可以防止潜在的医疗事故。

Logic-GNN 的核心创新在于将图神经网络与柯尔莫哥洛夫复杂度结合,从时间序列数据中学习语法规则。通过图柯尔莫哥洛夫复杂度,系统能够量化临床图的复杂性,并识别出导致描述长度显著增加的异常模式。该方法不仅在医疗数据清洗领域展现了巨大潜力,也为神经符号学习在现实世界中的应用提供了新思路。未来,研究团队计划将该框架扩展到金融交易日志等领域的异常检测,并进一步优化自愈建议的临床可解释性。该论文于2026年5月14日提交至arXiv,编号为2605.15242,被认为是机器学习和医疗信息学交叉领域的重要进展。