AI News HubLIVE
站内改写1 分钟阅读

PanDent:迈向牙科放射学中全面的牙齿级结构-语言一致性

研究团队推出PanDent,一个包含9,524张高质量牙科全景X光片、经专家验证的牙齿级结构标注的大规模基准,用于评估多模态大语言模型在牙科影像中的临床推理能力。实验显示,现有MLLM虽然能生成流畅的报告,但在牙齿定位和诊断上常出现明显错误;在PanDent上微调可显著提升结构-语言一致性和诊断准确性。

来源arXiv Computer Vision作者: Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

多模态大语言模型(MLLM)在牙科全景X线摄影(orthopantomogram,OPG)中的应用日益受到关注,但如何准确评估其临床能力仍是一大难题。现有评估方法往往缺乏细粒度、经过临床验证的基准,难以判断模型是否真正理解牙齿级别的结构信息与诊断逻辑。为此,Xiaohan Li等研究者提出了PanDent——一个大规模、以临床为基础的OPG基准,旨在填补这一空白。

PanDent数据集包含9,524张高质量的全景牙科X光片,每张影像都配有由经验丰富的牙医制作、并经口腔颌面放射科医生进一步验证的完整结构化标注。这些标注覆盖牙齿级诊断与推理所需的临床信息,为模型训练和评估提供了可靠的监督信号。研究团队还利用临床医生定义的报告逻辑,将专家验证过的结构化发现转换为与临床一致的放射学报告,使结构化临床证据与自然语言描述之间建立起明确的对应关系。

基于这一设计,研究者系统评估了多种MLLM,包括最先进的专有模型、通用领域开源模型和医学专用模型。实验结果显示,现有模型能够生成流利的放射学报告,但在临床一致性上表现不佳,在细粒度定位和牙齿级诊断方面存在大量错误。这说明仅凭语言流畅性无法反映模型的真实临床推理能力,亟需像PanDent这样以专家标注为核心的评测基准来揭示模型的不足。

研究者进一步在PanDent上对模型进行微调,结果表明模型的结构-语言一致性得到显著提升,视觉定位准确率和诊断正确率均有大幅改善,输出结果更接近牙科专家的解读。这一发现表明,高质、细粒度的临床标注数据可以成为提升牙科AI可靠性的关键资源。该论文由七位作者完成,于2026年7月29日提交至arXiv(编号arXiv:2607.27378),归属于计算机视觉与模式识别(cs.CV)和多媒体(cs.MM)方向,并提供PDF、HTML等全文访问方式。研究团队希望PanDent能够成为评估MLLM牙齿级临床推理能力的严格基准,同时为临床导向的牙科人工智能研究提供有力支撑。