AI News HubLIVE
站內改寫1 分鐘閱讀

PanDent:邁向牙科放射學中全面的牙齒級結構-語言一致性

研究團隊推出PanDent,一個包含9,524張高質量牙科全景X光片、經專家驗證的牙齒級結構標註的大規模基準,用於評估多模態大語言模型在牙科影像中的臨床推理能力。實驗顯示,現有MLLM雖然能生成流暢的報告,但在牙齒定位和診斷上常出現明顯錯誤;在PanDent上微調可顯著提升結構-語言一致性和診斷準確性。

來源arXiv Computer Vision作者: Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

多模態大語言模型(MLLM)在牙科全景X線攝影(orthopantomogram,OPG)中的應用日益受到關注,但如何準確評估其臨床能力仍是一大難題。現有評估方法往往缺乏細粒度、經過臨床驗證的基準,難以判斷模型是否真正理解牙齒級別的結構資訊與診斷邏輯。為此,Xiaohan Li等研究者提出了PanDent——一個大規模、以臨床為基礎的OPG基準,旨在填補這一空白。

PanDent資料集包含9,524張高質量的全景牙科X光片,每張影像都配有由經驗豐富的牙醫製作、並經口腔頜面放射科醫生進一步驗證的完整結構化標註。這些標註覆蓋牙齒級診斷與推理所需的臨床資訊,為模型訓練和評估提供了可靠的監督訊號。研究團隊還利用臨床醫生定義的報告邏輯,將專家驗證過的結構化發現轉換為與臨床一致的放射學報告,使結構化臨床證據與自然語言描述之間建立起明確的對應關係。

基於這一設計,研究者系統評估了多種MLLM,包括最先進的專有模型、通用領域開源模型和醫學專用模型。實驗結果顯示,現有模型能夠生成流利的放射學報告,但在臨床一致性上表現不佳,在細粒度定位和牙齒級診斷方面存在大量錯誤。這說明僅憑語言流暢性無法反映模型的真實臨床推理能力,亟需像PanDent這樣以專家標註為核心的評測基準來揭示模型的不足。

研究者進一步在PanDent上對模型進行微調,結果表明模型的結構-語言一致性得到顯著提升,視覺定位準確率和診斷正確率均有大幅改善,輸出結果更接近牙科專家的解讀。這一發現表明,高質、細粒度的臨床標註資料可以成為提升牙科AI可靠性的關鍵資源。該論文由七位作者完成,於2026年7月29日提交至arXiv(編號arXiv:2607.27378),歸屬於計算機視覺與模式識別(cs.CV)和多媒體(cs.MM)方向,並提供PDF、HTML等全文訪問方式。研究團隊希望PanDent能夠成為評估MLLM牙齒級臨床推理能力的嚴格基準,同時為臨床導向的牙科人工智慧研究提供有力支撐。