醫學視覺問答(Med-VQA)通常被認為需要醫學微調、大型模型或複雜的多智能體流程。於2026年9月3日提交至arXiv的一篇論文提出了一種名為MedProb的輕量級探測框架,對這一假設提出質疑。該框架從凍結的視覺語言模型(VLM)的內部表徵中直接預測多項選擇答案,完全避免自由文本生成,從而繞開了生成式評估可能引入的噪聲與偏差。
研究團隊在PATH-VQA、SLAKE和VQA-RAD三個公開的醫學視覺問答基準上進行了實驗。結果顯示,MedProb能夠比提示工程(prompting)恢復出多得多的答案相關信息,並且表現優於醫學專用的VLM以及更復雜的智能體系統。這表明,在醫學視覺問答任務中,未必需要昂貴的領域微調或龐大的模型規模,凍結模型內部本身就攜帶足夠的決策信號,只是需要合適的讀取方式。
一個值得關注的發現是,使用探測方法時,小型VLM與大型VLM之間的表現差距顯著縮小。相比之下,基於生成的評估方法讓小型模型看起來明顯更弱。這提示我們,小型VLM中實際包含的可恢復醫學問答信號比生成式評估所揭示的更多,評估方式的選擇會極大影響我們對模型能力的判斷。
論文還比較了14對通用模型與醫學適配模型的線性可解碼性。結果顯示,醫學領域的適應(medical adaptation)並不一致地改善模型內部表徵的可探測性。換句話説,經過醫學數據調整的模型未必更容易通過線性探針提取出正確答案相關的信息。這一結論對目前普遍採用的“先適應後評估”範式提出了新的審視角度。
此外,作者揭示了生成式自由文本評估中存在一種答案位置偏差,最高可達10個百分點:正確答案在選項中的位置會影響模型的表現。MedProb雖然同樣存在位置偏差,但其受影響的方式與提示工程不同。這一差異為理解VLM的決策機制提供了新的線索,同時也提醒研究者在比較不同方法時需要格外注意選項順序帶來的混淆效應。
MedProb的主要實驗聚焦於多項選擇和多元分類設定。作者還額外提出了一種基於拒絕採樣打分的過程,將探針擴展到開放式醫學問答生成中。該研究已被EMNLP Findings 2026接收,作者包括Erfan Nourbakhsh等人。