DeepLens诊断代理:智能体工作流设计让小型推理模型与前沿LLM竞争
DeepLens诊断代理通过五阶段流程(结构化临床提取、循证检索、约束候选生成、证据三角验证和可审计决策),将小型医疗推理模型JSL Medical Small 7B v2的性能提升至60.14%的诊断准确率,超越许多前沿模型,同时成本更低。该工作流设计使诊断推理在不确定性下仍能可靠运行,并提供了可追溯的中间结果以支持高 stakes 应用场景。
由John Snow Labs团队提出的DeepLens诊断代理是一种创新的智能体系统,它通过精心设计的五阶段工作流,将小型医疗推理模型JSL Medical Small 7B v2的诊断准确率从23.99%大幅提升至60.14%,在915个病例的DiagnosisArena基准测试中超越了包括Claude Sonnet 4.5和Gemini 3.1 Pro在内的多个前沿大语言模型,同时成本降低35-45%。这一成果表明,在医疗诊断这种高 stakes 领域,结构化的流程约束往往比单纯的模型参数扩展和API成本投入更为关键。
该工作流由五个严格定义的阶段组成:第一阶段是结构化临床提取,系统性地从病例描述中提取相关症状、体征、病史等关键临床信息;第二阶段是循证检索,利用检索增强生成技术从权威医学文献中获取相关证据;第三阶段是约束候选生成,基于前两步的结果生成可能的诊断候选列表;第四阶段是证据三角验证,通过交叉比对多种来源的证据来验证每个候选诊断的可靠性;第五阶段是可审计决策,生成包含推理过程和证据引用的最终诊断建议。每个阶段都会产生结构化的中间输出,便于后续的审计和错误定位。
实验结果显示,该代理在标准医疗基准上的表现达到了88.2%,但若没有工作流设计,其诊断准确率仅为23.99%,这36个百分点的提升完全归功于流程本身而非模型知识的补充。这一发现挑战了“更大模型必然更好”的传统认知,揭示了在需要处理不确定性、多步骤推理的复杂任务中,精心设计的智能体工作流可以成为比模型规模更重要的性能杠杆。
从经济性角度看,DeepLens诊断代理每例诊断的推理成本仅为0.0072美元(在A100 GPU上消耗约24K token),延迟24秒,远低于Claude Sonnet 4.5的0.0110美元和Gemini 3.1 Pro的0.0128美元,同时在准确率上分别高出9.70和9.17个百分点。这种成本效益比使其特别适用于资源受限的医疗环境,或需要大规模部署诊断辅助系统的场景。
更重要的是,该工作流生成的中间产物使得整个诊断过程透明可追溯。医生可以检查每个阶段的输出,理解模型为何选择某个诊断,并在必要时进行干预。这种可解释性对于医疗等高风险领域至关重要,因为它不仅提高了信任度,还便于在出现错误时快速定位问题环节。DeepLens诊断代理的实践表明,通过将强大的基础模型与精心设计的流程约束相结合,即使使用小型模型也能在专业领域达到与大型模型相当甚至更优的性能,同时保持更低的成本和更高的可解释性。