AI News HubLIVE
站内改写1 分钟阅读

自改进的冻结门训练(SIFT):用于动态文档分类的分类器自动学习

SIFT是一种自改进的动态文档分类器,通过廉价管道处理大部分文档,仅将低置信度的案例升级至LLM法官,从而实现模型持续自我提升,同时通过冻结门机制防止性能退化。

来源arXiv Computational Linguistics作者: Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

SIFT(Self-Improving, Frozen-gate Training)是一种创新的动态文档分类器服务,旨在解决企业级文档分类中的两大障碍:标注项目的前期投入以及机构对模型自主重训练的安全担忧。该方法在分类时优先使用廉价、仅依赖CPU的流水线(包含SPLADE稀疏编码器和LightGBM分类头),仅将低置信度的少部分文档升级至LLM法官进行判断。法官的判定结果被写回标注语料库,从而让昂贵模型持续教导廉价模型:升级率下降,语料库通过生产流量自然增长,而非依赖前期人工标注,准确率随使用不断提高。引入新文档系列仅需声明式配置包、标签空间、锚定短语和法官词汇表,无需启动标注项目。安全方面,SIFT通过双重提升门机制解决自主重训练带来的无声退化问题:关键标签F1回归检查以及永远不参与训练的冻结黄金回归集,任何一方均可否决模型升级。这一设计将“每月无人类参与重训练”从冒险变为常规。论文描述了架构、自馈送语料循环、冻结门提升机制及一个多领域部署示例,并讨论了边际标注成本趋近于零的经济意义。此外,SIFT的自馈送循环确保了廉价模型不断从LLM法官的判决中学习,使得标注成本接近零,同时保持了高准确率。冻结门机制通过回归检查和黄金集双重保障,防止了模型在自主训练中可能出现的性能倒退,使得定期自动重训练成为可靠的选择。经济上,这种方法大幅降低了企业部署文档分类系统的初始和持续成本,具有重要的商业价值。