自改進的凍結門訓練(SIFT):用於動態文件分類的分類器自動學習
SIFT是一種自改進的動態文件分類器,透過廉價管道處理大部分文件,僅將低置信度的案例升級至LLM法官,從而實現模型持續自我提升,同時透過凍結門機制防止效能退化。
來源arXiv Computational Linguistics作者: Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu
SIFT(Self-Improving, Frozen-gate Training)是一種創新的動態文件分類器服務,旨在解決企業級文件分類中的兩大障礙:標註專案的前期投入以及機構對模型自主重訓練的安全擔憂。該方法在分類時優先使用廉價、僅依賴CPU的流水線(包含SPLADE稀疏編碼器和LightGBM分類頭),僅將低置信度的少部分文件升級至LLM法官進行判斷。法官的判定結果被寫回標註語料庫,從而讓昂貴模型持續教導廉價模型:升級率下降,語料庫透過生產流量自然增長,而非依賴前期人工標註,準確率隨使用不斷提高。引入新文件系列僅需宣告式配置包、標籤空間、錨定短語和法官詞彙表,無需啟動標註專案。安全方面,SIFT透過雙重提升門機制解決自主重訓練帶來的無聲退化問題:關鍵標籤F1迴歸檢查以及永遠不參與訓練的凍結黃金迴歸集,任何一方均可否決模型升級。這一設計將“每月無人類參與重訓練”從冒險變為常規。論文描述了架構、自饋送語料迴圈、凍結門提升機制及一個多領域部署示例,並討論了邊際標註成本趨近於零的經濟意義。此外,SIFT的自饋送迴圈確保了廉價模型不斷從LLM法官的判決中學習,使得標註成本接近零,同時保持了高準確率。凍結門機制透過迴歸檢查和黃金集雙重保障,防止了模型在自主訓練中可能出現的效能倒退,使得定期自動重訓練成為可靠的選擇。經濟上,這種方法大幅降低了企業部署文件分類系統的初始和持續成本,具有重要的商業價值。