AI News HubLIVE
站內改寫1 分鐘閱讀

自改進的凍結門訓練(SIFT):用於動態文檔分類的分類器自動學習

SIFT是一種自改進的動態文檔分類器,通過廉價管道處理大部分文檔,僅將低置信度的案例升級至LLM法官,從而實現模型持續自我提升,同時通過凍結門機制防止性能退化。

來源arXiv Computational Linguistics作者: Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

SIFT(Self-Improving, Frozen-gate Training)是一種創新的動態文檔分類器服務,旨在解決企業級文檔分類中的兩大障礙:標註項目的前期投入以及機構對模型自主重訓練的安全擔憂。該方法在分類時優先使用廉價、僅依賴CPU的流水線(包含SPLADE稀疏編碼器和LightGBM分類頭),僅將低置信度的少部分文檔升級至LLM法官進行判斷。法官的判定結果被寫回標註語料庫,從而讓昂貴模型持續教導廉價模型:升級率下降,語料庫通過生產流量自然增長,而非依賴前期人工標註,準確率隨使用不斷提高。引入新文檔系列僅需聲明式配置包、標籤空間、錨定短語和法官詞彙表,無需啓動標註項目。安全方面,SIFT通過雙重提升門機制解決自主重訓練帶來的無聲退化問題:關鍵標籤F1迴歸檢查以及永遠不參與訓練的凍結黃金迴歸集,任何一方均可否決模型升級。這一設計將“每月無人類參與重訓練”從冒險變為常規。論文描述了架構、自饋送語料循環、凍結門提升機制及一個多領域部署示例,並討論了邊際標註成本趨近於零的經濟意義。此外,SIFT的自饋送循環確保了廉價模型不斷從LLM法官的判決中學習,使得標註成本接近零,同時保持了高準確率。凍結門機制通過迴歸檢查和黃金集雙重保障,防止了模型在自主訓練中可能出現的性能倒退,使得定期自動重訓練成為可靠的選擇。經濟上,這種方法大幅降低了企業部署文檔分類系統的初始和持續成本,具有重要的商業價值。