AI News HubLIVE
サイト内リライト2 分で読了

自己改善型フローズンゲート学習(SIFT):動的文書分類のための分類器自動学習

SIFTは自己改善型の動的文書分類器であり、廉価なCPUベースのパイプラインでほとんどの文書を処理し、低信頼度のものだけをLLM判定に委ねることで、モデルが継続的に自己学習し、フローズンゲート機構により性能低下を防ぎます。

ソースarXiv Computational Linguistics著者: Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

SIFT(Self-Improving, Frozen-gate Training)は、企業における文書分類の2つの大きな障壁、すなわちモデル構築前のラベル付けプロジェクトと、既存モデルが自身を再学習することへの組織的な恐れに取り組む、動的分類器サービスです。分類には意図的に安価なCPUバウンドのパイプライン(SPLADEスパースエンコーダとLightGBMヘッド)を使用し、低信頼度の少数のページのみをLLM判定に委ねます。判定結果はラベル付きコーパスに書き戻され、高価なモデルが継続的に安価なモデルを指導します。エスカレーション率は低下し、コーパスは事前のアノテーション作業ではなく本番トラフィックから成長し、精度は使用とともに向上します。新しい文書ファミリーの導入には、宣言型バンドル、ラベル空間、アンカーフレーズ、判定用語集のみが必要で、ラベル付けプロジェクトは不要です。より難しい問題は安全性です。自律的に再学習する分類器は静かに性能が低下する可能性があります。SIFTは二重のプロモーションゲート(重要ラベルのF1回帰チェックと、モデルが訓練されることのない凍結された黄金回帰セット)でこれを解決し、いずれかがプロモーションを拒否します。これにより「月次で人間なしで再学習する」ことが無謀から日常へと変わります。本論文では、アーキテクチャ、自己供給型コーパスループ、フローズンゲートプロモーション機構、および例示的なマルチドメイン展開について説明し、限界ラベル付けコストがゼロに近づく分類器の経済性について議論します。さらに、SIFTの自己供給ループにより、廉価モデルはLLM判定から継続的に学習し、ラベル付けコストはほぼゼロに抑えられながら、高い精度を維持します。フローズンゲート機構は、回帰チェックと黄金セットによる二重の保証により、自律訓練中の性能低下を防ぎ、定期的な自動再学習を信頼できる選択肢とします。経済的には、このアプローチは文書分類システムの初期導入コストと継続的なコストを大幅に削減し、大きなビジネス価値をもたらします。