Abliteration:分類器と評価のためのオーダーメイド訓練データ
Abliterationは、OpenAI互換APIを介して合成訓練データと評価データを生成するプラットフォームであり、拒否調整モデルの限界を克服します。Policy Gateway機能により、カスタムルール、構造化JSONL出力、プロジェクト別クォータ、決定ログを提供し、安全性分類器のテスト、ファインチューニングペア作成、敵対的訓練などのユースケースに対応します。
機械学習モデルの訓練と評価において、合成データの生成は重要な要素です。しかし、多くのチームは従来のAPIを使用する際に三つの大きな障壁に直面します。まず、拒否調整モデルは敵対的データを生成できません。例えば、安全分類器の訓練に必要な悪意のあるプロンプトのサンプルが生成できず、手作業による小規模データセットに頼らざるを得ません。次に、大規模生成時にはAPIの拒否率がトピックや表現によって変動し、再現可能な大量バッチジョブが非現実的になります。最後に、生成内容の監査追跡が欠如しており、微調整データセットを本番環境に出す際に、どのポリシー、どのプロンプト、どのモデルを使用したかという出所の証明ができません。
Abliterationはこれらの問題を解決するために設計されたプラットフォームです。OpenAI互換のAPIを介して「ポリシーゲートウェイ」機能を提供し、ユーザーが生成ルールをカスタマイズできるようにします。つまり、サービスプロバイダーのデフォルトの拒否ポリシーではなく、ユーザー自身のルールに基づいてコンテンツを生成できます。プラットフォームは構造化されたJSONL形式での出力を直接サポートしており、後処理なしでMLパイプラインに統合できます。さらに、各プロジェクトに独立したAPIキーとクォータを割り当てることができ、生成量、コスト、決定履歴を追跡して、データセットの完全な出所証明を提供します。
実際の適用例として、チームはAbliterationを使用して、安全分類器テスト用の10,000のラベル付きプロンプトを迅速に生成でき、各例にはポリシーIDと理由コードが付随するため、QAチームが決定を再現できます。垂直モデルの微調整では、拒否ノイズのない指示/応答ペアを生成できます。敵対的訓練データの生成も厳密に制御され、監査可能で再現可能であり、支払いを行ったプロジェクトキーに分離されます。
コンプライアンス面では、Abliterationはレコードごとの決定メタデータ(ポリシーID、理由コード、キースコープ)、再現可能な実行(同じプロンプトとバージョンで一貫した出力)、プロジェクトごとのハードクォータ(予算超過防止)、JSONL対応出力(訓練パイプラインに直接投入)、ゼロデータ保持(生成コンテンツは訓練や共有に使用されない)を備えています。SOC 2認証も進行中で、エンタープライズ監査要件に対応します。プラットフォームはトラストセンターも提供しています。総じて、Abliterationは合成データスタックにガバナンスをもたらし、チームが訓練と評価のプロセスでより高い透明性、制御性、効率性を実現することを目指しています。