Abliteration:为分类器和评估量身定制的训练数据
Abliteration 提供了一个通过开放式API生成合成训练和评估数据的平台,解决了拒绝调优模型无法生成对抗性数据、生成质量不可控且缺乏审计的问题。其政策网关功能支持自定义规则、结构化JSONL输出、项目级配额和决策日志,适用于安全分类器测试、微调对创建和对抗训练等场景。
在机器学习模型的训练和评估过程中,合成数据的生成是一个关键环节。然而,许多团队在使用传统API时遇到了三大障碍:首先,拒绝调优模型无法生成对抗性数据,例如训练安全分类器时需要的恶意提示样本,这导致团队只能依赖手工标注的小规模数据集;其次,大规模生成时,API的拒绝率不稳定,会随主题和措辞变化,使得可复现的大批量生成变得不切实际;最后,缺乏对生成内容的审计追踪,当微调数据集投入生产时,无法提供完整的来源证明——包括使用了哪个政策、哪些提示和哪个模型。
Abliteration正是为了解决这些问题而设计的平台。它通过兼容OpenAI的API,提供了一种名为“政策网关”的功能,允许用户自定义生成规则。这意味着,用户可以根据自己的项目需求定义哪些内容可以生成,而不是受限于服务提供商的默认拒绝策略。平台支持直接生成JSONL格式的结构化输出,无需后处理即可集成到ML流水线中。此外,每个项目都可以分配独立的API密钥和配额,便于追踪生成量、成本和决策历史,从而为数据集提供完整的来源证明。
在实际应用中,Abliteration可以用于多种场景。例如,团队可以快速生成10,000个用于安全分类器测试的提示,每个示例都附带政策ID和原因代码,以便QA团队能够重现决策过程。对于垂直领域的模型微调,该平台可以产生指令/响应对,且没有拒绝噪声污染数据集分布。对抗性训练数据的生成也被严格控制,确保可审计、可复现,并且与支付该项目的密钥隔离。
在合规方面,Abliteration内置了决策元数据记录(包括政策ID、原因代码和密钥范围)、可复现运行支持(相同提示和版本带来一致输出)、项目级硬性配额(防止预算超支)、JSONL就绪输出(直接用于训练流水线)以及零数据保留政策(生成内容不用于训练或分享)。其SOC 2认证正在推进中,以满足企业审计需求。平台还提供了信任中心供用户查看详细信息。总体而言,Abliteration旨在为合成数据栈带来治理能力,帮助团队在训练和评估过程中实现更高的透明度、控制力和效率。