跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

Adaption Labs 推出“Invent a Dataset”:从任务描述生成训练数据,而非种子语料库

文章摘要

Adaption Labs 发布了 Invent a Dataset,这项功能只需描述你希望模型学习的行为,就能生成结构化、可直接用于训练的数据集,无需种子语料库、预定义 schema 或标注指南。一次 datasets.invent 调用即可设置域、行数、输出格式和语言扩展,数据行可下载为 JSONL、JSON、CSV 或 Parquet。数据集 ID 可直接传入 AutoScientist,完成从意图到训练模型的闭环。

来源MarkTechPost作者: Michal Sutter
Adaption Labs 推出“Invent a Dataset”:从任务描述生成训练数据,而非种子语料库
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

本周,Adaption Labs 发布了 Invent a Dataset。该功能能够根据你想要模型学习的行为描述,生成结构化的、可直接用于训练的数据集。你不再需要准备种子语料库、预先定义 schema,也不用编写标注指南。当前该功能已在 Adaption 应用中上线,并通过 Python SDK 和 REST API 提供。生成的每一行数据可下载为 JSONL、JSON、CSV 或 Parquet 格式,因此产物是一个可移植文件,归你所有,可在任何环境中训练。生成过程运行在 Adaption 托管的平台上,会消耗 credits;文档中没有提供自托管生成路径。

大部分数据集工作流都始于已经存在的数据。团队往往要花数周时间标注、过滤和重塑数据,以逼近目标任务。Adaption 认为,这种做法使模型质量受限于现有数据与期望行为的接近程度。对于专有和专门任务,相关信号通常分布在内网系统、非结构化文本或工作流日志中,很难直接转化为高质量训练集。研究团队还与现有合成数据工具划清界限:那些工具是在人类已经定义好 schema、任务分布和生成策略之后,才自动化生成数据。Invent a Dataset 则提前一步,从“行为”本身开始。

API 的工作方式非常具体。对 datasets.invent 的一次调用将会创建数据集并开始生成,立即返回 status=running。之后你可以轮询 datasets.get,直到状态变为 succeeded 或 failed,然后下载数据。域代码(domain codes)是主要控制项。你需要通过 datasets.invent_domains 获取当前代码,而不是硬编码;例如可以传入 medical,也可进一步用限定子域(如 medical.symptoms_diagnosis)收窄范围。每次运行至少要指定一个域或子域,多个域会同时贡献到同一数据集。未带子域的域会覆盖该域的完整范围。

目前支持两种输出格式。instruction_dataset 是默认格式,生成用于监督微调的提示-完成对(prompt-completion pairs);preference_pairs 则会生成选定/拒绝对(chosen/rejected pairs),用于 DPO 等偏好训练。三个参数在生产环境中很关键:estimate=True 会为该请求估价,只返回预计与可用 credits,不实际创建也不收费;prompt 最长 10,000 字符,用于控制生成行真正涉及的内容;idempotency_key 最长 255 字符,使网络重试安全——如果重试,会返回原数据集而不是启动第二次运行。每次启动的行数受套餐限制。

语言扩展有两种模式。translate 模式会为每个目标语言生成一个新的数据行变体;localize 模式会为每个“国家/语言”组合生成符合当地表达习惯的变体,而不是简单直译。sample_rate 取值在 0.01 到 1 之间,控制被扩展的发明行占多大比例;费用按扩展后的输出行数计算,而不是原始行数。如果传入不支持的代码,接口返回 400,并附上可用值示例。

Invent a Dataset 是一个闭环的前半部分。数据集 ID 可直接传给 autoscientist.create,从而在优化目标下同时调整数据和训练配方。AutoScientist 于 2026 年 5 月推出,是“自适应数据”(Adaptive Data)支柱中的训练侧组件。Adaption 报告称,AutoScientist 平均比其研究团队自己配置的训练高出约 35% 的性能;胜率从 48% 提升到 64%。这些数字来自八个垂直领域的内部专项评测,数据集规模在 5,000 到 100,000 行之间,使用的都是 Together AI 提供的微调架构。

核心要点:Invent a Dataset 从任务描述生成训练行,不需要种子语料库、schema 或标签;一次 datasets.invent 调用即可设置域、行数、格式和语言扩展,生成是异步的;输出为指令对或偏好对,可下载为 JSONL、JSON、CSV 或 Parquet;数据集 ID 可直接进入 AutoScientist,实现从意图到训练模型的闭环。

展开要点与分析

文章情报

工程师进阶

要点

  • Invent a Dataset 从任务描述生成训练数据,不需要种子语料库、预定义 schema 或标注指南。
  • 该功能已在 Adaption 应用、Python SDK 和 REST API 中上线,生成过程为异步运行,数据可下载为 JSONL、JSON、CSV 或 Parquet 格式。
  • 支持生成指令数据集(instruction pairs)和偏好对数据集(preference pairs),并可为多语言训练扩展翻译或本地化版本。
  • 数据集 ID 可直接进入 AutoScientist 进行数据和训练配方的联合优化,其内部评测显示平均比人工配置的训练方法高出 35%。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。