本周,Adaption Labs 发布了 Invent a Dataset。该功能能够根据你想要模型学习的行为描述,生成结构化的、可直接用于训练的数据集。你不再需要准备种子语料库、预先定义 schema,也不用编写标注指南。当前该功能已在 Adaption 应用中上线,并通过 Python SDK 和 REST API 提供。生成的每一行数据可下载为 JSONL、JSON、CSV 或 Parquet 格式,因此产物是一个可移植文件,归你所有,可在任何环境中训练。生成过程运行在 Adaption 托管的平台上,会消耗 credits;文档中没有提供自托管生成路径。
大部分数据集工作流都始于已经存在的数据。团队往往要花数周时间标注、过滤和重塑数据,以逼近目标任务。Adaption 认为,这种做法使模型质量受限于现有数据与期望行为的接近程度。对于专有和专门任务,相关信号通常分布在内网系统、非结构化文本或工作流日志中,很难直接转化为高质量训练集。研究团队还与现有合成数据工具划清界限:那些工具是在人类已经定义好 schema、任务分布和生成策略之后,才自动化生成数据。Invent a Dataset 则提前一步,从“行为”本身开始。
API 的工作方式非常具体。对 datasets.invent 的一次调用将会创建数据集并开始生成,立即返回 status=running。之后你可以轮询 datasets.get,直到状态变为 succeeded 或 failed,然后下载数据。域代码(domain codes)是主要控制项。你需要通过 datasets.invent_domains 获取当前代码,而不是硬编码;例如可以传入 medical,也可进一步用限定子域(如 medical.symptoms_diagnosis)收窄范围。每次运行至少要指定一个域或子域,多个域会同时贡献到同一数据集。未带子域的域会覆盖该域的完整范围。
目前支持两种输出格式。instruction_dataset 是默认格式,生成用于监督微调的提示-完成对(prompt-completion pairs);preference_pairs 则会生成选定/拒绝对(chosen/rejected pairs),用于 DPO 等偏好训练。三个参数在生产环境中很关键:estimate=True 会为该请求估价,只返回预计与可用 credits,不实际创建也不收费;prompt 最长 10,000 字符,用于控制生成行真正涉及的内容;idempotency_key 最长 255 字符,使网络重试安全——如果重试,会返回原数据集而不是启动第二次运行。每次启动的行数受套餐限制。
语言扩展有两种模式。translate 模式会为每个目标语言生成一个新的数据行变体;localize 模式会为每个“国家/语言”组合生成符合当地表达习惯的变体,而不是简单直译。sample_rate 取值在 0.01 到 1 之间,控制被扩展的发明行占多大比例;费用按扩展后的输出行数计算,而不是原始行数。如果传入不支持的代码,接口返回 400,并附上可用值示例。
Invent a Dataset 是一个闭环的前半部分。数据集 ID 可直接传给 autoscientist.create,从而在优化目标下同时调整数据和训练配方。AutoScientist 于 2026 年 5 月推出,是“自适应数据”(Adaptive Data)支柱中的训练侧组件。Adaption 报告称,AutoScientist 平均比其研究团队自己配置的训练高出约 35% 的性能;胜率从 48% 提升到 64%。这些数字来自八个垂直领域的内部专项评测,数据集规模在 5,000 到 100,000 行之间,使用的都是 Together AI 提供的微调架构。
核心要点:Invent a Dataset 从任务描述生成训练行,不需要种子语料库、schema 或标签;一次 datasets.invent 调用即可设置域、行数、格式和语言扩展,生成是异步的;输出为指令对或偏好对,可下载为 JSONL、JSON、CSV 或 Parquet;数据集 ID 可直接进入 AutoScientist,实现从意图到训练模型的闭环。