跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

Adaption Labs 推出“Invent a Dataset”:從任務描述生成訓練資料,而非種子語料庫

文章摘要

Adaption Labs 釋出了 Invent a Dataset,這項功能只需描述你希望模型學習的行為,就能生成結構化、可直接用於訓練的資料集,無需種子語料庫、預定義 schema 或標註指南。一次 datasets.invent 呼叫即可設定域、行數、輸出格式和語言擴充套件,資料行可下載為 JSONL、JSON、CSV 或 Parquet。資料集 ID 可直接傳入 AutoScientist,完成從意圖到訓練模型的閉環。

來源MarkTechPost作者: Michal Sutter
Adaption Labs 推出“Invent a Dataset”:從任務描述生成訓練資料,而非種子語料庫
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

本週,Adaption Labs 釋出了 Invent a Dataset。該功能能夠根據你想要模型學習的行為描述,生成結構化的、可直接用於訓練的資料集。你不再需要準備種子語料庫、預先定義 schema,也不用編寫標註指南。當前該功能已在 Adaption 應用中上線,並透過 Python SDK 和 REST API 提供。生成的每一行資料可下載為 JSONL、JSON、CSV 或 Parquet 格式,因此產物是一個可移植檔案,歸你所有,可在任何環境中訓練。生成過程執行在 Adaption 託管的平臺上,會消耗 credits;文件中沒有提供自託管生成路徑。

大部分資料集工作流都始於已經存在的資料。團隊往往要花數週時間標註、過濾和重塑資料,以逼近目標任務。Adaption 認為,這種做法使模型質量受限於現有資料與期望行為的接近程度。對於專有和專門任務,相關訊號通常分佈在內網系統、非結構化文本或工作流日誌中,很難直接轉化為高質量訓練集。研究團隊還與現有合成資料工具劃清界限:那些工具是在人類已經定義好 schema、任務分佈和生成策略之後,才自動化生成資料。Invent a Dataset 則提前一步,從“行為”本身開始。

API 的工作方式非常具體。對 datasets.invent 的一次呼叫將會建立資料集並開始生成,立即返回 status=running。之後你可以輪詢 datasets.get,直到狀態變為 succeeded 或 failed,然後下載資料。域程式碼(domain codes)是主要控制項。你需要透過 datasets.invent_domains 獲取當前程式碼,而不是硬編碼;例如可以傳入 medical,也可進一步用限定子域(如 medical.symptoms_diagnosis)收窄範圍。每次執行至少要指定一個域或子域,多個域會同時貢獻到同一資料集。未帶子域的域會覆蓋該域的完整範圍。

目前支援兩種輸出格式。instruction_dataset 是預設格式,生成用於監督微調的提示-完成對(prompt-completion pairs);preference_pairs 則會生成選定/拒絕對(chosen/rejected pairs),用於 DPO 等偏好訓練。三個引數在生產環境中很關鍵:estimate=True 會為該請求估價,只返回預計與可用 credits,不實際建立也不收費;prompt 最長 10,000 字元,用於控制生成行真正涉及的內容;idempotency_key 最長 255 字元,使網路重試安全——如果重試,會返回原資料集而不是啟動第二次執行。每次啟動的行數受套餐限制。

語言擴充套件有兩種模式。translate 模式會為每個目標語言生成一個新的資料行變體;localize 模式會為每個“國家/語言”組合生成符合當地表達習慣的變體,而不是簡單直譯。sample_rate 取值在 0.01 到 1 之間,控制被擴充套件的發明行佔多大比例;費用按擴充套件後的輸出行數計算,而不是原始行數。如果傳入不支援的程式碼,介面返回 400,並附上可用值示例。

Invent a Dataset 是一個閉環的前半部分。資料集 ID 可直接傳給 autoscientist.create,從而在最佳化目標下同時調整資料和訓練配方。AutoScientist 於 2026 年 5 月推出,是“自適應資料”(Adaptive Data)支柱中的訓練側元件。Adaption 報告稱,AutoScientist 平均比其研究團隊自己配置的訓練高出約 35% 的效能;勝率從 48% 提升到 64%。這些數字來自八個垂直領域的內部專項評測,資料集規模在 5,000 到 100,000 行之間,使用的都是 Together AI 提供的微調架構。

核心要點:Invent a Dataset 從任務描述生成訓練行,不需要種子語料庫、schema 或標籤;一次 datasets.invent 呼叫即可設定域、行數、格式和語言擴充套件,生成是非同步的;輸出為指令對或偏好對,可下載為 JSONL、JSON、CSV 或 Parquet;資料集 ID 可直接進入 AutoScientist,實現從意圖到訓練模型的閉環。

展開要點與分析

文章情報

工程師進階

要點

  • Invent a Dataset 從任務描述生成訓練資料,不需要種子語料庫、預定義 schema 或標註指南。
  • 該功能已在 Adaption 應用、Python SDK 和 REST API 中上線,生成過程為非同步執行,資料可下載為 JSONL、JSON、CSV 或 Parquet 格式。
  • 支援生成指令資料集(instruction pairs)和偏好對資料集(preference pairs),並可為多語言訓練擴充套件翻譯或本地化版本。
  • 資料集 ID 可直接進入 AutoScientist 進行資料和訓練配方的聯合最佳化,其內部評測顯示平均比人工配置的訓練方法高出 35%。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。