跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

Adaption Labs 推出“Invent a Dataset”:從任務描述生成訓練數據,而非種子語料庫

文章摘要

Adaption Labs 發佈了 Invent a Dataset,這項功能只需描述你希望模型學習的行為,就能生成結構化、可直接用於訓練的數據集,無需種子語料庫、預定義 schema 或標註指南。一次 datasets.invent 調用即可設置域、行數、輸出格式和語言擴展,數據行可下載為 JSONL、JSON、CSV 或 Parquet。數據集 ID 可直接傳入 AutoScientist,完成從意圖到訓練模型的閉環。

來源MarkTechPost作者: Michal Sutter
Adaption Labs 推出“Invent a Dataset”:從任務描述生成訓練數據,而非種子語料庫
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

本週,Adaption Labs 發佈了 Invent a Dataset。該功能能夠根據你想要模型學習的行為描述,生成結構化的、可直接用於訓練的數據集。你不再需要準備種子語料庫、預先定義 schema,也不用編寫標註指南。當前該功能已在 Adaption 應用中上線,並通過 Python SDK 和 REST API 提供。生成的每一行數據可下載為 JSONL、JSON、CSV 或 Parquet 格式,因此產物是一個可移植文件,歸你所有,可在任何環境中訓練。生成過程運行在 Adaption 託管的平台上,會消耗 credits;文檔中沒有提供自託管生成路徑。

大部分數據集工作流都始於已經存在的數據。團隊往往要花數週時間標註、過濾和重塑數據,以逼近目標任務。Adaption 認為,這種做法使模型質量受限於現有數據與期望行為的接近程度。對於專有和專門任務,相關信號通常分佈在內網系統、非結構化文本或工作流日誌中,很難直接轉化為高質量訓練集。研究團隊還與現有合成數據工具劃清界限:那些工具是在人類已經定義好 schema、任務分佈和生成策略之後,才自動化生成數據。Invent a Dataset 則提前一步,從“行為”本身開始。

API 的工作方式非常具體。對 datasets.invent 的一次調用將會創建數據集並開始生成,立即返回 status=running。之後你可以輪詢 datasets.get,直到狀態變為 succeeded 或 failed,然後下載數據。域代碼(domain codes)是主要控制項。你需要通過 datasets.invent_domains 獲取當前代碼,而不是硬編碼;例如可以傳入 medical,也可進一步用限定子域(如 medical.symptoms_diagnosis)收窄範圍。每次運行至少要指定一個域或子域,多個域會同時貢獻到同一數據集。未帶子域的域會覆蓋該域的完整範圍。

目前支持兩種輸出格式。instruction_dataset 是默認格式,生成用於監督微調的提示-完成對(prompt-completion pairs);preference_pairs 則會生成選定/拒絕對(chosen/rejected pairs),用於 DPO 等偏好訓練。三個參數在生產環境中很關鍵:estimate=True 會為該請求估價,只返回預計與可用 credits,不實際創建也不收費;prompt 最長 10,000 字符,用於控制生成行真正涉及的內容;idempotency_key 最長 255 字符,使網絡重試安全——如果重試,會返回原數據集而不是啓動第二次運行。每次啓動的行數受套餐限制。

語言擴展有兩種模式。translate 模式會為每個目標語言生成一個新的數據行變體;localize 模式會為每個“國家/語言”組合生成符合當地表達習慣的變體,而不是簡單直譯。sample_rate 取值在 0.01 到 1 之間,控制被擴展的發明行佔多大比例;費用按擴展後的輸出行數計算,而不是原始行數。如果傳入不支持的代碼,接口返回 400,並附上可用值示例。

Invent a Dataset 是一個閉環的前半部分。數據集 ID 可直接傳給 autoscientist.create,從而在優化目標下同時調整數據和訓練配方。AutoScientist 於 2026 年 5 月推出,是“自適應數據”(Adaptive Data)支柱中的訓練側組件。Adaption 報告稱,AutoScientist 平均比其研究團隊自己配置的訓練高出約 35% 的性能;勝率從 48% 提升到 64%。這些數字來自八個垂直領域的內部專項評測,數據集規模在 5,000 到 100,000 行之間,使用的都是 Together AI 提供的微調架構。

核心要點:Invent a Dataset 從任務描述生成訓練行,不需要種子語料庫、schema 或標籤;一次 datasets.invent 調用即可設置域、行數、格式和語言擴展,生成是異步的;輸出為指令對或偏好對,可下載為 JSONL、JSON、CSV 或 Parquet;數據集 ID 可直接進入 AutoScientist,實現從意圖到訓練模型的閉環。

展開要點與分析

文章情報

工程師進階

要點

  • Invent a Dataset 從任務描述生成訓練數據,不需要種子語料庫、預定義 schema 或標註指南。
  • 該功能已在 Adaption 應用、Python SDK 和 REST API 中上線,生成過程為異步運行,數據可下載為 JSONL、JSON、CSV 或 Parquet 格式。
  • 支持生成指令數據集(instruction pairs)和偏好對數據集(preference pairs),並可為多語言訓練擴展翻譯或本地化版本。
  • 數據集 ID 可直接進入 AutoScientist 進行數據和訓練配方的聯合優化,其內部評測顯示平均比人工配置的訓練方法高出 35%。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。