今週、Adaption Labs は Invent a Dataset をリリースしました。この機能は、モデルに学習させたい行動を記述するだけで、構造化されたトレーニング済みデータセットを生成します。シードコーパスや事前定義スキーマ、ラベリングガイドは不要です。現在、Adaption アプリのほか、Python SDK と REST API から利用できます。生成された行は JSONL、JSON、CSV、または Parquet としてダウンロードできるため、成果物はポータブルなファイルとして手元に残り、任意の環境で学習に使えます。生成処理は Adaption のホスティングプラットフォーム上で実行され、クレジットを消費します。セルフホストでの生成パスはドキュメント化されていません。
ほとんどのデータセット作成フローは、既に存在するデータから始まります。チームはラベル付け、フィルタリング、再整形に数週間を費やし、目的のタスクに近づけようとします。Adaption の主張は、既存データと意図した行動がどれだけ近いかでモデルの品質の上限が決まるというものです。プロプライエタリな専門タスクでは、重要なシグナルは社内システムや非構造化テキスト、ワークフローログに埋もれており、そのまま学習セットに変換できることはほとんどありません。
研究チームは既存の合成データツールとも一線を画します。そうしたツールは、人間がスキーマやタスク分布、生成戦略を定義した後に、生成を自動化します。Invent a Dataset は、行動そのものを起点とする一段階前の段階から始まります。
API の仕組みは具体的です。datasets.invent を一度呼ぶとデータセットが作成され、生成が開始されて、即座に status=running が返ります。その後、datasets.get をポーリングして succeeded または failed になるのを待ち、行をダウンロードします。ドメインコードが主要な制御手段です。現在のコードはハードコードせず、datasets.invent_domains で取得します。医療なら medical を指定し、medical.symptoms_diagnosis のような修飾サブドメインで絞り込むことも可能です。少なくとも1つのドメインまたはサブドメインが必要で、複数ドメインは同じ実行に寄与します。サブドメインなしのドメインは、そのドメインの全範囲を使用します。
出力形式は2種類です。instruction_dataset は既定で、教師ありファインチューニング用のプロンプト/完了ペアを生成します。preference_pairs は、DPO のような選好学習用に chosen/rejected のペアを生成します。本番利用に重要なパラメータが3つあります。estimate=True は実際に作成や課金をせず、リクエストの価格を計算して推定クレジットと利用可能クレジットを返します。prompt は最大10,000文字まで指定でき、生成する行の内容を制御します。idempotency_key は最大255文字で、ネットワーク再試行を安全にし、再試行時は新しい実行の代わりに元のデータセットを返します。行数はプランごとの1回の実行上限に従います。
言語・ロケール拡張は2つのモードで動作します。translate は各ターゲット言語について新しい行バリアントを生成し、localize は国と言語のペアごとに、直接翻訳ではなく現地の表現を使ったバリアントを生成します。sample_rate は0.01~1で、発明された行のうちどの割合を拡張するかを制御し、クレジットは元の行数ではなく拡張後の出力行数に基づいて課金されます。サポートされていないコードを渡すと、利用可能な値のサンプルとともに400エラーが返ります。
Invent a Dataset はループの前半です。データセット ID を autoscientist.create に直接渡すと、目的に応じてデータと学習レシピを同時最適化できます。AutoScientist は2026年5月に発表された、Adaptive Data の柱に対応する学習側コンポーネントです。Adaption によると、AutoScientist は同社の研究スタッフ自身が構成したトレーニングを平均35%上回り、勝率は48%から64%に向上しました。これらの数値は、8つの業種にわたる社内の専門評価に基づいています。データセットサイズは5,000行から100,000行で、Together AI がファインチューニング用に提供するアーキテクチャを使用しています。
要点:Invent a Dataset は、シードコーパスやスキーマ、ラベルなしでタスク記述から学習行を生成します。1回の datasets.invent 呼び出しでドメイン、行数、形式、言語拡張が設定され、生成は非同期で行われます。出力はインストラクションペアまたはプリファレンスペアで、JSONL、JSON、CSV、Parquet としてダウンロードできます。データセットIDを直接AutoScientistに渡すことで、意図から学習済みモデルまでのループが閉じます。