Cerebras は最近、GPT-5.6 シリーズのモデルに関する詳細なガイドを公開しました。主な3つのモデル、Sol、Terra、Luna について説明しています。各モデルは独立してトレーニングおよび提供されており、調整可能な推論レベルを備えており、ユーザーはタスクのニーズに応じて速度、コスト、インテリジェンスのバランスを選択できます。
価格面では、Terra のコストは Sol の半分であり、Luna のコストは Sol の5分の1です(ショートコンテキストとロングコンテキストの両方で)。この価格差は、インテリジェンスと速度の違いをほぼ反映しています。実際のアプリケーションでは、各モデルは異なる種類の作業に適しています。Sol は長時間の実行タスク、複雑な技術的課題、パーソナルアシスタントに最適で、レイテンシとコストは高いものの、サブエージェントの調整や大規模プロジェクトの処理に優れています。Terra は中間に位置し、Sol の半分の価格でほとんどのインテリジェンスを提供し、速度も適度です。Sol と組み合わせると、強力なサブエージェントとして機能します。Luna は最も高速で手頃な価格でありながら、市場のほとんどのモデルよりも優れたパフォーマンスを発揮し、日常的な AI タスクに適しています。
モデル選択の推奨として、まず Luna から始め、進捗が停滞したら Terra または Sol にアップグレードします。さらにコストをかける場合は、Cerebras 上で Sol を毎秒750トークンで実行でき、通常モードよりも最大10倍高速です。推論レベル(Light、Medium、High、Extra High、Ultra)を調整することで、タスク処理をカスタマイズできます。Light は基本的なタスク、Medium は日常的なタスク、High と Extra High は難しい STEM およびコーディングタスク、Ultra は複雑な研究問題に適しています。テストによると、推論レベルを1段階上げるごとに平均コストが約50%増加します。
キャッシュ読み取りもコスト削減の鍵です。キャッシュされた入力は新しい入力より90%安く、キャッシュ TTL は約30分です。セッションをアクティブに保つことで、プロンプト処理コストを削減できます。マルチエージェントワークフローも効率を向上させます。例えば、Advisor ワークフローでは、1つのエージェントが目標と制約を追跡し、ワーカーエージェントを自動的に誘導します。さらに、Codex ローカル版では、Kimi K2.7 Code や GLM-5.2 などの外部プロバイダーのモデルを導入して、異なる強みを活用できます。
結論として、サブスクリプションの制限は寛大ですが、AI エージェントの普及に伴い、多くのユーザーが制限を超えています。速度は重要な要素であり、日中は高速トークンレートがエクスペリエンスを向上させ、オフ時間には低速で追加推論を行うモデルが大きな違いを生みます。最後に、Artificial Analysis をウォッチして、高品質なモデル速度ベンチマークとインテリジェンスインデックスを確認することをお勧めします。