本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

フロンティアAEOトラッカー:Astraは何を選ぶか(他のフロンティアモデルと、あなたにできること)

記事の要約

Latent Space が最初のAstraプロジェクトとして「フロンティアAEOトラッカー」を公開。7つのフロンティアモデルに対し161カテゴリで6種類のプロンプト変種を実行し、AI製品推薦を定量化する。モデルの自己バイアス、GPTがClaudeを薦める非バイアス例、Opus→FableとSol→Astraの世代間選択逆転、引用ソース数の変化などを明らかにした。

ソースLatent Space
フロンティアAEOトラッカー:Astraは何を選ぶか(他のフロンティアモデルと、あなたにできること)
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

Latent Space は本日、最初の Astra プロジェクトとして「フロンティア AEO トラッカー」を公開した。AEO(Answer Engine Optimization、回答エンジン最適化)への素朴な自動調査投資が大きな成果を上げたことから、この方向性を真剣に体系化することになった。数十億トークンにおよぶ試作・調整・パイプライン拡張を経て、一般公開に至っている。

トラッカーは AmplifyingAI の手法を拡張し、7つのフロンティアモデルに対し、検索を有効にした6種類のプロンプト変種を161カテゴリで実行する。カテゴリは、コーディングエージェント、AIポッドキャスト、AIサンドボックス、マネージドデータベース、ASRモデルから、「エンジェル投資家」「企業支出」「給与ソフト」のようなニッチな領域まで多岐にわたる。回答の抽出は Astra が担当し、専用の AEO スコアで採点される。このスコアは、第1候補・代替候補・言及にプラスの重みを与え、軽度および強い反推薦にはマイナスの重みを与える(稀だが実際に存在する)。また、エージェントの推薦に影響を与える上位引用ソースと、代表的な失敗パターンも抽出している。

基本結果では、いくつかの製品が自カテゴリで支配的だった。見慣れた名前も多く、「学習データ汚染」という当然の疑問も浮かぶが、Latent Space はすべてのプロンプトと回答ペアを検査可能にしている。とはいえ偏りは確かに存在する。コードエージェントの推薦を尋ねると、Fable/Opus は Claude Code を好み、Sol/Astra は Codex を好み、Grok は Cursor を好み、Muse は Muse Code、SWE-1.7 は Devin を好む。一方で、GPT 系モデルが Claude を推薦する例もあり、称賛に値する「非バイアス」も見られた。

161カテゴリのうち、全フロンティアモデルが一致した第1候補を持つのは28カテゴリのみ。残りは「僅差の争い」や「常に2番手」のカテゴリが多く、AEO の主戦場になると考えられる。Opus→Fable と Sol→Astra に分かれたサマリーページも用意され、同じラボ内でもモデル世代間で選択が大きく逆転する様子が示された。さらに、Anthropic はモデルに多くのソースを検索させる方向に調整しているようだ。ソース数の中間値は Sol が9、Astra が5、Opus が11、Fable が15だった。Astra は全体的に「自信過剰」とも「効率的」とも言える振る舞いをし、質問を少し言い換えた程度では考えを変える確率が大幅に低い。選択のランダム性が下がるため、AEO の価値自体が高まる。

ソース分析は、各ラボが何を優先し何を優先しないかをある程度強く予測する。ただし、サンプルサイズは小さく、ツール呼び出しから取得できる範囲に限られ、事前学習データセットそのものではない。確認できる範囲では、Ora と Vercel が測定した Markdown コンテンツネゴシエーションなどの AEO プラクティスは実際に効果があり、失敗するとモデルがコンテンツを読むのを躊躇するようになる。

おまけとして、LLM が選ぶ世界のトップエンジェル投資家リスト(重複整理は今後)や、自分の直感がデータと一致するか試せるゲームも公開された。提案やビジネス相談は @latentspacepod または [email protected] まで。脚注では、Gemini/Antigravity、GLM/Zcode、DeepSeek/DeepCode も当初は含める予定だったが、エラーとレート制限により初回分析には含められなかったと説明している。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 方法:6種類のプロンプト変種 × 7つのフロンティアモデル × 161カテゴリ。Astraが回答を抽出し、独自のAEOスコアで採点。全プロンプト/回答ペアは公開・検査可能。
  • モデルには自己バイアスが顕著(Claude系はClaude Code、Codex系はCodexなどを好む)が、GPT系がClaudeを推薦する例も見られる。
  • 161カテゴリ中、全モデルが一致する第1候補があるのはわずか28カテゴリ。残る「僅差の争い」や「常に2番手」の領域がAEOの主戦場。
  • 同一ラボ内の世代交代で明確な逆転が発生:Opus→Fableでは引用ソース中央値が11から15へ増加、Sol→Astraでは9から5へ減少。Astraは軽微な言い換えで選定を変えにくい。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。