跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

前沿 AEO 追踪器:Astra 会选什么(以及其他前沿模型,以及你能做什么)

文章摘要

Latent Space 首次发布 Astra 项目“前沿 AEO 追踪器”,用 6 种提示变体在 161 个类别中测试 7 个前沿模型,量化 AI 产品推荐。结果显示模型存在系统偏见、也有 GPT 推荐 Claude 等“无偏”反例,并发现 Opus→Fable、Sol→Astra 两代之间的选择反转和搜索行为差异。

前沿 AEO 追踪器:Astra 会选什么(以及其他前沿模型,以及你能做什么)
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

Latent Space 今日发布其首个 Astra 项目——前沿 AEO 追踪器。之前他们在 AEO(答案引擎优化)上的朴素自动研究投资已带来可观回报,因此决定将这套思路系统化,并扩展开拓同行的启发项目。团队先用数十亿 token 做原型开发、对齐和流水线扩展,再公开这套追踪器。

追踪器沿用并扩展了 AmplifyingAI 的方法:在 161 个类别中,对 7 个前沿模型分别执行 6 种提示变体并开启搜索;类别涵盖编程智能体、AI 播客、AI 沙箱、托管数据库、ASR 模型,甚至“天使投资人”“企业支出”“薪资软件”等冷门垂直领域。答案抽取由 Astra 完成,再用专有 AEO 评分:对首选、替代选项和提及给予正权重,对轻度与强烈反推荐给予负权重(这类案例很少见,但确实存在)。同时,团队提取了影响智能体推荐的高引用来源,并整理了典型失败模式。

基本结果显示,一些产品在各自类别中具有统治地位,但也有一些熟悉产品,自然引发“训练数据污染”的疑问。Latent Space 表示所有提示与回答对都可公开检查,无需隐藏。然而偏差确实存在:问编程智能体推荐时,Fable/Opus 偏好 Claude Code,Sol/Astra 偏好 Codex,Grok 喜欢 Cursor,Muse 倾向 Muse Code,SWE-1.7 则倾向 Devin。也有值得注意的反例:GPT 系模型会推荐 Claude,显示出“非偏见”。在 161 个类别中,只有 28 个出现了所有前沿模型一致的首选;更多的“接近竞争”和“总是陪跑”类别,才是 AEO 争夺的关键战场。

对同实验室的新模型代际进行比较,可以看到重要反转。Opus→Fable 和 Sol→Astra 两份摘要页面显示,模型的选择会随代际发生明显切换,部分场景还给出了竞争对手做得更好的中性分析。团队最惊讶的发现是:Anthropic 似乎在引导模型搜索更多来源——Sol 引用来源中位数为 9,Astra 为 5;Opus 为 11,Fable 为 15。Astra 通常显得更“自信”或“高效”(取决于视角);当问题被轻微改述时,Astra 改变主意的概率远低于前代。这意味着选择随机性下降,AEO 本身的价值随之上升。

来源分析也能较强地预示各实验室优先或不优先什么。不过样本量较小,且只能代表我们从工具调用中抓到的内容,并非预训练数据集。可以确认的是,Ora 和 Vercel 所衡量的 AEO 实践(如 Markdown 内容协商)是真实的;如果失败,模型会更不愿意阅读你的内容。

作为趣味拓展,团队还公开了 LLM 眼中全球顶级天使投资人名单(仍待去重),并做了一个“家庭问答”风格的小游戏,让读者比对自身直觉与数据。团队欢迎进一步建议和商业合作:可联系 @latentspacepod 或 [email protected]。脚注提到,他们原本非常希望纳入 Gemini/Antigravity、GLM/Zcode 和 DeepSeek/DeepCode,但错误与速率限制使其无法进入首轮分析。

展开要点与分析

文章情报

工程师进阶

要点

  • 方法:6 种提示变体 × 7 个前沿模型 × 161 个类别;答案由 Astra 提取并按专有 AEO 评分,所有提示/回答对公开可查。
  • 模型存在明显自我偏好(Claude 系偏好 Claude Code、Codex 系偏好 Codex 等),但也有 GPT 推荐 Claude 的公正反例。
  • 161 个类别中仅 28 个有全模型一致首选;更多“接近竞争”与“陪跑”类别是 AEO 争夺的关键战场。
  • 同实验室模型换代出现显著反转:Opus→Fable 引用来源中位数从 11 增至 15,Sol→Astra 从 9 降至 5;Astra 也更难因轻微改述而改选。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。