Latent Space 今日发布其首个 Astra 项目——前沿 AEO 追踪器。之前他们在 AEO(答案引擎优化)上的朴素自动研究投资已带来可观回报,因此决定将这套思路系统化,并扩展开拓同行的启发项目。团队先用数十亿 token 做原型开发、对齐和流水线扩展,再公开这套追踪器。
追踪器沿用并扩展了 AmplifyingAI 的方法:在 161 个类别中,对 7 个前沿模型分别执行 6 种提示变体并开启搜索;类别涵盖编程智能体、AI 播客、AI 沙箱、托管数据库、ASR 模型,甚至“天使投资人”“企业支出”“薪资软件”等冷门垂直领域。答案抽取由 Astra 完成,再用专有 AEO 评分:对首选、替代选项和提及给予正权重,对轻度与强烈反推荐给予负权重(这类案例很少见,但确实存在)。同时,团队提取了影响智能体推荐的高引用来源,并整理了典型失败模式。
基本结果显示,一些产品在各自类别中具有统治地位,但也有一些熟悉产品,自然引发“训练数据污染”的疑问。Latent Space 表示所有提示与回答对都可公开检查,无需隐藏。然而偏差确实存在:问编程智能体推荐时,Fable/Opus 偏好 Claude Code,Sol/Astra 偏好 Codex,Grok 喜欢 Cursor,Muse 倾向 Muse Code,SWE-1.7 则倾向 Devin。也有值得注意的反例:GPT 系模型会推荐 Claude,显示出“非偏见”。在 161 个类别中,只有 28 个出现了所有前沿模型一致的首选;更多的“接近竞争”和“总是陪跑”类别,才是 AEO 争夺的关键战场。
对同实验室的新模型代际进行比较,可以看到重要反转。Opus→Fable 和 Sol→Astra 两份摘要页面显示,模型的选择会随代际发生明显切换,部分场景还给出了竞争对手做得更好的中性分析。团队最惊讶的发现是:Anthropic 似乎在引导模型搜索更多来源——Sol 引用来源中位数为 9,Astra 为 5;Opus 为 11,Fable 为 15。Astra 通常显得更“自信”或“高效”(取决于视角);当问题被轻微改述时,Astra 改变主意的概率远低于前代。这意味着选择随机性下降,AEO 本身的价值随之上升。
来源分析也能较强地预示各实验室优先或不优先什么。不过样本量较小,且只能代表我们从工具调用中抓到的内容,并非预训练数据集。可以确认的是,Ora 和 Vercel 所衡量的 AEO 实践(如 Markdown 内容协商)是真实的;如果失败,模型会更不愿意阅读你的内容。
作为趣味拓展,团队还公开了 LLM 眼中全球顶级天使投资人名单(仍待去重),并做了一个“家庭问答”风格的小游戏,让读者比对自身直觉与数据。团队欢迎进一步建议和商业合作:可联系 @latentspacepod 或 [email protected]。脚注提到,他们原本非常希望纳入 Gemini/Antigravity、GLM/Zcode 和 DeepSeek/DeepCode,但错误与速率限制使其无法进入首轮分析。