Latent Space 今日發佈其首個 Astra 項目——前沿 AEO 追蹤器。之前他們在 AEO(答案引擎優化)上的樸素自動研究投資已帶來可觀回報,因此決定將這套思路系統化,並擴展開拓同行的啓發項目。團隊先用數十億 token 做原型開發、對齊和流水線擴展,再公開這套追蹤器。
追蹤器沿用並擴展了 AmplifyingAI 的方法:在 161 個類別中,對 7 個前沿模型分別執行 6 種提示變體並開啓搜索;類別涵蓋編程智能體、AI 播客、AI 沙箱、託管數據庫、ASR 模型,甚至“天使投資人”“企業支出”“薪資軟件”等冷門垂直領域。答案抽取由 Astra 完成,再用專有 AEO 評分:對首選、替代選項和提及給予正權重,對輕度與強烈反推薦給予負權重(這類案例很少見,但確實存在)。同時,團隊提取了影響智能體推薦的高引用來源,並整理了典型失敗模式。
基本結果顯示,一些產品在各自類別中具有統治地位,但也有一些熟悉產品,自然引發“訓練數據污染”的疑問。Latent Space 表示所有提示與回答對都可公開檢查,無需隱藏。然而偏差確實存在:問編程智能體推薦時,Fable/Opus 偏好 Claude Code,Sol/Astra 偏好 Codex,Grok 喜歡 Cursor,Muse 傾向 Muse Code,SWE-1.7 則傾向 Devin。也有值得注意的反例:GPT 系模型會推薦 Claude,顯示出“非偏見”。在 161 個類別中,只有 28 個出現了所有前沿模型一致的首選;更多的“接近競爭”和“總是陪跑”類別,才是 AEO 爭奪的關鍵戰場。
對同實驗室的新模型代際進行比較,可以看到重要反轉。Opus→Fable 和 Sol→Astra 兩份摘要頁面顯示,模型的選擇會隨代際發生明顯切換,部分場景還給出了競爭對手做得更好的中性分析。團隊最驚訝的發現是:Anthropic 似乎在引導模型搜索更多來源——Sol 引用來源中位數為 9,Astra 為 5;Opus 為 11,Fable 為 15。Astra 通常顯得更“自信”或“高效”(取決於視角);當問題被輕微改述時,Astra 改變主意的概率遠低於前代。這意味着選擇隨機性下降,AEO 本身的價值隨之上升。
來源分析也能較強地預示各實驗室優先或不優先什麼。不過樣本量較小,且只能代表我們從工具調用中抓到的內容,並非預訓練數據集。可以確認的是,Ora 和 Vercel 所衡量的 AEO 實踐(如 Markdown 內容協商)是真實的;如果失敗,模型會更不願意閲讀你的內容。
作為趣味拓展,團隊還公開了 LLM 眼中全球頂級天使投資人名單(仍待去重),並做了一個“家庭問答”風格的小遊戲,讓讀者比對自身直覺與數據。團隊歡迎進一步建議和商業合作:可聯繫 @latentspacepod 或 [email protected]。腳註提到,他們原本非常希望納入 Gemini/Antigravity、GLM/Zcode 和 DeepSeek/DeepCode,但錯誤與速率限制使其無法進入首輪分析。