AI News HubLIVE
站內改寫2 分鐘閱讀

機器不可見:基於完整市場普查的AI餐飲推薦審計

一項針對巴厘島倉古和烏布兩個市場共4776家餐飲場所的AI推薦審計顯示,85.6%的場所從未被ChatGPT、Claude、Gemini或Perplexity推薦。進入推薦需要評論數量、官方網站、價格信息和第三方提及等文檔化信號;星級評分隻影響推薦中的排序。系統很少虛構信息,但推薦了93家永久關閉的場所,數據陳舊是主要風險。

來源Hacker News AI作者: fspunch

一項新研究首次以完整市場普查的方式審計了AI助手對本地餐飲場所的推薦行為。該研究由Vladimir Pitenin完成,覆蓋印尼巴厘島的兩個邊界清晰的市場——倉古(Canggu)和烏布(Ubud),完整枚舉了4776家咖啡館、餐廳和酒吧,並以此作為分母,測量四個主流AI系統(ChatGPT、Claude、Gemini、Perplexity)在七天內對96個帶有用户角色設定的查詢所產生的2208條搜索型回答。

研究採用預註冊協議,避免審計過程中的主觀偏差。結果顯示,絕大多數場所從未出現在任何AI推薦中:85.6%的場所完全沒有被推薦過;即使在擁有至少50條評價的成熟商户中,也有72.6%從未被系統提及。研究者指出,這種“不可見性”並非隨機,而是呈現出與商户在線文檔化程度相關的結構。

通過邏輯迴歸分析,研究識別出影響一個場所能否進入AI回答的兩個層面。在“進入推薦列表”層面,評論數量(比值比1.64)、擁有自己的網站(1.92)、公開價格信息(1.54)以及第三方網頁提及(1.44)都會顯著提高被推薦概率;而星級評分在這一層面幾乎沒有作用(比值比0.89)。但在“排名”層面,規律發生反轉:在已被推薦的場所中,評分越高越容易排在第一位(比值比1.17)。換句話説,評分決定的是排序而非入圍資格。

研究還檢驗了一個民間流行的假設:出現在Foursquare等開放興趣點(POI)數據集中是否有助於獲得AI推薦。結果顯示,這種數據存在性在兩個層面都沒有正面效應。另一個值得注意的發現是,完全捏造的信息很少,僅佔全部提及的0.08%;但系統推薦了93家已永久關閉的場所。這説明當前AI推薦的主要風險並非“幻覺”,而是知識庫更新滯後導致的數據陳舊問題。

各系統之間的推薦重合度也不高,排名前20的推薦結果傑卡德相似係數僅為0.33至0.54。在兩週後的重測中,跨時間的回答相似性與同日重複運行的相似性相當,説明系統答案的波動主要來自採樣隨機性,而非真實世界隨時間的變化。研究者公開了協議、登記冊構建方法和派生數據,為後續審計提供了可復現的基礎。