機器不可見:基於完整市場普查的AI餐飲推薦審計
一項針對巴厘島倉古和烏布兩個市場共4776家餐飲場所的AI推薦審計顯示,85.6%的場所從未被ChatGPT、Claude、Gemini或Perplexity推薦。進入推薦需要評論數量、官方網站、價格資訊和第三方提及等文件化訊號;星級評分隻影響推薦中的排序。系統很少虛構資訊,但推薦了93家永久關閉的場所,資料陳舊是主要風險。
一項新研究首次以完整市場普查的方式審計了AI助手對本地餐飲場所的推薦行為。該研究由Vladimir Pitenin完成,覆蓋印尼巴厘島的兩個邊界清晰的市場——倉古(Canggu)和烏布(Ubud),完整列舉了4776家咖啡館、餐廳和酒吧,並以此作為分母,測量四個主流AI系統(ChatGPT、Claude、Gemini、Perplexity)在七天內對96個帶有使用者角色設定的查詢所產生的2208條搜尋型回答。
研究採用預註冊協議,避免審計過程中的主觀偏差。結果顯示,絕大多數場所從未出現在任何AI推薦中:85.6%的場所完全沒有被推薦過;即使在擁有至少50條評價的成熟商戶中,也有72.6%從未被系統提及。研究者指出,這種“不可見性”並非隨機,而是呈現出與商戶線上文件化程度相關的結構。
透過邏輯迴歸分析,研究識別出影響一個場所能否進入AI回答的兩個層面。在“進入推薦列表”層面,評論數量(比值比1.64)、擁有自己的網站(1.92)、公開價格資訊(1.54)以及第三方網頁提及(1.44)都會顯著提高被推薦機率;而星級評分在這一層面幾乎沒有作用(比值比0.89)。但在“排名”層面,規律發生反轉:在已被推薦的場所中,評分越高越容易排在第一位(比值比1.17)。換句話說,評分決定的是排序而非入圍資格。
研究還檢驗了一個民間流行的假設:出現在Foursquare等開放興趣點(POI)資料集中是否有助於獲得AI推薦。結果顯示,這種資料存在性在兩個層面都沒有正面效應。另一個值得注意的發現是,完全捏造的資訊很少,僅佔全部提及的0.08%;但系統推薦了93家已永久關閉的場所。這說明當前AI推薦的主要風險並非“幻覺”,而是知識庫更新滯後導致的資料陳舊問題。
各系統之間的推薦重合度也不高,排名前20的推薦結果傑卡德相似係數僅為0.33至0.54。在兩週後的重測中,跨時間的回答相似性與同日重複執行的相似性相當,說明系統答案的波動主要來自取樣隨機性,而非真實世界隨時間的變化。研究者公開了協議、登記冊構建方法和派生資料,為後續審計提供了可復現的基礎。