AI News HubLIVE
站内改写2 分钟阅读

机器不可见:基于完整市场普查的AI餐饮推荐审计

一项针对巴厘岛仓古和乌布两个市场共4776家餐饮场所的AI推荐审计显示,85.6%的场所从未被ChatGPT、Claude、Gemini或Perplexity推荐。进入推荐需要评论数量、官方网站、价格信息和第三方提及等文档化信号;星级评分只影响推荐中的排序。系统很少虚构信息,但推荐了93家永久关闭的场所,数据陈旧是主要风险。

来源Hacker News AI作者: fspunch

一项新研究首次以完整市场普查的方式审计了AI助手对本地餐饮场所的推荐行为。该研究由Vladimir Pitenin完成,覆盖印尼巴厘岛的两个边界清晰的市场——仓古(Canggu)和乌布(Ubud),完整枚举了4776家咖啡馆、餐厅和酒吧,并以此作为分母,测量四个主流AI系统(ChatGPT、Claude、Gemini、Perplexity)在七天内对96个带有用户角色设定的查询所产生的2208条搜索型回答。

研究采用预注册协议,避免审计过程中的主观偏差。结果显示,绝大多数场所从未出现在任何AI推荐中:85.6%的场所完全没有被推荐过;即使在拥有至少50条评价的成熟商户中,也有72.6%从未被系统提及。研究者指出,这种“不可见性”并非随机,而是呈现出与商户在线文档化程度相关的结构。

通过逻辑回归分析,研究识别出影响一个场所能否进入AI回答的两个层面。在“进入推荐列表”层面,评论数量(比值比1.64)、拥有自己的网站(1.92)、公开价格信息(1.54)以及第三方网页提及(1.44)都会显著提高被推荐概率;而星级评分在这一层面几乎没有作用(比值比0.89)。但在“排名”层面,规律发生反转:在已被推荐的场所中,评分越高越容易排在第一位(比值比1.17)。换句话说,评分决定的是排序而非入围资格。

研究还检验了一个民间流行的假设:出现在Foursquare等开放兴趣点(POI)数据集中是否有助于获得AI推荐。结果显示,这种数据存在性在两个层面都没有正面效应。另一个值得注意的发现是,完全捏造的信息很少,仅占全部提及的0.08%;但系统推荐了93家已永久关闭的场所。这说明当前AI推荐的主要风险并非“幻觉”,而是知识库更新滞后导致的数据陈旧问题。

各系统之间的推荐重合度也不高,排名前20的推荐结果杰卡德相似系数仅为0.33至0.54。在两周后的重测中,跨时间的回答相似性与同日重复运行的相似性相当,说明系统答案的波动主要来自采样随机性,而非真实世界随时间的变化。研究者公开了协议、登记册构建方法和派生数据,为后续审计提供了可复现的基础。