AI News HubLIVE
站内改写4 分钟阅读

信息架构是人工智能迫切渴求的基础

本文指出,信息架构(IA)的缺失是许多AI问题的根源,包括幻觉、错误答案和检索失败。AI放大了结构上的歧义,使原本分散的用户困惑变成系统性的代价高昂的错误。没有受控词汇和结构化元数据,检索系统只能找到最匹配的片段而非正确答案。对于AI代理,结构不仅关乎回答,还关乎安全行动。作者认为,现在正是为IA投资的时候,因为它直接关系到AI项目的成败。

来源Hacker News AI作者: speckx

二十年来,信息架构一直是被忽视的学科。职位头衔消失了,团队之间难以协同,公司内部混乱不堪。做好信息架构不仅仅是关于结构,更是让整个组织就如何命名和安排事物达成一致。然而,这项工作缓慢、充满政治斗争且吃力不讨好,每个季度都输给那些推出新功能的项目。它的价值一直隐藏在幕后,它的失败也同样隐蔽。

然后人工智能来了,这个隐形的基础设施突然出现在了资产负债表上。过去,信息架构的缺陷可能只是让一个访问者感到困惑;现在,它会导致幻觉、错误答案,或者一个代理自信地检索到垃圾信息并据此行动。2025年的一项调查显示,数据质量和可用性已成为AI采用的首要障碍,超过了其他所有阻碍。失败并没有变得更糟,而是变得可见、可重复且代价高昂。简单来说,糟糕的信息架构现在可以用token成本来衡量——而且是非常高的成本。

你可以购买更好的模型,调整更精准的提示词,增加更多的评估层,但你仍然会得到错误的答案,因为模型检索的是一个没有人同意如何组织的混乱仓库。在修复基础之前,你等于在为同一个错误支付两次费用。

检索只取决于它开始时的数据质量。大多数团队将检索视为一个已解决的问题:将模型指向你的内容,让它拉取相关段落,生成答案。这种技术被称为检索增强生成(RAG),其机制正如其名:模型基于运行时获取的文档来生成答案,而不是仅依赖训练时记住的内容。但这个机制继承了它所检索的仓库中的所有缺陷。如果你有一个扁平、非结构化的内容仓库,检索就无法正常工作。它会找到最匹配的段落——那个与查询共享最多表面词汇的片段,而不考虑它是否是最新的、权威的或正确的。信息架构的作用就是让“正确的那个”成为可能。组织方案、标签和导航不是内容的装饰,它们决定了正确的答案是可以找到的,还是被埋藏在四份相互矛盾的草稿之中。模型无法超越你给它的结构,如果你从未提供过结构,它就只能抓取最近的东西。

结构让模型知道事物是什么。一个价格、一个政策、一个废弃的注释和一个客户引用,它们在文本上可能十分相似,但含义却截然相反。人可以通过扫视周围页面来区分它们,而模型面对同样的四个片段,如果没有结构化信息,它就只会看到四段看似合理的文字,无法判断优先级。元数据、分类法和内容类型可以让系统区分权威与传闻、最新与过期、官方与推测。这就是信息架构师Lou Rosenfeld、Peter Morville和Jorge Arango在《信息架构:超越Web的设计》中正式化的组织、标签和语义结构。如今,这个领域有了一个新名字——语义层,即原始内容与读取它的系统之间的一套受控的定义、类型和关系。无论是称为分类法、本体还是语义层,其工作都是一样的:告诉机器一个事物是什么以及它与其他事物的关系。受控词汇——一套固定、统一的术语——让语言保持稳定,防止“取消”、“终止”、“关闭”等词将同一概念分裂成四个互不相干的部分。结构化元数据则提供系统依赖的框架:标记哪些是当前的、权威的,以及事物之间的关联,使检索除了原始文本之外还有更多的推理依据。这种词汇在输入侧同样有用:你可以将用户的查询规范化,将“退款”、“退钱”、“报销”映射到同一术语下,这样查询和内容仓库就能使用相同的受控语言。如果没有这些框架,模型就无法区分信号和噪声,因为从来没有人告诉它什么是信号。

歧义不会被解决,反而会被放大。人类面对混乱的结构时,会运用判断力填补空白,忽略问题并继续前进。这种容忍让糟糕的信息架构的成本隐藏了二十年。但模型去除了人类这个环节。它们不会用判断力填补空白,而是根据混乱进行模式匹配,并自信地大规模复制结果。一个人类用户可能默默纠正的模糊标签,现在变成了一个系统性的错误答案,服务于成千上万不知道来源有歧义的查询。2025年《世界质量报告》发现,幻觉和可靠性问题是企业列出的主要障碍之一,只有15%的企业在规模上部署了生成式AI。这是论证的转折点:糟糕的信息架构过去一次只让一个用户感到困惑,成本分散得无人提及;现在,它变成了自动化、重复、自信的失败——同一个错误答案,为每个提问者新鲜生成。混乱没有变,但波及范围变了。

代理需要结构来行动,而不仅仅是回答。检索是简单的情况——答错问题让人尴尬;但执行错误操作则是责任问题。当代理不再仅仅检索,而是开始执行操作时——比如处理工单、更新记录、批准请求、调用其他系统——它需要的不仅仅是正确的段落。它需要知道关系、层级和边界:什么属于什么,什么依赖什么,它被允许接触什么,不被允许接触什么。这就是信息架构作为运营模型而非文件系统的功能。曾经用来组织帮助文章的分类法,现在决定了哪些操作对哪些对象是有效的。错误的答案侵蚀信任,错误的操作则转移资金、改变记录,并触发下游系统,而这些下游系统假设操作是正确的。一个没有这些关系模型的代理不会拒绝行动,而是会用它一贯的自信,基于它获得的扁平而模糊的信息去行动。这已经有了代价,甚至在一个代理行动之前就已如此。在Moffatt v. Air Canada案中,航空公司支持聊天机器人告诉一位悲痛的用户可以追溯申请丧亲票价,而该公司的丧亲政策页面却明确表示相反。聊天机器人甚至提供了指向该页面的链接。当用户依赖这个答案并遭到拒绝时,不列颠哥伦比亚省的一个仲裁庭裁定航空公司承担责任,并命令其赔偿。一个站点的两个页面表达了相反的信息,没有任何东西来协调它们。如果让一个类似的代理拥有行动能力,同样的未协调结构就会开始自行转移资金。

这就是信息架构最终获得投资的方式。到目前为止,每一个理由都将一个曾经不可见的成本转化为一个可见的结果:可查找性变成检索准确性,类型区分变成幻觉率,结构变成代理可靠性和部署时间。这个学科没有变,但资产负债表变了。这种重新定义改变了愿意为它买单的人。当信息架构的回报是“减少困惑用户”这个没人能放在幻灯片上的数字时,它从未赢得过预算。但当它的回报变成“已经在路线图上的AI项目不会失败”时,它就赢得了预算。2025年,企业在生成式AI上的支出达到370亿美元,而前一年是115亿美元,根据Menlo Ventures的报告。而其中大部分支出都依赖于检索和接地,而这些只有在底层内容有序的情况下才能正常工作。收益是可测量的,而不是空谈:Anthropic的Contextual Retrieval工作发现,添加用于定位的情境信息,可以将检索失败率降低67%。定义和结构让模型更快地找到正确信息,减少了token消耗和调用次数,并且减少了因错误答案带来的隐性成本。