AI News HubLIVE
站内改写4 分钟阅读

构建 Foundry:AI 并非取代创造力,而是消除摩擦

本文探讨了 AI 如何通过语义搜索和向量数据库解决创意工作流程中的检索问题,而非取代创意人员。作者认为,创意工作的主要摩擦在于组织、查找和复用已有资产,而 AI 作为基础设施层,可以提升现有工作的可访问性,减少重复劳动。

在游戏工作室、后期制作公司、动画管线以及设计机构中,像“final_final_v7.png”、“USE_THIS_ONE.mov”或“new_character_export.psd”这样的文件名几乎无处不在。这些命名惯例虽然各不相同,但背后的问题却是共通的:创意工作的累积速度远超人们的整理能力,而六个月前创造的内容往往比从头开始重新制作更难找到。

解决这个问题并不需要更好的命名规范或不同的设计工具。本质上,这是一个检索问题,而且大多数创意工具从未被设计来解决它。

问题不在于创造力

关于 AI 与创意工作的讨论中,一个持久的问题是 AI 是否能生成绘画、剧本或音乐等作品。然而,更紧迫且实际的故事远没有那么戏剧化。

考虑一个游戏制作管线的实际运作过程。概念艺术家可能画出几十个角色草图,直到其中一个方向获得批准。被否决的探索被放入一个名为“alt_directions_v2”的文件夹中,三个月后,没有人能可靠地找到那个激发最终设计的版本。当开发续集或扩展包时,有人需要那个确切的色彩调色板和美学方向。由于搜索“dark armour character concepts 2023”毫无结果,他们只能从头开始,而不是在已有的基础上继续。

这个问题在不同领域中表现各异。电影剪辑师寻找特定 B-roll 时,不得不滚动浏览按卡片编号和拍摄日期标记的素材箱,因为制作期间没人有时间写镜头描述。动画师寻找某个奔跑循环的参考时,可能要深入到三级文件夹后放弃。平面设计师为回访客户寻找早期标志探索时,只能凭记忆重现。音乐制作人寻找两年前使用过的鼓声纹理时,不得不打开一个又一个项目,浏览音轨,直到找到或妥协使用新材料。

搜索以往工作、重新设计已完成的内容、在日益增长的媒体海洋中保持组织性,这些都占用了真正重要的创作时间。

时间实际上花在了哪里

在大多数创意工作流程中,实际创作的时间只占项目总时间的很小一部分。前期制作和后期制作的时间远超制作本身。研究、参考收集、资产组织、版本追踪以及不断定位已存在内容的过程,都消耗了本应用于实际工作的时间。

以动画制作中常见的情景为例:绑定团队需要检查之前项目中某个角色的肩部拓扑处理方式。但这里没有组织化的资产库,只有一个按项目名称和日期排列的共享驱动器。绑定文件就在那里,但找到它要么需要确切知道位置,要么询问知情者。如果原始绑定者已经转到其他工作室,知识也随之流失。

这在一定程度上是文档问题,但正确的命名和组织只能帮团队到一定程度。工作和信息都存在,但无法高效检索导致团队损失时间、一致性,有时甚至金钱——当他们无意中重复了已有的工作。

传统搜索不仅没有解决问题,反而使问题更复杂。关键词搜索要求你猜测命名或描述时使用的词语,而这些词语往往是他人数月甚至数年前使用的。搜索“blue environmental concept”如果文件名为“ENV_ALTSTYLING_DARK_V4”,则毫无结果。

Weaviate 正是为了处理这种检索而设计的,它在传统元数据旁边存储语义表示,使创意资产可以通过含义和结构化过滤器进行搜索。

AI 作为工作流程层

AI 在创意领域最有用的一面,并非作为新作品的生成器,而是作为使现有作品更易访问的基础设施层。

这就是一类称为语义搜索的技术变得真正相关的地方。为了构建这个基础设施层,我们可以使用语义搜索根据含义而非精确匹配的术语或短语来组织和检索文档。

其工作原理是利用机器学习将原始媒体转换为向量嵌入。机器学习模型处理一段内容(无论是文本、图像还是音频文件),并将其转换为一长串数字,代表该内容的意义或描绘的内容。意义相似的两个事物,即使描述方式截然不同,也会产生在后续高维向量空间中彼此接近的数字序列。例如,查询“dark forest with blue atmospheric haze”和一张黄昏时分雾气弥漫的松林图像,其嵌入会在该空间中聚类靠近,尽管查询和图像没有任何匹配的文本。

向量搜索就是找到与给定查询嵌入最接近的项的过程。这种接近度使得通过含义而非关键词进行检索成为可能。

一个简单的例子

一个开发开放世界 RPG 的游戏工作室,在多年代开发过程中可能积累数万张概念图。团队构成变化,文件夹结构演变,第一年精心维护的命名惯例到第三年已经变得相当随意。

一位在项目后期加入的设计师需要为寒冷森林生物群系提供参考,该群系应与游戏现有环境在视觉上区分明显。搜索“cold forest biome”从关键词搜索中得不到有用结果,因为这些文件命名时没人预料到那个特定查询。语义搜索系统,给定相同的自然语言描述,可以匹配图像本身的视觉嵌入、索引过程中自动生成的描述,或两者的结合。

在搜索成为可能之前,内容需要以支持语义检索的方式处理和存储。这就是摄取步骤:通过管道运行文件,为每个项目生成嵌入,并将该嵌入与原始内容和元数据一起存储。

即使在语义搜索系统中,元数据仍然重要。我们需要这些信息来确认结果属于正确的项目、创建于过去两年内、并且是合适的文件类型。因此,除了原始媒体和生成的向量嵌入,存储文件的元数据也很重要。

向量数据库将这一切整合在一起。与传统关系数据库专为精确查找设计不同,向量数据库将嵌入与原始数据和元数据一起存储,其内部架构针对快速语义检索进行了优化。当你运行查询时,数据库将其转换为嵌入,并返回嵌入最相似的项目。结果是搜索似乎理解你实际在找什么,而不仅仅是你输入的内容。

这只是开始

上述描述没有超出当前技术范围。语义搜索和向量数据库已经用于企业知识管理、法律文档检索和电子商务产品搜索,原因正是如此。我们可以将这些原则应用于创意资产管理。

挑战在于摄取层:决定索引哪些内容、如何为不同类型内容生成描述和嵌入、以及搜索界面如何融入现有工具和工作流程。

下一步

在下一篇文章中,我们将仔细审视创意工作流程真正崩溃的地方,以及为什么传统文件夹结构、标签系统和关键词搜索始终无法跟上创意团队的工作节奏。之后,我们将逐步构建一个具体的实现:使用 Weaviate 构建创意资产的语义搜索系统。

准备好开始构建了吗?查看快速入门教程,或注册免费 Weaviate Cloud 账户。