生产级AI系统——34章,1026个可运行断言
一本面向软件工程师的技术书籍,教授如何构建生产级AI系统,涵盖分布式系统基础、LLM原理、检索增强、AI平台设计、代理AI、系统设计及员工工程等内容。每个章节都包含可运行代码和面试准备材料,全书34章按故障模式组织。
构建生产级AI系统并非易事。市面上充斥着各种演示和笔记本,但真正能服务真实用户、处理真实资金、并在凌晨3点崩溃的系统却鲜有书籍涉及。这正是《生产级AI系统》一书试图填补的空白。
这本书专为软件工程师设计,教他们如何从头到尾打造生产级AI系统。全书共34章,分为八个部分,从分布式系统基础开始,逐步深入到数据与事件基础设施、LLM基础、检索技术、AI平台、代理AI、系统设计,最后是员工工程。每个部分都紧密结合实际,提供了可运行代码示例,确保读者不仅能理解理论,还能动手实践。
与其他书籍不同,本书的每个断言都经过测试。例如,当书中提到重试风暴会使负载增加2倍时,就有可运行的代码来证明这一点。这些示例不是插图,而是断言。如果散文中的数字与代码中的数字不匹配,构建就会失败。此外,每章末尾都附有面试题和员工级答案,帮助读者在学完一章后就能回答相关问题。
本书的一个显著特点是按故障模式组织内容。传统书籍往往按技术主题分类,而本书则按照实际开发中可能遇到的故障模式来编排:当检索管道返回垃圾数据时会发生什么?当提供商出现故障时怎么办?当成本超出预算时该如何应对?这种组织方式更贴近实际生产环境中的挑战。
所有示例代码均可直接运行,无需API密钥,无需Docker,只需Node.js 22.6+版本。读者可以克隆GitHub仓库,直接运行任意章节的实验室脚本。每个实验室在运行时都会打印断言,示例本身就是真理之源。
无论你是AI新手还是经验丰富的工程师,这本书都能提供从入门到精通的完整路径。它不仅是技术指南,更是应对生产环境各种突发状况的实战手册。