AI News HubLIVE
站内改写2 分钟阅读

从原型到生产:Databricks AI Search 的高 QPS

Databricks AI Search 现支持高 QPS 扩展,通过单一参数即可将标准端点扩展至数千 QPS,无需管理副本或负载均衡器。适用于搜索栏、推荐系统和实时实体解析等场景,并内置生产级可观测性。

搜索无处不在:零售网站的产品发现、智能电视的语音查询、每个信息流中的推荐,以及账户查找时的身份匹配。每一次页面浏览、每一次按键、每一次用户操作,都会触发一个请求。在消费者级别的规模下,这意味着每秒钟有数千个查询命中搜索索引,而峰值流量往往是平时的数倍。

搜索也处于收入的关键路径上。在零售领域,使用搜索的购物者转化率是单纯浏览者的两到三倍。在流媒体平台上,推荐驱动了用户观看的大部分内容。

过去,要达到生产级别的 QPS,意味着需要为每个应用构建定制化的检索栈。需要针对不同索引大小、查询类型和过滤器进行负载测试,手动调整容量,并在索引前设置负载均衡器。每一个新的搜索用例都意味着从头开始。这种痛苦普遍存在于向量数据库、搜索引擎和 DIY 栈中。

今天,我们宣布 Databricks AI Search 的高 QPS 扩展功能正式可用。现在,通过一个人类可读的参数,标准端点可以扩展到数千 QPS。您告诉我们目标,我们为您配置基础设施。

在创建端点时设置 target_qps,或随时通过 SDK、REST API 或端点 UI 更新现有端点。Databricks 会配置基础设施以满足目标。无需管理副本数量、无需调整节点大小、无需连接负载均衡器。

Unity Catalog 治理和 Delta Sync 保持不变。同一端点可以从原型扩展到生产流量,无需离开平台。

何时需要高 QPS 扩展:

搜索栏:例如电商产品搜索、流媒体和媒体平台的内容发现、联网设备上的语音搜索。自动补全框每次按键都可能触发搜索调用,因此 QPS 随活动输入量增长。延迟直接影响转化率。

推荐/个性化系统:例如电商的“你可能也喜欢”面板、媒体和流媒体平台的个性化信息流。每次页面浏览都会触发推荐查询,流量高峰首先影响检索。推荐延迟是请求的关键路径。

实时实体解析:例如身份匹配、去重、请求时对大型目录的查找。这里的查询速率是运营 SLA,不是可以缓冲的突发流量。

如果出现以下情况,您可能需要此功能:

  • 生产日志中出现 429(请求过多)错误
  • P95 延迟随流量增加而飙升,即使是平均利用率适中时
  • 使用重复端点或客户端负载均衡等变通方法

工作原理详解:

声明:您在端点上设置 QPS 目标。Databricks 计算并配置计算容量以达成目标。无需管理副本数量、无需节点大小规划、无需容量规划。

与现有端点兼容:通过 Python SDK、REST API 或 UI 更新任何标准端点。新容量在下一次在端点上创建或同步索引时生效。

监控扩展状态:端点上的 scaling_info 字段跟踪进度,从 SCALING_CHANGE_IN_PROGRESS 到 SCALING_CHANGE_APPLIED。

生产可观测性:在生产中运行检索系统需要了解每秒请求数、请求延迟和端点健康。端点 UI 现在为每个端点提供这三项指标。

使用服务主体认证以获得最佳性能:服务主体流量通过为高 QPS 生产工作负载优化的网络路由。个人访问令牌(PAT)流量限制在每秒几十个 QPS,适合原型设计但不适合生产。请参阅性能指南以获取完整说明。

规模调整:使用端点可观测性 UI 和原生 Genie 集成来了解流量模式,并设置具有足够余量的 target_qps 以应对突发。

立即开始构建:

原型和生产之间的区别现在只是一个配置参数。高 QPS 扩展现已全面可用,无需选择加入。两种开始路径:

  • 使用 target_qps 设置初始目标创建新端点
  • 更新现有端点的 target_qps 以扩展已为应用服务的索引

接下来:

我们将继续使搜索在规模上更易操作。计划今年晚些时候推出针对流量突发的自动扩展(无需手动容量规划或规模调整)以及对存储优化端点的支持。

深入了解:

  • 高 QPS 文档
  • Databricks AI Search 概览
  • 性能最佳实践
  • 在 Databricks 上构建实时产品搜索