AI News HubLIVE
站内改写5 分钟阅读

开源权重AI推理的生产平台

Together AI发布了其推理平台的重大更新,为用户提供对性能、成本和质量的完全控制。新功能包括金丝雀部署、A/B测试、自动缩放以及自定义训练的封闭测试版,包含强化学习和微调。

Together AI今天宣布推出其专用模型推理平台的重大更新,旨在让企业能够更轻松、更可靠、更优化地运行开源权重模型。该平台提供了对性能、成本和质量的全面控制,同时简化了部署和管理流程。

新平台的核心特性之一是部署的灵活性。用户可以选择不同的硬件和优化配置,支持多种量化级别和并行方案。此外,平台引入了金丝雀部署、蓝绿部署和滚动更新策略,确保变更可以安全地逐步推出,并在出现问题时自动回滚。A/B测试和影子流量功能允许用户在不影响生产环境的情况下评估新模型和配置。

Together AI还宣布了自定义训练的封闭测试版,包括全权重和LoRA强化学习以及监督微调。训练后的检查点可以直接部署到生产环境中,无需额外的转移步骤。该测试版目前有限名额开放。

平台还提供了组织级的Prometheus端点,用于可观测性和监控,以及改进的产品内分析体验。Together AI表示,该平台是更广泛愿景的一部分,旨在创建一个从训练到优化、部署、测量和持续改进的完整生命周期平台,无需拼凑不同的系统。

当前,开源权重模型在质量上已与闭源模型匹敌,但成本仅为闭源模型的一小部分,并且可以完全根据任务进行定制。这使得它们成为构建重要AI产品和代理的团队的基础。然而,采用开源权重模型的战略动机仍然是能够行使控制权。与闭源替代品不同,开源权重模型让团队能够控制性能、质量和功能。许多商业AI应用采用了以开源权重为主的端点策略,以保持对用户体验的完全控制。许多企业利用这种控制将宝贵的专有IP集成到模型中,而无需担心向第三方泄露。

尽管开源权重模型用户希望最大限度地控制性能、功能和质量,但很少有团队愿意每周测试他们在量化级别、并行方案、引擎参数和草稿模型架构等方面的决策矩阵的准确性。与此同时,实现最佳质量和性能的前沿技术也在快速进步。在快速发展的AI领域中,没有人有时间或意愿停下来阅读关于推理内部的大量琐碎信息或堆积如山的研究论文——即使是运行世界上最成功模型和代理的团队也是如此。

Together专用模型推理应用了从每月服务超过400万亿个token中积累的经验,提供推理平台,让用户完全控制模型、性能、成本、质量和功能,避免从头构建每个推理堆栈和端点管理层所浪费的时间、资金和意外停机,并不断整合最新的经过验证的研究,以实现前沿水平的性能、质量和效率。

这次更新汇集了研究、模型优化和平台工程团队的进展,提供单一服务,让公司能够更轻松、更可靠、更优化地在生产环境中运行开源、许可闭源和微调模型。

实现这种控制和简单性的结合,需要将推理视为不仅仅是托管模型在API后面。你使用的精度、部署的硬件、使用的服务配置以及扩展和路由流量的方式,都会对性能、可靠性和成本产生重大影响。

我们构建这个平台,使得从实验转向生产不需要更改平台或重建部署。生产就绪性已内置于基础中,即使你仍在测试和迭代。这意味着你可以安全地推出新版本,针对真实流量测试更改,镜像生产请求,跨部署路由流量,根据需求扩展,并在出现异常时回滚。

Decagon的Max Lu这样描述这一转变:“Together已经让我们的延迟达到了语音所需的水平。他们的新推理平台改变的是我们发布下一个模型版本的方式:我们可以将一个新的微调模型以一小部分在线流量进行金丝雀测试,如果关键指标下降,则自动回滚。我们将从‘快速推理’转变为‘我们可以每周安全迭代的快速推理’。”

这最终是我们想要解锁的:不仅是快速高效的推理,还有持续改进所提供内容的能力,而不会引入不必要的风险。你可以从Together已经优化的路径开始,然后随着工作负载变得更为专业化而承担更多控制。这一原则体现在整个平台中——从如何引入和配置模型,到如何扩展、测试更改、观察性能以及将新版本投入生产。

平台支持从Together模型平台部署模型,或自带开源权重或微调模型。你可以从Hugging Face、S3或本地机器上传完整的模型权重或适配器。该平台旨在支持模型的完整生命周期,从早期的微调直到最终服务于生产流量的版本。

模型本身只是部署的一部分。硬件类型、量化、张量并行、推测解码和服务引擎都会影响工作负载的性能和经济性。你不必成为这些选择的专家就能获得强劲效果。Together部署配置文件打包了我们的研究和工程团队已经测试和优化的配置,因此你可以从经过验证的设置开始,而不是从头组装。当你需要更多控制时,这些选择仍然可用。你可以选择不同的硬件和优化配置文件,并随着时间的推移选择主要针对延迟、吞吐量或两者之间的平衡进行优化。

模型越大,启动时间就越受移动数百GB权重的影响。我们重建了模型缓存和分发层,使权重可以在整个集群中共享,并在部署需要之前主动预热。在内部测试中,这使多个前沿模型的冷启动速度大约提高了4倍。

部署时间因模型大小而异:小模型(如Qwen 2.5 7B、Llama 3.1 8B)约需2-5分钟,中等模型(如GPT-OSS 20B、Qwen 3.5 35B)约需3-7分钟,大型模型(如Llama 3.3 70B、Qwen 3 235B)约需4-12分钟,前沿级MoE模型(如Kimi K2.7、GLM 5.2)约需7-14分钟。

你可以选择将模型固定到特定区域或保持灵活的放置位置,并定义部署如何响应流量变化。根据工作负载的不同,扩展信号可能不同,因此自动缩放不应局限于单一的通用指标。平台从合理的默认值开始,同时允许你根据进行中的请求、GPU利用率、首个token时间、延迟、解码速度或吞吐量进行缩放。

一个推理端点不再必须映射到单个静态部署。你可以在同一个端点后创建多个部署,每个部署可以使用不同的模型权重、硬件或服务配置。这让你可以更改API背后的内容,而无需强制应用程序更改调用模型的方式。端点保持稳定,而背后的部署不断演进,从而更容易测试、推出和替换模型或配置,而无需重新设计应用层。

使用金丝雀、蓝绿或滚动更新逐步引入新的模型版本和配置。平台处理流量移动和部署生命周期,同时让你控制变更推进的速度以及何时停止或回滚。你无需自己构建推出机制就能获得所需的生产控制。

通过A/B测试将一定比例的流量路由到不同部署并直接比较其行为,或使用影子流量将生产请求镜像到新部署而不影响返回给用户的响应。这使得可以使用实际流量评估新权重、配置和硬件,而不是仅依赖离线基准或合成测试。

新平台提供了组织级的可抓取Prometheus端点,你可以将其连接到所选的观察性工具,以构建仪表板、设置警报、监控推出健康状态、比较A/B测试变体,并测量影子流量与生产流量的对比。我们还刷新了产品内分析体验,使部署健康、流量、性能和扩展行为在Together中更易于直接理解。

除了推理平台,我们还推出了自定义训练的封闭测试版,包括全权重和LoRA强化学习以及高级监督微调。你可以通过Python SDK和细粒度原语配置训练,并在专用容量上同时运行多个LoRA实验。自定义训练将实验直接连接到生产。当检查点准备好评估时,你可以将其原生部署到推理部署中,无需在训练和服务之间进行单独的交接,也无需重建设置即可在同一平台上从训练后实验转向生产评估。封闭测试版名额有限。

这次更新只是一个开始。它是平台的基石,使得模型可以在不将不同系统拼凑起来的情况下进行训练、优化、部署、测量和持续改进。开源权重模型赋予公司对质量、性能和成本的巨大控制权。我们的工作是让这种控制变得可访问,而不将推理变成DIY基础设施项目。这意味着提供有效的默认值、我们已经优化的配置,以及当你需要时更深层次的控制。

在接下来的几周里,我们将更深入地探讨平台背后的系统,包括部署配置文件、模型启动、自动缩放、可观察性、推出、A/B测试和影子流量。现在,新的专用模型推理平台已经可用,帮助你从早期迭代转向生产,并在到达后持续改进所服务的内容。