開源權重AI推理的生產平台
Together AI發佈了其推理平台的重大更新,為用户提供對性能、成本和質量的完全控制。新功能包括金絲雀部署、A/B測試、自動縮放以及自定義訓練的封閉測試版,包含強化學習和微調。
Together AI今天宣佈推出其專用模型推理平台的重大更新,旨在讓企業能夠更輕鬆、更可靠、更優化地運行開源權重模型。該平台提供了對性能、成本和質量的全面控制,同時簡化了部署和管理流程。
新平台的核心特性之一是部署的靈活性。用户可以選擇不同的硬件和優化配置,支持多種量化級別和並行方案。此外,平台引入了金絲雀部署、藍綠部署和滾動更新策略,確保變更可以安全地逐步推出,並在出現問題時自動回滾。A/B測試和影子流量功能允許用户在不影響生產環境的情況下評估新模型和配置。
Together AI還宣佈了自定義訓練的封閉測試版,包括全權重和LoRA強化學習以及監督微調。訓練後的檢查點可以直接部署到生產環境中,無需額外的轉移步驟。該測試版目前有限名額開放。
平台還提供了組織級的Prometheus端點,用於可觀測性和監控,以及改進的產品內分析體驗。Together AI表示,該平台是更廣泛願景的一部分,旨在創建一個從訓練到優化、部署、測量和持續改進的完整生命週期平台,無需拼湊不同的系統。
當前,開源權重模型在質量上已與閉源模型匹敵,但成本僅為閉源模型的一小部分,並且可以完全根據任務進行定製。這使得它們成為構建重要AI產品和代理的團隊的基礎。然而,採用開源權重模型的戰略動機仍然是能夠行使控制權。與閉源替代品不同,開源權重模型讓團隊能夠控制性能、質量和功能。許多商業AI應用採用了以開源權重為主的端點策略,以保持對用户體驗的完全控制。許多企業利用這種控制將寶貴的專有IP集成到模型中,而無需擔心向第三方泄露。
儘管開源權重模型用户希望最大限度地控制性能、功能和質量,但很少有團隊願意每週測試他們在量化級別、並行方案、引擎參數和草稿模型架構等方面的決策矩陣的準確性。與此同時,實現最佳質量和性能的前沿技術也在快速進步。在快速發展的AI領域中,沒有人有時間或意願停下來閲讀關於推理內部的大量瑣碎信息或堆積如山的研究論文——即使是運行世界上最成功模型和代理的團隊也是如此。
Together專用模型推理應用了從每月服務超過400萬億個token中積累的經驗,提供推理平台,讓用户完全控制模型、性能、成本、質量和功能,避免從頭構建每個推理堆棧和端點管理層所浪費的時間、資金和意外停機,並不斷整合最新的經過驗證的研究,以實現前沿水平的性能、質量和效率。
這次更新彙集了研究、模型優化和平台工程團隊的進展,提供單一服務,讓公司能夠更輕鬆、更可靠、更優化地在生產環境中運行開源、許可閉源和微調模型。
實現這種控制和簡單性的結合,需要將推理視為不僅僅是託管模型在API後面。你使用的精度、部署的硬件、使用的服務配置以及擴展和路由流量的方式,都會對性能、可靠性和成本產生重大影響。
我們構建這個平台,使得從實驗轉向生產不需要更改平台或重建部署。生產就緒性已內置於基礎中,即使你仍在測試和迭代。這意味着你可以安全地推出新版本,針對真實流量測試更改,鏡像生產請求,跨部署路由流量,根據需求擴展,並在出現異常時回滾。
Decagon的Max Lu這樣描述這一轉變:“Together已經讓我們的延遲達到了語音所需的水平。他們的新推理平台改變的是我們發佈下一個模型版本的方式:我們可以將一個新的微調模型以一小部分在線流量進行金絲雀測試,如果關鍵指標下降,則自動回滾。我們將從‘快速推理’轉變為‘我們可以每週安全迭代的快速推理’。”
這最終是我們想要解鎖的:不僅是快速高效的推理,還有持續改進所提供內容的能力,而不會引入不必要的風險。你可以從Together已經優化的路徑開始,然後隨着工作負載變得更為專業化而承擔更多控制。這一原則體現在整個平台中——從如何引入和配置模型,到如何擴展、測試更改、觀察性能以及將新版本投入生產。
平台支持從Together模型平台部署模型,或自帶開源權重或微調模型。你可以從Hugging Face、S3或本地機器上傳完整的模型權重或適配器。該平台旨在支持模型的完整生命週期,從早期的微調直到最終服務於生產流量的版本。
模型本身只是部署的一部分。硬件類型、量化、張量並行、推測解碼和服務引擎都會影響工作負載的性能和經濟性。你不必成為這些選擇的專家就能獲得強勁效果。Together部署配置文件打包了我們的研究和工程團隊已經測試和優化的配置,因此你可以從經過驗證的設置開始,而不是從頭組裝。當你需要更多控制時,這些選擇仍然可用。你可以選擇不同的硬件和優化配置文件,並隨着時間的推移選擇主要針對延遲、吞吐量或兩者之間的平衡進行優化。
模型越大,啓動時間就越受移動數百GB權重的影響。我們重建了模型緩存和分發層,使權重可以在整個集羣中共享,並在部署需要之前主動預熱。在內部測試中,這使多個前沿模型的冷啓動速度大約提高了4倍。
部署時間因模型大小而異:小模型(如Qwen 2.5 7B、Llama 3.1 8B)約需2-5分鐘,中等模型(如GPT-OSS 20B、Qwen 3.5 35B)約需3-7分鐘,大型模型(如Llama 3.3 70B、Qwen 3 235B)約需4-12分鐘,前沿級MoE模型(如Kimi K2.7、GLM 5.2)約需7-14分鐘。
你可以選擇將模型固定到特定區域或保持靈活的放置位置,並定義部署如何響應流量變化。根據工作負載的不同,擴展信號可能不同,因此自動縮放不應侷限於單一的通用指標。平台從合理的默認值開始,同時允許你根據進行中的請求、GPU利用率、首個token時間、延遲、解碼速度或吞吐量進行縮放。
一個推理端點不再必須映射到單個靜態部署。你可以在同一個端點後創建多個部署,每個部署可以使用不同的模型權重、硬件或服務配置。這讓你可以更改API背後的內容,而無需強制應用程序更改調用模型的方式。端點保持穩定,而背後的部署不斷演進,從而更容易測試、推出和替換模型或配置,而無需重新設計應用層。
使用金絲雀、藍綠或滾動更新逐步引入新的模型版本和配置。平台處理流量移動和部署生命週期,同時讓你控制變更推進的速度以及何時停止或回滾。你無需自己構建推出機制就能獲得所需的生產控制。
通過A/B測試將一定比例的流量路由到不同部署並直接比較其行為,或使用影子流量將生產請求鏡像到新部署而不影響返回給用户的響應。這使得可以使用實際流量評估新權重、配置和硬件,而不是僅依賴離線基準或合成測試。
新平台提供了組織級的可抓取Prometheus端點,你可以將其連接到所選的觀察性工具,以構建儀表板、設置警報、監控推出健康狀態、比較A/B測試變體,並測量影子流量與生產流量的對比。我們還刷新了產品內分析體驗,使部署健康、流量、性能和擴展行為在Together中更易於直接理解。
除了推理平台,我們還推出了自定義訓練的封閉測試版,包括全權重和LoRA強化學習以及高級監督微調。你可以通過Python SDK和細粒度原語配置訓練,並在專用容量上同時運行多個LoRA實驗。自定義訓練將實驗直接連接到生產。當檢查點準備好評估時,你可以將其原生部署到推理部署中,無需在訓練和服務之間進行單獨的交接,也無需重建設置即可在同一平台上從訓練後實驗轉向生產評估。封閉測試版名額有限。
這次更新只是一個開始。它是平台的基石,使得模型可以在不將不同系統拼湊起來的情況下進行訓練、優化、部署、測量和持續改進。開源權重模型賦予公司對質量、性能和成本的巨大控制權。我們的工作是讓這種控制變得可訪問,而不將推理變成DIY基礎設施項目。這意味着提供有效的默認值、我們已經優化的配置,以及當你需要時更深層次的控制。
在接下來的幾周裏,我們將更深入地探討平台背後的系統,包括部署配置文件、模型啓動、自動縮放、可觀察性、推出、A/B測試和影子流量。現在,新的專用模型推理平台已經可用,幫助你從早期迭代轉向生產,並在到達後持續改進所服務的內容。