開源權重AI推理的生產平臺
Together AI釋出了其推理平臺的重大更新,為使用者提供對效能、成本和質量的完全控制。新功能包括金絲雀部署、A/B測試、自動縮放以及自定義訓練的封閉測試版,包含強化學習和微調。
Together AI今天宣佈推出其專用模型推理平臺的重大更新,旨在讓企業能夠更輕鬆、更可靠、更最佳化地執行開源權重模型。該平臺提供了對效能、成本和質量的全面控制,同時簡化了部署和管理流程。
新平臺的核心特性之一是部署的靈活性。使用者可以選擇不同的硬體和最佳化配置,支援多種量化級別和並行方案。此外,平臺引入了金絲雀部署、藍綠部署和滾動更新策略,確保變更可以安全地逐步推出,並在出現問題時自動回滾。A/B測試和影子流量功能允許使用者在不影響生產環境的情況下評估新模型和配置。
Together AI還宣佈了自定義訓練的封閉測試版,包括全權重和LoRA強化學習以及監督微調。訓練後的檢查點可以直接部署到生產環境中,無需額外的轉移步驟。該測試版目前有限名額開放。
平臺還提供了組織級的Prometheus端點,用於可觀測性和監控,以及改進的產品內分析體驗。Together AI表示,該平臺是更廣泛願景的一部分,旨在建立一個從訓練到最佳化、部署、測量和持續改進的完整生命週期平臺,無需拼湊不同的系統。
當前,開源權重模型在質量上已與閉源模型匹敵,但成本僅為閉源模型的一小部分,並且可以完全根據任務進行定製。這使得它們成為構建重要AI產品和代理的團隊的基礎。然而,採用開源權重模型的戰略動機仍然是能夠行使控制權。與閉源替代品不同,開源權重模型讓團隊能夠控制效能、質量和功能。許多商業AI應用採用了以開源權重為主的端點策略,以保持對使用者體驗的完全控制。許多企業利用這種控制將寶貴的專有IP整合到模型中,而無需擔心向第三方洩露。
儘管開源權重模型使用者希望最大限度地控制效能、功能和質量,但很少有團隊願意每週測試他們在量化級別、並行方案、引擎引數和草稿模型架構等方面的決策矩陣的準確性。與此同時,實現最佳質量和效能的前沿技術也在快速進步。在快速發展的AI領域中,沒有人有時間或意願停下來閱讀關於推理內部的大量瑣碎資訊或堆積如山的研究論文——即使是執行世界上最成功模型和代理的團隊也是如此。
Together專用模型推理應用了從每月服務超過400萬億個token中積累的經驗,提供推理平臺,讓使用者完全控制模型、效能、成本、質量和功能,避免從頭構建每個推理堆疊和端點管理層所浪費的時間、資金和意外停機,並不斷整合最新的經過驗證的研究,以實現前沿水平的效能、質量和效率。
這次更新彙集了研究、模型最佳化和平臺工程團隊的進展,提供單一服務,讓公司能夠更輕鬆、更可靠、更最佳化地在生產環境中執行開源、許可閉源和微調模型。
實現這種控制和簡單性的結合,需要將推理視為不僅僅是託管模型在API後面。你使用的精度、部署的硬體、使用的服務配置以及擴充套件和路由流量的方式,都會對效能、可靠性和成本產生重大影響。
我們構建這個平臺,使得從實驗轉向生產不需要更改平臺或重建部署。生產就緒性已內建於基礎中,即使你仍在測試和迭代。這意味著你可以安全地推出新版本,針對真實流量測試更改,映象生產請求,跨部署路由流量,根據需求擴充套件,並在出現異常時回滾。
Decagon的Max Lu這樣描述這一轉變:“Together已經讓我們的延遲達到了語音所需的水平。他們的新推理平臺改變的是我們釋出下一個模型版本的方式:我們可以將一個新的微調模型以一小部分線上流量進行金絲雀測試,如果關鍵指標下降,則自動回滾。我們將從‘快速推理’轉變為‘我們可以每週安全迭代的快速推理’。”
這最終是我們想要解鎖的:不僅是快速高效的推理,還有持續改進所提供內容的能力,而不會引入不必要的風險。你可以從Together已經最佳化的路徑開始,然後隨著工作負載變得更為專業化而承擔更多控制。這一原則體現在整個平臺中——從如何引入和配置模型,到如何擴充套件、測試更改、觀察效能以及將新版本投入生產。
平臺支援從Together模型平臺部署模型,或自帶開源權重或微調模型。你可以從Hugging Face、S3或本地機器上傳完整的模型權重或介面卡。該平臺旨在支援模型的完整生命週期,從早期的微調直到最終服務於生產流量的版本。
模型本身只是部署的一部分。硬體型別、量化、張量並行、推測解碼和服務引擎都會影響工作負載的效能和經濟性。你不必成為這些選擇的專家就能獲得強勁效果。Together部署配置檔案打包了我們的研究和工程團隊已經測試和最佳化的配置,因此你可以從經過驗證的設定開始,而不是從頭組裝。當你需要更多控制時,這些選擇仍然可用。你可以選擇不同的硬體和最佳化配置檔案,並隨著時間的推移選擇主要針對延遲、吞吐量或兩者之間的平衡進行最佳化。
模型越大,啟動時間就越受移動數百GB權重的影響。我們重建了模型快取和分發層,使權重可以在整個叢集中共享,並在部署需要之前主動預熱。在內部測試中,這使多個前沿模型的冷啟動速度大約提高了4倍。
部署時間因模型大小而異:小模型(如Qwen 2.5 7B、Llama 3.1 8B)約需2-5分鐘,中等模型(如GPT-OSS 20B、Qwen 3.5 35B)約需3-7分鐘,大型模型(如Llama 3.3 70B、Qwen 3 235B)約需4-12分鐘,前沿級MoE模型(如Kimi K2.7、GLM 5.2)約需7-14分鐘。
你可以選擇將模型固定到特定區域或保持靈活的放置位置,並定義部署如何響應流量變化。根據工作負載的不同,擴充套件訊號可能不同,因此自動縮放不應侷限於單一的通用指標。平臺從合理的預設值開始,同時允許你根據進行中的請求、GPU利用率、首個token時間、延遲、解碼速度或吞吐量進行縮放。
一個推理端點不再必須對映到單個靜態部署。你可以在同一個端點後建立多個部署,每個部署可以使用不同的模型權重、硬體或服務配置。這讓你可以更改API背後的內容,而無需強制應用程式更改呼叫模型的方式。端點保持穩定,而背後的部署不斷演進,從而更容易測試、推出和替換模型或配置,而無需重新設計應用層。
使用金絲雀、藍綠或滾動更新逐步引入新的模型版本和配置。平臺處理流量移動和部署生命週期,同時讓你控制變更推進的速度以及何時停止或回滾。你無需自己構建推出機制就能獲得所需的生產控制。
透過A/B測試將一定比例的流量路由到不同部署並直接比較其行為,或使用影子流量將生產請求映象到新部署而不影響返回給使用者的響應。這使得可以使用實際流量評估新權重、配置和硬體,而不是僅依賴離線基準或合成測試。
新平臺提供了組織級的可抓取Prometheus端點,你可以將其連線到所選的觀察性工具,以構建儀表板、設定警報、監控推出健康狀態、比較A/B測試變體,並測量影子流量與生產流量的對比。我們還重新整理了產品內分析體驗,使部署健康、流量、效能和擴充套件行為在Together中更易於直接理解。
除了推理平臺,我們還推出了自定義訓練的封閉測試版,包括全權重和LoRA強化學習以及高階監督微調。你可以透過Python SDK和細粒度原語配置訓練,並在專用容量上同時執行多個LoRA實驗。自定義訓練將實驗直接連線到生產。當檢查點準備好評估時,你可以將其原生部署到推理部署中,無需在訓練和服務之間進行單獨的交接,也無需重建設定即可在同一平臺上從訓練後實驗轉向生產評估。封閉測試版名額有限。
這次更新只是一個開始。它是平臺的基石,使得模型可以在不將不同系統拼湊起來的情況下進行訓練、最佳化、部署、測量和持續改進。開源權重模型賦予公司對質量、效能和成本的巨大控制權。我們的工作是讓這種控制變得可訪問,而不將推理變成DIY基礎設施專案。這意味著提供有效的預設值、我們已經最佳化的配置,以及當你需要時更深層次的控制。
在接下來的幾周裡,我們將更深入地探討平臺背後的系統,包括部署配置檔案、模型啟動、自動縮放、可觀察性、推出、A/B測試和影子流量。現在,新的專用模型推理平臺已經可用,幫助你從早期迭代轉向生產,並在到達後持續改進所服務的內容。