AI News HubLIVE
站內改寫2 分鐘閱讀

配置專用模型推理

Together AI 的專用模型推理架構詳解:端點、部署、配置三部分模型,以及基於容量的路由機制。

Together AI 的專用模型推理平臺由三個核心元件構成:端點(endpoint)、部署(deployment)和配置(config)。端點是客戶呼叫時使用的固定名稱,例如“專案名/端點名”,在應用程式碼中作為模型引數傳入。部署則繫結一個特定模型版本與一個配置,並配有自動擴縮策略,實際執行副本。部署被設計為可丟棄的,常規操作包括建立和銷燬。配置是不可變的配方,指定引擎、GPU型別與數量、並行度以及最佳化目標(延遲/吞吐量/平衡)。每個配置有唯一的 cr_ ID,部署始終指向經過測試的配置。

這三個元件透過容量感知的流量拆分聯動。流量拆分是一個列表,包含部署ID和權重。權重是每個就緒副本的權重,路由計算每個部署的有效容量(權重×就緒副本數),並按比例分配流量。例如,部署A權重1且有1個就緒副本(容量1),部署B權重1且有3個就緒副本(容量3),則流量為25%/75%。這種設計使擴縮與路由自然協同:當A擴容到3個副本時,容量自動增加,吸收對應的流量,無需調整百分比。權重可以任意正數,無總和約束,0.7/0.3與700/300等效。如需固定份額,可使用A/B實驗的整數百分比(總和100%)。

部署在流量拆分中但就緒副本為0時,容量為0,流量流向其他可用部署。刪除部署前應先從拆分中移除。系統還支援影子實驗(權重為0的部署接收映象流量)和回滾。

使用者無需從頭編寫配置。支援的模型目錄提供認證的部署配置檔案,包含GPU型別、數量、量化精度和效能基準。使用者可依據加速器型別、數量、最佳化目標和拓撲選擇配置。最佳化目標是最常選擇的維度:延遲配置最佳化首token時間,適合互動式聊天;吞吐量配置最大化GPU小時總token數,適合離線批處理;平衡配置是預設良好起點。

配置不可變,避免因“臨時修改標誌”導致行為漂移,舊配置作為經過測試的回滾目標。推測解碼也可透過配置中的草稿模型屬性觸發。

文章還透過實驗驗證了容量感知路由:兩個部署各權重1,初始各1副本,流量約50/50;將A擴至2副本後,流量變為約66.7/33.3,符合理論預期。效能對比顯示,不同配置在不同併發度下的表現差異顯著。例如,配置A(Qwen3.5-9B, BF16, TP1)在併發4時362 tok/s,併發16時1464 tok/s,TTFT p95僅368ms;配置B(Qwen3-VL-8B, BF16, TP1)在併發4時495 tok/s,但併發16時降至240 tok/s,TTFT p95 323ms。B在低併發時勝出,高併發時急劇退化。建議使用者透過實際測試選擇。

最後,文章給出了快速開始的五個命令:tg whoami、tg beta models public --product dedicated、tg beta endpoints deploy、使用客戶端呼叫、tg beta endpoints get。從那裡開始,一切都只需再增加一個部署。