AI News HubLIVE
站内改写2 分钟阅读

配置专用模型推理

Together AI 的专用模型推理架构详解:端点、部署、配置三部分模型,以及基于容量的路由机制。

Together AI 的专用模型推理平台由三个核心组件构成:端点(endpoint)、部署(deployment)和配置(config)。端点是客户调用时使用的固定名称,例如“项目名/端点名”,在应用代码中作为模型参数传入。部署则绑定一个特定模型版本与一个配置,并配有自动扩缩策略,实际运行副本。部署被设计为可丢弃的,常规操作包括创建和销毁。配置是不可变的配方,指定引擎、GPU类型与数量、并行度以及优化目标(延迟/吞吐量/平衡)。每个配置有唯一的 cr_ ID,部署始终指向经过测试的配置。

这三个组件通过容量感知的流量拆分联动。流量拆分是一个列表,包含部署ID和权重。权重是每个就绪副本的权重,路由计算每个部署的有效容量(权重×就绪副本数),并按比例分配流量。例如,部署A权重1且有1个就绪副本(容量1),部署B权重1且有3个就绪副本(容量3),则流量为25%/75%。这种设计使扩缩与路由自然协同:当A扩容到3个副本时,容量自动增加,吸收对应的流量,无需调整百分比。权重可以任意正数,无总和约束,0.7/0.3与700/300等效。如需固定份额,可使用A/B实验的整数百分比(总和100%)。

部署在流量拆分中但就绪副本为0时,容量为0,流量流向其他可用部署。删除部署前应先从拆分中移除。系统还支持影子实验(权重为0的部署接收镜像流量)和回滚。

用户无需从头编写配置。支持的模型目录提供认证的部署配置文件,包含GPU类型、数量、量化精度和性能基准。用户可依据加速器类型、数量、优化目标和拓扑选择配置。优化目标是最常选择的维度:延迟配置优化首token时间,适合交互式聊天;吞吐量配置最大化GPU小时总token数,适合离线批处理;平衡配置是默认良好起点。

配置不可变,避免因“临时修改标志”导致行为漂移,旧配置作为经过测试的回滚目标。推测解码也可通过配置中的草稿模型属性触发。

文章还通过实验验证了容量感知路由:两个部署各权重1,初始各1副本,流量约50/50;将A扩至2副本后,流量变为约66.7/33.3,符合理论预期。性能对比显示,不同配置在不同并发度下的表现差异显著。例如,配置A(Qwen3.5-9B, BF16, TP1)在并发4时362 tok/s,并发16时1464 tok/s,TTFT p95仅368ms;配置B(Qwen3-VL-8B, BF16, TP1)在并发4时495 tok/s,但并发16时降至240 tok/s,TTFT p95 323ms。B在低并发时胜出,高并发时急剧退化。建议用户通过实际测试选择。

最后,文章给出了快速开始的五个命令:tg whoami、tg beta models public --product dedicated、tg beta endpoints deploy、使用客户端调用、tg beta endpoints get。从那里开始,一切都只需再增加一个部署。