Cursor与Together AI实现大规模实时低延迟推理
Cursor是一款AI驱动的编码平台,其编辑器内AI代理需要极低延迟以保持上下文一致性。与Together AI合作,基于NVIDIA Blackwell架构(GB200 NVL72 / HGX B200)部署生产推理,通过ARM主机优化、NVFP4量化管道和自定义内核,实现了从新权重到测试端点仅需数天的快速迭代,并在多个数据中心运行。
Cursor是一款AI驱动的编码平台,其核心能力在于编辑器内的连续智能。当开发者输入代码时,Cursor会实时构建代码上下文模型,预测编辑、重构代码并管理上下文。这种体验要求AI代理在编辑器的反馈循环内做出响应,因此延迟成为关键指标。与批量推理不同,编辑器内延迟必须可预测且极低,否则建议会与开发者当前的代码上下文脱节。
为了满足严格的实时性要求,Cursor与Together AI合作,基于NVIDIA Blackwell架构(GB200 NVL72和HGX B200)构建推理基础设施。Blackwell提供了更高的内存带宽和张量吞吐量,能够支持更快速的模型服务。团队在硬件、固件、主机软件和服务层进行了全面优化,包括ARM主机适配、Blackwell Tensor Core自定义内核以及针对GB200 NVL72的并行性设计。GB200 NVL72采用全互联拓扑连接72块GPU,Together AI设计了高效的并行网格,将通信开销控制在合理范围内,使计算增益充分用于推理。
在模型迭代方面,Cursor的研究团队持续训练新权重,结合专有数据和针对编码工作流的优化。Together AI建立了一条从权重到生产端点的可重复路径,核心是量化管道。他们利用NVIDIA TensorRT-LLM和NVFP4格式,在保持输出质量的同时降低内存和计算开销。新权重可在数天内完成量化、验证并启动测试端点,随后通过内部评估和A/B测试逐步过渡到生产环境。切换过程由验证和实时流量检查严格把关。
目前,Cursor的生产部署已运行在多个数据中心的NVIDIA Blackwell GPU上,GB200 NVL72负责推理任务。随着延迟问题得到解决,下一步重点将转向提高吞吐量和GPU利用率,以优化单GPU经济效益。Cursor和Together AI正在Blackwell平台上构建更高吞吐的端点,以应对使用量的增长。