AI News HubLIVE
站內改寫1 分鐘閱讀

Cursor與Together AI實現大規模實時低延遲推理

Cursor是一款AI驅動的編碼平台,其編輯器內AI代理需要極低延遲以保持上下文一致性。與Together AI合作,基於NVIDIA Blackwell架構(GB200 NVL72 / HGX B200)部署生產推理,通過ARM主機優化、NVFP4量化管道和自定義內核,實現了從新權重到測試端點僅需數天的快速迭代,並在多個數據中心運行。

來源Hacker News AI作者: inferhaven

Cursor是一款AI驅動的編碼平台,其核心能力在於編輯器內的連續智能。當開發者輸入代碼時,Cursor會實時構建代碼上下文模型,預測編輯、重構代碼並管理上下文。這種體驗要求AI代理在編輯器的反饋循環內做出響應,因此延遲成為關鍵指標。與批量推理不同,編輯器內延遲必須可預測且極低,否則建議會與開發者當前的代碼上下文脱節。

為了滿足嚴格的實時性要求,Cursor與Together AI合作,基於NVIDIA Blackwell架構(GB200 NVL72和HGX B200)構建推理基礎設施。Blackwell提供了更高的內存帶寬和張量吞吐量,能夠支持更快速的模型服務。團隊在硬件、固件、主機軟件和服務層進行了全面優化,包括ARM主機適配、Blackwell Tensor Core自定義內核以及針對GB200 NVL72的並行性設計。GB200 NVL72採用全互聯拓撲連接72塊GPU,Together AI設計了高效的並行網格,將通信開銷控制在合理範圍內,使計算增益充分用於推理。

在模型迭代方面,Cursor的研究團隊持續訓練新權重,結合專有數據和針對編碼工作流的優化。Together AI建立了一條從權重到生產端點的可重複路徑,核心是量化管道。他們利用NVIDIA TensorRT-LLM和NVFP4格式,在保持輸出質量的同時降低內存和計算開銷。新權重可在數天內完成量化、驗證並啓動測試端點,隨後通過內部評估和A/B測試逐步過渡到生產環境。切換過程由驗證和實時流量檢查嚴格把關。

目前,Cursor的生產部署已運行在多個數據中心的NVIDIA Blackwell GPU上,GB200 NVL72負責推理任務。隨着延遲問題得到解決,下一步重點將轉向提高吞吐量和GPU利用率,以優化單GPU經濟效益。Cursor和Together AI正在Blackwell平台上構建更高吞吐的端點,以應對使用量的增長。