AI News HubLIVE
站內改寫1 分鐘閱讀

Cursor與Together AI實現大規模即時低延遲推理

Cursor是一款AI驅動的編碼平臺,其編輯器內AI代理需要極低延遲以保持上下文一致性。與Together AI合作,基於NVIDIA Blackwell架構(GB200 NVL72 / HGX B200)部署生產推理,透過ARM主機最佳化、NVFP4量化管道和自定義核心,實現了從新權重到測試端點僅需數天的快速迭代,並在多個資料中心執行。

來源Hacker News AI作者: inferhaven

Cursor是一款AI驅動的編碼平臺,其核心能力在於編輯器內的連續智慧。當開發者輸入程式碼時,Cursor會即時構建程式碼上下文模型,預測編輯、重構程式碼並管理上下文。這種體驗要求AI代理在編輯器的反饋迴圈內做出響應,因此延遲成為關鍵指標。與批次推理不同,編輯器內延遲必須可預測且極低,否則建議會與開發者當前的程式碼上下文脫節。

為了滿足嚴格的即時性要求,Cursor與Together AI合作,基於NVIDIA Blackwell架構(GB200 NVL72和HGX B200)構建推理基礎設施。Blackwell提供了更高的記憶體頻寬和張量吞吐量,能夠支援更快速的模型服務。團隊在硬體、韌體、主機軟體和服務層進行了全面最佳化,包括ARM主機適配、Blackwell Tensor Core自定義核心以及針對GB200 NVL72的並行性設計。GB200 NVL72採用全互聯拓撲連線72塊GPU,Together AI設計了高效的並行網格,將通訊開銷控制在合理範圍內,使計算增益充分用於推理。

在模型迭代方面,Cursor的研究團隊持續訓練新權重,結合專有資料和針對編碼工作流的最佳化。Together AI建立了一條從權重到生產端點的可重複路徑,核心是量化管道。他們利用NVIDIA TensorRT-LLM和NVFP4格式,在保持輸出質量的同時降低記憶體和計算開銷。新權重可在數天內完成量化、驗證並啟動測試端點,隨後透過內部評估和A/B測試逐步過渡到生產環境。切換過程由驗證和即時流量檢查嚴格把關。

目前,Cursor的生產部署已執行在多個資料中心的NVIDIA Blackwell GPU上,GB200 NVL72負責推理任務。隨著延遲問題得到解決,下一步重點將轉向提高吞吐量和GPU利用率,以最佳化單GPU經濟效益。Cursor和Together AI正在Blackwell平臺上構建更高吞吐的端點,以應對使用量的增長。