AI News HubLIVE
站內改寫1 分鐘閱讀

超越準確率與成本:面向動態工作負載的延遲感知LLM查詢路由

現代語言查詢路由器通常忽略生成延遲,而僅關注響應質量和成本。本文提出一種輕量級延遲估計器,模擬自迴歸標記批處理,估計首個令牌生成時間(TTFT),並將其整合到路由決策中,實現延遲、準確率和成本的聯合最佳化。實驗表明,該方法在保持與標準負載均衡相同延遲的同時,將準確率-成本效用提升了高達40%。

來源arXiv AI作者: Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick, Gauri Joshi

2026年5月13日,一篇題為《超越準確率與成本:面向動態工作負載的延遲感知LLM查詢路由》的論文由Shivam Patel等四位作者提交至arXiv(編號2607.18253)。該論文直擊當前大語言模型(LLM)推理系統中的關鍵痛點:查詢路由器的延遲盲區。現有路由器通常將查詢分配給能平衡響應質量與金錢成本的模型,但幾乎完全忽略了生成延遲。在動態工作負載環境下,延遲往往由輪詢或最短佇列等負載均衡策略控制,這些策略並不考慮模型準確率或推理費用,導致使用者感知的響應時間不可預測。

研究團隊指出,將查詢延遲納入路由決策絕非易事,因為延遲不僅取決於查詢的提示長度,還深受模型例項當前預填充和解碼工作負載、服務框架的排程與批處理策略的影響。為此,他們創新性地設計了一種輕量級延遲估計器,能夠模擬服務框架中自迴歸令牌的批處理過程,從而準確估算查詢的首個令牌生成時間(TTFT)。該估計器無需侵入式監控,計算開銷極低,適合線上推理場景。

基於這一估計器,團隊構建了一個延遲感知的路由器。在分配查詢時,該路由器將延遲、準確率和成本納入聯合最佳化目標,而非傳統方法僅考慮其一或其二。實驗結果表明,與標準負載均衡方法相比,這種聯合最佳化在保持相同延遲水平的同時,將準確率-成本效用提升了高達40%。這意味著,在不犧牲使用者響應速度的前提下,系統可以顯著提升回答質量或降低推理成本。

該研究為動態工作負載下的LLM推理效率最佳化開闢了新路徑。隨著LLM服務化部署的普及,延遲感知的路由策略有望成為下一代推理系統的標準元件,尤其適用於互動式應用(如聊天機器人)和成本敏感的雲端計算場景。未來工作可能包括擴充套件到多模態模型、考慮尾部延遲最佳化等方向。