InferenceBench:用於AI智慧體開放式LLM推理最佳化的基準測試
InferenceBench是一個新的基準測試,旨在評估AI智慧體在開放式LLM推理最佳化中的能力。智慧體需在兩小時內最佳化目標LLM的推理速度,涉及預填充延遲、解碼延遲和併發吞吐量等場景。測試顯示,智慧體雖能超越基線,但往往收斂於單一框架,未能充分探索多樣化策略,表明瓶頸在於配置多樣性而非領域知識。
AI智慧體正越來越多地被用於自動化研發任務,然而現有的基準測試通常侷限於預設的工作流或狹窄的動作空間。即使那些名義上開放的任務,也常常可以透過檢索已知的解決方案並調整少量超引數來解決,這使得我們難以判斷強大的結果是源於真正的最佳化還是記憶化的解決方案。為了應對這一挑戰,研究人員推出了InferenceBench——一個全新的基準測試,要求智慧體部署一個相容OpenAI的推理伺服器,並在兩小時內最佳化LLM推理的速度。
在InferenceBench中,每個智慧體獲得一個目標LLM、一塊H100 GPU、一個最佳化場景以及兩小時的掛鐘時間預算。最佳化場景包括四個:預填充延遲、解碼延遲、併發請求吞吐量,以及一個平衡所有三者的綜合場景。研究人員測試了15種前沿智慧體配置,結果顯示,智慧體能夠可靠地超越樸素的PyTorch基線,最高實現了8.08倍的加速,並且經常匹配或超過使用預設設定的推理引擎(例如vLLM的4.05倍)。然而,它們仍然低於在相同時間預算下進行的簡單超引數搜尋(最高達到11.53倍)。
對智慧體軌跡的定性分析揭示了有趣的現象:儘管智慧體列舉了許多相關的最佳化技術,但它們絕大多數會收斂於同一個推理框架。它們只測試少數幾種不同的配置,然後將剩餘的時間用於重新測量、修復錯誤或最佳化超引數,而不是探索截然不同的策略。這表明,瓶頸不在於領域知識,而在於提出多樣化配置、系統評估它們並提交最佳解決方案的能力。
總體而言,InferenceBench反映了智慧體在開放式AI工程環境中的運作能力。在這種環境中,記憶化的解決方案只能帶來有限的改進,而真正的創新需要智慧體具備探索和評估多種策略的能力。該基準測試為評估智慧體在複雜、真實的推理最佳化任務中的表現提供了全新的視角,同時也揭示了當前智慧體在開放式任務中的侷限性。