AI News HubLIVE
站內改寫1 分鐘閱讀

“我們喜歡兩種模型都能使用的世界”:NVIDIA如何看待本地模型與前沿模型

NVIDIA高階總監Joey Conway表示,本地小型模型與前沿大模型正協同工作,透過路由器分配任務,企業可藉此降低成本、提高效率。NVIDIA推出DGX Spark等硬體支援本地執行大模型,並強調資料控制與安全性。

來源The New Stack AI作者: Frederic Lardinois

NVIDIA高階總監Joey Conway在接受The New Stack採訪時表示,如今本地模型和開源模型的能力已足夠強大,問題不再是能否執行它們,而是如何充分利用它們。Conway認為,任務複雜度不同,處理它們的模型也應有所區別。他提到早期開源推理模型會為“2+2”這類簡單問題耗費大量計算資源,而合理的做法是將簡單任務路由到快速本地模型,複雜任務則交給更先進的模型,從而在降低成本的同時提高效率。

Conway描述了一個“模型系統”的概念:企業可以構建一個由專業代理組成的團隊,每個代理專注於特定任務並不斷最佳化。對使用者而言,這一切都隱藏在一個統一介面之後,背後則是多種模型協同工作。實現這一系統的關鍵在於路由技術,而NVIDIA的貢獻在於其開源推理服務軟體Dynamo,它能夠將每個查詢導向最近處理過類似請求的GPU。至於具體任務最適合哪種模型,NVIDIA交由更廣泛的路由器生態系統來決定,其中一些路由器本身就是模型,能夠權衡預算、延遲和模態。

NVIDIA還展示了與LangChain的合作成果:基於Nemotron 3 Ultra(5500億引數的開源模型)的Deep Agents在商業任務上達到了頂級閉源模型的效能,成本卻降低了10倍。Conway指出,這些提升完全來自對提示詞、工具描述和中介軟體的調優,無需重新訓練模型。

對於希望本地執行大模型的企業,NVIDIA推出了DGX Spark(售價4,699美元,配備128GB統一記憶體,支援高達2000億引數的模型)和更高階的DGX Station(748GB記憶體)。這些裝置讓AI計算完全在本地進行,無需考慮網路延遲。Conway強調,企業應該“將AI帶到資料所在之處”,而不是將資料交給外部供應商。透過微調開源模型,企業可以像僱傭員工一樣將其融入自身業務流程,同時確保智慧財產權安全。

當需要處理更廣泛的問題時,企業仍可隨時呼叫雲端的前沿模型。無論模型執行在桌面還是雲端,其底層晶片都是NVIDIA的產品,因此對NVIDIA而言,這種“混合模型”策略無疑是雙贏的選擇。