AI News HubLIVE
站內改寫2 分鐘閱讀

Cerebras與AMD合作打造全球最快的分離式AI推理解決方案

Cerebras與AMD宣佈合作,共同打造全球最快的分離式AI推理解決方案。該方案將AMD Helios用於預填充階段,Cerebras晶圓級引擎用於解碼階段,實現每瓦每秒5倍Token吞吐量提升。方案針對智能編碼、實時語音和多模態生成等對速度要求極高的工作負載,計劃今年晚些時候在Cerebras數據中心部署AMD Helios系統。

來源SiliconANGLE AI作者: Thomas Godwin

分離式AI推理正在證明自己不僅僅是解決預填充和解碼瓶頸的補充方案,這些瓶頸一直阻礙着企業級AI的大規模應用。Cerebras與AMD近日宣佈合作,共同打造全球最快的分離式AI推理解決方案。

根據Cerebras首席營銷官Julie Choi的介紹,這次合作將AMD的Helios機架級架構用於計算密集的預填充階段,而Cerebras晶圓級引擎則負責超低延遲的解碼任務。這種組合帶來了每瓦每秒5倍的Token吞吐量提升,相比現有解決方案優勢明顯。今年晚些時候,Cerebras將把AMD Helios系統引入自己的數據中心,用於生產部署中的預填充層。

Choi在接受theCUBE採訪時表示:“Lisa和Andrew共同宣佈了AMD與Cerebras在世界上最強大的分離式推理解決方案上的合作。在這個案例中,一加一等於五。”她進一步解釋了分離式AI推理背後的技術架構,以及哪些工作負載正在推動最強勁的需求,為何合作延伸到2026年底前在Cerebras數據中心內部署AMD Helios。

分離式AI推理的架構邏輯相當直接。預填充階段計算密集,但可以通過優化的GPU基礎設施(如AMD Helios)來管理。解碼階段則受限於內存帶寬。Cerebras晶圓級引擎擁有約2000倍於競爭對手Nvidia GPU的內存帶寬,這使其成為解決大規模AI推理中解碼瓶頸的理想選擇。Choi指出:“在解碼部分,這是一個內存帶寬受限的問題。Cerebras晶圓級引擎擁有最大的內存帶寬,是Nvidia GPU的2000倍。”

推動分離式AI推理最大需求的工作負載包括智能編碼、實時語音和多模態生成。這些類別都對響應速度有功能性的要求。5倍的吞吐量提升意味着相同的基礎設施可以服務更多的併發用户。Choi表示,雙方預計在今年年底前推出聯合市場推廣活動。Cerebras還將在今年將AMD Helios系統引入自己的數據中心,用於預填充層,這使得合作不僅是產品層面的協作,更是生產基礎設施上的承諾。

Choi總結道:“我們的願景是真正提供這種速度和最大智能,無需權衡,讓地球上的每一位開發者都能使用。”