AI News HubLIVE
站内改写2 分钟阅读

Cerebras与AMD合作打造全球最快的分离式AI推理解决方案

Cerebras与AMD宣布合作,共同打造全球最快的分离式AI推理解决方案。该方案将AMD Helios用于预填充阶段,Cerebras晶圆级引擎用于解码阶段,实现每瓦每秒5倍Token吞吐量提升。方案针对智能编码、实时语音和多模态生成等对速度要求极高的工作负载,计划今年晚些时候在Cerebras数据中心部署AMD Helios系统。

来源SiliconANGLE AI作者: Thomas Godwin

分离式AI推理正在证明自己不仅仅是解决预填充和解码瓶颈的补充方案,这些瓶颈一直阻碍着企业级AI的大规模应用。Cerebras与AMD近日宣布合作,共同打造全球最快的分离式AI推理解决方案。

根据Cerebras首席营销官Julie Choi的介绍,这次合作将AMD的Helios机架级架构用于计算密集的预填充阶段,而Cerebras晶圆级引擎则负责超低延迟的解码任务。这种组合带来了每瓦每秒5倍的Token吞吐量提升,相比现有解决方案优势明显。今年晚些时候,Cerebras将把AMD Helios系统引入自己的数据中心,用于生产部署中的预填充层。

Choi在接受theCUBE采访时表示:“Lisa和Andrew共同宣布了AMD与Cerebras在世界上最强大的分离式推理解决方案上的合作。在这个案例中,一加一等于五。”她进一步解释了分离式AI推理背后的技术架构,以及哪些工作负载正在推动最强劲的需求,为何合作延伸到2026年底前在Cerebras数据中心内部署AMD Helios。

分离式AI推理的架构逻辑相当直接。预填充阶段计算密集,但可以通过优化的GPU基础设施(如AMD Helios)来管理。解码阶段则受限于内存带宽。Cerebras晶圆级引擎拥有约2000倍于竞争对手Nvidia GPU的内存带宽,这使其成为解决大规模AI推理中解码瓶颈的理想选择。Choi指出:“在解码部分,这是一个内存带宽受限的问题。Cerebras晶圆级引擎拥有最大的内存带宽,是Nvidia GPU的2000倍。”

推动分离式AI推理最大需求的工作负载包括智能编码、实时语音和多模态生成。这些类别都对响应速度有功能性的要求。5倍的吞吐量提升意味着相同的基础设施可以服务更多的并发用户。Choi表示,双方预计在今年年底前推出联合市场推广活动。Cerebras还将在今年将AMD Helios系统引入自己的数据中心,用于预填充层,这使得合作不仅是产品层面的协作,更是生产基础设施上的承诺。

Choi总结道:“我们的愿景是真正提供这种速度和最大智能,无需权衡,让地球上的每一位开发者都能使用。”