← すべての記事

AMD与Cerebras把AI推理拆成两套系统

AMD与Cerebras宣布联合推出分离式AI推理方案:由AMD Helios负责高吞吐提示词处理,由Cerebras晶圆级引擎负责低延迟生成。AI基础设施竞争正从单一芯片性能,转向不同工作负载的系统级组合。

著者Open Market Notes Auto種類記事

在旧金山举行的 Advancing AI 2026 活动上,AMD 与 Cerebras 把一套AI推理系统拆成了两个环节:AMD Helios负责处理提示词和大上下文,Cerebras Wafer-Scale Engine负责快速生成Token。两家公司称,联合方案预计在2026年下半年首先通过 Cerebras Cloud 提供,目标是在不牺牲吞吐量的情况下,降低对实时响应的等待。(investors.cerebras.ai)

发生了什么

这不是一次简单的芯片采购公告,而是一种不同于“单一加速器包打天下”的架构尝试。按照两家公司公布的设计,Helios充当高吞吐的提示词引擎,负责把请求送入计算流程;Cerebras的晶圆级处理器则承担对内存带宽更敏感的解码和Token生成。公司预计,联合系统最高可实现每瓦每秒Token数提升5倍,但这一数字仍属于厂商披露的预期性能,实际效果取决于模型、软件栈和部署环境。(investors.cerebras.ai)

这一合作发生在AMD加快进入AI数据中心市场之际。路透社报道,AMD最新一代Helios服务器已经进入全面生产,计划于2026年第三季度末开始出货;OpenAI方面也表示,预计将在2026年年底开始大规模部署Helios,并在2027年进一步扩大使用。(investing.com)

为什么重要

AI基础设施的瓶颈正在从“能不能训练模型”,转向“能不能以足够低的成本和延迟服务大量请求”。训练阶段更看重总算力和集群规模;而聊天机器人、代码助手、实时代理和机器人应用,则更直接地受到首个Token等待时间和持续生成速度影响。

分离式推理的意义,在于允许数据中心针对不同阶段选择不同硬件。它可能减少企业必须围绕单一芯片体系建设全部计算流程的依赖,也给AMD、Cerebras等非主导供应商提供了切入推理市场的路径。对公共市场而言,投资者需要观察的也不再只是芯片峰值性能,而是软件兼容性、客户迁移成本、云服务商采购以及每次推理的实际经济性。

更大的变化是,AI服务器可能越来越像一个由多种专用组件拼接而成的金融基础设施:资本开支、能源效率、机架级互联和服务价格,会共同决定模型公司的利润空间。此前市场习惯用GPU出货量衡量竞争格局;接下来,推理请求能否被稳定、快速、低成本地处理,可能成为更接近收入端的指标。

还需要观察什么

首先是产品能否按期交付。公告使用了“计划”和“预计”等表述,商业可用时间仍需通过实际部署验证。其次是软件层面的整合:两套架构能否被云客户和模型开发者当作一个统一系统调用,将决定分离式推理是否只是演示,还是能够进入生产环境。最后要看客户结构。若OpenAI、云服务商或大型企业形成连续采购,AMD的竞争地位才可能从“第二供应商”进一步转化为可持续的基础设施平台;若部署仍集中在少数合作伙伴,市场影响则可能有限。(investors.cerebras.ai)

来源

情報提供のみを目的としており、投資・法律・税務・財務上の助言ではありません。