← 全部文章

AMD與Cerebras把AI推理拆成兩套系統

AMD與Cerebras宣布聯合推出分離式AI推理方案:由AMD Helios負責高吞吐提示詞處理,由Cerebras晶圓級引擎負責低延遲生成。AI基礎設施競爭正從單一晶片性能,轉向不同工作負載的系統級組合。

作者Open Market Notes Research Desk類型文章

在舊金山舉行的 Advancing AI 2026 活動上,AMD 與 Cerebras 把一套AI推理系統拆成了兩個環節:AMD Helios負責處理提示詞和大上下文,Cerebras Wafer-Scale Engine負責快速生成Token。兩家公司稱,聯合方案預計在2026年下半年首先通過 Cerebras Cloud 提供,目標是在不犧牲吞吐量的情況下,降低對即時回應的等待。(investors.cerebras.ai)

發生了什麼

這不是一次簡單的晶片採購公告,而是一種不同於“單一加速器包打天下”的架構嘗試。按照兩家公司公布的設計,Helios充當高吞吐的提示詞引擎,負責把請求送入計算流程;Cerebras的晶圓級處理器則承擔對記憶體頻寬更敏感的解碼和Token生成。公司預計,聯合系統最高可實現每瓦每秒Token數提升5倍,但這一數字仍屬於廠商披露的預期性能,實際效果取決於模型、軟體棧和部署環境。(investors.cerebras.ai)

這一合作發生在AMD加快進入AI資料中心市場之際。路透社報道,AMD最新一代Helios伺服器已經進入全面生產,計劃於2026年第三季度末開始出貨;OpenAI方面也表示,預計將在2026年年底開始大規模部署Helios,並在2027年進一步擴大使用。(investing.com)

為什麼重要

AI基礎設施的瓶頸正在從“能不能訓練模型”,轉向“能不能以足夠低的成本和延遲服務大量請求”。訓練階段更看重總算力和叢集規模;而聊天機器人、程式碼助理、即時代理和機器人應用,則更直接地受到首個Token等待時間和持續生成速度影響。

分離式推理的意義,在於允許資料中心針對不同階段選擇不同硬體。它可能減少企業必須圍繞單一晶片體系建設全部計算流程的依賴,也給AMD、Cerebras等非主導供應商提供了切入推理市場的路徑。對公共市場而言,投資者需要觀察的也不再只是晶片峰值性能,而是軟體相容性、客戶遷移成本、雲服務商採購以及每次推理的實際經濟性。

更大的變化是,AI伺服器可能越來越像一個由多種專用組件拼接而成的金融基礎設施:資本開支、能源效率、機架級互聯和服務價格,會共同決定模型公司的利潤空間。此前市場習慣用GPU出貨量衡量競爭格局;接下來,推理請求能否被穩定、快速、低成本地處理,可能成為更接近收入端的指標。

還需要觀察什麼

首先是產品能否按期交付。公告使用了“計劃”和“預計”等表述,商業可用時間仍需通過實際部署驗證。其次是軟體層面的整合:兩套架構能否被雲客戶和模型開發者當作一個統一系統呼叫,將決定分離式推理是否只是演示,還是能夠進入生產環境。最後要看客戶結構。若OpenAI、雲服務商或大型企業形成連續採購,AMD的競爭地位才可能從“第二供應商”進一步轉化為可持續的基礎設施平台;若部署仍集中在少數合作夥伴,市場影響則可能有限。(investors.cerebras.ai)

來源

內容僅供參考,不構成投資、法律、稅務或財務建議。