Cerebras CS-4 運算怪獸登場!搭載 WSE-3 Turbo 晶片,AI 推論速度狠甩傳統 GPU 機架 30 倍

4 兆電晶體加持!Cerebras WSE-3 Turbo 晶片規格全面進化
當大家還在為了搶購高階 GPU 大打出手時,晶圓級晶片先驅 Cerebras 再次端出讓人瞠目結舌的硬體怪物。這家向來不走尋常路的公司正式發表最新 Cerebras CS-4 系統,直接向市場霸主 NVIDIA 下戰帖。
這套全新架構的核心靈魂,正是 Cerebras 最新研發的 WSE-3 Turbo(簡稱 WSE-3T)晶片,它延續全球最大單一晶片的王者地位,面積高達 46,225 平方毫米,在單一晶圓上塞進 4 兆個電晶體與 90 萬個 AI 核心,並直接整合 44GB 的高速 SRAM 記憶體。受惠於製程與架構的最佳化,單片晶圓即可提供高達 125 PFLOPS 的 AI 算力(若啟用稀疏計算更可衝上 250 PFLOPS),記憶體頻寬來到驚人的 43.2 PB/s,晶片內建網路頻寬亦達到 53.5 PB/s,更將晶圓級延遲從原本的 5 微秒大幅壓低至 2 微秒。

除了單晶片規格亮眼,Cerebras 更針對現代資料中心打造名為 Nexus Platform 的 CS-4 機架解決方案。整個系統由三組 WSE-3 Turbo 晶片共同組成,一整台機架能輸出 750 PFLOPS 的龐大算力、129.6 PB/s 的 SRAM 頻寬與 7.2 Tb/s 的 I/O 頻寬。工程團隊採用獨創的「後背包(Backpack)」模組化設計,將供電、液冷散熱、控制系統與 I/O 整合為一體,直接垂直貼附在電力陣列後方。這種極短距離的供電配置幾乎完全消除了傳輸電阻損失,讓晶片能直接獲得雙倍可用電力,進而拉高運作時脈與運算能效。



在實際應用層面,CS-4 展現出極具侵略性的推論表現。以開源大型模型 GPT-OSS 120B 為例,單台 CS-4 機架每秒可產出超過 4,400 個 Token;過去傳統 GPU 機架需要耗費 30 秒才能完成的生成運算,CS-4 僅需 1 秒就能輕鬆搞定,每瓦吞吐量更比前代 CS-3 提升整整 10 倍。為了進一步拓展市場版圖,Cerebras 已與 AMD 展開深度合作,將 CS-4 機架方案與 AMD Helios AI 架構相結合,同時亦原生支援 AWS Trainium 等硬體進行分離式推論架構部署,讓未來的超大型 AI 工廠得以輕鬆支援參數量超越 50 兆的終極模型。
Cerebras CS-4 搭載的是哪一款處理器?
CS-4 搭載 Cerebras 最新發表的 WSE-3 Turbo(WSE-3T)晶圓級處理器,單片具備 4 兆個電晶體、90 萬個 AI 運算核心與 44 GB 整合式 SRAM 記憶體。
單台 Cerebras CS-4 機架的總體算力與頻寬規格為何?
單台 CS-4 機架整合 3 片 WSE-3 Turbo 晶片,提供最高 750 PFLOPS 的 AI 運算效能、129.6 PB/s 的 SRAM 頻寬以及 7.2 Tb/s 的 I/O 頻寬。
Cerebras CS-4 的 AI 生成推論速度表現如何?
在 GPT-OSS 120B 模型測試中,單台 CS-4 機架每秒可產生超過 4,400 個 Token,相同工作負載下僅需 1 秒即可完成傳統 GPU 機架需要 30 秒才能處理完的運算量。
CS-4 採用的 Nexus Platform 架構有何散熱與供電優勢?
Nexus Platform 採用模組化「後背包」設計,將液冷散熱與供電模組直接貼合晶圓後方,大幅減少電能損耗並提供雙倍供電裕度,進而拉高晶片運行時脈。
Cerebras CS-4 能否與其他主流硬體平台協同運作?
可以。CS-4 原生支援分離式推論架構(Disaggregated Inference),能與 AMD Helios AI 機架以及 AWS Trainium 等加速晶片搭配,支援規模超過 50 兆參數的超大型模型。
延伸閱讀
歡迎加入我們的 Facebook 粉絲團,隨時掌握最新消息!
喜歡看圖說故事的話,也可以追蹤 Instagram 專頁!
我們也有 Threads 可以隨時 follow!
