Cerebras新推WSE-3 Turbo芯片和CS-4系统,词元容量提升10倍,速度是GPU方案的30倍。
Cerebras推出新一代芯片WSE-3 Turbo和基于该芯片的CS-4系统,与上代CS-3相比带来10倍词元容量和2倍速度。WSE-3 Turbo集成90万个核心和44GB SRAM片上缓存,其FP16稀疏AI算力、内存带宽、片上互联带宽、I/O带宽均实现翻倍。CS-4系统在OpenAI GPT-OSS模型上拥有4465 Token/s的词元交付速度,是GPU方案的30倍,较CS-3提升93%。对于超高参数模型,CS-4的2μs低延迟晶圆间互连能在10T规模上实现超1000 Token/s的词元输出。
IT之家 8 月 19 日消息,晶圆级 AI 推理加速器制造商 Cerebras 当地时间 18 日宣布推出其新一代芯片 WSE-3 Turbo 和基于该芯片的 CS-4 系统。与上代 CS-3 相比, CS-4 带来了 10 倍的词元容量和 2 倍的速度 。 与此前的 WSE-3 类似,WSE-3 Turbo 集成了 90 万个核心和 44GB SRAM 片上缓存,但 其 FP16 稀疏 AI 算力、内存带宽、片上互联带宽、I/O 带宽均实现翻倍 。而 CS-4 系统则可集成 3 块 WSE-3 Turbo,进一步提升了算力密度。 Cerebras 表示,CS-4 在 OpenAI GPT-OSS 模型上拥有 4465 Token/s 的词元交付速度, 是 GPU 方案的 30 倍 ,同时较 CS-3 提升 93%。对于超高参数模型,CS-4 的 2μs 低延迟晶圆间互连则 能在 10T 规模上实现超 1000 Token/s 的词元输出 。 CS-4 原生支持推理负载拆分, 可作为解码单元与异构的预填充硬件配套使用 ,发挥双方架构上的差异化优势。 这一算力硬件基于 Cerebras 全新的 Nexus 机架式平台,计算、电源、互连 3 大方面现在是重新设计的独立系统,整体组件数量减少了 50%,制造自动化比例大幅提升。CS-4 几乎完全消除了板级供电功率损耗,为 WSE-3 Turbo 提供了双倍的电力供给。