事件专题 · 多源确认

芯展速 AI90 方案将 SSD 纳入显存,首 Token 延迟缩短 50 倍

芯展速在 WAIC 2026 展出 AI90 软硬件一体化推理加速方案,将高性能 SSD 纳入 GPU 显存体系,形成 HBM+DRAM+SSD 三级存储。该方案将首 Token 延迟从秒级降至亚秒级,提速 50 倍,吞吐量提升 5.1 倍,显存节省 39%。针对 8 卡 NVIDIA GeForce RTX 5090 集群,推理加速达 5.8 倍,支持 128K+ 上下文。配套 PT200Z AI SSD 采用 pSLC 闪存与 PCIe Gen5 接口,顺序读取 14.8GB/s,随机读取 3100K IOPS,读取时延 54μs。

当前结论

芯展速用SSD给显卡做显存扩展,首Token快了50倍,8卡RTX 5090集群也能跑128K上下文,适合长文本推理场景。

4 个信源57° AI 热度最后更新 2026/7/20 03:57:36

证据链

相关来源 3AWS Machine Learning Blog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情