芯展速用SSD给显卡做显存扩展,首Token快了50倍,8卡RTX 5090集群也能跑128K上下文,适合长文本推理场景。
芯展速在 WAIC 2026 展出 AI90 软硬件一体化推理加速方案,将高性能 SSD 纳入 GPU 显存体系,形成 HBM+DRAM+SSD 三级存储。该方案将首 Token 延迟从秒级降至亚秒级,提速 50 倍,吞吐量提升 5.1 倍,显存节省 39%。针对 8 卡 NVIDIA GeForce RTX 5090 集群,推理加速达 5.8 倍,支持 128K+ 上下文。配套 PT200Z AI SSD 采用 pSLC 闪存与 PCIe Gen5 接口,顺序读取 14.8GB/s,随机读取 3100K IOPS,读取时延 54μs。
芯展速 AI90 固态硬盘显存化方案亮相:首 Token 延迟缩短至 1/50
IT之家 7 月 20 日消息,芯展速 (GenStorAIGE) 在 WAIC 2026 展出了其 AI90 软硬件一体化 AI 推理加速方案。 其将高性能 SSD 纳入 GPU 显存体系, 让 KV Cache 卸载到更大容量的固态硬盘上 ,形成 HBM + DRAM + SSD 三级存储体系。 这一方案 可将首 Token(词元)延迟从秒级降低至亚秒级 , 提速 50 倍 ;吞吐量提升 5.1 倍;显存节省 39%。结合智能 P2P 多卡互联技术,AI90 可让 8 卡 NVIDIA GeForce RTX 5090 集群推理加速可达 5.8 倍、支持 128K+ 上下文。 而为了满足 KV Cache 卸载带来的高写入负载,芯展速同步带来了 PT200Z AI SSD。其基于 pSLC 闪存介质,采用 PCIe Gen5 接口,DWPD 最高达 100,顺序读取 14.8GB/s、随机读取 3100KIOPS,读取时延 54μs、写入时延 10μs。