Google发布第八代TPU,拆分为训练与推理两款芯片

Google 发布了第八代 TPU 最核心的变化:以前一颗芯片什么活都干,这次拆成了两颗,各管一头。 - TPU 8t — 专门用来训练模型 - TPU 8i — 专门用来推理,跑模型 为什么...

精选理由

谷歌把TPU拆成训练和推理两颗,8t管训练、8i管推理,延迟减半、性价比提升80%,搞AI的可以看看。

AI 摘要

Google发布第八代TPU,首次拆分为TPU 8t和TPU 8i两款芯片。TPU 8t面向训练,单组9600颗芯片提供121 exaflops算力和2 PB共享内存,峰值性能为上一代3倍。TPU 8i面向推理和后训练,通信密集任务延迟最多降低一半。据Google Cloud介绍,新系统在低延迟场景下性能每美元提升最高80%,可扩展至100万颗以上芯片。

图片来源 · 小互
原文 · 小互

Google 发布了第八代 TPU 最核心的变化:以前一颗芯片什么活都干,这次拆成了两颗,各管一头。 - TPU 8t — 专门用来训练模型 - TPU 8i — 专门用来推理,跑模型 为什么...

Google 发布了第八代 TPU 最核心的变化:以前一颗芯片什么活都干,这次拆成了两颗,各管一头。 - TPU 8t — 专门用来训练模型 - TPU 8i — 专门用来推理,跑模型 为什么要拆? 因为这两件事要的东西已经彻底不一样了: 训练要的是"能一次吞下海量数据",慢一点无所谓; 而跑模型要的是"反应快"——你问一句它得立刻答上来。 现在 AI 进入了Agent时代(AI 自己一步步干活、反复思考),一个任务要来回想很多轮,每轮慢一点点,加起来用户就等不了了。 TPU 8t(训练):定位为:万亿参数级大模型预训练, 一组 9600 颗芯片,121 exaflops 算力、2 PB 共享内存, 峰值性能是上一代的 3 倍 TPU 8i(推理): 后训练 + 实时推理,通信密集任务延迟最多少一半 Your browser does not support the video tag. 🔗 View on Twitter Google Cloud @googlecloud TPU 8i and TPU 8t deliver sustainable economics—offering up to 80% better performance-per-dollar for low-latency serving while seamlessly scaling to 1M+ chips! Learn how our 8th-generation TPU system drives the next frontier of AI ↓ Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 4 🔄 2 ❤️ 8 👀 3222 📊 4 ⚡

Google发布第八代TPU,拆分为训练与推理两款芯片 · AI 热点