模型中美对照多源确认精选12:31单卡700TPS!Google发布Diffusion Gemma,26B模型4B激活Diffusion Gemma把文本生成速度拉到单卡700TPS,做实时对话或高吞吐推理的团队可以直接用,4bit量化16G显存就能跑,值得试试能否做投机解码的草稿模型。#Diffusion模型#Gemma#Google#NVIDIA10 个信源在谈事件专题karminski-牙医 (AI工具)@karminski311 个信源在谈原文稍后读已读值得跟进有用关注 Diffusion模型