#并行生成
共 7 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「并行生成」标签的资讯、产品与论文,按刊登时间排,新的在上。
7月15日
7月2日
NVIDIA推出Nemotron-Labs-TwoTower:将30B模型拆二并行生成token
NVIDIA把30B模型劈成两半,并行写token,速度翻倍还保质量,不是新训模型是复用预训练,挺聪明的做法。
6月12日
GoogleDeepMind 发布 DiffusionGemma:26B 扩散语言模型,vLLM 原生支持
DiffusionGemma 用并行去噪替代逐 token 生成,大幅提升推理速度,做大规模文本生成或实时应用的团队可以直接在 vLLM 中体验,值得关注。
6月11日
Google DiffusionGemma 开源:4倍速文本生成,18GB显卡可跑
DiffusionGemma 把文本生成速度拉到 4 倍,还彻底开源,做本地部署或加速日常 workflow 的开发者可以直接拖权重玩。
Google DeepMind 发布 DiffusionGemma,并行生成 256 tokens,速度提升 4 倍
文本扩散模型把生成速度拉到新高度,做代码补全或实时编辑的开发者可以直接在 NVIDIA 端点试跑,感受并行 token 的爽感。
5月28日
产品18:05
Gemini 3.5 Flash 在 Google AI Studio 中并行生成 6 个 UI 变体,加速原型设计UI/UX 设计师和前端开发者可以借助 Gemini 3.5 Flash 的并行生成能力,将原型迭代时间从小时级压缩到分钟级,建议直接体验 Google AI Studio 中的这个 demo。
5月20日
NVIDIA 发布 Nemotron-Labs-Diffusion 系列扩散语言模型,并行生成多 token
NVIDIA 的扩散语言模型打破了传统逐 token 生成瓶颈,做推理加速或大模型部署的团队可以直接拿来提升 GPU 利用率,值得关注。