BF16

concept · 首次出现 2026-06-05 · 最近出现 2026-09-10 · 累计提及 57

综述

BF16 近期进展

BF16 技术应用与性能提升

  • 硬件感知的FP4 FlashAttention-4:该研究提出了一种新的硬件感知的FP4 FlashAttention-4模型,旨在提高BF16数据类型的性能。
  • Gated DeltaNet在4位量化中保持性能的机制研究:这项研究探讨了Gated DeltaNet在4位量化中保持性能的机制,为BF16数据类型的优化提供了新的思路。
  • 模型压缩与本地运行

  • Qwen3.8-27B可在笔记本本地运行,Atomic Chat发布量化版:Qwen3.8-27B模型通过量化技术实现了在笔记本上的本地运行,Atomic Chat发布了其量化版本。
  • Qwen3.8-27B发布:单GPU跑1M上下文,vLLM Day-0支持:Qwen3.8-27B模型支持单GPU运行1M上下文,为大型语言模型在资源受限设备上的应用提供了可能。
  • 新工具与芯片发布

  • NVIDIA发布Nemotron 3.5 Lightning,面向长时智能体执行:NVIDIA发布了Nemotron 3.5 Lightning,这是一款面向长时智能体执行的工具。
  • 蚂蚁百灵开源 Ling-3.0-tiny,支持英伟达 DGX Spark 和 Mac mini 部署:蚂蚁百灵开源了Ling-3.0-tiny,支持在英伟达DGX Spark和Mac mini上部署。
  • 优化与实操指南

  • 用NVIDIA Transformer Engine加速Transformer训练:融合内核与FP8实操指南:本文提供了使用NVIDIA Transformer Engine加速Transformer训练的实操指南,包括融合内核与FP8的使用。
  • 软件定义与芯片创新

  • 阶段重放分歧跟随KV缓存:固定前缀精度控制与双向缓存移植:该研究提出了阶段重放分歧跟随KV缓存的方法,用于固定前缀精度控制和双向缓存移植。
  • 东方算芯首次展出全球首颗软件定义近存计算3D AI芯片DF1000:东方算芯展出了全球首颗软件定义近存计算3D AI芯片DF1000。
  • 当前焦点与观察点

    BF16作为一种高效的数据类型,正逐渐在人工智能领域得到广泛应用。随着模型压缩和量化技术的发展,BF16在提高性能的同时,也降低了计算资源的需求。同时,硬件和软件的优化也在不断推进BF16技术的普及。

    相关报道

    10 条在档