论文精选73°11:19硬件感知的FP4 FlashAttention-4NVIDIA研究团队推出Direct-P方法,解决了Blackwell FP4张量核心在注意力计算中的瓶颈问题。#FlashAttention-4#FP4#Blackwell#Direct-PaarXiv cs.LG@Robert Hu原文稍后读已读值得跟进有用关注 FlashAttention-4
论文精选73°11:51UE5M3 FP4块缩放实现稳定语言模型预训练NVIDIA提出新方法让FP4预训练更稳定,训练速度提升21.2%,模型性能全面超越现有方案。#Nemotron-H#FP4#UE5M3#量化训练aarXiv cs.LG@Robert Hu 等 3 人原文稍后读已读值得跟进有用关注 Nemotron-H
论文11:01UltraQuant:面向上下文密集型智能体的4位KV缓存压缩长上下文智能体推理慢?UltraQuant把4位KV缓存做到实用,延迟降3倍多,吞吐涨1.6倍,值得看看。#UltraQuant#FP4#KV缓存#AMD GPUaarXiv cs.LG@Inesh Chakrabarti 等 7 人原文稍后读已读值得跟进有用关注 UltraQuant