04:37rohanpaul_ai@rohanpaul_ai精选72°阿里巴巴与南京大学联合发表论文,提出RTPurbo方法,通过轻量级适配将百万token预填充速度提升9.36倍(对比FlashAttention-2)。该方法发现训练好的全注意力模型已存在隐藏稀疏结构,无需重新训练。RTPurbo识别出少数需要远距离token的注意力头,其余头聚焦邻近文本,并使用16维索引器快速定位关键token。在长上下文基准和推理任务中,RTPurbo保持接近全注意力的精度,同时实现高达9.36倍加速。这证明长上下文推理中的浪费比表面看起来更有结构性。论文长上下文注意力稀疏化推理加速推荐理由:长上下文推理的算力瓶颈是AI应用落地的关键障碍,做LLM推理优化或长文档处理的团队可以直接参考RTPurbo的稀疏化思路,无需从头训练模型。原文稍后读已读值得跟进有用关注 长上下文
01:35官方一手Pandaily@contact@pandaily.com (Pandaily)精选阿里巴巴的Qwen 3.7 Max预览版已出现在LM Arena排行榜上。同时,Qwen 3 Ultra预览版也在活跃迭代。这两款模型均为72B参数的旗舰模型。此举表明阿里巴巴正同时推进两个大型模型的开发,为全面公开发布做准备。AI模型Qwen 3.7 MaxQwen 3 UltraAlibaba推荐理由:阿里双72B模型齐发原文稍后读已读值得跟进有用关注 Qwen 3.7 Max