做 RL 训练或大规模推理部署的可以看,DeepSeek-V3 权重同步直接从 5.78 秒砍到 2.77 秒,还是进 NCCL 的正经方案。
#DeepSeek-V3
59.8K 星的开源课程,不调 API,从线性代数手写到 DeepSeek-V3 架构和多智能体,学完还能攒下 523 个作品,特别适合想搞懂底层原理的人。
Stanford 和 Together AI 让 o3-mini、Claude Sonnet 4、DeepSeek-V3 自己商量怎么合作,只练 15 道题就在 AIME 上比理想路由器高 13.4 分,方法写得挺细。
一篇教 RL 生成 SVG 的论文:把每条指令拆成 6 项评分细则当奖励,不需要标注数据,效果追平 DeepSeek-V3,做生成任务奖励设计的可以看看。
如果你在做MoE推理,TEMPO这个调度器在内存/算力瓶颈混合时能比常规方案快15.5%;不过DeepSeek-V3那种通信瓶颈场景它不灵。
论文提出了DA-MoE,根据路由分布动态选最优内核,在DeepSeek-V3和Kimi K2上延迟最高降低56%,做MoE推理的同学可以关注这个优化思路。
Google的新研究发现,给模型喂对TPU文档,比堆参数管用。JAXBench测50个真实负载,结果很实在。
NVIDIA 的 Blackwell Ultra 训练 DeepSeek-V3 671B 比上一代快 3 倍,每 GPU 跑到 1648 TFLOPS,优化太狠了。
这篇论文解释了为什么Megatron-Core的MLA吸收模式在训练时会导致内存暴增,还给出了一个叫LAGA的修复方法,通信更省,速度和内存几乎没损失。
这篇论文用DeepSeek-V3搞期刊推荐,不用训练直接匹配,23,609篇文章上Top-5超53%,比传统方法更灵活还带解释。
想知道LLM为什么在导航任务中迷路吗?这个基准把问题拆成三个层级,告诉你59%的锅在交叉口选择,39%在局部感知,方向判断几乎不犯错。对做空间推理的开发者非常有用。
英伟达Blackwell平台在MLPerf上把DeepSeek-V3 671B训练时间压到2分钟,比上代快60%,性能真狠。
这个框架解决了「只看答案正确率」的评估盲区,做模型选型或合规审计的团队会发现,原来高分模型可能推理过程一团糟——建议点开看看你的模型在哪个维度翻车。