arXiv 论文解析 Direct Feedback Alignment 训练停滞的共模崩塌机制
用 DFA 训网络总卡在常量预测器?这篇论文把根因拆到共模误差和 tanh 饱和,还给了减批量均值这种直接可用的修复办法。
用 DFA 训网络总卡在常量预测器?这篇论文把根因拆到共模误差和 tanh 饱和,还给了减批量均值这种直接可用的修复办法。
朋友A对朋友B说:刚看到个挺有意思的论文,叫MoARa,是DeepSeek团队搞的,专门针对大语言模型训练优化,能让训练速度提升37%,时间缩短34%,挺实用的。
AI Engineer 大会的后训练专场正在直播,讲训练怎么决定模型行为,TypeSafe、Hugging Face、MiniMax 都有人讲。
写了个新优化器CMuon,训练扩散Transformer比AdamW快两倍多,675M模型200轮就跑到FID 1.18,厉害得很。
DeepSeek-V4 Flash RL 在 AMD 显卡上跑通了,训练结果还不错,AIME 分数涨了一截。想试试 AMD 平台搞 RL 训练可以看看这篇。
AWS发了篇实战教程,教你用NVIDIA Blackwell在SageMaker上调优训练,从选精度到调batch size都讲清了,搞大模型训练的人别错过。
杨植麟用460万美元和极致架构打脸烧钱竞赛,做AI代理或准备2026年入场的团队,看完会重新思考资源分配策略——建议存下来周末细看。