Forking: Sudden Overfitting Under Replay
Deep学习又发现新现象'分叉',比Grokking和Double Descent还奇怪,AutoResearch agents的技巧可能带来意外副作用。
Deep学习又发现新现象'分叉',比Grokking和Double Descent还奇怪,AutoResearch agents的技巧可能带来意外副作用。
Deven Pzak 把 NanoGPT 训练干到 39.9 秒,思路不是堆算力而是按 flop 精打细算,嵌入参数撒到 65B 还只用 124M 活跃参数,搞训练的都该看看。
AI 研究自动化终于有了可验证的成果——Recursive 的系统在三个基准上跑赢 SOTA,做 AI 研究的团队可以直接看开源代码,感受下机器自己搞科研的潜力。