nanoGPT 是 Andrej Karpathy 开发的 GPT 模型最小化实现,常用于教育研究和快速原型开发。它以简洁的代码和易于修改的特性,成为探索 Transformer 训练和优化的重要基准工具。近期多项研究围绕 nanoGPT 展开,既包括利用自动化工具刷新其训练记录,也涵盖对其评估能力的质疑。
nanoGPT 近期进展
Prime Intellect 用 Claude Code 和 Codex 刷新 nanoGPT 记录:Prime Intellect 团队使用 Claude Code 和 Codex 等 AI 工具自动化 AI 研究流程,成功在 nanoGPT 任务上取得新的最佳结果,展示了自动化系统在复现和改进现有算法上的潜力。 原文标题
NanoGPT-Bench 评估揭示编码智能体恢复率仅 9.3%:一项名为 NanoGPT-Bench 的基准测试发现,当前最先进的编码智能体仅能恢复人类在 nanoGPT 相关研究工作进展的 9.3%,凸显了 AI 在自主科研原创性上的巨大差距。 原文标题
两项新优化器研究为 nanoGPT 训练提供新思路:arXiv 近期发表的两篇论文分别提出“径向抑制”加速算法泛化和“角度步长衰减”矩阵感知优化器,这些技术理论上可直接应用于 nanoGPT 训练,以提升收敛速度和模型性能。 原文标题 原文标题