09:27官方一手arXiv: OpenAI@Zehao Wang, Yisen Xu, Chenglin Li, Chao Peng, Bram Adams, Ahmed E. Hassan, Tse-Hsun, Chen精选论文提出 Ledger,一个确定性运行时层,将编码智能体的交互历史蒸馏为显式执行状态。它在模型行动前通过 inform 路径注入状态视图,在命令执行前通过 govern 路径复用有效结果并标记冗余操作。在 SWE-bench Verified 的 500 个实例上,Ledger 将 GPT-5 mini 的 Pass@1 从 56.2% 提升至 64.2%,将 MiniMax M2.5 从 75.8% 提升至 81.0%。成本分别降低 28.9% 和 31.8%;附加到 OpenAI Codex 后 Pass@1 提升 3.4 个百分点,成本降低 24.4%。消融实验显示 govern 贡献主要正确率提升,inform 贡献主要效率提升,两者结合效果最佳。论文LedgerSWE-benchGPT-5 mini10 个信源在谈事件专题推荐理由:arXiv 新论文做了个 Ledger 层,给编码智能体记账执行状态。GPT-5 mini 在 SWE-bench 从 56.2% 提到 64.2%,成本降 28.9%。原文稍后读已读值得跟进有用关注 Ledger
10:12官方一手arXiv: DeepSeek@Robson Alves Vilar, Emanuel Dantas Filho, Ademar França de Sousa Neto, Mirko Perkusich, Danyllo Wagner Albuquerque, João Paiva, Kyller Gorgônio, Angelo Perkusich一项研究评估了GPT-5 mini、Gemini 3 Flash和DeepSeek Chat 3.2在993道PSM I风格Scrum认证题上的表现,使用零样本、链式思考和源接地三种提示策略。Gemini 3 Flash准确率最高,GPT-5 mini次之,DeepSeek Chat 3.2最低。模型在单选题上表现最好,但在多选题和判断题上错误更多。定性分析发现错误系统性源于过度泛化、限制性措辞和复合干扰项。论文GPT-5 miniGemini 3 FlashDeepSeek Chat 3.2推荐理由:想了解GPT-5 mini、Gemini 3 Flash、DeepSeek Chat谁更适合Scrum考试?这篇论文用993道真题实测了准确率和稳定性,还分析了典型错误原因。原文稍后读已读值得跟进有用关注 GPT-5 mini