8月14日
23:19
23:19小互@imxiaohu
75°
智谱发布 GLM-5.3,基座模型与 GLM-5.2 完全相同,所有改进均来自后训练。内部评测显示编程能力比 GLM-5.2 提升 50%,网络安全能力持平 Mythos 5。该模型已在 269 个开源项目中挖出 2436 个真实漏洞。
事件专题

推荐理由:智谱用同一套基座只做后训练,就把 GLM-5.3 的编程能力拉高了五成,还能在开源项目里挖出两千多个漏洞,挺值的看。
8月7日
00:20
7月17日
08:00
08:00IT之家博客/媒体
73°
谷歌旗舰AI模型Gemini 3.5 Pro延期数月,原计划未按时推出。谷歌希望提升编程能力,但更换训练数据后测试结果未达预期。内部不同派系争夺主导权,部分员工不满并加入Anthropic。OpenAI和Meta已在AI编程上拉开与谷歌现有产品的差距。
事件专题

推荐理由:谷歌Gemini 3.5 Pro延期了,编程能力没达标,内部还乱成一团。和OpenAI、Anthropic比差距更大了。
7月9日
23:37
05:30
05:30官方账号OpenAI@OpenAI
精选78°
OpenAI对SWE-Bench Pro进行了审计,发现该基准存在约70%的噪音上限,已无法可靠衡量前沿编码能力。该基准在业界广泛使用,但目前已被认为饱和。OpenAI决定撤回之前推荐研究社区使用该基准作为主要编码评估的建议。
事件专题

推荐理由:OpenAI发现SWE-Bench Pro这个编码基准有70%噪音上限,已经饱和了,不再适合用来衡量最强AI编码能力。
6月26日
10:46
10:46官方账号arXiv cs.LG@Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-An Ma, Yuxiong He
论文提出Ranking-induced VERifiable framework (RiVER),无需真实答案即可通过基于分数的执行反馈训练LLM。在12个AtCoder Heuristic Contest任务上训练后,Qwen3-8B在Algorithm Engineering Benchmark (ALE-Bench)上的rating rank提升8.9%,GLM-Z1-9B-0414提升9.4%。同时,RiVER在LiveCodeBench和USACO等精确求解基准上分别带来2.4%和3.5%的绝对平均提升。对比基线表明,仅用原始执行分数训练可提升ALE rating但无法泛化到精确求解任务。
推荐理由:论文介绍RiVER,用强化学习训练模型解决无标准答案的得分优化问题,还能顺带提升常规编程基准,实用思路值得一看。
6月23日
23:00
23:00量子位@十三
73°
字节跳动发布豆包2.1,其Agent可在18小时内自动完成芯片设计代码编写。在编程基准测试中,豆包2.1的表现比肩Opus 4.7。该版本强化了自主编程和长时任务执行能力,适用于复杂工程场景。
推荐理由:豆包2.1的Agent太能干了,独自跑18小时写出芯片代码,编程水平还追上了Opus 4.7,做硬件的可以关注下。