23:19小互@imxiaohu75°智谱发布 GLM-5.3,基座模型与 GLM-5.2 完全相同,所有改进均来自后训练。内部评测显示编程能力比 GLM-5.2 提升 50%,网络安全能力持平 Mythos 5。该模型已在 269 个开源项目中挖出 2436 个真实漏洞。AI模型GLM-5.3智谱编程能力10 个信源在谈事件专题推荐理由:智谱用同一套基座只做后训练,就把 GLM-5.3 的编程能力拉高了五成,还能在开源项目里挖出两千多个漏洞,挺值的看。原文稍后读已读值得跟进有用关注 GLM-5.3
13:38IT之家(博客/媒体)78°智谱今日发布开源模型 GLM-5.3,基座与 GLM-5.2 相同,通过后训练 Scaling 提升能力。在 Terminal-Bench 3.0 上得分从 4.6 提升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9。官方称编程能力较前代提升 50%,公开基准中取得开源第一,编程与智能体能力接近 Claude Fable 5。模型权重将在两周内开放,API 即将上线。AI模型GLM-5.3智谱开源模型10 个信源在谈事件专题推荐理由:想用最强开源编程模型的可以蹲一下,GLM-5.3 纯靠后训练就把 Terminal-Bench 分数翻了 6 倍,两周后开放权重。原文稍后读已读值得跟进有用关注 GLM-5.3
18:29IT之家(博客/媒体)76°Gemini 发布时间推迟约两个月,内部测试显示其编程能力仍落后于竞争对手。开发团队存在多名负责人,在开发重点和资源分配上出现分歧,并受算力限制。去年 11 月发布的 Gemini 3 一度达到前沿水平,但 Anthropic 和 OpenAI 推出新版本后谷歌再度追赶。8 月 5 日 DeepMind 调整管理层,哈萨比斯转任董事长,卡武库奥卢接任主要管理职责。布林在 4 月内部会议上敦促加快进度,并推动投入递归自我改进方向。行业GeminiDeepMindGoogle10 个信源在谈事件专题推荐理由:路透爆了谷歌AI内幕:Gemini延期、编程落后、布林亲自下场督战,想了解换帅背后的真乱象就看这篇。原文稍后读已读值得跟进有用关注 Gemini
00:20向阳乔木@vista8DeepSeek V4 Pro综合性能进入全球第一梯队。其编程能力与Claude旗舰差距仅0.3%。API定价是海外竞品的1/10到1/100。模型原生适配华沟昇腾95OPR,补齐国产算力闭环。AI模型DeepSeekV4 ProClaude1 个信源在谈事件专题推荐理由:DeepSeek V4 Pro编程只比Claude旗舰差0.3%,API价格便宜很多,还适配国产芯片,性价比拉满。原文稍后读已读值得跟进有用关注 DeepSeek
04:45lmarena.ai@lmarena_ai77°月之暗面(Kimi_Moonshot)发布的Kimi-K3模型在Frontend Code Arena基准上首次超越美国模型,击败了此前领先的Fable。这是自2025年初DeepSeek-R1以来中国模型再次接近领先位置,仅隔6周。Kimi-K3使月之暗面成为全球前端编程能力第一的AI实验室。该模型为开源,标志着中国开源模型首次在编码领域超越美国。AI模型Kimi-K3Frontend Code Arena月之暗面10 个信源在谈事件专题推荐理由:月之暗面刚发的Kimi-K3直接打败了Fable,中国模型第一次在Frontend Code Arena登顶,开源领域又一大动静。原文稍后读已读值得跟进有用关注 Kimi-K3
08:00IT之家(博客/媒体)73°谷歌旗舰AI模型Gemini 3.5 Pro延期数月,原计划未按时推出。谷歌希望提升编程能力,但更换训练数据后测试结果未达预期。内部不同派系争夺主导权,部分员工不满并加入Anthropic。OpenAI和Meta已在AI编程上拉开与谷歌现有产品的差距。AI模型Gemini 3.5 ProGoogle编程能力10 个信源在谈事件专题推荐理由:谷歌Gemini 3.5 Pro延期了,编程能力没达标,内部还乱成一团。和OpenAI、Anthropic比差距更大了。原文稍后读已读值得跟进有用关注 Gemini 3.5 Pro
23:37向阳乔木@vista8用户开始对Grok 4.5进行正式评测,要求它开发一个用于评测大模型的案例网站。初步测试中,模型的Skill功能调用准确率较高,但网站开发效果还有待观察。该评测侧重考察模型在真实任务中的工具使用和编程能力。AI模型Grok 4.5大模型评测Skill调用推荐理由:有人正在测Grok 4.5的真实水平——让它写个评测网站,目前Skill调用挺准,来看看能不能真搭出来。原文稍后读已读值得跟进有用关注 Grok 4.5
05:30官方账号OpenAI@OpenAI精选78°OpenAI对SWE-Bench Pro进行了审计,发现该基准存在约70%的噪音上限,已无法可靠衡量前沿编码能力。该基准在业界广泛使用,但目前已被认为饱和。OpenAI决定撤回之前推荐研究社区使用该基准作为主要编码评估的建议。行业OpenAISWE-Bench Pro基准测试10 个信源在谈事件专题推荐理由:OpenAI发现SWE-Bench Pro这个编码基准有70%噪音上限,已经饱和了,不再适合用来衡量最强AI编码能力。原文稍后读已读值得跟进有用关注 OpenAI
10:46官方账号arXiv cs.LG@Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-An Ma, Yuxiong He论文提出Ranking-induced VERifiable framework (RiVER),无需真实答案即可通过基于分数的执行反馈训练LLM。在12个AtCoder Heuristic Contest任务上训练后,Qwen3-8B在Algorithm Engineering Benchmark (ALE-Bench)上的rating rank提升8.9%,GLM-Z1-9B-0414提升9.4%。同时,RiVER在LiveCodeBench和USACO等精确求解基准上分别带来2.4%和3.5%的绝对平均提升。对比基线表明,仅用原始执行分数训练可提升ALE rating但无法泛化到精确求解任务。论文RiVERQwen3-8BGLM-Z1-9B-0414推荐理由:论文介绍RiVER,用强化学习训练模型解决无标准答案的得分优化问题,还能顺带提升常规编程基准,实用思路值得一看。原文稍后读已读值得跟进有用关注 RiVER
23:00量子位@十三73°字节跳动发布豆包2.1,其Agent可在18小时内自动完成芯片设计代码编写。在编程基准测试中,豆包2.1的表现比肩Opus 4.7。该版本强化了自主编程和长时任务执行能力,适用于复杂工程场景。AI模型豆包2.1字节跳动智能体推荐理由:豆包2.1的Agent太能干了,独自跑18小时写出芯片代码,编程水平还追上了Opus 4.7,做硬件的可以关注下。原文稍后读已读值得跟进有用关注 豆包2.1
05:21rohanpaul_ai@rohanpaul_ai72°Datacurve 推出 DeepSWE,一个更严格的编程基准测试,旨在揭示领先模型之间的真实差距。GPT-5.5 得分 70%,而 GPT-5.4 为 56%,Claude Opus 4.7 为 54%,差距在旧基准中常被掩盖。DeepSWE 使用原创任务而非公开 GitHub 问题,避免模型训练时见过答案。其提示词长度仅为 SWE-bench Pro 的一半,但解决方案需要 5.5 倍代码量和约 2 倍输出 token。评分方式也不同,DeepSWE 检查请求行为是否真正实现,而非仅依赖合并 PR 的测试。AI模型基准测试编程能力GPT-5.51 个信源在谈事件专题推荐理由:做 AI 模型评估或选型的团队,DeepSWE 能帮你看到模型在长周期软件工程任务上的真实差距,建议关注这个新基准。原文稍后读已读值得跟进有用关注 基准测试
13:43IT之家(博客/媒体)精选阿里旗舰模型 Qwen3.7-Max 在权威编程榜单 Code Arena 上以 1541 分排名全球第二,仅次于 Claude 系列,超越了 Claude Opus 4.6、GLM-5.1 和 Kimi K2.6。Code Arena 采用用户随机盲测,防止刷榜,评估真实代码生成、调试和重构能力。此外,该模型在 Design Arena 榜单也位列第十。这标志着国产大模型在硬核编程能力上首次进入全球第一梯队。AI模型Qwen3.7-Max阿里千问Code Arena推荐理由:国产模型首次在权威编程盲测中超越 Claude Opus 4.6,做 AI 编程工具选型或关注国产大模型进展的开发者值得关注,建议直接去 Code Arena 看榜单。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
09:19IT之家(博客/媒体)谷歌 DeepMind CEO 戴米斯·哈萨比斯在 I/O 大会前接受《连线》采访,批评 AI 将导致大规模裁员的说法别有用心,认为企业应利用 AI 提升生产力做更多事,而非裁员。他提到谷歌新模型 Gemini 3.5 Flash 具备强大编程能力,但强调不会取代开发者,反而会创造更多需求。哈萨比斯指出,试图用 AI 替代开发者的公司缺乏想象力,可能犯下大错。谷歌在 I/O 大会上发布了 Antigravity 编程工具等 AI 产品,Gemini 3.5 Pro 将于下月发布。行业AI 裁员论DeepMindGemini 3.5 Flash推荐理由:哈萨比斯直接反驳了 AI 裁员论,给焦虑的开发者吃了定心丸——做编程或技术决策的人看完会松口气,建议点开了解他的完整观点。原文稍后读已读值得跟进有用关注 AI 裁员论