16:24官方一手Pandaily@contact@pandaily.com (Pandaily)8月20日,OpenRouter低调列出匿名、免费的模型'ox-alpha',其真实世界编码结果击败多个封闭前沿模型,引发行业猜测游戏,并聚焦中国隐形模型策略。AI模型Ox Alpha编码基准OpenRouter7 个信源在谈事件专题推荐理由:OpenRouter发布了一个免费模型,其编码能力超越多个前沿模型,引发行业关注。原文稍后读已读值得跟进有用关注 Ox Alpha
20:06@koltregaskes@koltregaskes71°Kimi K3在Arena's Frontend Code盲测中击败Claude Fable 5和GPT-5.6 Sol,排名第一。在DeepSWE基准上,K3得69%且每任务成本$4.65,而Sol得73%成本$8.39,Fable 5得70%成本$21.63。在Artificial Analysis的Intelligence Index上,K3得57分,仅比Fable 5的60分低3分。该模型在长时编码和知识工作方面表现突出,在AA-Briefcase排名第二。但幻觉率为51%,接近Grok 4.5的54%。开放权重将于7月27日发布。AI模型Kimi K3Moonshot开源模型10 个信源在谈事件专题推荐理由:中国开源模型Kimi K3编码能力比Claude和GPT还强,价格却便宜好几倍,做长上下文编程选它准没错。原文稍后读已读值得跟进有用关注 Kimi K3
04:11官方一手OpenAI Blog(博客/媒体)OpenAI的最新分析指出了SWE-Bench Pro基准测试中存在的信号噪声问题,影响了对AI模型编码能力的评估准确性。该分析发现SWE-Bench Pro存在评估指标不稳定、模型分数波动等问题。这引发了对该基准可靠性的质疑,可能影响模型比较和性能判断。行业OpenAISWE-Bench Pro编码基准10 个信源在谈事件专题推荐理由:OpenAI发文说SWE-Bench Pro这个编码基准有噪声问题,做评估的得留个心眼。原文稍后读已读值得跟进有用关注 OpenAI
03:16官方账号Decoder@Matthias Bastian精选xAI发布Grok 4.5,模型基于数万块Nvidia GB300 GPU训练。在编码基准上,Grok 4.5落后于Fable 5和GPT-5.5,但相比Opus 4.8,token消耗减少4.2倍。Grok 4.5定价每百万输入token仅2美元,远低于竞品。欧盟市场预计7月中旬可用。AI模型Grok 4.5xAIFable 510 个信源在谈事件专题推荐理由:Grok 4.5每百万token才2美元,编码虽不如Fable 5但便宜到可以忽略差距,性价比碾压。原文稍后读已读值得跟进有用关注 Grok 4.5
00:49Geek@geekbb73°DeepSeek 在 Pro Max 模式下于多个编码/工程基准取得领先成绩:LiveCodeBench 93.5%、Codeforces Rating 3206、SWE Verified 80.6%,超越 GPT-5.4、Gemini 3.1 Pro、Claude Opus 4.6 等闭源模型。这些结果来自 X 用户 @geekbb 的推文,并关联到 DeepSeek 的 Hugging Face 仓库。目前该模型尚未开放本地部署,引发社区期待。AI模型DeepSeekPro Max编码基准推荐理由:DeepSeek 拿 Pro Max 模式在 LiveCodeBench 等三大编码基准上直接碾压 GPT-5.4 和 Claude Opus 4.6,分数拉满,但还没开放下载,先来围观一下。原文稍后读已读值得跟进有用关注 DeepSeek
04:01elvis@omarsar0GLM 5.2 在 FrontierSWE 基准上排名第 3,得分仅次于 Fable 5 和 Opus 4.8,并超越 GPT-5.5。这是首个缩小 Anthropic/OpenAI 与其他提供商之间差距的模型,同时也是目前最强的开源权重模型。该成绩展示了开源模型在编码任务上的竞争力。AI模型GLM 5.2FrontierSWEGPT-5.510 个信源在谈事件专题推荐理由:GLM 5.2 在编码基准上干掉了 GPT-5.5,开源里最强,值得关注。原文稍后读已读值得跟进有用关注 GLM 5.2
08:46Gary Marcus@GaryMarcus83°Gary Marcus 发推指出 METR 的编码基准已饱和,但 Cognition 随即推出更难的 FrontierCode 评测,最高分仅 13.4%。该评测由顶级开源维护者花费 40+ 小时设计,首次衡量代码是否可合并维护,而非仅功能正确。这揭示了当前模型在编写可维护代码方面的严重不足,为 AI 编程能力评估设立了新标准。AI模型编码基准FrontierCodeClaude Opus 4.83 个信源在谈事件专题推荐理由:做 AI 编程评估或关注模型实际能力的开发者,这个新基准直接戳中了当前模型的软肋——代码能跑但不可维护,值得看看你的模型能拿几分。原文稍后读已读值得跟进有用关注 编码基准