8月24日
16:24
7月9日
03:16
03:16官方账号Decoder@Matthias Bastian
精选
xAI发布Grok 4.5,模型基于数万块Nvidia GB300 GPU训练。在编码基准上,Grok 4.5落后于Fable 5和GPT-5.5,但相比Opus 4.8,token消耗减少4.2倍。Grok 4.5定价每百万输入token仅2美元,远低于竞品。欧盟市场预计7月中旬可用。
事件专题

推荐理由:Grok 4.5每百万token才2美元,编码虽不如Fable 5但便宜到可以忽略差距,性价比碾压。
6月9日
08:46
08:46Gary Marcus@GaryMarcus
83°
Gary Marcus 发推指出 METR 的编码基准已饱和,但 Cognition 随即推出更难的 FrontierCode 评测,最高分仅 13.4%。该评测由顶级开源维护者花费 40+ 小时设计,首次衡量代码是否可合并维护,而非仅功能正确。这揭示了当前模型在编写可维护代码方面的严重不足,为 AI 编程能力评估设立了新标准。
事件专题

推荐理由:做 AI 编程评估或关注模型实际能力的开发者,这个新基准直接戳中了当前模型的软肋——代码能跑但不可维护,值得看看你的模型能拿几分。