模型中美对照多源确认83°08:46METR 编码基准饱和?Cognition 发布 FrontierCode 新评测,Claude Opus 4.8 仅 13.4%做 AI 编程评估或关注模型实际能力的开发者,这个新基准直接戳中了当前模型的软肋——代码能跑但不可维护,值得看看你的模型能拿几分。#编码基准#FrontierCode#Claude Opus 4.8#代码可维护性3 个信源在谈事件专题Gary Marcus@GaryMarcus4 个信源在谈原文稍后读已读值得跟进有用关注 编码基准