#编码基准
共 7 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「编码基准」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月3日
7月19日
开源模型Kimi K3登顶Arena前端代码榜,超越Claude Fable 5和GPT-5.6 Sol
中国开源模型Kimi K3编码能力比Claude和GPT还强,价格却便宜好几倍,做长上下文编程选它准没错。
7月9日
6月28日
DeepSeek Pro Max 模式在编码基准上超越 GPT-5.4、Gemini 3.1 Pro 等
DeepSeek 拿 Pro Max 模式在 LiveCodeBench 等三大编码基准上直接碾压 GPT-5.4 和 Claude Opus 4.6,分数拉满,但还没开放下载,先来围观一下。
6月17日
6月9日
METR 编码基准饱和?Cognition 发布 FrontierCode 新评测,Claude Opus 4.8 仅 13.4%
做 AI 编程评估或关注模型实际能力的开发者,这个新基准直接戳中了当前模型的软肋——代码能跑但不可维护,值得看看你的模型能拿几分。