#基准测试
SAP 把 TabPFN 这类表格模型的注意力掰开测了一遍,FlashAttention、cuDNN、SageAttention 谁快谁慢、在哪张卡上快都列清楚了,做表格模型推理的可以直接抄作业。
25 个模型在这个基准上只给故事不给问题,直觉成绩差了 22 倍,排名和常规榜单完全对不上,还有模型被自己的过滤器拦住,很值得细看。
Ethan Mollick 说那张刷屏的 METR 任务时长曲线该退休了,还给出了替代图,做 AI 汇报的人可以看看。
Fireworks 的特种智能指数又添新成员,这次是 FactoryAI 的 Legacy-Bench,专门考模型能不能搞定遗留代码系统,做企业级 Agent 的可以关注。
有人专门做了个家具组装基准,测模型空间推理,10个月分数从28%飙到80%,连以前模型搞不定的活也开始拿下了。
Anthropic 的 Opus 5.5 在编程智能体评测拿第一,三项基准都涨了,价格还降了 20%,不过每任务要烧 13 美元 tokens,用前算算账。
OpenAI 新出的 GPT-6 Sol 和 Luna 被拿来做法律场景实测了,Sol 抓合同变更、Luna 管细节核查,做法律 AI 的可以看看成绩。
Epoch AI 搞了个叫 FAB 的新基准,让模型看宜家说明书加半成品照片找拼装错误,10 个月内最高分从 28% 冲到 80%。
OpenAI 拿出 1215 段心理对话让各家模型答题,GPT-6 Astra 拿 57.3% 第一,Gemini 2.5 Pro 只有 29.5%,数据集已开放下载。
有人把 EU AI Act 那套系统性风险分类做成了开源评估面板,18 个模型最坏情况评分比平均分低 14–37 分,证据可逐条追溯。
这个叫 PASTABench 的新基准测了 16 个大模型给智能体踩刹车的时机,最好的也只拿到 40.74%,还拆穿了不少小模型靠关键词得分。
做游戏内或实时状态类对话智能体的朋友看看,三个包装器把接地准确率从 60% 多拉到 96.7%,延迟还压在 1.5 秒。
腾讯混元做了个新基准 WebCraftBench,用 369 条真实需求测 AI 写网页到底靠不靠谱,测了 17 个模型,和 Code Arena 榜单相关性 0.89。
阿里 Qwen 出了三个手机智能体,能规划任务、操作手机、一句话生图,还把测试基准开源了,做移动端 Agent 的可以看看。
浏览器操作智能体的性价比榜刷新了,GPT-6 Sol 比.Opus 便宜三倍还高分,挑模型前可以看看这份数据。
Genspark 把做幻灯片的模型 Gen-1 Slides 放进了 FireworksAI 的 SII 指数,价格只有常规的 1/17,做 PPT 的可以看看成绩单。
Mem0 团队做了个新基准 DolphinBench,专测智能体记忆:不看答题对错,看长对话后动作做没做对,还把成本和延迟一起排名,选记忆系统前可以先看看。
有人出了个数学基准 Endless Exam,14类构造题自动验证打分,8个模型全测了一遍,目前没谁超过人类已发表纪录。
想给 Agent 配图记忆数据库前先看这篇,Corvic AI、Neo4j 等 8 款引擎实测,最贵的不是查询慢,是把数据喂进去。
xAI 的 Grok 4.7 便宜但跑分只有 46,比 Claude 和 GPT-6 各低 7 分,预算敏感的场景可以看看。
想了解游戏开发中 AI 生成软件的性能?这个新基准测试集 GameASG-Bench 很有用,它有 47 个具体任务和详细的实验数据,能帮你判断不同模型的效果。