Karpathy 的新测试:让 Claude Opus 5 用 100 万 tokens 把《指环王》开头做成 3D 场景,2 小时生成了 5500 行代码。
#基准测试
VulcanBench 实测:Qwen3.8-Max 跑一趟 126 美元,DeepSeek V4-Flash 只要 13.6 美元,便宜 10 倍还更快。选性价比就 DeepSeek,选准确率就 Grok 4.5。
阿里新模型qwen3.8-max一上榜就冲到综合第五,只比榜首Claude差13分;kimi-k3-max代码也进了前十,国产模型进步挺明显,榜单值得翻翻。
DungeonBench用D&D战斗测AI战术推理,分单场和连战两关,发现大模型会打单场却管不好资源,想测AI决策的可以看看。
OpenAI 的 GPT-5.6 三兄弟开测,Sol 全栈第 3,Terra 和 Luna 也进 top20,挑模型看这个。
Thinking Machines 新出的 Inkling-Small 虽然没登顶,但官方给了它和头部模型的对比图,想了解它大概什么水平可看。
做代码基准测试的朋友可以看看,PAIChecker能自动揪出PR和Issue配错的情况,SWE-bench上准确率超九成。
OpenAI推出GPT-5.6 Sol,在自定测试里赢了Anthropic的Opus 5,但换官方环境就掉到7.8%,差距挺大。
想看看AI到底能不能做会计?新出的APEX-Accounting基准拿160道真实会计题考了九个模型,最强Claude Fable-5才56%,离实际干活还差得远。
这篇论文搞了个MemSecBench,专门测AI记忆会不会被黑,结果84%的案例恶意记忆都能长存,而且不同记忆系统差别很大,做AI安全的朋友应该看看。
如果你想了解现有AI智能体到底能多深地理解用户,这个新基准Setoka用心理学理论和方法测出了它们的短板——不只是翻聊天记录,还要推断行为和性格。
Cline让Kimi K3自己当工程师优化测试框架,17小时得分从77.5%涨到88.8%,成本还降了快一半,挺有意思的实验。
想测试你的桌面Agent到底能不能分清操作后的界面变化?这个新基准有2000多个真实案例,能看出模型在哪类失败上翻车。
临床诊断AI评估有新基准了!1089个真实案例、3760张影像,15个模型测试下来发现,再好的模型完全正确诊断率也不高,而且容易犯信息整合错误和视觉幻觉。
想测AI罕见病诊断能力?GraphRareBench用2365个案例和18093对混淆,专门检测模型能不能分清真病和假病。
Anthropic 和欧洲几所高校搞了个新基准,专门测大模型破解密码的本事,比单纯看推理能力更有针对性。
xAI发了Grok 4.6发布预告,同时4.5在Agent Arena上冲到了第13名,比4.3进步了16名,尤其Bash Recovery能力追上了Claude和GPT,推荐关注。
Code Arena 刚上线了全栈能力排行榜,Kimi K3 拿了第一,GPT 5.6 和 Claude Fable 紧随其后,想比模型写代码能力的可以看看。
如果你看重模型回答的准确性,LMSys 新出的事实性排名很有参考价值。Claude Opus 5 这次在最重视事实的榜单上拿了第一,比之前只看人类偏好的排名更实在。
Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。