Surge 出了个新基准 sudo L7,用 60 个真实生产仓库任务测 AI 编程,最好的 agent 也只过 45%,想看差距在哪可以读读。
#基准测试
拿 Minecraft 重建曼哈顿、白金汉宫这些真实地点来考模型找路,GPT-6 Astra 考了 85.6 分,开源的 DeepSeek-V4.1-Flash 才 23.9,差距很直观。
Salesforce Ventures 投了 Arena 的 B 轮。这个靠真人盲测给模型排名的平台,现在是各家实验室选模型的重要参考。
Artificial Analysis 的模型榜单要更新了,v5 加入 Terminal-Bench Science 和私有数据集的编程测试,看榜单选模型的朋友可以蹲一下。
Perplexity 的 Decider V1.1 在 DecisionBench 拿了第一,准确率 93.9%,每千次决策才 0.016 美元,做决策路由的可以看看。
这篇论文测试了让智能体自己动手省钱:让 Opus 5 等模型把任务封装成小程序或小模型,成本能降 657 倍但多数尝试会翻车,结果挺有意思。
Mistral Large 4 在网络安全基准上击败了 Opus 5.5 和 GPT-6 Astra,安全过滤策略更宽松。
ARC Prize 拉上 Snorkel 办晚宴,40 个搞基准测试的人聚一起,连 METR、Epoch、Artificial Analysis 都来了,聊怎么把模型评测做标准化。
这个 TasteVal 把研究品味换算成省了多少算力来打分,Opus 5.5 用 1/30 的成本跑赢人类专家,数字挺有意思的。
这篇论文拿 5 种神经网络和线性 SVM 掰手腕,结果在 CONSTRAINT 上 SVM 反而赢了集成模型,做分类任务选型前可以看看。
斯坦福 HAI 出了两篇研究,专门追问 LMSYS、MMLU 这些基准分数到底能不能代表模型真实能力,做选型或评测的都该看看。
哥伦比亚法律考了 15 个模型,Gemini 3.1 Pro 选择题 0.905 但写答案正确率不到 0.45,引用的法条一半是编的,做法律 AI 的都该看看。
一篇把 LLM 智能体用在自然灾害分析上的论文,亮点是让智能体自己判断该用哪种科学方法,还配套了 141 个实例的基准,代码开源可以直接跑。
Lovable 创始人和风投 Judith Dada 在聊基准测试图表怎么画才不误导,还抛出了基准对 ASI 是否还有效的问题。
Cohere 讲了怎么给 North Small Translate 做防作弊测试:用模型做完之后才发布的 WMT26 数据,成绩没法刷,方法挺实在。
GeneralityLabs公布Exploit Bench测试结果,V4.1 Flash性能下降,Claude Code超越Codex。