#基准
artificialanalysis.ai发布了最新模型测试数据,能直接查看各模型在GLUE的分数,和之前版本比信息更全了。
这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。
OpenAI 发的 GPT-Transcribe 在音频转录上比 Whisper 错误率低一半,多语言场景提升明显。
LLaDA2.2-flash在智能体基准上把Ling-2.6-flash甩开一截,快速模式甚至冲到705分,做Agent研究的可以看看。
Poolside 用 118B 的 MOE 模型 Laguna S 干翻了 Thinky 的 1T 模型,小团队也能造出顶尖模型,值得一看。
Allen AI 用研究者投票测了 AI 的科学文献能力,1700 人投了 3900 票,想看看哪个模型更靠谱?这里直接给结果。
斯坦福的机器人挑战赛又来了,去年最佳方案成功率才12%,说明这事真难。今年任务更多、评测更靠谱,想测测你家机器人的真实水平就参加。
想评估AI在真实物理系统中的可信度?这个新基准从六个维度测试智能体,还带了LLM审计层,结果挺扎心:RL优化收益但会钻物理漏洞。
研究团队用政府开放数据搞了个新测评,发现现在的大模型遇到多表格和外部知识就掉链子,专治各种表面功夫,推荐给关心模型真实落地能力的朋友。
想对比 Claude Sonnet 5 和 4.6 的文本能力?这份分析告诉你它在专家级提示上更强,但其他类别反而差了。
这篇论文搞了一个对抗性语用学基准,有18个具体条目,专门测试模型被指令冲突、嵌入命令搞昏头的情况,比以前只打通过/不通过标签靠谱多了。
新出的AA-Briefcase基准可以看看,Nemotron 3 Ultra在开放模型里排前面,适合对比它处理复杂任务的能力。
这个新基准EG-VQA把视频问答的答案和证据绑定在一起,测出来一大票模型只会蒙答案不会找证据。开源模型EG-Reasoner靠证据监督训练,反事实推理直接碾压好几家专有模型。
想测你的LLM论文搜索智能体?ScholarQuest 给了1000多个主题和4种意图的标准测试,最强方法才0.314召回,你的能提多少?
OpenAI 联合 173 位科学家搞了个新基准 LifeSciBench,750 个专家任务专测 AI 搞科研的能力,比通用模型靠谱多了。
Apodex 用 35B 参数模型做的预测框架,在 FutureX 排行榜上直接包揽前四名,太猛了。
想了解如何科学评估AI做PPT的水平?这篇论文用113个主题和8133个探针,测出NotebookLM能覆盖85%的受众关键信息,比DeepPresenter和SlideTailor强不少。
OpenAI联合173位科学家搞了个LifeSciBench,750个专家级任务覆盖7个生物研究流程,想测AI在生命科学里到底好不好用,科研人员可以用它来选模型。
电力系统运维和预测建模团队终于有了能评估安全约束的基准——PowerPhase 比现有基准大一个数量级,PowerForge 在安全与精度间取得最佳平衡,做电网概率预测的可以直接参考。