主要来源Decoder
查看原文事件专题 · 单一信源
英国AISI研究:标准基准测试系统性低估AI智能体能力
英国AI安全研究所(AISI)在涵盖7项基准测试的研究中发现,标准评估通过限制计算预算系统性地低估了AI智能体的实际能力。在软件工程任务中,当token预算增加10倍时,成功率提升约25%。新模型受益最大,实际进展比之前测量结果陡峭约60%。
当前结论
别信那些基准排名——AISI发现给智能体多点token,表现就能飙升25%。新模型潜力更大。
2 个信源63° AI 热度最后更新 2026/7/3 16:14:44
证据链
相关来源 1@koltregaskes
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。