事件专题 · 单一信源

AISI发现提高token预算后模型时间跨度从40分钟增至4小时

AISI在测试前沿模型时,将推理计算预算从250万token提高到5000万token,模型的时间跨度从40分钟跃升至4小时。在网络安全、软件工程和数学基准上,模型性能随token预算增加而持续提升,8%的任务仅在1000万token以上才被解决。新模型更能有效利用额外计算资源,前沿模型的加倍率在高预算下陡增60%。标准评估因在模型性能还未饱和前就限制计算量,系统性低估了模型能力,固定预算的得分会遗漏大量提升。

当前结论

AISI用更高的token预算测试模型,发现性能远超标准评测——8%的任务需要千万级token才能解决,前沿模型能力被低估了。

2 个信源73° AI 热度最后更新 2026/7/3 10:04:25

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情