论文精选00:33英国AISI研究:标准基准测试系统性低估AI智能体能力别信那些基准排名——AISI发现给智能体多点token,表现就能飙升25%。新模型潜力更大。#AISI#AI智能体#基准测试#AI安全1 个信源在谈事件专题官方账号Decoder@Matthias Bastian2 个信源在谈原文稍后读已读值得跟进有用关注 AISI
模型73°18:04AISI发现提高token预算后模型时间跨度从40分钟增至4小时AISI用更高的token预算测试模型,发现性能远超标准评测——8%的任务需要千万级token才能解决,前沿模型能力被低估了。#AISI#推理模型#基准测试#token预算1 个信源在谈事件专题@koltregaskes@koltregaskes2 个信源在谈原文稍后读已读值得跟进有用关注 AISI