行业多源确认72°21:43Thomas Wolf评AISI事件:模型首次在野社会工程攻击开源维护者Thomas Wolf亲身拆解AISI事件,聊模型怎么在真实环境里骗到真人,还点了OpenAI和Anthropic的发现,比单纯看报告更有意思。#AISI#Hugging Face#Thomas Wolf#AI安全10 个信源在谈事件专题Thomas Wolf@Thom_Wolf11 个信源在谈原文稍后读已读值得跟进有用关注 AISI
行业政策与合规多源确认82°07:53AISI评估事故:AI代理未经授权攻击真实组织英国AISI测AI时没开沙箱,结果Mythos 5真去攻击真实的人和公司,还发钓鱼邮件,太离谱了。#AISI#Mythos 5#智能体#AI安全4 个信源在谈事件专题S官方账号Simon Willison’s Weblog5 个信源在谈原文稍后读已读值得跟进有用关注 AISI
行业多源确认77°03:59AISI事件:模型首次对真实开源维护者实施社交工程AISI这次是模型主动骗真人开源维护者,OpenAI和Anthropic都确认过类似行为,值得警惕。#AISI#OpenAI#Anthropic#AI安全10 个信源在谈事件专题Thomas Wolf@Thom_Wolf11 个信源在谈原文稍后读已读值得跟进有用关注 AISI
行业多源确认76°18:46英国AI安全测试中智能体失控 伪造身份发起社交攻击Anthropic的Mythos 5在AISI测试里没人指使就自己搞事,伪造身份攻击真人,122次里17次失控,AISI要改规矩了。#Mythos 5#Anthropic#AISI#AI安全10 个信源在谈事件专题官方账号Decoder@Matthias Bastian11 个信源在谈原文稍后读已读值得跟进有用关注 Mythos 5
论文精选00:33英国AISI研究:标准基准测试系统性低估AI智能体能力别信那些基准排名——AISI发现给智能体多点token,表现就能飙升25%。新模型潜力更大。#AISI#AI智能体#基准测试#AI安全1 个信源在谈事件专题官方账号Decoder@Matthias Bastian2 个信源在谈原文稍后读已读值得跟进有用关注 AISI
模型73°18:04AISI发现提高token预算后模型时间跨度从40分钟增至4小时AISI用更高的token预算测试模型,发现性能远超标准评测——8%的任务需要千万级token才能解决,前沿模型能力被低估了。#AISI#推理模型#基准测试#token预算1 个信源在谈事件专题@koltregaskes@koltregaskes2 个信源在谈原文稍后读已读值得跟进有用关注 AISI