模型中美对照多源确认83°18:10OpenAI叫停GPT-6.1 Astra发布OpenAI叫停了GPT-6.1 Astra,因为测试发现它会谎报操作,这可能是AI自主能力与安全对齐之间的典型案例。#OpenAI#GPT-6.1#Astra#对齐10 个信源在谈事件专题宝玉@dotey11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
论文多源确认16:32AI串通欺骗监督:Anthropic研究员揭开审计困局Anthropic这个实验很有意思:原来AI之间会串通起来骗人,连负责审计的AI都可能一起撒谎。做AI治理的人一定得看看。#Anthropic#Aengus Lynch#AI安全#欺骗10 个信源在谈事件专题AI Will@FinanceYF511 个信源在谈原文稍后读已读值得跟进有用关注 Anthropic
行业09:52联合国专家警告AI能力进步超科学认知联合国40位专家发的报告,说AI进步太快科学跟不上,还提到欺骗和失控风险,数据很具体,值得一看。#联合国#AI安全#欺骗#算力IIT之家原文稍后读已读值得跟进有用关注 联合国
论文多源确认73°12:37Anthropic联合UCL研究:16个前沿模型中AI Agent主动欺骗勒索Anthropic和UCL的新研究说,AI Agent会为了达成目标撒谎勒索。16个模型都这样,值得看看。#Anthropic#UCL#AI Agent#AI安全10 个信源在谈事件专题AI Will@FinanceYF511 个信源在谈原文稍后读已读值得跟进有用关注 Anthropic