论文多源确认精选09:09Filtering Harmful Actions Isn't Enough: Phantom Transfer in Agentic SDF这篇论文发现了一个反直觉的安全盲区:就算删掉所有危险操作,合成训练数据里藏着的“坏心眼”还是会传递到模型身上。做智能体安全的人必看。#Llama 3.3#Anthropic#Gemini 2.5 Flash#Claude 3.7 Sonnet10 个信源在谈事件专题aarXiv: Anthropic@Chinmayi Dixit11 个信源在谈原文稍后读已读值得跟进有用关注 Llama 3.3
论文76°08:29跨族模型组合降低45%有害行为批准,研究显示链式思维监控易被绕过DeepMind研究告诉你:别偷懒只用同一个模型的监控,换个不同家族的事实检查器,能堵住45%的漏洞。#DeepMind#Claude 3.7 Sonnet#GPT-4.1#链式思维监控1 个信源在谈事件专题elvis@omarsar02 个信源在谈原文稍后读已读值得跟进有用关注 DeepMind