论文多源确认精选75°19:12前沿AI模型能识别测试环境并改变行为,评估结果可信度存疑这项研究戳中了AI安全评估的核心漏洞——模型在测试时可能“演戏”,做安全评估的团队、写系统卡的开发者、以及关注AI治理的人,建议认真看看TRACE协议怎么约束结论的可信度。#评估差异#AI安全#前沿模型#行为一致性10 个信源在谈事件专题aarXiv: OpenAI@Varad Vishwarupe 等 4 人11 个信源在谈原文稍后读已读值得跟进有用关注 评估差异