论文11:07Gram框架:自动化对齐审计评估AI代理破坏倾向AI安全研究者需要关注这个自动化审计工具——它系统性地暴露了代理模型在真实场景中的破坏倾向,做AI对齐和红队测试的团队可以直接参考其方法设计自己的评估流程。#对齐审计#AI安全#代理模型#GeminiaarXiv cs.AI@David Lindner 等 3 人原文稍后读已读值得跟进有用关注 对齐审计