#安全评估
共 20 条 · 7 天 0 条 · 30 天 7 条
信息流里打上「安全评估」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月2日
9月20日
Anthropic 与埃森哲合作投入 20 亿美元进行 AI 安全评估
Anthropic 和埃森哲要花 20 亿美元搞 AI 安全评估,让第三方专家驻场查漏洞。这和 OpenAI 公布异常报告的做法不一样,是想从内部把安全搞得更扎实。
9月19日
9月13日
Anthropic 将为第三方提供永久访问权限以评估模型对齐
朋友,Anthropic 的 CEO Dario Amodei 写了一篇关于 AI 行业应该放慢脚步的文章,他们决定给第三方评估员永久访问权限,这样能更严格地检查模型安全。
9月4日
9月3日
8月31日
8月19日
8月18日
DeepSeek Harness 安全评估:A.I.G 测试 14,560 次间接提示注入
腾讯用 A.I.G 把 DeepSeek Harness 翻来覆去测了 1.4 万多次,隐藏 Unicode 攻击成功率能到 25.5%。想自查提示注入的可以看看这个框架。
7月31日
6月17日
6月10日
产品22:36
Waymo 推出 ReD 虚拟驾驶员,研究人类如何应对紧急碰撞Waymo 用认知科学给自动驾驶安全找了个新基准——不是比谁刹车快,而是比谁更像人类老司机。做自动驾驶安全评估的团队值得看看,开源代码可以直接拿来跑实验。
IT之家原文
6月9日
VESTA:LLM 智能体全自动场景生成与安全评估框架
做 LLM 智能体安全评估的团队终于有了自动化工具——VESTA 能生成上千个真实任务场景,直接测出模型执行中的安全漏洞。建议关注智能体安全的开发者点开看看,结果可能会让你重新审视现有模型的风险。
5月22日
5月19日
STRIDE-AI:面向生成式AI安全评估的威胁建模框架
AI安全团队终于有了一个从理论到工具都落地的威胁建模框架——STRIDE-AI把NIST和OWASP的鸿沟填上了,做LLM应用安全评估的可以直接用它的Web工具跑一遍评估流程。
5月15日
用可预测失败训练ML模型:新方法提升部署安全评估
做AI安全评估的团队终于有了一个可量化的失败预测工具——新方法解决了评估集太小无法捕捉罕见失败模式的痛点,做模型部署前风险评估的开发者可以直接参考实验方法。
5月13日
Google Research 多项AI突破:科研伙伴、推理Agent与合成数据
多项成果集中在AI辅助科研与智能体推理,尤其是ReasoningBank和AI加速脑神经研究,表明AI正从工具向自主式科研伙伴演进。对研究人员和AI工程师而言,这些开源资源和评估方法具有实践参考价值。