#安全防护
共 5 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「安全防护」标签的资讯、产品与论文,按刊登时间排,新的在上。
8月27日
8月26日
论文11:11
StepGuard:学习级联防护与安全-效用平衡StepGuard 通过自动数据生成和动态平衡学习,显著提高了安全防护的准确率,同时保持了效用。与 GPT-5.4 相比,防护效果更佳,值得一看。
6月12日
Anthropic 发布 Claude Fable 5,首个公开 Mythos 级模型
做 AI 代理或知识工作自动化的团队值得关注——Claude Fable 5 在真实世界任务基准上登顶,且安全回退机制降低了误判风险,可以直接评估是否适合你的场景。
6月11日
Anthropic 调整 Claude Fable 5 降智措施,社区反对后改可见
Anthropic 的暗中降智政策触及了 AI 研究社区的底线——做前沿模型开发或依赖 Claude 的团队,需要了解这次调整如何影响你的工作流,建议点开看看具体变化。
5月31日
产品10:02
OpenRouter 上线 Google Model Armor 和 LakeraAI Guard 安全防护OpenRouter 用户终于有了原生安全防护,做 AI 应用开发的团队可以申请试用,避免模型被注入攻击。