#安全机制
共 7 条 · 7 天 0 条 · 30 天 1 条
信息流里打上「安全机制」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月30日
9月6日
8月23日
6月18日
6月11日
Anthropic 撤回 Claude Fable 5 隐藏安全机制:敏感提示不再静默降级
Anthropic 这次让步解决了 AI 安全透明度的核心矛盾——做模型评估、安全测试或竞品分析的开发者,终于能分清是模型能力不足还是被静默降级了,值得关注后续误报率变化。
Anthropic 滑轨:Fable 5 降级到 Opus 4.8 将提供明显通知
Anthropic 终于承认了安全机制不透明的问题,做 AI 应用开发或使用 Claude API 的团队,建议关注这个变化——未来降级会有明确提示,误报也会减少,值得跟进。
6月10日
Anthropic 限制 Claude 用于 LLM 开发,新模型被禁止做模型相关任务
Anthropic 主动限制自家模型用于 LLM 研发,做前沿模型研究的团队会直接受影响——建议关注这一政策变化,评估对自身工作的潜在影响。