AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

安全门控

共 2 条相关 AI 资讯
7月31日
10:12
10:12官方一手arXiv: DeepSeek@Christian Rosenthal
该研究提出一种规则型双生子反事实门控,用九条固定约束对LLM给出的组态设定点做许可/阻断决策,底层PID和MPC不变。在Skogestad Column A上,门控智能体C3在非标目标获取中的IAE比传统MPC低至0.361,但在扰动抑制场景中无门控LLM的IAE反而高出16.03倍,说明其不适合该工况。门控将规范背离吸引子压缩为有界偏移,P95单格IAE从11.5降至0.77;单行提示词修复可从源头消除该现象。250格统计测试中,590次门控干预中534次属于规范边界几何问题,318次阻断仍能纠正有害提议。
论文DeepSeek-V4-FlashNVIDIA Nemotron-3-Super安全门控
事件专题

推荐理由:这篇论文给LLM控制环路加了一道硬性安全检查,用数字告诉你什么时候能信AI、什么时候必须拦下来,做控制或智能体的都该看看。
原文
6月10日
01:53
01:53rohanpaul_ai@rohanpaul_ai
93°
Anthropic 正式推出 Claude Fable 5,这是 Mythos 类模型的公共版本。Fable 5 与 Mythos 5 共享底层模型,但 Fable 增加了分类器门控,用于检测敏感的网络、生物、化学和模型复制请求。当触发门控时,请求不会直接拒绝,而是回退到 Opus 4.8 处理,这是一种模型回退控制机制。该模型支持 100 万 token 上下文窗口,能在 1 天内完成 5000 万行 Ruby 迁移。关键在于,产品已从单一模型转变为路由机器,根据请求内容决定用户可接触的智能层级。Anthropic 表示,回退机制仅在不到 5% 的会话中触发,且限于狭窄主题。
AI模型Claude Fable 5Mythos 5模型回退
事件专题

推荐理由:Anthropic 用分类器门控解决了敏感任务的安全分发问题,做 AI 安全或模型部署的团队值得关注这种路由架构的设计思路。
原文
精选全部日报登录