10:12官方一手arXiv: DeepSeek@Christian Rosenthal该研究提出一种规则型双生子反事实门控,用九条固定约束对LLM给出的组态设定点做许可/阻断决策,底层PID和MPC不变。在Skogestad Column A上,门控智能体C3在非标目标获取中的IAE比传统MPC低至0.361,但在扰动抑制场景中无门控LLM的IAE反而高出16.03倍,说明其不适合该工况。门控将规范背离吸引子压缩为有界偏移,P95单格IAE从11.5降至0.77;单行提示词修复可从源头消除该现象。250格统计测试中,590次门控干预中534次属于规范边界几何问题,318次阻断仍能纠正有害提议。论文DeepSeek-V4-FlashNVIDIA Nemotron-3-Super安全门控10 个信源在谈事件专题推荐理由:这篇论文给LLM控制环路加了一道硬性安全检查,用数字告诉你什么时候能信AI、什么时候必须拦下来,做控制或智能体的都该看看。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
01:53rohanpaul_ai@rohanpaul_ai93°Anthropic 正式推出 Claude Fable 5,这是 Mythos 类模型的公共版本。Fable 5 与 Mythos 5 共享底层模型,但 Fable 增加了分类器门控,用于检测敏感的网络、生物、化学和模型复制请求。当触发门控时,请求不会直接拒绝,而是回退到 Opus 4.8 处理,这是一种模型回退控制机制。该模型支持 100 万 token 上下文窗口,能在 1 天内完成 5000 万行 Ruby 迁移。关键在于,产品已从单一模型转变为路由机器,根据请求内容决定用户可接触的智能层级。Anthropic 表示,回退机制仅在不到 5% 的会话中触发,且限于狭窄主题。AI模型Claude Fable 5Mythos 5模型回退10 个信源在谈事件专题推荐理由:Anthropic 用分类器门控解决了敏感任务的安全分发问题,做 AI 安全或模型部署的团队值得关注这种路由架构的设计思路。原文稍后读已读值得跟进有用关注 Claude Fable 5