7月8日
09:54
09:54官方账号arXiv cs.AI@He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li
DT-Guard提出一种推理主动训练、推理自由推理的范式,在训练时使用推理监督,推理时只输出结构化安全标签。它采用意图-类别-安全的三步决策过程,并构建带意图标签、风险类别、安全标签和推理轨迹的数据集。通过Rollout-Guided Progressive Hard-Case Optimization (RG-PHO)提升硬样本鲁棒性。在提示侧和响应侧安全基准上,DT-Guard分别达到0.886和0.870的平均F1分数,4B参数版本取得0.878的双侧平均F1,超越多个8B基线。
推荐理由:想用轻量模型做好内容安全?DT-Guard靠训练时推理、运行时只打标签,4B就干掉8B的护栏,速度快还准。
7月2日
05:27
05:27AI SDK@aisdk
Anthropic 的 Claude Fable 5 模型因内置安全护栏可能拒绝部分请求。用户可通过配置将拒绝请求自动回退到 Opus 4.8 模型处理。此功能在 SDK 中提供,支持自定义每个护栏的 fallback 行为。目前已有 514 次查看和 9 个点赞。
事件专题

推荐理由:Anthropic 给 Claude Fable 5 加了安全护栏,请求被拒时可以自动切换到 Opus 4.8,开发时避免中断。
6月11日
6月10日