论文Agent 与开发者09:53PyINE:用可执行程序研究模型捷径行为的监督框架这篇把模型走捷径的监督问题做成了可复现的实验场:百万条执行轨迹加代码变体,还实测了探针、judge、debate 四种监督方式各自漏什么、贵在哪。#PyINE#可验证奖励#AI安全#激活探针aarXiv cs.LG@Pierre-Luc St-Charles 等 8 人原文稍后读已读值得跟进有用关注 PyINE
论文政策与合规15:42合规检测器存在规则盲区,审计揭示其失效机制这篇论文把合规检测器的底裤扒了:换掉规则文本,检测结果居然不变。想搞懂 AI 合规监控靠不靠谱,看这篇就对了。#合规检测#规则盲区#激活探针#防护模型aarXiv cs.AI@Saisab Sadhu 等 4 人原文稍后读已读值得跟进有用关注 合规检测
论文10:55激活探针揭示模型输出遗漏的代码安全信号这篇论文告诉你,光靠问模型“这代码安全吗”不够,读它的内部激活反而能发现漏洞,对做代码审查的人很有用。#激活探针#代码安全#漏洞检测#开源模型aarXiv cs.LG@Ivan Wiryadi原文稍后读已读值得跟进有用关注 激活探针
论文精选11:02预测推理模型未来行为,新方法FPCG实现更优控制这项研究解决了推理模型行为控制中输出质量下降的痛点,做模型对齐或安全控制的开发者可以直接用FPCG方法,在保持生成质量的同时精准引导模型行为。#推理模型#模型控制#激活探针#行为预测aarXiv cs.LG@Evgenii Kortukov 等 8 人原文稍后读已读值得跟进有用关注 推理模型