12:03官方一手arXiv: DeepSeek@Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic76°该研究对GPT-5、Claude、Grok、Gemini、DeepSeek、Kimi、Qwen共7个主流模型进行了基于政治轴的可控性压力测试,使用12种意识形态角色提示和70个政治指南针项目,共收集63,700条回答。结果发现,上下文框架解释了经济和社会轴上约88%-93%的方差,而模型自身身份的影响不到3%。在威权提示下,不同模型在相同问题上表现出相似偏移。研究强调需要进行可操控性审计,报告分散性、对称性、饱和度和拒绝底线。数据集和代码已开源。论文GPT-5ClaudeGrok推荐理由:这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。原文稍后读已读值得跟进有用关注 GPT-5
12:12官方账号arXiv cs.LG@Juanwu Lu, Junyu Zhu, Ziran Wang论文提出可控神经变分代理(CNeVA),通过闭合形式共轭变分更新从逐通道折扣回报推断每个代理的高斯行为潜变量。采用混合通道掩码课程训练整流流轨迹生成器,实现无分类器引导。在Waymo Open Motion数据集上,CNeVA达到竞争性真实感,同时暴露逐通道可控性——这是排名更高的模仿模型所缺乏的。基于速度和加速度的操控产生单调响应,且引入软资格门(soft eligibility gates)后安全性操控显著且单调。实验表明,必须将操控指标与物理合理性护栏结合阅读,以避免奖励黑客混杂。AI模型CNeVAWaymo Open Motion Dataset交通模拟推荐理由:这篇论文提出了CNeVA,能在Waymo数据集上仿真交通,并且沿速度、加速度等轴直接操控行为,比纯模仿模型多了可控制性,做自动驾驶仿真的可以看看。原文稍后读已读值得跟进有用关注 CNeVA
09:29官方账号arXiv cs.AI@Chaitanya Shinde, Hadi Hajieghrary, Paul Schmitt, Adam Shoemaker, Bodo Seifert, Steve Kenner这篇论文针对自动驾驶汽车(AV)中缺乏人类驾驶员的情况,重新审视了ISO 26262功能安全标准中的可控性概念。作者将可控性分解为两个可审计的证据维度:可转移性和可预测性。可转移性衡量AV系统将控制权移交给专用后备安全机制的能力,而可预测性则量化外部实体预测AV行为的难易程度。论文还引入了设计能力与可实现能力之间的差距,以区分架构后备声明与场景条件下的实际后备能力。这些指标与ISO 26262和ISO/PAS 21448(SOTIF)兼容,使后备和交互声明在ODD切片上可证伪和可追溯,从而将标准扩展到SAE L4和L5级无人驾驶系统。论文自动驾驶功能安全ISO 26262推荐理由:自动驾驶安全工程师和标准制定者终于有了量化可控性的方法——可转移性和可预测性让ISO 26262在L4/L5场景下可落地,做功能安全验证的团队可以直接参考论文中的数学框架来改进测试用例。原文稍后读已读值得跟进有用关注 自动驾驶
22:33AI Notkilleveryone@ai_zona精选AI 代理系统在生产环境中运行时,如果没有适当的控制机制,可能会执行意外或有害的操作。审批门(Approval gates)是一种关键但常被低估的功能,它允许人类在代理执行关键操作前进行审核和批准。本文解释了为什么每个生产级 AI 代理部署都需要审批门,以及如何实现它们来确保安全性和可控性。AI产品AI代理审批门生产部署推荐理由:做 AI 代理系统部署的团队,审批门能防止代理失控造成损失,建议立即检查你的系统是否具备这一功能。原文稍后读已读值得跟进有用关注 AI代理