12:51John Schulman@johnschulman2精选OpenAI 联合创始人 John Schulman 在 X 上表示期待 Geoffrey Hinton 的新对齐组织。他特别提到 Hinton 2018 年关于 AI 安全辩论的论文是其最爱之一,认为该论文优雅地定义了可扩展监督问题,远超时代。这暗示 Hinton 可能正在组建新的 AI 安全研究团队,引发行业关注。行业AI 安全对齐Geoffrey HintonJohn Schulman可扩展监督10 个信源在谈推荐理由:Hinton 和 Schulman 两位 AI 安全重量级人物联手,关注 AI 对齐的从业者值得跟进这一动向。原文
AITOP5月29日 08:02Opus 4.8发布:编程助手的“静默时刻”,是解放开发者,还是新门槛?🔥Anthropic 把 AI 编程的“确认键”彻底删掉了!Claude Code 搭载全新 Opus 4.8 模型,长时间任务不跑偏、不废话、不中断,像一个资深工程师一样默默干活,从功能开发到漏洞清扫全包圆,你在旁边喝茶等结果就行。过去 AI 写代码三步一问“这样可以吗”,现在它直接交完整交付物……自主编程的最后一层窗户纸,被捅破了。做自动化开发和代码审查的团队,这个模型建议直接上手,效率差距肉眼可见……
11:26arXiv cs.AI@William Overman, Mohsen Bayati精选论文提出校准集体监督(CCO)方法,通过聚合多个辅助评分函数形成惩罚项,衡量AI行为对保守基线的偏离。CCO受可达到效用保留启发,实现集体保守主义:当监督者认为行为无异议时,高效用行为仍被选中,仅在担忧累积时被覆盖。该方法利用共形决策理论在线校准保守程度,确保不良结果低于用户指定阈值,且无需分布假设。在修改版SWE-bench上,较弱监督者成功约束了对抗性更强的智能体;在MACHIAVELLI环境中,CCO在保持奖励的同时大幅减少伦理违规。论文AI安全可扩展监督共形预测保守主义智能体对齐推荐理由:这篇论文解决了超人类AI系统的监督难题,做AI安全和对齐的研究者可以直接参考其理论保证和实验验证。原文