#AI安全
共 2389 条 · 7 天 340 条 · 30 天 999 条 · 话题观测 →
9月29日
用 Claude Opus 5.5 把《认知机器》改编成 p(doom) 音乐视频
有人拿 Opus 5.5 把一本 AI 书做成了 MV,主题是 p(doom),听听机器越快越要减速这版MV长什么样。
arXiv 论文提出 MoralLedger:道德历史可线性操纵 LLM 道德决策
研究者做了个 MoralLedger 框架,发现你之前干过啥会改变 LLM 的道德判断,还能沿一个内部方向直接干预改写它的选择,比单纯改提示词管用。
VLM-Safe-RL:用 CLIP 信号改进安全强化学习,事故率从 31.6% 降至 19.4%
把 CLIP 接进 PPO-Lagrangian 做安全强化学习,MetaDrive Hard 上事故率降了 12 个点,但作者自己发现信号并不能预判碰撞,分析很实在。