04:18AI Engineer@aiDotEngineer精选Erik Meijer 在 AIE World's Fair 闭幕演讲中介绍了 Automind 和 Universalis interpreter。他引用 @solomonstre 对智能体的定义(“循环中破坏环境的 LLM”)及 @simonw 提出的尚未解决的 Lethal Trifecta 概念。Automind 智能体能够携带自身的可验证安全证明,代码示例使用 Lean 和 Dafny 语言。演讲融合了 Dario、Daniella、Sam 等人物故事和编程示例。AI模型Erik MeijerAutomindUniversalis interpreter推荐理由:Erik Meijer 给智能体加了“自带安全证明”,用 Lean 和 Dafny 验证行为,解决了 Lethal Trifecta 问题,技术宅必须看。原文稍后读已读值得跟进有用关注 Erik Meijer
11:10官方账号arXiv cs.LG@Kai S. Yun, Zeyang Li, Navid AzizanPS2-RL是一种两阶段安全强化学习框架,第一阶段通过safe-arrival价值函数训练备份策略,隐含构建控制不变集。第二阶段利用可微投影层对RL策略进行端到端训练,严格保证安全约束。该方法在最高10维状态的机器人控制任务上评估,较此前可证明安全方法更可扩展且性能更优。PS2-RL不限制底层RL算法,可插入现有训练流程。论文PS2-RL安全强化学习可证明安全推荐理由:安全RL扩展新解法原文稍后读已读值得跟进有用关注 PS2-RL