05:03elvis@omarsar0精选一篇关于持续学习的新论文提出了一种名为“受保护 harness 演化”的方法。该方法将 harness 组件的更新提议与实际提交分离开来。通过使用持续优化器和持续评估器,该方法在文本推理、多模态感知和开放世界交互等任务上实现了超过10%的相对增益。论文还定义并量化了“harness 级别遗忘”这一现象。论文持续学习智能体harness推荐理由:这篇论文讲的是怎么让AI智能体在更新技能或记忆时,不会把之前学好的东西忘了。它把更新和评估分开,效果比原来好10%以上,对做智能体的人很有用。原文稍后读已读值得跟进有用关注 持续学习
09:19Gary Marcus@GaryMarcusAnthropic技术员工Jess Yan表示,模型与harness无法分离,分离就会损失性能。她认为测试模型时必须搭配harness进行,且会选择Anthropic自建的harness。Gary Marcus转发该言论,称这是神经符号AI的胜利。行业Anthropic神经符号AIharness7 个信源在谈事件专题推荐理由:Gary Marcus转发Anthropic员工的话:模型和harness拆不开,测试必须连着一起测。神经符号AI派觉得这是胜利。原文稍后读已读值得跟进有用关注 Anthropic
00:56elvis@omarsar0该演示展示了基于动态工作流(dynamic workflows)构建的harness框架。框架可根据需要动态生成子代理(subagent),对开放世界游戏的图形和可玩性进行批判与改进。这个示例来自开发者正在构建的另一个开放世界游戏项目。技巧harness子代理动态工作流推荐理由:这个demo展示了怎么让AI自动派生子agent帮你优化游戏画面和可玩性,挺实用的,适合搞游戏开发的人看看。原文稍后读已读值得跟进有用关注 harness
16:56rohanpaul_ai@rohanpaul_ai76°AI 智能体的能力不仅取决于模型本身,更依赖于其周围的系统(称为“harness”),包括记忆、工具、上下文、路由、检查和权限。当前许多智能体被误判为仅由模型驱动,而实际行为受这些系统组件影响更大。论文指出,进步应来自扩展 harness 的三个部分:更好的上下文控制、更可信的记忆、以及更优的工具或辅助智能体路由。长上下文不等于可用上下文,记忆多不等于可信,工具多不等于知道何时使用。两个智能体可能得出相同答案,但一个可能消耗更多 token、做出更冒险的工具调用或携带损坏的记忆。未来前沿不是单纯扩展模型,而是扩展系统纪律。论文智能体系统扩展harness推荐理由:这篇论文点破了智能体评测的常见误区——只看模型不看系统,做智能体开发的团队值得读,能帮你重新思考系统架构的优先级。原文稍后读已读值得跟进有用关注 智能体