21:38官方账号NVIDIA AI@NVIDIAAI精选NVIDIA AVO通过持续检查、规划、实施和评估,利用内存、工具和执行反馈来构建学习成果,实现长任务中的持续进步。阅读关于AVO及其为长周期自主智能体构建的过程:nvda.ws/3S5qdS1AI模型NVIDIA AVO自主智能体持续优化2 个信源在谈事件专题推荐理由:NVIDIA的AVO系统持续优化,适合长周期自主智能体,与现有模型相比,进步更持续。原文稍后读已读值得跟进有用关注 NVIDIA AVO
08:47IT之家(博客/媒体)82°据 The Information 8 月 1 日报道,OpenAI CEO 奥尔特曼在 7 月 29 日的国会山闭门会见中展示了新模型 Astra。Astra 主打长周期任务处理能力,能把任务拆分给多个智能体协同完成。奥尔特曼当天会见了参议员 Raphael Warnock 和 Bernie Moreno,并计划与 Mark Warner 会面。AI模型OpenAIAstra智能体10 个信源在谈事件专题推荐理由:OpenAI 新模型 Astra 能让多个智能体拆任务协同,专攻长周期复杂任务,不是单个模型硬扛。原文稍后读已读值得跟进有用关注 OpenAI
02:12AI Engineer@aiDotEngineerRLanceMartin 在视频中讨论了构建有效智能体(agents)的四个核心主题:解耦大脑与工具(3:21处)、使用验证器(6:20处)、自我学习与记忆(10:11处)、全局/组织级利用(16:08处)。该教程基于Claude模型,针对长周期任务设计,提供具体实施框架。视频源自AI工程师频道的第三次专访,时长约20分钟。技巧ClaudeRLanceMartin智能体推荐理由:想用Claude做复杂长周期任务?这个教程讲了四个实操要点:脑子跟手分开、加验证器、自己学习记忆、整组织级别控制。别错过。原文稍后读已读值得跟进有用关注 Claude
11:06官方账号arXiv cs.AI@Shengguang Wu, Hao Zhu, Yuhui Zhang, Xiaohan Wang, Serena Yeung-Levy73°AutoMem 框架将 LLM 的记忆管理视为可训练技能,通过两轮优化自动改进。第一轮由强 LLM 审查完整轨迹并迭代修改记忆结构(提示、文件模式、动作词汇)。第二轮从多个回合中识别出好的记忆决策,作为训练信号直接提升模型记忆熟练度。在三个程序化生成的长周期游戏(Crafter、MiniHack、NetHack)中,仅优化记忆(不修改任务动作行为)使基础 32B 开放权重模型性能提升约 2-4 倍,达到与 Claude Opus 4.5 和 Gemini 3.1 Pro Thinking 等前沿系统竞争的水平。论文AutoMemLLM记忆管理1 个信源在谈事件专题推荐理由:想让你家 32B 模型在长任务上干翻 Claude 和 Gemini?试试 AutoMem——不动任务行为,只优化记忆管理,效果翻倍。原文稍后读已读值得跟进有用关注 AutoMem
01:15AK@_akhaliqOSWorld2.0 是一个新发布的基准测试,专门用于评估计算机使用智能体在长周期真实世界任务中的表现。该基准包含 100 个任务,每个任务平均需要 10 步以上才能完成。相比 OSWorld 1.0,新版本增加了更多涉及多步骤规划和错误恢复的场景。测试结果显示,当前最先进的模型(如 GPT-4o)在 OSWorld2.0 上的成功率仅为 15.3%,表明长周期任务仍是 AI 面临的关键挑战。AI模型OSWorld2.0基准测试智能体推荐理由:想看看 AI 在真实电脑操作上能走多远?OSWorld2.0 拿 100 个长任务测智能体,GPT-4o 都只拿到 15% 成功率,差距一目了然。原文稍后读已读值得跟进有用关注 OSWorld2.0
11:12官方账号arXiv cs.AI@Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu网络上有大量多模态、异构、嘈杂的程序性知识,但直接用于智能体执行长周期任务效果不佳。研究者提出 guide-to-skill 学习问题,并发布首个基准 MMG2Skill-Bench。他们设计的闭环框架 MMG2Skill 能将人类指南编译为可编辑技能,在执行时条件化固定视觉语言模型,并通过轨迹级根因反馈持续修正技能。在 GUI 控制、开放游戏和策略卡牌等六个 VLM 骨干上,该方法比基线提升 12.8 到 25.3 个百分点。消融实验表明,直接提示原始指南反而会降低性能,而结构化技能构建和轨迹驱动修正是关键。论文智能体技能蒸馏多模态推荐理由:做智能体长任务规划的团队终于有了把网络教程变成可执行技能的方案——MMG2Skill 直接解决了指南与技能之间的鸿沟,做 GUI 自动化或游戏 AI 的开发者可以试试这个闭环框架。原文稍后读已读值得跟进有用关注 智能体
09:54Harrison Chase@hwchase17LangChain 推出 Managed Deep Agents,旨在简化构建和部署需要长时间运行、使用工具、保持上下文并生成产物的智能体。该服务目前处于私有预览阶段,团队可通过私信申请访问。已有团队在构建支持与分类、研究、编程、数据分析和内部运营等类型的智能体。这降低了长周期智能体的开发门槛,适合需要复杂任务自动化的开发者。AI产品LangChain智能体长周期任务推荐理由:LangChain 把长周期智能体的部署门槛降下来了,做支持、研究或数据分析自动化的团队可以直接申请试用,省去自己搭建基础设施的麻烦。原文稍后读已读值得跟进有用关注 LangChain
05:08官方账号LangChain@LangChainAILangChain 发布了 Managed Deep Agents,专为需要长时间运行、使用工具、保持上下文并生成产物的智能体设计。该产品支持多种应用场景,包括客服与分类智能体、研究智能体、编程智能体、数据分析智能体和内部运营智能体。它解决了传统智能体在长周期任务中上下文丢失和工具调用不稳定的问题。团队可以基于此构建更可靠、更自主的自动化工作流。AI产品LangChain智能体长周期任务推荐理由:做复杂自动化任务的团队终于有了专门的长周期智能体方案——LangChain 的 Managed Deep Agents 解决了上下文丢失和工具调用稳定性问题,做客服、研究、编程或数据分析的开发者可以直接用来构建更可靠的自主工作流。原文稍后读已读值得跟进有用关注 LangChain
05:19AI Engineer@aiDotEngineer精选Anthropic 举办了一场 75 分钟的工作坊,由 Ash Prabaker 和 Andrew Wilson 主讲,展示了如何构建能够持续运行数小时的智能体,而非传统智能体仅能存活几秒。工作坊聚焦于解决智能体在长时间任务中的持久性和可靠性问题,提供了实用的构建方法和设计原则。这对于需要执行复杂、长周期任务的 AI 应用开发者具有重要参考价值。AI产品智能体Anthropic长周期任务9 个信源在谈事件专题推荐理由:做长周期 AI 智能体开发的团队,终于有了可落地的方案——Anthropic 直接给出了让智能体从秒级存活到小时级的方法,建议点开工作坊回放学习。原文稍后读已读值得跟进有用关注 智能体
13:13OpenRouter@OpenRouterAI精选76°OpenRouter 推出了一套用于构建长周期智能体的基础原语,旨在解决 AI 智能体在长时间任务中的可靠性和可扩展性问题。这些原语提供了模块化的构建块,帮助开发者更高效地设计能够持续运行数小时甚至数天的智能体。该发布引起了社区关注,已有近千次浏览,表明开发者对长周期智能体开发工具的需求强烈。AI产品智能体长周期任务OpenRouter推荐理由:OpenRouter 这套原语解决了长周期智能体开发中的核心痛点,做复杂自动化任务的团队可以直接参考,省去自己造轮子的时间。原文稍后读已读值得跟进有用关注 智能体