00:35掘金本周最热@老王以为文章用公式"Agent=决策引擎+信息视野+执行通道"解释AI Agent的本质。介绍了2022年提出的ReAct循环,让模型交替进行思考与行动。提到Claude Code、千问、豆包等日常工具都属于Agent形态。用"上海到北京3天旅行"的伪代码展示轨迹的消息序列结构。对比了Agent与聊天机器人的差异,强调其能调用工具并循环改进。技巧智能体ReActClaude Code推荐理由:这篇用公式加旅行规划案例拆解AI Agent,比空谈概念的文章实在,看完能跟人讲清楚。原文稍后读已读值得跟进有用关注 智能体
12:40官方账号arXiv cs.AI@Daniel Pearson, Sidney Shapiro, Emiliano Sebastian Gonzalez Venegas, Sanad Al-Khatib, Aurora Pinzón Arzola该论文介绍了基于LangGraph的三种可执行工作流方案:SQL分析带修复循环、智能体RAG带证据门控、人工在环策略审查带中断恢复。每种方案展示了类型化状态、条件路由、确定性工具、重试、中断和检查点恢复的组合方式。论文还对比了LangGraph与ReAct、SDK循环、DSPy等方法的适用场景,强调LangGraph适用于需要显式结构的工作流,而非通用默认选项。每份实践方案均说明了何时LangGraph值得额外结构,以及如何使路由、暂停和审计追踪成为显式产品行为。技巧LangGraphDSPyReAct推荐理由:这篇论文给了三个LangGraph实操例子,告诉你什么时候用它比ReAct或DSPy更合适,特别适合跑长时间有状态的业务流程。原文稍后读已读值得跟进有用关注 LangGraph
23:01官方一手AWS Machine Learning Blog@Christopher Phillippi精选Stripe采用ReAct代理框架构建金融合规系统,通过任务分解将复杂流程拆解为92个原子步骤。系统使用提示缓存技术将推理成本降低40%,同时保持人工监督机制确保审计可追溯性。该设计在Stripe的支付处理场景中覆盖了98%的合规审核任务,漏报率低于0.5%。技巧StripeReAct金融合规推荐理由:Stripe分享了他们怎么用AI代理处理金融合规的真实案例,包括ReAct框架和提示缓存省钱技巧,适合做合规系统的人参考。原文稍后读已读值得跟进有用关注 Stripe
09:44官方账号arXiv cs.AI@Seyed Morteza Ahmadian, Paolo Monti, Carlos Natalino光网络需要意图驱动的闭环智能体管理以提升自主性。该论文首次提出T-API兼容的推理与行动(ReAct)循环。实验使用领域特定复合工具实现了90%的oracle验证正确率。与通用工具相比,token消耗节省了三倍。论文T-APIReAct光网络推荐理由:这篇论文首次把ReAct循环和T-API结合到光网络管理里,领域专用工具准确率更高还省token,值得一看。原文稍后读已读值得跟进有用关注 T-API
10:37官方账号arXiv cs.LG@Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang JiTRACE 提出了一种针对多轮智能体强化学习(RLVR)的 rollout 预算分配框架,解决了因奖励对比不足导致的策略优化效率低问题。传统方法仅在 prompt 层面分配资源,忽略了同一 rollout 中不同回合(turn)前缀的信息量差异。TRACE 将每个 ReAct 风格的思考-行动-观察回合建模为语义节点,形成树状结构,并动态分配预算到最可能产生混合奖励的 prompt 根节点和中间前缀。实验表明,在相同采样成本下,TRACE 在 Multi-Hop QA 等基准上将 Qwen3-14B 的平均准确率提升了 2.8 个百分点。该框架通过增强奖励对比,显著提升了多轮智能体任务的训练效率。论文强化学习智能体预算分配推荐理由:做智能体强化学习或 RLVR 的团队,TRACE 解决了多轮 rollout 中奖励信号稀疏的痛点,直接用树状分配提升采样效率,值得在自家 agent 训练流程中试试。原文稍后读已读值得跟进有用关注 强化学习