7月24日
7月22日
12:56
12:56官方账号arXiv cs.AI@Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini
本教程汇总了基于大语言模型(LLM)的智能体系统在软件工程、科学发现和金融等领域的生产级部署经验。内容涵盖推理与规划、多智能体协调和评估等研究进展,以及来自实际部署的挑战。通过制药发现和金融系统的应用案例,分析了成功设计模式和失败缓解策略,包括验证管线、回退机制和人在环路监督。
推荐理由:这篇论文从实际部署出发,总结了LLM智能体在软件、金融等领域的成功模式和失败应对,比只看benchmark的研究更有实战价值。
7月21日
7月19日
15:59
7月17日
11:27
11:27官方账号arXiv cs.AI@Yuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan, Jin Zhang, Shihan Ma, Yao Yao, Weiran Qi, Chuyan Jin, Guiyu Ma, Xingzhong Xu, Kai Yang, Ji-Rong Wen, Zhicheng Dou
SearchOS是一个系统级多智能体协作框架,旨在解决工具集成大语言模型在信息检索中的重复搜索和预算浪费问题。它通过关系型模式补全和基于引用的证据填充,将隐式搜索进度显式化,并设计了Search-Oriented Context Management (SOCM) 来管理进化状态,包括Frontier Task、Evidence Graph、Coverage Map和Failure Memory。在WideSearch和GISA两个基准上,SearchOS在所有评估指标上均领先于单智能体和多智能体基线模型。
推荐理由:多智能体协作搜索老是卡壳?论文提出SearchOS,用显式状态管理和管道并行调度解决重复循环,在WideSearch和GISA上全面领先。搞检索智能体可以看看。
09:38
09:38官方账号arXiv cs.AI@Haoxuan Li, Tianci Gao, Jianhe Li, Yang Fan, Runze Shi, Weiran Wang, Tianxiang Zhao, Zezhao Wu, Xiaoyang Jiang, Qihui Zhang, Jia Li, Xiao Xiao, Kai Du, Xiaoxuan Jia, Chao Xie, Lu Mi
BrainPilot 是一个完全开源的多智能体系统,旨在自动化脑科学发现过程。该系统包含一个统一脑科学知识库(7233个索引条目)和技能库(72个可复用方法单元),覆盖七个研究领域。每个步骤记录在Graph of Trace中,提供可审计的日志,同时Auditor agent负责检查编造内容。在Agents' Last Exam的三个脑科学任务及自建基准BrainPilotBench-v0上,BrainPilot使用开源骨干模型达到与SOTA框架相当的性能,且成本更低。
推荐理由:脑科学研究有多繁琐你懂的,BrainPilot开源出来帮你自动查文献、做分析、防编造,性能不输顶级框架还省钱。
7月15日
7月14日
7月10日
04:59
04:59官方账号Simon Willison@simonw
91°
GPT-5.6 发布,API 新增程序化工具调用(programmatic tool calling)和多智能体(multi-agent)功能。该版本包含 6 个推理级别和 3 个新模型变体。开发者可通过 API 直接编排工具调用和多智能体工作流。
事件专题

推荐理由:GPT-5.6 的 API 直接支持工具调用和多智能体,开发新玩法更多了,值得试试。
7月9日
7月8日
7月7日
11:33
11:33官方账号arXiv cs.AI@Kaiyuan Chen, Shuangyu Xie, Letian Fu, Justin Yu, William Pacini, Sandeep Bajamahal, Hudson Kim, Jaimyn Drake, Daehwa Kim, Haoru Xue, Jonathan Francis, Christian Juette, Peter Schaldenbrand, Muhammet Yunus Seker, Ruwan Wickramarachchi, Uksang Yoo, Guanzhi Wang, Adithyavairavan Murali, Balakumar Sundaralingam, S. Shankar Sastry, Spencer Huang, Yuke Zhu, Linxi "Jim" Fan, Ken Goldberg
GaP(Graph-as-Policy)是一种多智能体编码框架,从模块化开放机器人技能库MORSL生成含感知、规划和控制节点的有向计算图。它构建内部仿真环境并行排练不同图结构的任务实例,迭代优化图结构与参数以提升成功率和吞吐量。在8个新开放VA任务基准(4个仿真、4个真实世界)上,GaP的成功率显著优于基线方法。论文、代码和数据已开源。
推荐理由:这篇论文提出GaP,把机器人编程的可靠性和模型无关策略的适应性结合起来,在8个变分自动化任务上吊打基线。做机器人任务规划的话值得一看。
11:15
11:15官方账号arXiv cs.AI@Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez
精选
该研究提出了首个多人世界模型,适用于Rocket League等动态物理环境。模型使用5B参数潜扩散架构,在单张Nvidia B200 GPU上以20fps实时生成4人比赛。训练数据为10,000小时游戏回放,模型在5分钟评估窗口内保持分布质量稳定,实际可稳定运行数小时。研究者系统分析了视频编解码器、生成目标和多人条件方案等设计选择。
事件专题

推荐理由:第一个能实时多人互动的世界模型,Rocket League里5B参数跑20fps,还开源了全部代码和数据,值得看看。
11:12
11:12官方账号arXiv cs.AI@Adriana Laurindo Monteiro, Nayse Fagundes, Gabriel Mattos Langeloh, Gustavo de Oliveira Kanno, Priscila Louise Aguirre, Thiago Costa Rizuti da Rocha, Victor Leme Beltran
OptiAgent是一个多智能体框架,能将运筹学问题的自然语言描述转换为求解器可用的数学公式和可执行代码。其架构包含专用智能体提取决策变量和约束,并支持迭代自纠正。引入多循环验证架构,包含四个专门反馈机制,分别针对误解、结构缺陷、数学不一致、验证失败和代码错误。在LP、MILP和非线性规划任务的4个基准中,OptiAgent在3个上取得SOTA,并在剩余数据集上具有竞争力。
推荐理由:运筹学问题用自然语言描述就能自动建模生成代码,OptiAgent在多个基准上SOTA,迭代自纠正机制很靠谱。
7月3日
16:26
16:26官方一手pandaily@contact@pandaily.com (Pandaily)
蚂蚁集团与香港科技大学(广州)联合提出Skill-MAS框架,该框架将多智能体系统设计经验抽象为可重用的元技能。在DeepSeek-V4-Flash等模型上的实验验证了其有效性,能够通过元技能进化机制提升多智能体协作效率,并实现跨场景迁移。此外,Skill-MAS支持动态组合元技能以适应不同任务需求。
事件专题

推荐理由:蚂蚁和港科大的新框架Skill-MAS,把多智能体经验打包成可复用的元技能,在DeepSeek-V4-Flash上验证有效,做多智能体开发可以看看。
7月2日
23:33
23:33Harrison Chase@hwchase17
精选
Deep Agents 是一个开源、模型无关的代理框架。最新更新支持程序化调用子代理,并附有6种常见实现示例。博客与视频教程由 @sydneyrunkle 和 @huntlovell 提供,涵盖类似RLM的操作及代码解释器安全方案。
推荐理由:Deep Agents 开源框架现在可以编程调用子代理了,还给了6种现成方案,适合搭建复杂多代理工作流。
06:05
06:05官方账号LangChain@LangChainAI
精选
LangChain分享了一条观点:如果多智能体系统中每个团队负责一个Agent,本质是在输出组织架构而非优化产品。SierraPlatform的@zackrw解释为何该公司默认每个品牌只配置一个Agent。这一做法强调产品整体效果而非部门分工。
推荐理由:SierraPlatform说多智能体系统不该按组织架构建,一个品牌一个Agent更合理,做AI产品的都该看看。
7月1日
10:14
10:14官方账号arXiv cs.AI@Shiyi Chen, Nicholas Saban, Collin Hargreaves, Huiqi Wang
TreeAgent是一个多智能体框架,通过编译专家决策树与视觉语言模型(VLM)实现自动化偏差标注。其解耦声明式决策(D3)框架允许在不同专家定义的决策结构间零修改泛化。在树高偏差分类测试中,TreeAgent的表现优于监督式机器学习基线,并显著减少了专家标注所需的工作量。
推荐理由:林业标注太费人力?TreeAgent用专家规则加VLM自动标注偏差,比传统监督学习强还省心。