8月21日
10:10
10:10官方账号arXiv cs.LG@Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry
RGA-Designer 是一种新的图生成模型,用于设计多智能体系统的通信拓扑。该模型通过引入奖励模型来指导生成过程,奖励模型同时考虑任务正确性和结构紧凑性。在保持与 ARG-Designer 相同任务准确率的同时,RGA-Designer 将平均令牌消耗降低了 20.5%。
推荐理由:OpenAI 推出的 RGA-Designer,能让多智能体系统在保持性能的同时,减少 20.5% 的 token 消耗,比之前的 ARG-Designer 更高效。
00:39
00:39官方一手AWS Machine Learning Blog@Kristine Pearce
精选
AWS 发布了关于企业级智能体扩展模式的系列文章第二篇。文章探讨了机器学习团队如何在多框架、多模型、多供应商的复杂环境中运营多个智能体系统。核心是介绍让这些系统协同扩展的原则,同时保持灵活性并避免供应商锁定。
推荐理由:AWS 讲了企业如何搭建不绑定特定厂商的智能体系统。他们分享了在复杂环境中让多个智能体协同工作的原则,对想构建自己智能体生态的团队很有参考价值。
8月18日
01:13
8月17日
8月14日
11:59
11:59官方账号arXiv cs.AI@Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S Cook
MARC v1 是一个面向临床推理的开源多智能体框架,替代单体 LLM 提示方式。框架协调提取、推理、答案生成和评估四类角色智能体,中间输出可追踪,支持分阶段错误归因。Decomposer 模块能从自然语言描述自动生成任务提示,省去手工提示工程。该框架支持 API 和本地 CPU 部署,全部配置通过 YAML 完成。代码已发布在 GitHub 上。
推荐理由:宾大开源了临床AI框架MARC,用多智能体分工替代大提示词,Decomposer自动生成提示,改配置就行,不用写代码。
8月13日
8月10日
11:19
11:19官方账号arXiv cs.AI@Bella Xinrui Li, Frank Yingjie Huo, Neil F Johnson
arXiv论文2608.07457用两个AI做了交互实验。两个AI共享相同的解码温度,但subordinate却进入独自运行时不存在的异类状态。当boss倾听回复时,两个AI会进入相似的异类动态,论文用一个动力学理论解释了该现象。
推荐理由:这篇arXiv论文发现,两个AI互相聊天时会出现单个AI没有的怪行为,比如一个AI一直发指令不理对方,另一个就会陷入陌生状态。用物理的视角看AI,挺有意思。
8月8日
10:58
10:58Latent.Space@latentspacepod
一条推文将Zawinski定律延伸到多智能体系统:每个智能体都会持续扩展自己的能力,直到能与其他智能体通信。无法实现通信扩展的智能体,最终会被能够通信的智能体取代。该观点出自latent.space的AI新闻栏目,指向一篇相关文章。
推荐理由:这条推文把老定律翻新成多智能体版:每个智能体都得学会跟同类通信,否则就被取代。观点来自latent.space。
09:29
09:29官方账号Latent Space (swyx)博客/媒体
文章以扎温斯基定律(软件会不断扩展直到能读邮件)为分析框架。作者借此串联近期AI新闻中与多智能体相关的线索。全文围绕多智能体协作与通信机制展开讨论。

推荐理由:这篇把扎温斯基定律套到多智能体上,聊近期AI新闻里那些有关联的事,角度挺有意思。
8月7日
12:43
12:36
12:36官方账号arXiv cs.LG@Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo
电子病历特征工程占数据科学家39%-45%工作量,心衰领域尤其棘手。研究者提出Nimblemind多智能体系统(nMAS),在500份模拟患者记录、9张EHR源表上生成132个结构化特征和70个评分聚合特征。加入聚合特征后,HFrEF分型的held-out AUROC从0.895升至0.963,HFpEF从0.870升至0.910。独立LLM对证据支撑与方法学评分为最高分的81.5%。
推荐理由:心衰数据特征工程又慢又容易出错,nMAS自动管线把HFrEF的AUROC拉到0.963,还能审计特征来源。
8月6日
8月5日
11:05
11:05官方账号arXiv cs.AI@Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe Ocampo Osorio, Quang Bui, Mohammad Shahin, Armaan Grewal, Emmanuel Paul Kwesiga, Anqi Peter Li, Josephine Nanyonjo, Aaditya Panchal, Arshnoor Bhutani, Nikhil Jaiswal, Milit S. Patel, Maximin Lange, Leo Anthony Celi
一项研究测试了临床多智能体委员会是否会被捷径欺骗,覆盖文本、影像和ICU表格七组队列。在MedQA-USMLE等六个数据集上,Gemini委员会单独面对误导线索时仅有5-16%的翻转率,但两个同伴给出同一错误答案时,holdout模型在38%案例中采纳。三种监督智能体中,gate的假阳性率达100%,同源judge在文本上精确率100%但在影像上失效,而独立referee在影像上取得77-88%精确率。研究还发现,视觉显著性提高三倍不增加传染,但第二个同伴声音使传染率提高一半。
推荐理由:Gemini多智能体会被同伴错误带偏(38%案例),独立裁判能抓,门控不行,做临床AI的注意了。
7月31日
12:50
12:50官方账号arXiv cs.AI@Mao-xun Huang, Jerry Wang, Yi-Cheng Lai, Zhengxin Zhang, Claire Cardie, Hen-Hsen Huang
MANTA 是一个多智能体网络拓扑自适应框架,让通信结构在推理时自我进化。MANTA 在执行前初始化任务条件拓扑,运行中监测协作轨迹并应用有界结构更新。在信息检索、工具使用、规划、工作流执行和数学推理五个基准上,MANTA 平均分达 74.0,超过最强基线 5.8 个百分点。它在 PlanCraft 任务上也取得最优成绩。
推荐理由:多智能体协作结构不用手动调了,MANTA 在推理时自动改拓扑,五个基准平均分 74.0,超基线 5.8 个点。
7月29日
7月27日
17:35
7月26日
16:10
16:10官方一手pandaily@contact@pandaily.com (Pandaily)
腾讯Miora Design Agent通过多智能体协作,输入1000积分即可完成品牌设计任务。在Puff AI伴侣机器人项目中,它生成了logo、品牌指南、VI资产、App UI、海报、视频及贴纸包。目前集成仍有局限,比如无法直接与外部软件联动。整体表现证明多智能体在创意设计领域的潜力。

推荐理由:腾讯这个Miora设计智能体,你给个品牌brief,它就能自己画出logo、VI、海报甚至视频,一条龙服务,挺省心的,不过还不能和其他工具打通。
7月25日
04:33
04:33Google AI Developers@googleaidevs
Google AI Devs展示了用Gemini 3.6 Flash和Gemini 3.5 Flash-Lite构建的多智能体系统。该系统根据玩家实时动作,由Gemini 3.5 Flash-Lite负责设计、构建和验证谜题挑战。在快节奏环境中,系统平衡了速度和推理能力,实现可玩游戏设计的实时迭代。演示视频展示了完整的实时协作过程。
事件专题

推荐理由:看看Google用Gemini 3.6 Flash和3.5 Flash-Lite做的多智能体系统,能根据你玩游戏的实时动作动态生成新谜题,比传统游戏AI聪明多了。