7月28日
22:27
7月14日
7月6日
16:30
16:30官方一手Pandaily@contact@pandaily.com (Pandaily)
精选
南京大学在ICML 2026发表论文,发现多智能体系统故障根源来自编排器而非单个智能体。研究使用熵动力学诊断系统退化,实验显示编排器熵值升高可提前预测协作失败。该方法在多个基准测试中识别漏洞准确率达92%。
推荐理由:多智能体系统翻车往往不是单个智能体的锅,而是编排器的问题。南京大学用熵动力学找到了诊断方法。
6月30日
11:32
11:32官方账号arXiv cs.AI@Zihan Guo, Zeyi Chen, Zhiyu Chen, Zicai Cui, Shuai Shao, Bo Huang, Zhi Han, Yuanyi Song, Yuan Yuan, Chenxi Zeng, Xiaohang Nie, Zhengxi Yu, Hanwen Zhu, Junwei Liao, Ming Zhou, Yang Li, Yuanjian Zhou, Weinan Zhang
Clarus是一个用于协调自主研究代理的协作基础设施,定义了项目-代理-资源对象模型。它通过研究应用、数字协作、物理基板和物理世界四个层组织科学协作。在受控论文生成案例研究中,Clarus将研究目标组织成可追溯、可审查、可归因且累积的协作网络。Clarus已在clarus.holosai.io开放访问。
推荐理由:Clarus让多个AI或人类研究者像团队一样协作,能自动拆解科研任务并记录每个贡献,适合想做复杂科学项目的团队。
6月26日
10:50
10:50官方账号arXiv cs.AI@Zhengyuan Liu, Stella Xin Yin, Min-Yen Kan, Nancy F. Chen
本文提出一个概念框架,用于分析协作问题解决中的对话,尤其关注人类-AI和多智能体协作的动态。该框架通过一个层次化两层编码方案,整合认知与非认知问题解决及元认知调节机制。在跨越多个领域的9个数据集上验证了其有效性和泛化能力,发现元认知调节是深层协作的关键区分器。
推荐理由:这篇论文给出了分析对话的实用框架,在9个数据集上测试过,特别点出元认知调节对协作深度的重要性。
6月18日
10:58
10:58官方账号arXiv cs.AI@Zongmin Zhang, Yuyang Lou, Bowen Zhang, Junwu Chen, Ryo Kuroki, Xuan Vu Nguyen, Edvin Fako, Lixue Cheng, Philippe Schwaller
AdsMind提出闭环多智能体框架,通过机器学习力场(MLFF)松弛反馈实现自主纠错。在AA20和OCD-GMAE62基准上分别达到100%和98.8%的成功率。每个案例仅需4.11和4.67次MLFF松弛,比启发式枚举减少约14倍。DFT验证(VASP/PBE)显示,相比开放循环基线,AdsMind在所有测试案例中保持正确的吸附能符号。该框架兼顾可靠性、自反思和可解释性。
推荐理由:AdsMind用物理反馈让AI自纠错,在催化剂吸附搜索中达到近乎完美成功率,比暴力枚举快14倍,值得做计算化学的试试。
6月12日
10:14
10:14官方账号arXiv cs.AI@King Yeung Tsang, Zihao Zhao, Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Semih Yavuz, Shafiq Joty, Hao Wang
多智能体系统(MAS)依赖大语言模型(LLM)进行有效编排,但训练编排器面临监督信号稀缺和计算成本高的问题。本文提出OrchRM,一种自监督框架,通过多智能体执行过程中的中间产物构建胜负对,训练Bradley-Terry奖励模型,无需人工标注。相比依赖昂贵子智能体回滚的现有方法,OrchRM直接在编排层面操作,将训练效率提升10倍(以token使用量计),并将测试时扩展的准确率提升8%。该方法在数学推理、网页问答和多跳推理等多个领域均有效,代码已开源。
推荐理由:做多智能体系统编排的团队终于有了一个低成本、高回报的训练方案——OrchRM 省去了人工标注和子智能体回滚,直接提升 8% 准确率,建议做 MAS 的开发者试试这个开源框架。
02:03
02:03官方账号LangChain@LangChainAI
精选
Rippling AI 采用多智能体系统架构,每个主管智能体下辖三个专业 Deep Agent:读取智能体负责查询结构化数据,RAG 智能体检索非结构化信息(如 HR 文档、手册),行动智能体执行写入操作。主管智能体分析查询并决定调用哪个子智能体。该架构将复杂企业任务拆解为专业分工,提升自动化效率与准确性。
推荐理由:做企业级 AI 应用或 HR 系统集成的团队值得关注——Rippling 的 Deep Agents 架构展示了如何用多智能体分工处理结构化与非结构化数据,直接复用思路可加速自家产品智能化。
6月11日
6月9日
09:25
09:25官方一手arXiv: DeepSeek@Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh
精选72°
该研究分析了多智能体LLM系统中幻觉的动态传播过程,通过500次级联实验追踪事实不一致性。结果显示,3级级联将归一化幻觉分数从0.422降至0.272,但事实准确性从0.789降至0.769,揭示了幻觉抑制与事实保留之间的权衡。不同模型表现各异:LLaMA-3-70B-Instruct幻觉最低,GPT-5.3生成更快但幻觉率更高。领域分析表明,科学领域幻觉较低,抽象领域较高。
推荐理由:多智能体系统开发者终于有了量化幻觉传播的基准——这篇论文揭示了级联深度与事实准确性的权衡,做Agent编排的团队建议仔细看,避免盲目堆叠智能体导致事实失真。
6月3日
08:47
08:47官方账号Google DeepMind@GoogleDeepMind
精选
Google DeepMind 推出了 Co-Scientist,一个基于 Gemini 的多智能体系统,旨在作为科研人员的专属研究伙伴。该系统能够自动生成、辩论并演化针对复杂科学问题的新假设。Co-Scientist 通过多智能体协作,模拟科研团队的工作流程,有望加速科学发现过程。这一工具将帮助科学家更高效地探索未知领域,推动突破性进展。
推荐理由:科研人员终于有了 AI 驱动的协作伙伴——Co-Scientist 能自动生成和优化假设,做基础研究或跨学科探索的团队可以直接用它加速发现,建议点开看看具体怎么用。
5月28日
5月27日