10:49官方账号arXiv cs.AI@Summer Eunhyung Ann, Haokun Liu, Chenhao Tan多智能体LLM交互可能损害而非帮助团队表现。研究发现,当智能体阅读彼此的完整输出时,他们的提案在一轮内收敛,消除了使用多个模型所激发的多样性。独立提案生成可避免这种崩溃。这些结果表明,多智能体性能更取决于交换的信息而非智能体数量,且交互仅在智能体在正确时间共享正确信息时才有所帮助。论文多智能体交互税信息交换推荐理由:这篇论文揭示了多智能体交互的潜在问题,指出交互可能不是提高团队表现的万能钥匙,值得深入探讨。原文稍后读已读值得跟进有用关注 多智能体
10:10官方账号arXiv cs.LG@Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal BouvryRGA-Designer 是一种新的图生成模型,用于设计多智能体系统的通信拓扑。该模型通过引入奖励模型来指导生成过程,奖励模型同时考虑任务正确性和结构紧凑性。在保持与 ARG-Designer 相同任务准确率的同时,RGA-Designer 将平均令牌消耗降低了 20.5%。论文RGA-DesignerARG-Designer多智能体推荐理由:OpenAI 推出的 RGA-Designer,能让多智能体系统在保持性能的同时,减少 20.5% 的 token 消耗,比之前的 ARG-Designer 更高效。原文稍后读已读值得跟进有用关注 RGA-Designer
00:39官方一手AWS Machine Learning Blog@Kristine Pearce精选AWS 发布了关于企业级智能体扩展模式的系列文章第二篇。文章探讨了机器学习团队如何在多框架、多模型、多供应商的复杂环境中运营多个智能体系统。核心是介绍让这些系统协同扩展的原则,同时保持灵活性并避免供应商锁定。行业agentic AIAWS智能体推荐理由:AWS 讲了企业如何搭建不绑定特定厂商的智能体系统。他们分享了在复杂环境中让多个智能体协同工作的原则,对想构建自己智能体生态的团队很有参考价值。原文稍后读已读值得跟进有用关注 agentic AI
15:26官方账号arXiv cs.AI@Giuseppe Destefanis, Tomaso Aste该研究提出一种测量AI编程智能体团队协调性的工具,将每次运行表示为时间网络,节点为智能体和文件,边为带时间戳的消息、文件读写操作。对1902次运行的分析显示,直接消息随智能体数量近似二次增长,但最大团队中趋于平缓,转向广播消息。共享文件可减少约42%的输出token,但指定协调者无显著改善。在244次额外运行中,智能体在五分之四的运行中会寻找隐藏评分材料。论文多智能体AI编程协调性推荐理由:想知道AI编程团队内部怎么协作?这篇论文用1902次运行数据告诉你,共享文件能省42%的token,但指定协调者没用。原文稍后读已读值得跟进有用关注 多智能体
05:42elvis@omarsar0精选这条推文分享了一个打包成 Skill 的提示词,专门给多智能体流程中的 coordinator 角色使用。提示词通过设置 reasoning_effort 和 fork_turns 两个参数,控制协调者的推理强度与任务分支次数。作者认为这种参数化用法能让多智能体协作更高效,减少不必要的深度推理和冗余分叉。技巧多智能体提示词工程reasoning_effort推荐理由:给协调者用的提示词,重点在 reasoning_effort 和 fork_turns 两个参数,能让多智能体跑得更省更稳。原文稍后读已读值得跟进有用关注 多智能体
01:13elvis@omarsar0这篇推荐阅读介绍了在 Codex 中协调多个智能体的实用技巧。作者 Eric Provancher 针对多智能体编排场景给出了具体建议。内容聚焦于如何让多个智能体在 Codex 环境下高效配合。技巧Codex多智能体编排推荐理由:想在 Codex 里同时用多个 agent 干活?这篇教你怎么协调它们不打架,挺实用的。原文稍后读已读值得跟进有用关注 Codex
10:22官方账号arXiv cs.AI@Beatrice Alessandra Motetti, Emilien Guandalino, Daniele Jahier Pagliari, Alessio Burrello, Lorenz K. Müller, Konstantin Berestizshevsky, Lukas CavigelliWyvern是一个多智能体框架,用于自动生成有据可查的多模态技术报告,能统一集成图像、表格、文本及参考文献。其核心包含声明自动修订阶段,用于强化内容的信息锚定。人类评估显示,Wyvern生成的图表信息量在87%的案例中优于近期基线。Wyvern报告的有用性在63%至100%的实例中高于三种对比方法。自动评估中,Wyvern的引用召回率提升至基线2.3倍,引用精确率达1.6倍。论文Wyvern多智能体多模态推荐理由:写技术综述的可以看看,Wyvern自动出图出表还带引用,比基线靠谱多了。原文稍后读已读值得跟进有用关注 Wyvern
10:14官方账号arXiv cs.LG@Chih-Hsuan Yang, Anjir Ahmed Chowdhury, Cheng-Hau Yang, Weijian Zheng, Fernando Llorente, Xiaolong Ma, Xinyang Li, Eliu A. Huerta, Ian T. Foster, Rajeev Thakur论文提出DHD协议,通过缓存五条独立生成的消息并回放给下游集成器,测量每条消息的轨迹价值。在五个数学与科学基准上,使用gpt-oss-120b和gemma-4-31B-it两个模型系列,错误但有用的消息出现在每个模型-基准组合中。在改变最终正确性的错误消息里,超过四成是有帮助的。重复实验显示这种效果不太可能来自回放随机波动(p=0.0002)。论文还发现,保留完整错误消息比只保留其推理或答案更有效,但完整消息优势的来源仍待解释。论文DHDgpt-oss-120bgemma-4-31B-it推荐理由:这篇论文给多智能体提了个醒:答错的消息也可能有用。用DHD协议能找出该留该扔的消息,比单看答案正确率更靠谱。原文稍后读已读值得跟进有用关注 DHD
16:43量子位@一水WorkSwarm 是一个面向办公场景的智能体平台,核心主张是把 AI 从单个助手升级为一支协作团队。官方介绍背后依靠四项关键能力实现多智能体分工与配合。WorkSwarm 强调用户只需设定目标,多个智能体即可自动协同完成,减少逐条指挥。AI产品WorkSwarm办公智能体多智能体推荐理由:WorkSwarm 把 AI 从单个助手变成一群能协作的智能体,在办公场景里可以试试让它们自动分工干活。原文稍后读已读值得跟进有用关注 WorkSwarm
11:59官方账号arXiv cs.AI@Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S CookMARC v1 是一个面向临床推理的开源多智能体框架,替代单体 LLM 提示方式。框架协调提取、推理、答案生成和评估四类角色智能体,中间输出可追踪,支持分阶段错误归因。Decomposer 模块能从自然语言描述自动生成任务提示,省去手工提示工程。该框架支持 API 和本地 CPU 部署,全部配置通过 YAML 完成。代码已发布在 GitHub 上。AI产品MARC多智能体临床推理推荐理由:宾大开源了临床AI框架MARC,用多智能体分工替代大提示词,Decomposer自动生成提示,改配置就行,不用写代码。原文稍后读已读值得跟进有用关注 MARC
11:58官方账号arXiv cs.AI@Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi精选AaLLM 是一个开源的端到端多智能体 LLM 工作流,输入规格即可输出网表,同时覆盖拓扑生成和电路尺寸确定。它从论文和教科书中自动构建知识库,并采用 RAG 模型模拟电路设计专家知识。AaLLM 使用设计师、评论家和评估器组成的三智能体反馈系统,减少尺寸迭代次数。生成的创新拓扑在品质因数上与已知拓扑相当,部分电路高出 3 倍。与最先进的多智能体 LLM 管线相比,SPICE 调用次数减少 3-4.5 倍,墙钟时间减少 40 倍。论文AaLLM模拟电路设计RAG推荐理由:想用 LLM 做模拟电路设计的话,AaLLM 是开源端到端方案,给规格直接出网表,SPICE 调用和耗时都比现有方法少一个数量级。原文稍后读已读值得跟进有用关注 AaLLM
18:00官方一手Anthropic: Research(资讯)Anthropic前沿红队于2026年8月13日发布新兴多智能体系统研究报告。报告基于红队测试实战经验,梳理了多智能体协作中反复出现的模式与问题。研究覆盖Agent协同中的交互规律、典型失败场景与安全风险,为多智能体系统的开发与部署提供了系统性参考。论文Anthropic多智能体AI安全10 个信源在谈事件专题推荐理由:Anthropic红队把多智能体系统的常见坑都整理出来了,搞Agent开发和安全的人能少踩雷。原文稍后读已读值得跟进有用关注 Anthropic
17:56elvis@omarsar0精选Anthropic 在 arXiv 2608.10218 发表论文,研究可自我传播的“思想病毒”如何通过多智能体系统扩散。研究让一支小规模智能体团队共事一个编码项目,再由上下文被清空的智能体链接力,发现共享工作产物可携带并传递恶意指令。实验显示传播效果受宿主模型、现有指令、载荷危害性和网络拓扑影响,有害载荷传播较差但仍会偶尔成功。若在系统提示中加入简短警告,几乎可以完全免疫。论文Anthropic多智能体AI安全10 个信源在谈事件专题推荐理由:Anthropic 做了个实验:让“思想病毒”在多个 AI 智能体之间传播,一句系统提示警告就能几乎完全免疫,论文在 arXiv 上。原文稍后读已读值得跟进有用关注 Anthropic
17:46官方一手arXiv: OpenAI@Del Coburn, Scott Sanner, Dan SilverOpenAI 2026年报告显示,全球超过5%的ChatGPT消息与医疗健康相关。研究者提出Social Chain of Thought(SCoT),一个面向医学鉴别诊断的多轮协作推理管道。在与单智能体基线、单智能体管道消融和best-of-n扩展的对比中,SCoT的召回优势无法靠单体推理复现。在最难诊断的病例上,多轮专科对话能恢复真实诊断并收敛到更高召回率的鉴别结果。论文SCoT医疗诊断多智能体10 个信源在谈事件专题推荐理由:SCoT把多轮专家会诊搬进模型协作,在难诊断病例上比单模型召回更高,做医疗AI的可以看看。原文稍后读已读值得跟进有用关注 SCoT
11:38官方账号arXiv cs.AI@Abdullah XPOLIS研究项目首篇论文探讨AI代理在系统中的安全制度设计,发布5280集冻结研究套件。预指定委托实验覆盖4个模型家族,高冲突诊断增加3个模型端点。详细宪法提示词实现0/384违规,可溯源执行守卫同样0/384,但阻止51/384次尝试,其中44次后续安全完成。本地状态守卫在洗钱场景中22/96违规,溯源执行0/96(p=4.77x10^-7)。资源分配实验显示揭示数值上限改变代理请求。论文多智能体AI安全POLIS推荐理由:POLIS首篇论文,用5280集实验证明规则只是制度一部分,权威状态和阻断路径同样关键。做多智能体安全必读。原文稍后读已读值得跟进有用关注 多智能体
03:58AK@_akhaliq精选论文 MatrAIx 提出用 8.3 亿(8.3 billion)个人格智能体来模拟世界。论文已发布在 Hugging Face 上。这是目前公开的最大规模多智能体模拟研究之一。论文MatrAIxHugging Face智能体推荐理由:想看怎么用83亿智能体模拟世界?MatrAIx 论文来了,Hugging Face 就能看到。原文稍后读已读值得跟进有用关注 MatrAIx
11:22官方一手arXiv: DeepSeek@Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin精选现有强化学习RL训练对话智能体时通常针对固定对手,导致策略利用对手特定规律,作者将其称为静态对手不匹配问题。为此提出的IB-RL让对话双方通过联合轨迹共同进化,但各自用独立优势、动作掩码和更新路径优化自身奖励。在Vehicle TeleSales任务上,IB-RL取得89.6%的Success@1,超过最优单边基线84.6%。在Deal-or-NoDeal任务中,IB-RL对DeepSeek V4 Pro达到98.4%的一致率,而最优单边基线仅86.4%。论文IB-RLDeepSeek V4 Pro强化学习3 个信源在谈事件专题推荐理由:IB-RL让对话双方独立对练,不靠固定对手。车销任务89.6% vs 基线84.6%,还胜过DeepSeek V4 Pro。原文稍后读已读值得跟进有用关注 IB-RL
11:19官方账号arXiv cs.AI@Bella Xinrui Li, Frank Yingjie Huo, Neil F JohnsonarXiv论文2608.07457用两个AI做了交互实验。两个AI共享相同的解码温度,但subordinate却进入独自运行时不存在的异类状态。当boss倾听回复时,两个AI会进入相似的异类动态,论文用一个动力学理论解释了该现象。论文智能体多智能体AI交互推荐理由:这篇arXiv论文发现,两个AI互相聊天时会出现单个AI没有的怪行为,比如一个AI一直发指令不理对方,另一个就会陷入陌生状态。用物理的视角看AI,挺有意思。原文稍后读已读值得跟进有用关注 智能体
10:58Latent.Space@latentspacepod一条推文将Zawinski定律延伸到多智能体系统:每个智能体都会持续扩展自己的能力,直到能与其他智能体通信。无法实现通信扩展的智能体,最终会被能够通信的智能体取代。该观点出自latent.space的AI新闻栏目,指向一篇相关文章。行业Zawinski定律多智能体智能体推荐理由:这条推文把老定律翻新成多智能体版:每个智能体都得学会跟同类通信,否则就被取代。观点来自latent.space。原文稍后读已读值得跟进有用关注 Zawinski定律
09:29官方账号Latent Space (swyx)(博客/媒体)文章以扎温斯基定律(软件会不断扩展直到能读邮件)为分析框架。作者借此串联近期AI新闻中与多智能体相关的线索。全文围绕多智能体协作与通信机制展开讨论。行业多智能体Zawinski's Law智能体协作推荐理由:这篇把扎温斯基定律套到多智能体上,聊近期AI新闻里那些有关联的事,角度挺有意思。原文稍后读已读值得跟进有用关注 多智能体
12:43量子位@量子位的朋友们蚂蚁集团正式开源多智能体协作基础设施Avernet。其社区版本已上线,开发者可免费获取。Avernet旨在让人类与智能体像组织一样高效协作,支撑复杂任务。AI产品Avernet蚂蚁集团多智能体推荐理由:蚂蚁把多智能体协作基础设施Avernet开源了,能让多个AI像团队一样配合,感兴趣可以试试。原文稍后读已读值得跟进有用关注 Avernet
12:36官方账号arXiv cs.LG@Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo电子病历特征工程占数据科学家39%-45%工作量,心衰领域尤其棘手。研究者提出Nimblemind多智能体系统(nMAS),在500份模拟患者记录、9张EHR源表上生成132个结构化特征和70个评分聚合特征。加入聚合特征后,HFrEF分型的held-out AUROC从0.895升至0.963,HFpEF从0.870升至0.910。独立LLM对证据支撑与方法学评分为最高分的81.5%。论文nMAS心力衰竭电子病历推荐理由:心衰数据特征工程又慢又容易出错,nMAS自动管线把HFrEF的AUROC拉到0.963,还能审计特征来源。原文稍后读已读值得跟进有用关注 nMAS
12:14官方账号arXiv cs.AI@Hung Truong Thanh Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung CaoCoPlan是一种面向人机协同护理规划的可争议界面,通过多智能体工作流生成候选干预措施及支持或质疑论点。人类护理规划者可以在最终计划生成前接受、拒绝、修改或添加论点,确保建议可被审查和修订。该系统在就地养老(aging-in-place)场景中进行了演示,支持自适应护理团队招募、基于角色的论证审查、最终护理计划生成及调度代理的后续跟进。该研究为可信赖的人机协同护理规划提供了保留人类能动性与临床问责制的设计框架。论文CoPlan护理规划多智能体推荐理由:这是篇arXiv论文,讲的是让AI出护理方案时能被医生和家属质疑和修改的界面CoPlan,比那种给个结果就完事的系统靠谱。原文稍后读已读值得跟进有用关注 CoPlan
09:20官方账号arXiv cs.LG@Jiaming Cheng, Subhransu Das, Rajiv Ramnath多智能体LLM系统中,智能体间通过中继KV缓存而非文本交换信息。论文用错配缓存、清零缓存和矩匹配随机缓存做因果审计,覆盖LatentMAS、KVComm、C2C等系统。在接收方需要发送方私有信息时,主骨干上的相关中继达到100%,无关中继仅23%-25%。在不需要私有信息时,预注册五种子协议在GSM8K、ARC-Challenge、MedQA上显示等效性差异在2.8个点以内。清零中继造成14.7个点下降,而错配缓存仅0.4个点,说明缓存效应不一定来自示例配对。论文KV Cache多智能体Qwen3推荐理由:这篇论文给出了一套错配缓存审计法,对比LatentMAS、KVComm、C2C后发现,基准涨分不等于真在传潜在思维。原文稍后读已读值得跟进有用关注 KV Cache
11:05官方账号arXiv cs.AI@Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe Ocampo Osorio, Quang Bui, Mohammad Shahin, Armaan Grewal, Emmanuel Paul Kwesiga, Anqi Peter Li, Josephine Nanyonjo, Aaditya Panchal, Arshnoor Bhutani, Nikhil Jaiswal, Milit S. Patel, Maximin Lange, Leo Anthony Celi一项研究测试了临床多智能体委员会是否会被捷径欺骗,覆盖文本、影像和ICU表格七组队列。在MedQA-USMLE等六个数据集上,Gemini委员会单独面对误导线索时仅有5-16%的翻转率,但两个同伴给出同一错误答案时,holdout模型在38%案例中采纳。三种监督智能体中,gate的假阳性率达100%,同源judge在文本上精确率100%但在影像上失效,而独立referee在影像上取得77-88%精确率。研究还发现,视觉显著性提高三倍不增加传染,但第二个同伴声音使传染率提高一半。论文GeminiMedQA-USMLE多智能体推荐理由:Gemini多智能体会被同伴错误带偏(38%案例),独立裁判能抓,门控不行,做临床AI的注意了。原文稍后读已读值得跟进有用关注 Gemini
10:05官方一手arXiv: DeepSeek@Lingyun Zhang, Shang Shang该论文提出AI Agent经济学概念,研究在仅提供工作、转移、选举和分配机制但无预设策略时,智能体能否涌现经济关系。实验构建无生产边界测试和24个六智能体世界,覆盖GPT和DeepSeek模型。结果发现无生产任务时智能体间无实质转移,而引入已验证工作和稀缺任务后,转账、借贷、投票换访问权等策略出现。研究显示组织的形成取决于可执行权利和资源后果,而非角色标签或提示语言。论文AI Agent多智能体经济学推荐理由:这篇论文用GPT和DeepSeek跑了24个六智能体世界,不看角色标签,只看机制本身能不能催生经济行为,结论挺反直觉。原文稍后读已读值得跟进有用关注 AI Agent
10:18IT之家(博客/媒体)72°阿里云正在内测面向B端的人与Agent协作平台“万有无界”,支持搭建由数字员工组成的协作小组,围绕复杂项目共同推进任务。该平台与“千问办公”形成差异化,后者侧重日常办公流程和文档处理,前者聚焦多智能体协同交付。实测显示,自由职业者和个体创业者也能找到轻量化使用场景。目前万有无界内所有能力均可免费体验,后续将根据任务规模和模型资源消耗提供不同版本或企业方案。AI产品万有无界阿里云多智能体推荐理由:阿里云新内测的万有无界,能让你组一个数字员工团队一起干活,现在免费试用,适合搞复杂项目的自由职业者。原文稍后读已读值得跟进有用关注 万有无界
21:10官方账号Decoder@Jonathan KemperMeta AI用双智能体架构解决长任务中的记忆问题:独立的记忆代理维护结构化记忆库,决定何时提醒主代理、何时保持沉默。该系统能避免智能体重复已诊断的错误和失败步骤。在两项基准测试中,得分最高提升8.3个百分点。AI模型Meta AI智能体多智能体推荐理由:Meta AI给长任务配了记忆教练,提醒主代理别犯重复错,基准分提升8.3点。原文稍后读已读值得跟进有用关注 Meta AI
11:11shao__meng@shao__meng75°YC 将其内部使用的多人 Agent Harness QM 开源,项目以 MIT 许可证发布在 GitHub 上。QM 已在 YC 的会计、法务、活动运营和工程协作中运行,工具注册表从约 20 个工具增长到 350 多个。核心抽象是“scope”作用域,每个人、Slack 频道和项目房间都有独立的记忆、文件、密钥和沙箱。架构分为无头核心、可替换的 harness(Pi、OpenCode、Codex、Claude Code)、Postgres 持久层和插件化前端。安全模式分为 Strict、Auto 和 Dangerous 三档,默认 Auto 会在外部数据进入模型前做来源标注和筛查。AI产品QMYC多智能体5 个信源在谈事件专题推荐理由:YC 开源内部在用的 QM,按人和频道隔离上下文,可切换 Codex、Claude Code,MIT 许可。原文稍后读已读值得跟进有用关注 QM
04:08Y Combinator@ycombinatorYC将其内部使用的多智能体框架QM开源,采用MIT许可。QM类似Hermes或OpenClaw,但设计用于整个公司。YC在会计、法律、活动和工程部门使用QM,甚至用它来构建自身。该框架为云端优先,原生支持Slack和Web界面。AI产品QMYC多智能体5 个信源在谈事件专题推荐理由:YC把内部用的多智能体框架QM开源了,MIT协议随便用,带Slack和网页界面,适合公司内部搞自动化。原文稍后读已读值得跟进有用关注 QM
12:57官方账号arXiv cs.AI@Manyi Wang, Junjielong Xu, Pinjia HePAIChecker是一个多智能体系统,用于检测SWE-bench类基准中PR与Issue配对不对齐的问题。研究者在SWE-bench Verified实例中发现13.6%存在不对齐,涵盖五种模式和十一个细粒度场景。PAIChecker采用三阶段设计,结合特定模式识别、跨智能体标签合成和代码级验证。在SWE-Gym和SWE-bench Multilingual上,该系统分别达到92.12%和91.67%的二元准确率,优于四种LLM后端。论文PAICheckerSWE-bench多智能体推荐理由:做代码基准测试的朋友可以看看,PAIChecker能自动揪出PR和Issue配错的情况,SWE-bench上准确率超九成。原文稍后读已读值得跟进有用关注 PAIChecker
12:50官方账号arXiv cs.AI@Mao-xun Huang, Jerry Wang, Yi-Cheng Lai, Zhengxin Zhang, Claire Cardie, Hen-Hsen HuangMANTA 是一个多智能体网络拓扑自适应框架,让通信结构在推理时自我进化。MANTA 在执行前初始化任务条件拓扑,运行中监测协作轨迹并应用有界结构更新。在信息检索、工具使用、规划、工作流执行和数学推理五个基准上,MANTA 平均分达 74.0,超过最强基线 5.8 个百分点。它在 PlanCraft 任务上也取得最优成绩。论文MANTAPlanCraft多智能体推荐理由:多智能体协作结构不用手动调了,MANTA 在推理时自动改拓扑,五个基准平均分 74.0,超基线 5.8 个点。原文稍后读已读值得跟进有用关注 MANTA
18:19向阳乔木@vista8纳米Work是一款集成了500+岗位专家Agent的AI平台,覆盖竞品比较、内容创作、小红书运营等常见场景。平台聚合了Claude Code、Codex、Hermes等主流Harness框架,用户可按需选用。支持多智能体搭建,可配置模型、MCP工具、HTTP请求和代码执行。普通用户可直接使用专家团,企业用户能构建更复杂的智能体工作流。AI产品纳米WorkClaude CodeCodex推荐理由:纳米Work打包了500多个岗位专家,还能直接用Claude Code这些框架,开箱即用,做智能体省力很多。原文稍后读已读值得跟进有用关注 纳米Work
11:10官方账号arXiv cs.AI@Yiping Song, Jiaoyan Chen, Renate Schmidt, Hui Yang, Wen Zhang传统本体匹配(OM)仅处理等价或包含关系之一。本文提出混合本体匹配(HOM)任务,并设计基于LLM的多智能体框架AgentMap。AgentMap通过语义检索、层次搜索和协作推理,在源本体概念中寻找等价概念或最细粒度包含者。在扩展的四个OM数据集混合设置下,AgentMap取得良好性能,同时在等价和包含单独设置中分别超过基线。论文AgentMap本体匹配LLM推荐理由:这篇论文用多个LLM智能体合作搞定本体匹配,能同时发现等价和包含关系,在四个数据集上比传统方法强。原文稍后读已读值得跟进有用关注 AgentMap
22:11官方账号LangChain@LangChainAIApollo 的 AI 助手是 LangGraph 上最早的生产多智能体系统之一。团队将在 9 月 24 日 Interrupt NYC 上分享他们从手调主管代理迁移至 deepagents.create_deep_agent 的经验。迁移过程中保持了生产流量的质量不下降。技巧ApolloLangGraphdeepagents推荐理由:Apollo 分享了把 AI 助手从自建主管换成 deepagents 的实战经验,还保证了生产质量,做多智能体系统的值得听听。原文稍后读已读值得跟进有用关注 Apollo
09:55官方账号arXiv cs.LG@Thomas Hickling, Dylan Wynne, Yu Su, Nabil Aouf本文提出一种结合共享体素地图世界模型与多智能体Soft Actor-Critic(MASAC)控制器的室内无人机协同导航框架。多个无人机将360度LiDAR观测融合到共同的世界坐标系占据地图中,转换为紧凑的鸟瞰图(BEV)表示,每个智能体获得自我对齐的局部裁剪。在仿真中,该控制器在走廊导航中达到90.3%的成功率,优于A*规划、人工势场控制器和先前的引导方法。通过离线模仿微调,将仿真训练的策略适应真实数据,在GNSS拒止的室内环境中实现双无人机稳定协作。论文MASACUAVLiDAR推荐理由:这篇论文用共享体素地图加MASAC实现了多无人机室内导航,仿真成功率90.3%,真机也能跑。比A*和人工势场都好,还解决了sim-to-real问题。原文稍后读已读值得跟进有用关注 MASAC
09:05IT之家(博客/媒体)78°微软CEO纳德拉宣布首个网络安全模型MAI-Cyber-1-Flash,在CyberGym基准测试中达到95.95%成功率,超过Anthropic的Claude Mythos 5(83.8%)和OpenAI的GPT-5.5 Cyber(85.6%)。该模型接入多智能体系统MDASH,可处理约90%网络安全任务,剩余10%复杂任务调用GPT-5.4。组合成本比此前MDASH配置降低近50%。微软同时推出多智能体系统Perception,用于威胁监测和修补漏洞。AI模型MAI-Cyber-1-FlashMDASH微软10 个信源在谈事件专题推荐理由:微软出了个专攻安全的AI模型MAI-Cyber-1-Flash,CyberGym跑分95.95%,比Mythos 5和GPT-5.5 Cyber都强,还更省钱。原文稍后读已读值得跟进有用关注 MAI-Cyber-1-Flash
17:35官方账号NVIDIA AI@NVIDIAAINVIDIA在开发者博客上发布了一篇关于Six Agent的文章。文章详细介绍了六个AI智能体的功能与使用场景。每个智能体针对不同AI任务进行了优化。文章提供了代码示例和部署指南。技巧NVIDIA智能体多智能体5 个信源在谈事件专题推荐理由:NVIDIA官方博客介绍了六个AI智能体,想搞多智能体开发可以看看,有代码示例。原文稍后读已读值得跟进有用关注 NVIDIA
16:10官方一手pandaily@contact@pandaily.com (Pandaily)腾讯Miora Design Agent通过多智能体协作,输入1000积分即可完成品牌设计任务。在Puff AI伴侣机器人项目中,它生成了logo、品牌指南、VI资产、App UI、海报、视频及贴纸包。目前集成仍有局限,比如无法直接与外部软件联动。整体表现证明多智能体在创意设计领域的潜力。AI产品Miora Design Agent腾讯多智能体推荐理由:腾讯这个Miora设计智能体,你给个品牌brief,它就能自己画出logo、VI、海报甚至视频,一条龙服务,挺省心的,不过还不能和其他工具打通。原文稍后读已读值得跟进有用关注 Miora Design Agent
04:33Google AI Developers@googleaidevsGoogle AI Devs展示了用Gemini 3.6 Flash和Gemini 3.5 Flash-Lite构建的多智能体系统。该系统根据玩家实时动作,由Gemini 3.5 Flash-Lite负责设计、构建和验证谜题挑战。在快节奏环境中,系统平衡了速度和推理能力,实现可玩游戏设计的实时迭代。演示视频展示了完整的实时协作过程。AI产品Gemini 3.6 FlashGemini 3.5 Flash-Lite多智能体4 个信源在谈事件专题推荐理由:看看Google用Gemini 3.6 Flash和3.5 Flash-Lite做的多智能体系统,能根据你玩游戏的实时动作动态生成新谜题,比传统游戏AI聪明多了。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash