#多智能体
Cursor 团队晒出的 swarm 实战:用 Opus 规划、Composer 执行,四小时从零写出能通过全套测试的 SQLite,成本只要一千刀出头。工程细节很硬核,值得看他们怎么解决多 agent 的协调问题。
华为云在WAIC 2026上拿出了AgentArts和openJiuwen,专门帮企业把多个AI智能体安全稳定地部署到生产环境,解决协作难题。
网信办刚发了智能体互信互联互操作全球合作倡议,定了十个行动方向,从技术研发到跨境数据流动全包了,想了解全球智能体生态政策走向可以看看。
多智能体协作搜索老是卡壳?论文提出SearchOS,用显式状态管理和管道并行调度解决重复循环,在WideSearch和GISA上全面领先。搞检索智能体可以看看。
这篇论文用LLM智能体模拟政党结盟谈判,设计了MILT和CIS两个新指标来追踪条款来源和影响力,在比利时选举数据上验证了有效性,对政治学和AI研究都很有参考价值。
看这篇论文你就知道,不用微调也能高效提取临床症状。Pythia靠多智能体自己写提示词,敏感度0.76、特异度0.95,比传统词典和BERT都稳,还能本地部署。
Thrad.ai 用 Strands Agents 和 Bedrock 搭了多智能体系统,自动找客户并写邮件,还给出了两种编排模式的成本和性能对比。
这篇论文把LLM智能体在狼人杀中的信念和行为拆开审计,发现加信念能让好人胜率从20%提到39%,但行动和信念不太一致,框架本身是个好工具。
OpenAI刚发的GPT-5.6 Sol太火,但新ChatGPT Work和Codex有坑,Tibo亲自重置额度并认错,还列出了具体修复计划,对使用这两个产品的用户很有参考价值。
Google DeepMind这篇论文把AGI到ASI的四种路径拆解得明明白白,递归改进和多智能体集体两条线特别值得关注。
这篇论文拿多个模型种群跑了几万局游戏,发现换一条规则,事故率能差 58 个百分点,而且匿名化也挡不住针对性消除。做多智能体安全的一定要看。
邬贺铨院士给出了很具体的流量预测数据,对话类流量会大幅萎缩,智能体服务将成为主流。想了解未来网络趋势的可以看看。
官方团队分享了两种省钱的混搭模式:用便宜的Sonnet 5跑大部分任务,偶尔让贵的Fable 5把把关,性能损失不大但预算砍半。
这篇论文提出GaP,把机器人编程的可靠性和模型无关策略的适应性结合起来,在8个变分自动化任务上吊打基线。做机器人任务规划的话值得一看。
蚂蚁和港科大的新框架Skill-MAS,把多智能体经验打包成可复用的元技能,在DeepSeek-V4-Flash上验证有效,做多智能体开发可以看看。
Arxiv上发了篇Copewell的论文,搞多智能体群组做心理支持,用情绪模型路由到不同专家AI,还有伦理监督。想了解AI心理健康新架构可以看看。
想了解多智能体LLM之间怎么互相影响输出?这篇论文给出了可量化框架CAF,还拿DeepSeek和GPT-4o-mini做了实验,能看到图像条件会放大耦合效应。
想知道多智能体怎么一起搞科研、怎么评估数据科学智能体?James Zou 分享了两个新基准,很实用。
多智能体容易各说各话?LLawCo让它们自己学会“必要时说话”“等待伙伴”,在PARTNR-Dialog和TDW-MAT上成功率都涨了4-7个百分点,挺实在的。
这篇论文让AI玩三方狼人杀,发现GPT-4.1狼人总犯傻投票出Jester,而DeepSeek学会了装可疑又不露馅。想看看AI怎么玩心眼?读它。