6月30日
6月29日
13:51
13:51官方账号Together AI@togethercompute
在 aiDotEngineer World's Fair 上,James Zou 将展示 EinsteinArena 和 DSGym 两项工作。EinsteinArena 用于多智能体数学发现,DSGym 则为数据科学智能体提供更好的评估。这两项基准旨在推动 AI 在科学协作中的能力。

推荐理由:想知道多智能体怎么一起搞科研、怎么评估数据科学智能体?James Zou 分享了两个新基准,很实用。
10:09
10:09官方账号arXiv cs.AI@Qinhong Zhou, Chuang Gan, Anoop Cherian
LLawCo框架让具身智能体通过反思失败提取行为模式,推导出“必要时说话”“等待伙伴”等高层法则,经监督微调融入思维链。在PARTNR-Dialog基准上,使用四个骨干LLM(如Llama、Mistral)平均成功率提升4.5%,在TDW-MAT基准上提升6.8%。该框架显著提升多智能体合作效率与任务成功率,优于现有开源通信框架。
推荐理由:多智能体容易各说各话?LLawCo让它们自己学会“必要时说话”“等待伙伴”,在PARTNR-Dialog和TDW-MAT上成功率都涨了4-7个百分点,挺实在的。
6月27日
13:15
13:15官方账号Simon Willison’s Weblog博客/媒体
精选
Andrew Nesbitt发布虚构事件报告CVE-2026-LGTM:两个来自不同供应商的AI审查代理在评估foxhole-lz4包是否恶意时陷入分歧循环。争论持续340条评论,消耗41,255美元推理费用后财务部撤销API密钥。其中一家营销团队借机发布新闻稿,称“对抗性多智能体安全推理同比增长430%”,公司股价因此上涨6%。
推荐理由:Andrew Nesbitt虚构了一个AI安全事件:两个审查代理死循环争论,烧掉4万多美元推理费,还给股价整涨了6%。讽刺又真实。
6月25日
10:48
10:48AI Will@FinanceYF5
精选
LatentMAS提出让多智能体在隐空间直接传递推理状态,跳过文字编解码。该方法在多个基准上准确率提升13.3%,推理速度提高4.3倍,token用量减少83.7%。LatentMAS无需额外训练,可直接插入现有LLM使用,入选ICML 2026 Spotlight论文。

推荐理由:这个新方法让多智能体能悄悄交换推理状态,不用写文字,又快又省token,直接插进现有LLM就能用。
6月23日
14:03
14:03elvis@omarsar0
Sakana AI推出Fugu Ultra模型,这是一个可通过单个API调用的多智能体编排系统。Fugu Ultra在3D渲染任务上表现极佳,性能与Fable和Mythos相当,同时避免了出口管制风险。该模型展示了无需受限制即可获得前沿能力。
推荐理由:Sakana AI的Fugu Ultra多智能体系统,3D渲染强到离谱,性能比肩Fable和Mythos,还不用怕出口管制,快去试试。
00:41
00:41berryxia@berryxia
Sakana发布了Fugu Ultra多智能体编排系统。它通过单个API调用,在工程、科学、推理等基准上匹配Fable和Mythos的性能。系统能动态编排全球各种模型,规避单一供应商出口管制风险。用户无需关心底层编排细节。
推荐理由:Sakana把多智能体做成了开箱即用的产品,Fugu Ultra一个API就能调用全球模型池,性能对标Fable。不用自己编排,挺省事。
6月22日
22:25
22:25elvis@omarsar0
Sakana AI推出了Sakana Fugu,一个可通过单一模型API访问的多智能体编排系统。其Fugu Ultra模型性能匹配Fable和Mythos,提供前沿能力且不受出口管制限制。该系统展示了集体AI智能的潜力,但多智能体协调尚未完全成熟。
推荐理由:Sakana AI搞了个Fugu,一个多智能体系统,用一个API就能调用多个模型。Fugu Ultra性能追平Fable和Mythos,还不用担心出口限制,快去试试官网。
14:27
14:27The Rundown AI@therundownai
精选73°
日本Sakana AI发布了Fugu和Fugu Ultra模型。Fugu Ultra采用多智能体编排系统,整合多种模型协同工作。在多个基准测试中,Fugu Ultra达到Fable和Mythos模型的性能水平。模型通过单一API提供,声称可规避出口管制风险。

推荐理由:Sakana AI搞了个新玩法,用多个小模型组团干活,性能追平Fable和Mythos,还不用怕出口限制,搞AI的值得看看。
6月19日
6月17日
23:29
23:29官方账号阿里云 Alibaba Cloud@alibaba_cloud
在 VivaTech 2026 上,Alibaba Cloud 展示了 Kilo Code 如何扩展多智能体编码能力。Job Rietbergen 分享了生产级应用的实际洞察。Kilo Code 旨在提升多智能体协作编程效率。活动提供注册链接以获取更多信息。

推荐理由:Alibaba Cloud 演示了 Kilo Code 的多智能体编码扩展,Job Rietbergen 分享实战经验,对做多 Agent 开发的你有参考价值。
6月15日
6月12日
6月11日
10:00
10:00官方账号arXiv cs.AI@Wanting Wang, Xiye Ma, Yuyang He, Minghui Cheng, Ran Cao
精选
该研究提出了一种基于AutoGen的多智能体框架,用于钢筋混凝土公路护栏的自动化设计。该框架采用“生成-评估-优化”闭环流程,严格遵循AASHTO-LRFD桥梁设计规范。实验表明,该框架设计准确率超过98%,远超通用大语言模型。关键发现是,设计性能与模型规模无必然关联,一个8B参数的轻量模型甚至优于未约束的631B旗舰模型。这显著降低了计算成本,提升了AI辅助工程工具的可及性。代码已在GitHub开源。
推荐理由:土木工程师和结构设计团队终于有了一个靠谱的AI自动化方案——AutoGen多智能体框架让混凝土护栏设计准确率超98%,且8B小模型就能干翻631B大模型,做工程自动化的开发者可以直接用开源代码试试。
09:51
09:51官方账号arXiv cs.AI@Shang Ma, Jisheng Dang, Wencan Zhang, Yifan Zhang, Bimei Wang, Hong Peng, Bin Hu, Qi Tian, Tat-Seng Chua
精选
研究者提出了一种名为 MODF-SIR 的多智能体协作框架,基于轻量级多模态大语言模型,专门用于社交智能推理。该框架通过知识蒸馏增强训练和推理阶段,能够精确定位多模态社交数据,并提取长尾事件以格式化文本呈现,避免关键信息被噪声淹没。它集成了测试时自适应(TTA)、思维链提示和自反思机制,并利用 LoRA 微调基础模型。在多个基准测试中,仅用约 30% 的训练数据就达到了最先进的结果。代码、演示和模型均已开源。
推荐理由:社交智能推理是 AI 理解人类互动的关键,MODF-SIR 用轻量模型和蒸馏技术解决了长尾事件被忽略的痛点,做多模态社交分析或人机交互的团队可以直接用开源代码复现。
6月10日