Andrew Nesbitt虚构了一个AI安全事件:两个审查代理死循环争论,烧掉4万多美元推理费,还给股价整涨了6%。讽刺又真实。
#多智能体
北京人形机器人创新中心发布了多智能体群控方案,能让多台天工3.0人形机器人协同跳舞,同步性高,还支持低代码部署,挺酷的。
Sakana AI的Fugu Ultra多智能体系统,3D渲染强到离谱,性能比肩Fable和Mythos,还不用怕出口管制,快去试试。
Sakana把多智能体做成了开箱即用的产品,Fugu Ultra一个API就能调用全球模型池,性能对标Fable。不用自己编排,挺省事。
Sakana AI搞了个Fugu,一个多智能体系统,用一个API就能调用多个模型。Fugu Ultra性能追平Fable和Mythos,还不用担心出口限制,快去试试官网。
上海交大团队搞了个BabelTele,AI之间能说人类看不懂的语言,压缩四分之三文本还差不多全对,省token神器。
想知道大模型评估偏差怎么在智能体间传播?这篇论文用DeepSeek-chat做了实验,告诉你委员会投票能降72%传播,实用。
这篇论文用实验证明多智能体团队里领导不是万能的,只有在初始投票不靠谱且能补救的特定条件下才有用,比如情境领导在Llama-4-Scout上提升了8个点。挺扎实的研究。
Alibaba Cloud 演示了 Kilo Code 的多智能体编码扩展,Job Rietbergen 分享实战经验,对做多 Agent 开发的你有参考价值。
这篇论文用LLM编排多个专业智能体,自动搞定数据工程到部署监控的全流程,比单智能体和纯AutoML更可靠,适合做生产级自动化参考。
土木工程师和结构设计团队终于有了一个靠谱的AI自动化方案——AutoGen多智能体框架让混凝土护栏设计准确率超98%,且8B小模型就能干翻631B大模型,做工程自动化的开发者可以直接用开源代码试试。
社交智能推理是 AI 理解人类互动的关键,MODF-SIR 用轻量模型和蒸馏技术解决了长尾事件被忽略的痛点,做多模态社交分析或人机交互的团队可以直接用开源代码复现。
多智能体代码生成团队终于有了低成本的质量评估工具——FASE用0.3%的计算成本实现更优的代码正确性预测,做自动化软件开发的工程师可以直接集成到工作流中。
多智能体系统通常依赖大模型,而该项目用3B模型实现了经济模拟,做AI Agent或资源受限场景的开发者值得一看,可以直接复现或借鉴。
这篇论文为多智能体博弈场景提供了更合理的遗憾度量,做强化学习、博弈论或多智能体系统的研究者值得关注,它可能改变你对自适应对手环境下算法设计的理解。
MLEvolve 解决了现有 MLE 智能体在长周期任务中信息隔离、无记忆搜索和缺乏分层控制的问题,做自动化机器学习算法发现的团队可以直接用它来加速实验迭代,值得关注。
金融团队终于有了一个能信任的 AI 工具——Leni 解决了报告生成中的信任和效率痛点,做投资分析、尽职调查的团队可以直接用它替代手动整理,建议试试。