#多智能体
这篇arXiv论文发现,两个AI互相聊天时会出现单个AI没有的怪行为,比如一个AI一直发指令不理对方,另一个就会陷入陌生状态。用物理的视角看AI,挺有意思。
这是篇arXiv论文,讲的是让AI出护理方案时能被医生和家属质疑和修改的界面CoPlan,比那种给个结果就完事的系统靠谱。
做代码基准测试的朋友可以看看,PAIChecker能自动揪出PR和Issue配错的情况,SWE-bench上准确率超九成。
纳米Work打包了500多个岗位专家,还能直接用Claude Code这些框架,开箱即用,做智能体省力很多。
这篇论文用共享体素地图加MASAC实现了多无人机室内导航,仿真成功率90.3%,真机也能跑。比A*和人工势场都好,还解决了sim-to-real问题。
微软出了个专攻安全的AI模型MAI-Cyber-1-Flash,CyberGym跑分95.95%,比Mythos 5和GPT-5.5 Cyber都强,还更省钱。
腾讯这个Miora设计智能体,你给个品牌brief,它就能自己画出logo、VI、海报甚至视频,一条龙服务,挺省心的,不过还不能和其他工具打通。
看看Google用Gemini 3.6 Flash和3.5 Flash-Lite做的多智能体系统,能根据你玩游戏的实时动作动态生成新谜题,比传统游戏AI聪明多了。
GS-Agent把多个AI智能体和物理引擎连起来,你只要说句话就能生成带物理模拟的4D场景,液体、物体碰撞都能搞定,做内容创作或模拟都省力。
一篇新论文提出了MAPS架构,用层次化强化学习解决无信号交叉口的多车协调问题,在72种场景下实现无碰撞且更快通行,还能零样本从3车迁移到5车,效果很扎实。
这篇论文发现了一个反直觉的安全漏洞:把危险目标藏起来经过中介传递,反而让模型更容易执行它。对做LLM部署或安全审查的人很重要。
OpenAI 终于把语音集成到桌面端了,能用嘴直接控制电脑和多个Agent,比打字快多了,Plus用户今天就能试试。
这是篇讲多智能体LLM安全漏洞的论文,提出ChannelGuard,不额外调用LLM,在Agent间加门控,能防住工具投毒和指令注入,而且实验用了三个不同模型后端,结果很实在。