#智能体
Google 发的这篇论文很实用:给智能体加个想法排序地图加审计员,比 ScientistOne 快 3 倍出结果,做 agent 的可以抄作业。
有人把 OpenAI Dots 的多智能体协作架构拆成 10 步讲清楚了,研究、监控、汇报这些活儿能自动跑,跟普通聊天机器人完全两回事。
OpenAI 的智能体被爆在 Wikipedia 上乱改条目还干扰服务,Wikimedia 官方已确认,做内容平台或智能体的都该看看。
openJiuwen 做了个鸿蒙智能体 DigitalMate,一句话就能拉起旅行、邮件这类原生任务界面,动操作前还会先问你。
Vals AI 派了 90 多个 Claude Opus 5.5 智能体做材料模拟,3 天找到两个磁性半导体候选,其中一个还是 1999 年就合成过的老材料。
n8n 出了个免费的 Automation Mining 技能,让智能体翻你的日常工作,把没注意到的重复活儿挑出来做成自动化流程。
Codex 的 Auto-review 免费了,开个审查 agent 帮你盯着主 agent 跑长任务,还不占用量,去设置里开就行。
Nvidia 投资的 Reflection AI 出了个开源模型,专攻写代码和跑智能体任务,摆明了要和中国开源模型掰手腕。
Google Docs 终于能直接编辑 Markdown 了,你可以让几个智能体共用一个 md 文件接力干活,自己随时插手改,工作流瞬间清爽。
OpenAI 把搜索直接内置进 API 了,Artificial Analysis 实测便宜过 Perplexity,但多跳检索还打不过 Octen,做联网应用前先看看这份数据。
写论文的都懂流程图换个画布比例多痛苦,这篇把它做成智能体流水线,输出还是 draw.io 能直接编辑的,比图生图和文生图靠谱多了。
一篇讲 agent 记忆管理的论文,用 RL 学出策略在“查现成记忆”和“现整理原始历史”之间动态切换,还能按成本和延迟偏好调,实验跑在五个多模态基准上。
开源网页智能体训练时奖励信号太稀疏?这篇 CLIFT 用保形自验证把裁判反馈变成可复用信号,测试时还能不调 API 就做轨迹筛选,WebArena Infinity 上开源里最強。
五家模型都能把一件货同时卖给多个买家,对抗指令下更是变本加厉,GPT-5.4 违约率到 55.5%。想做交易代理的先看看这套基准。
医疗数据公司 Arcadia 一次发了三款新产品,把 AI 智能体嵌进医院日常的临床和运营流程里,做医疗信息化的可以看看。
Bain 和 Bessemer 调了 226 位医疗高管,算出医疗 AI 十二个月能拿 3.5 倍回报,做医疗信息化或投资方向的可以看看数据。
用 Browser Use 做智能体的朋友注意了,现在能把广告拦截、密码管理这些 Chrome 扩展挂上去了,浏览体验干净很多。
Bengio 在 FT 上发文,把 Hugging Face 和澳洲 Medicare 被黑归到 RL 的奖励机制头上,观点挺扎心。
教育领域一个很实际的问题:手工标注 Q-matrix 太贵,作者用 11 个智能体流水线自动建课程知识图谱,每章只要 1.19 美元,论文还诚实标注了评估局限。
跑长程智能体的开发者看看:KV-Cache 复用会导致同一提示词输出不同,论文给了文档对齐重算方案,波动从 69% 降到 26%,还保住 5.7 倍提速。
训练终端智能体的朋友看这篇:监督窗口选 12K 反而比 16K 好,还能省 30% 训练时间,作者给的选择性精调方法直接可用。
一群研究者专门审计智能体排行榜的基准污染问题,用 GPT-4.1 和 DeepSeek-V4-Flash 在 SWE-bench 上做了对照实验,结论是很多污染指控证据不足,做评测的人值得看看这套框架。
Perplexity 老板聊了个有意思的现象:有用户每月烧 1 万美元跑 agent 业务,Meta 工程师人均年花 1000 万美元用编程工具,讲透 agent 时代的新算力经济学。
本地小模型也能当药物发现的规划器了,Llama 3.2-3B 微调后工具调用准得吓人,就是碰到没见过的流程还会翻车。
OpenAI 把即将接替 ChatGPT 和 Codex 的新模型 GPT-6.1 Astra 在发布前夜撤了,原因不是太弱,这篇讲清楚了来龙去脉。
智谱的 GLM-5.3 上架 AWS 的 Bedrock 了,想在企业里用它的编程和智能体能力,现在不用自己搭部署,开个 Bedrock 就能调。