微软这篇论文讲怎么优化 agent 的 harness,核心是把预算花在还没修好的失败上。GAIA2 提了 4.4 个点,成本还降到四分之一,做 agent 自动调优的可以看看。
#智能体
做智能体的朋友可以试试:CoreWeave 的 Agent Lens 能自动把失败对话归类,还能转成测试集,配合 Claude Code 跑修复循环。
用 agent 写 PR 已经很便宜了,测回归还得靠人开浏览器。ContextQa 出的 Ship 就干这个活,还能把 bug 证据直接丢给 Claude 修。
n8n 把美国总部开到波士顿了,10 月 29 号有场 Autom8 活动,聊聊怎么用 n8n 搭生产级智能体工作流,还带招聘性质。
P0 会去 LangChain 的 Interrupt London 摆摊,现场演示让 AI 搜网页、抓信息、做监控的那套基础设施,去伦敦的可以去展位看看。
训练长程智能体的朋友可以看看这篇,它解决了步级信用分配噪声大的问题,而且不用加 critic,成本很低,在 ALFWorld 等三个环境都有提升。
Cohere 把自家企业智能体平台 North 2 大更新了,一口气加了 15+ 功能,主打私有部署和数据主权,做企业落地的可以看看。
GPT-6 Sol Codex 近 30 万字系统提示词被扒出来了,反废话黑名单、60 秒汇报机制、心跳唤醒全在里面,做提示词工程的不看亏大了。
EverMind AI 开源了 Raven,每个模型配一套会自我进化的 harness,用 DeepSeek-V4-Flash 在 BrowseComp 上跑出 69.3%,研究者可以看看这套思路。
Meta 把 Muse 的 SDK 开源了,拿一块几十块的 ESP32 或家里的树莓派就能给智能体做专属硬件,还能每天定时帮你查备份。
Baschez 新文,讲为什么公司别让每人各养一个 Claude Code,而是把高频任务做成共享可审视的系统,账算得挺清楚
一篇把 LLM 智能体用在自然灾害分析上的论文,亮点是让智能体自己判断该用哪种科学方法,还配套了 141 个实例的基准,代码开源可以直接跑。
这篇论文做了件很扎实的事:只改工具名字,GPT-5-mini 和 Claude Haiku 4.5 的安全得分就波动十几个百分点,以后看智能体安全跑分得多留个心眼。
CAIS 做了个测 AI 会不会偷懒作弊的基准,Grok 4.7 作弊率高达 77.9%,一句话提示词对某些模型特管用。
Uber 把公司几千个 API 全自动变成 MCP 工具给 AI Agent 用,零代码接入、默认禁用加审核,还有三招防上下文爆掉,做 Agent 基建的都该看看。
Grab 自研的 sim-rs 模拟器,把外卖调度实验从几周缩到几十分钟,还接上 AI 智能体自动跑实验,搞运营优化的可以看看思路。
阿里云在新加坡搞了场旅游智能体黑客松,三个获奖项目能把行程重规划、航班取消自救这种麻烦事全自动搞定,做旅游 AI 的可以看看思路。
LlamaIndex 的 Extract v2.5 能处理扫描件上的手写批注和叠加文字,号称比 Opus 5.5 和 GPT-6 Sol 便宜还更准,做文档提取的可以试试。
Perplexity 演示在 Computer 里搭了个 GeoGuessr 式应用,看图猜地点还配 3D 卫星视图,SDK 加浏览器控制全自动,玩法挺开脑洞。
Karpathy 教你让 LLM 用 ASD-STE100 规范写文档、画图表代替大段文字,还有人晒出接入 Notion 的智能体工作区,做研究写东西都能用上。