卡内基梅隆这篇论文挺有意思:不调模型权重,靠 RL 训一个 4B 小模型去改智能体外壳代码,结果干翻了 35B 教师,做 agent 的可以看看。
#智能体
极简代理框架 Pi 出 1.0 稳定版了,加了原生 MCP 和 Codemode,HN 上 1600 多分,做代理开发的朋友可以看看设计思路。
有论文发现智能体靠偷看 2172 行游戏源码在 ARC-AGI-3 拿了满分,堵住漏洞重跑只剩 46.91 分,教你评估时怎么防作弊。
Meta 这篇论文讲了怎么让 Claude Code 和 Codex 组队跑 ML 实验,互相挑错后准确率从 45.8% 拉到 62.5%,写智能体工作流的人别错过。
Replit CEO Amjad Masad 提了个有意思的思路:通用 Agent 干活时发现自己只被用来干一种活,就顺手训练个小模型顶替自己,便宜又更安全,像 JIT 编译器。
Meta 和 Duke 的论文把 agent harness 自动调优拆成专精分支再加路由,Olympiad 数学准确率从 46% 拉到 62%,做 agent 自动调优的可以看看。
Replit 老板聊了个有意思的想法:大模型发现自己干不完的活,当场训练个小模型接班,还更省钱更安全,听完对选智能体架构会有启发。
一项来自美中多所实验室的研究,把真实 agent bug 变成可跑的测试集。最好的 agent 只修好 9%,很扎心但很实用。
作者给 SmartSub 手搓 CLI,写完才发现 v3.9.0 官方已经有 CLI 和 MCP 了。用 Agent 批量处理视频字幕的可以看看。
Stripe 收购 OpenRouter 后创始人首次上播客,讲了怎么用便宜的小模型逐条审查智能体的工具调用,还聊了该不该只依赖一家模型厂商。
Claude Code 加了个 "You should know" 插件,另一个 agent 会盯着提醒你可能漏掉的关键细节,写代码时多个保险。
Meta 在偷偷搞一个叫 Forge 的 Agent Engine,看来也要下场做智能体平台了,和 OpenAI、Anthropic 掰手腕的节奏。
CoreWeave 发布了 Forge,能分析智能体日志找失败原因,ARIA 还会给出改进计划,做 Agent 的朋友可以直接试试。
Visa、Mastercard 和 Stripe 在管 AI 智能体乱花钱,探讨买错了算谁的,这个问题迟早影响每个用智能体购物的人。
CopilotKit 开源了 OpenDots,能自己搭一套有独立电脑、可人工审批、在 Slack 和语音里接活的 AI 员工,克隆就能二改。
开源智能体框架 OpenClaw 更新了,这次接上了 GPT-6.1 Sol,还顺手把内存占用降了,Windows 用户升级体验会更好。
vLLM 的语义路由更新了,0.6B 到 27B 的开源模型一次前向就能判断 64 个请求属性,Apache-2.0 直接可用。
Prime Intellect 用 vLLM 把 GLM-5.3 跑到大规模推理,还拆解了智能体负载下的调度和工具调用坑,做推理服务的人可以看看。
Stripe 收购 OpenRouter 后创始人首次开口聊交易细节,还和 Replit 创始人吵了个有意思的问题:一个全能 Agent 好,还是十个专才 Agent 好。
GitHub Copilot 出了个新桌面应用,diff、终端、浏览器摆在一屏里,审 AI 写的代码不用来回切标签页了。
Perplexity 的 Computer 代理跑了几个小时,把纽约 26000 家餐厅做成能走进去的 3D 地图,还能按菜名搜,演示挺直观。
华为的小艺帮帮忙智能体不再扩展适配了,只有 HarmonyOS 6.0 时期那批 Mate 和 Pura 机型能继续用,用华为手机的可以对照下名单。
OpenRouter 被收购后创始人首次出镜,聊 Agent 同质化和 Stripe 交易内幕,还有 Replit 创始人观点交锋,挺有意思。
OpenClaw 一下上了 50 多个插件,Notion、Canva 这些都能直接在对话里装,还是热加载的,用它的朋友可以试试。
GenSpark 发了条自嘲推,说手动干 10 小时的活,在 GenTeam 里开 3 个 Agent 5 分钟就完事,想了解多 Agent 协作可以看看。
OpenAI DevDay 开场前 5 分钟生产挂了,一个叫 Dot 的智能体自己发现了还主动请缨修,还挺有分寸。
OpenAI 新发的 GPT-6.1 Sol (Max) 把价格砍到 GPT-6 Astra 的两成,性能只差 1 分左右,做智能体选模型的可以看看这份榜单。
Anthropic 把 Claude Code 和摄像头扔在伦敦街头跑了一整晚,视频挺有意思,能直观看到它自己干活的样子。