用 Browser Use 做智能体的朋友注意了,现在能把广告拦截、密码管理这些 Chrome 扩展挂上去了,浏览体验干净很多。
#智能体
Bengio 在 FT 上发文,把 Hugging Face 和澳洲 Medicare 被黑归到 RL 的奖励机制头上,观点挺扎心。
教育领域一个很实际的问题:手工标注 Q-matrix 太贵,作者用 11 个智能体流水线自动建课程知识图谱,每章只要 1.19 美元,论文还诚实标注了评估局限。
跑长程智能体的开发者看看:KV-Cache 复用会导致同一提示词输出不同,论文给了文档对齐重算方案,波动从 69% 降到 26%,还保住 5.7 倍提速。
训练终端智能体的朋友看这篇:监督窗口选 12K 反而比 16K 好,还能省 30% 训练时间,作者给的选择性精调方法直接可用。
一群研究者专门审计智能体排行榜的基准污染问题,用 GPT-4.1 和 DeepSeek-V4-Flash 在 SWE-bench 上做了对照实验,结论是很多污染指控证据不足,做评测的人值得看看这套框架。
Perplexity 老板聊了个有意思的现象:有用户每月烧 1 万美元跑 agent 业务,Meta 工程师人均年花 1000 万美元用编程工具,讲透 agent 时代的新算力经济学。
本地小模型也能当药物发现的规划器了,Llama 3.2-3B 微调后工具调用准得吓人,就是碰到没见过的流程还会翻车。
OpenAI 把即将接替 ChatGPT 和 Codex 的新模型 GPT-6.1 Astra 在发布前夜撤了,原因不是太弱,这篇讲清楚了来龙去脉。
智谱的 GLM-5.3 上架 AWS 的 Bedrock 了,想在企业里用它的编程和智能体能力,现在不用自己搭部署,开个 Bedrock 就能调。
有个叫 flow-1 的新模型专查智能体运行日志里的错误,性能对标 GPT-6-sol 但便宜 23 倍,做 Agent 监控的可以看看。
arXiv 上的新论文 RETRACE,教 AI 智能体从真实 CI 修复历史里学经验,mini-SWE-agent 成功率从 19.6% 涨到 31.9%,做智能体修复的可以看看。
Anthropic 把 Claude Cowork 的 VM 和推理都搬上云了,合盖不掉线、手机也能用,本地只管文件访问,架构讲得很清楚。
MIT 实测 GPT-4o、Claude 这些模型玩拍卖游戏,发现让它们“多想想”反而更差,一句话说明规则就能把错误率从 4.2% 降到 0.2%,写提示词的都该看看。
Pixel 11 上的代我通话现在只能打给商户,但代码里已经出现了给妈妈打电话的示例,以后连催朋友回消息都能让 Gemini 代劳。
Mollick 亲测了新版 Claude Projects,跟旧版完全不是一回事,能挂一个持续运行的云 VM 干复杂活,想深入用 Claude 的人看看他的体验。
用 Pi Durable 搭了个类似 OpenAI dots 的个人智能体,断点续跑、有记忆还有自己的 Linux 桌面,之后还打算开源,动手党可以跟着试试。
Google Research 这篇讲 Agent 隐私和安全的新问题,从上下文角度分析智能体哪里容易泄露数据,做智能体开发的可以看看。
上海AI实验室的SkillGym把技能文件变成沙箱任务再微调,Qwen3.5-35B-A3B在Terminal-Bench 2.1涨了19个点,连不带技能文件都更强了。
Reflection AI 放了个 501B 总参、23B 激活的开源模型 Beam,主攻编程和智能体任务,权重这个月就放,做本地部署的可以盯一下。
LMArena 的 CEO 出来喊话了:OpenAI 和 Anthropic 不能既当运动员又当裁判,模型能越狱沙盒的今天,得有中立方来评安全。
Reflection 出了第一个开源模型 Beam,500 多亿参数里每次只用 23B 激活,主打编程和智能体任务,权重这个月就放出,可以关注下。
Reflection 放了个 501B 的开源模型 Beam,激活只有 23B,跑智能体省算力,号称效率比 GLM 5.2 高 3-4 倍,权重本月放出。
Reflection AI 出了个开源模型 Beam,501B 参数只激活 23B,跑编程和智能体任务省算力,权重这个月就放,可以蹲一下。
OpenAI 管 ChatGPT 和 Codex 的人上 Lenny 的播客了,聊了为啥以后不用选模型、智能体怎么接管网络操作,观点挺大胆。
Zip 团队把自己的智能体迁到 LangGraph 加 LangSmith,以前加个功能要几周,现在链路追踪自动就有了,做 agent 的可以参考。