Boltzbit 给出了智能体自我改进的第二条路:直接改权重而不是堆记忆,理论上算力省约 1000 倍,思路很值得琢磨。
全部动态
Ethan Mollick 说那张刷屏的 METR 任务时长曲线该退休了,还给出了替代图,做 AI 汇报的人可以看看。
Meta 给智能体配了个记忆员,专记它犯过的错并适时提醒,把 Claude Sonnet 4.5 成绩从 37.6% 拉到 45.9%,做智能体的可以看看。
Fireworks 的特种智能指数又添新成员,这次是 FactoryAI 的 Legacy-Bench,专门考模型能不能搞定遗留代码系统,做企业级 Agent 的可以关注。
Google 这篇论文拆了 serverless CPU 跑量化小模型的延迟构成,55-70% 耗在加载权重,加内存到 8 GB 就能让推理快近一倍,部署前值得看。
这篇论文做了实验:Agent 记忆里存错一条权限,98.6% 的情况下会照着执行,修正记忆后归零。做 Agent 权限系统的建议看看。
恶意skill会装的时候装乖,用的时候才下手,这篇论文的SkillSonar在GLM-5上把攻击成功率砍到10%左右,讲清了怎么防。
Epoch AI 搞了个叫 FAB 的新基准,让模型看宜家说明书加半成品照片找拼装错误,10 个月内最高分从 28% 冲到 80%。
METR 给 Anthropic 的 AI 研发加速打了个具体分数:1.5 倍。想知道 AI 到底多大程度替代了工程师干活,这个口径很严谨,值得看看。
Salesforce 这篇论文发现公开 RL 环境大多有奖励错误,还给出 RIVER 筛选方法,8B 模型跑分反超随机采样,做 RL 训练的都该看看。
NVIDIA 把公开 Agent Skills 自动转成 RL 训练环境,产出近 8000 条任务,还开源了流水线思路,做 Agent 训练的可以看看。
Google 这篇论文把 agent harness 蒸馏进模型,移除专用 harness 后成功率反而从 23.3% 涨到 44.3%,比带 harness 还高,做 agent 的都该看看。
Boltzbit 和剑桥搞了个新架构,把聊天里的新知识直接编译成 LoRA 权重写进模型,长对话和多轮场景下比 RAG 省算力还更准。
腾讯混元把经典批大小理论搬进了 LLM 强化学习,实测 PPO 吞吐提升 2.29 倍、GRPO 训练省 29% 时间,做 RL 训练的可以看看怎么调参省钱。
腾讯混元做了个新基准 WebCraftBench,用 369 条真实需求测 AI 写网页到底靠不靠谱,测了 17 个模型,和 Code Arena 榜单相关性 0.89。
Google 这篇论文值得做 Agent 的人细读:自动优化 harness 会让你 eval 分数涨但真实任务变差,RRSI 用双向正则化解决了这个问题。
Microsoft Research 研究说机器人不用把推理都塞进本体,放到外部算反而任务成功率更高、效率更好,做具身智能的可以看看。
Stanford 和 Together AI 让 o3-mini、Claude Sonnet 4、DeepSeek-V3 自己商量怎么合作,只练 15 道题就在 AIME 上比理想路由器高 13.4 分,方法写得挺细。
Anthropic 出了份报告,讲有人拿代理偷偷转发用户 prompt 到 Claude API 蒸馏模型,还点出隐私风险,做 AI 产品的人都该看看。
Perplexity 公开了他们训练 Computer 智能体的后训练细节,用 RFT 加自蒸馏纠正错误工具调用,实测失败率降了 21%,做 agent 的话值得看看他们怎么用真实用户会话。
同一模型放进 Claude Code 和 Codex 跑同样的任务,结果居然会一个升一个降,这篇论文用 PowerPoint 重建实验讲清楚了 harness 的影响。
一篇教你怎么标注 on-policy 对齐数据的论文,思路是在 token 层面做修正,LLM 和 Agent 都适用,做对齐训练的可以看看。