JHU 与 CMU 论文:4B 小模型可自动改写 Agent harness 代码并泛化到新任务
JHU 和 CMU 让 4B 小模型自己改 agent 的 harness 代码,效果反超 35B 教师模型,做 agent 开发可以试试这思路。
JHU 和 CMU 让 4B 小模型自己改 agent 的 harness 代码,效果反超 35B 教师模型,做 agent 开发可以试试这思路。
CMU 的 Neubig 和 Fried 开了门 AI Agents 课程,视频已经放出 9 讲,资料免费公开,周末正好刷完。
Meta和CMU的新研究:智能体自己管理上下文,不再傻傻丢东西。在BrowseComp-Plus上提升了27%,代码已开源,值得看看。
斯坦福和CMU搞了个新格式叫Agent-Native Research Artifact,它把代码、失败记录都塞进去后,AI理解能力从72%跃升到93%,复现也涨了7个百分点,比读传统论文好用多了。
这项研究戳破了AI基准测试的盲区——如果你在评估智能体工具或做AI产品,会发现现有测试可能误导了你的判断,建议点开看看如何修正评估标准。
Self-Play SWE-RL 解决了编码智能体依赖人类标注数据的瓶颈,做 AI 编程助手或智能体训练的团队值得关注——它展示了智能体自我进化的新路径,看完会对训练数据来源有全新认识。