精选 AI 资讯 · AI 热点

arXiv cs.LG@Mengyu Zheng, Kai Han, Boxun Li, Haiyang Xu, Yuchuan Tian, Wei He, Hang Zhou, Jianyuan Guo, Hailin Hu, Lin Ma, Chao Xu, Guohao Dai, Lixue Xia, Yunchao Wei, Yunhe Wang, Yu Wang

精选

通用智能体（如OpenClaw）在编程任务上的表现难以用现有SWE-bench准确衡量，因为其不满足Docker工作区、补丁和预测合约要求。为此，研究者推出了Claw-SWE-Bench，一个多语言基准测试和适配器协议，能在固定提示、预算、工作区等公平条件下比较不同智能体框架。该基准包含350个GitHub问题实例，覆盖8种语言和43个仓库，并提供了80实例的轻量版Lite用于快速验证。实验显示，OpenClaw在直接适配器下仅得19.1% Pass@1，而完整适配器可达73.4%，表明适配器设计对编程任务至关重要。该基准将框架和成本作为评估核心维度，数据已开源。

论文基准测试编程智能体 OpenClaw SWE-bench 适配器

推荐理由：做智能体编程评估的团队终于有了公平比较的基准——Claw-SWE-Bench解决了不同框架无法直接对比的痛点，建议做Agent评估的开发者直接用它来测试自己的适配器设计。

原文

6月9日

11:45

arXiv cs.AI@Dun Li, Jiatao Li, Hongzhi Li

精选

这篇论文提出了 MetaAI 递归自设计的操作化证据框架，包含四个标准：可检查的目标系统、元级修改器、反馈导向选择和递归延续。作者将 DGM、STOP、Goedel Agent 和 ShinkaEvolve 等公开系统映射到该框架上，其中 DGM 提供了最直接的证据：经过 80 次迭代，SWE-bench Verified 从 20% 提升到 50%，Polyglot 从 14.2% 提升到 30.7%。消融实验表明开放探索和自我改进都有贡献。论文还提供了 MetaAI-Mini，一个基于 HumanEval 的可复现协议和代码库，但目前尚未包含完整模型运行结果。这项工作为 AI 自我改进提供了系统化的评估方法。

论文递归自设计 MetaAI DGM SWE-bench 可复现性

推荐理由：做 AI 自我改进研究的团队终于有了可对照的评估框架——DGM 的 80 轮迭代提升数据值得参考，建议用 MetaAI-Mini 协议复现验证。

原文

6月8日

09:31

shao__meng@shao__meng

精选76°

一篇大规模实证研究评估了仓库级上下文文件（如 AGENTS.md、CLAUDE.md）对编码 Agent 任务完成率的影响。实验覆盖 SWE-bench Lite 和新建 AGENTBENCH 两个基准，测试了 Claude Code、Codex、Qwen Code 等四种 Agent。结果显示，LLM 自动生成的 context file 在多数设置下导致成功率下降（平均 -0.5% 至 -2%），开发者手写的仅提升 +4%，但步数和成本增加 20% 以上。轨迹分析表明 Agent 会过度执行 context file 中的建议性流程，增加复杂度却未提升成功率。当仓库文档齐全时，context file 与现有文档高度冗余，反而可能有害。

技巧 Coding Agent AGENTS.md 上下文文件 SWE-bench 实证研究

推荐理由：这篇论文戳破了 AGENTS.md 的神话——自动生成不仅没用还更贵，手写提升也有限。做 Coding Agent 工具或维护大型仓库的团队，看完会重新评估是否值得投入 context file。

原文

6月1日

00:09

AITOP6月1日 00:09

OpenAI 发起“Codex for Open Source”：免费赠送 6 个月 Pro 订阅，开源维护者能否迎来 AI 变革？

5月29日

08:02

AITOP5月29日 08:02

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？🔥Anthropic 把 AI 编程的“确认键”彻底删掉了！Claude Code 搭载全新 Opus 4.8 模型，长时间任务不跑偏、不废话、不中断，像一个资深工程师一样默默干活，从功能开发到漏洞清扫全包圆，你在旁边喝茶等结果就行。过去 AI 写代码三步一问“这样可以吗”，现在它直接交完整交付物……自主编程的最后一层窗户纸，被捅破了。做自动化开发和代码审查的团队，这个模型建议直接上手，效率差距肉眼可见……

5月23日

22:17

rohanpaul_ai@rohanpaul_ai

精选72°

论文智能体控制层自然语言 SWE-bench 论文

推荐理由：这篇论文戳中了AI智能体工程化的核心痛点——控制层设计比模型选择更关键，做智能体框架或复杂任务自动化的开发者值得一读。

原文