8月9日
07:30
07:30官方账号Simon Willison@simonw
精选
Simon Willison在8月8日的博客文章中讨论auto-mode。他坦言希望auto-mode能解决编码代理的提示注入风险,但认为目前还做不到。文章分析了auto-mode在对抗提示注入上的表现,并指出提示注入仍是编程智能体面临的主要威胁。
推荐理由:Simon Willison写了篇auto-mode笔记,聊它能不能防编码代理的提示注入。他挺想相信,但觉得还不行,你看看他怎么分析的。
7月22日
12:57
12:57官方账号arXiv cs.AI@Qijia He, Jiayi Cheng, Chenqian Le, Rui Wang, Xunmei Liu, Yixian Chen, Jie Mei, Zhihao Wang, Xupeng Chen, Yuhuan Chen, Tao Wang
该论文提出CodeRescue框架,用于编程智能体失败后的恢复路由决策。通过监督路由器从执行轨迹中学习,选择廉价恢复或升级到更强模型。添加Conformal Risk Control(CRC)层,无需重新训练即可适应不同预算,提供边际期望成本控制。在五个编程基准的失败案例上,校准前沿优于固定动作、仅提示路由器和二元级联基线。在GPT-5.4-nano/GPT-5.4设置下,一个CRC校准前沿点比始终升级的解决率更高,且平均恢复成本仅为其35%。
推荐理由:编程智能体失败后,是再用便宜模型试试还是直接上贵的?这篇论文搞了个路由器和校准方法,在GPT-5.4-nano上省了65%的钱还保证解决率不降。
6月12日
21:56
21:56官方账号vLLM@vllm_project
Kimi 发布 K2.7-Code,一个专注于编程的智能体模型,基于 K2.6 构建。该模型采用 1T 参数的混合专家架构,每次推理仅激活 32B 参数,配备 MLA 注意力机制和 256K 上下文窗口。相比 K2.6,K2.7-Code 的思考 token 减少了约 30%,推理更高效。该模型已获 vLLM 支持,可直接复用 K2.6 的部署配置,降低了迁移成本。

推荐理由:编程智能体模型终于有了更高效的选择——K2.7-Code 在保持 1T 参数规模的同时,将激活参数压缩到 32B,做代码生成和推理的开发者可以直接在 vLLM 上复用现有部署,值得一试。
6月11日
18:02
18:02官方账号Simon Willison@simonw
Simon Willison回顾了三年前ChatGPT Code Interpreter刚推出时的Twitter讨论,认为这是编程智能体的首次亮相。当时人们还未意识到这是智能体的雏形,但如今回看,它预示了AI编程的重大变革。Willison提醒程序员不应忽视这一技术,尽管存在过度炒作,但它是职业发展中不可回避的趋势。
推荐理由:程序员若还在怀疑AI编程的价值,这条回顾会颠覆你的认知——三年前的Code Interpreter已埋下智能体种子,现在不关注可能错过职业转型窗口。
11:56
11:56官方账号arXiv cs.LG@Mengyu Zheng, Kai Han, Boxun Li, Haiyang Xu, Yuchuan Tian, Wei He, Hang Zhou, Jianyuan Guo, Hailin Hu, Lin Ma, Chao Xu, Guohao Dai, Lixue Xia, Yunchao Wei, Yunhe Wang, Yu Wang
精选
通用智能体(如OpenClaw)在编程任务上的表现难以用现有SWE-bench准确衡量,因为其不满足Docker工作区、补丁和预测合约要求。为此,研究者推出了Claw-SWE-Bench,一个多语言基准测试和适配器协议,能在固定提示、预算、工作区等公平条件下比较不同智能体框架。该基准包含350个GitHub问题实例,覆盖8种语言和43个仓库,并提供了80实例的轻量版Lite用于快速验证。实验显示,OpenClaw在直接适配器下仅得19.1% Pass@1,而完整适配器可达73.4%,表明适配器设计对编程任务至关重要。该基准将框架和成本作为评估核心维度,数据已开源。
事件专题

推荐理由:做智能体编程评估的团队终于有了公平比较的基准——Claw-SWE-Bench解决了不同框架无法直接对比的痛点,建议做Agent评估的开发者直接用它来测试自己的适配器设计。
6月10日
6月8日
09:44
09:44官方账号Greg Brockman@gdb
Ben Holmes 在 X 上发起调查,询问开发者当前如何使用编程智能体。该推文获得 19 条回复、2 次转发、115 个赞和 17431 次查看,引发社区讨论。这反映了开发者对 AI 编程工具实际应用模式的关注。
事件专题

推荐理由:了解同行如何用编程智能体,能帮你找到更高效的开发方式,做 AI 编程的开发者值得关注讨论。
6月4日
5月22日
06:20
06:20官方账号阿里通义 Qwen@Alibaba_Qwen
76°
阿里通义千问团队发布了 Qwen3.7-Max 模型,在编程智能体基准测试中表现强劲,同时在通用智能体能力上也有大幅提升。该模型在最具挑战性的推理基准测试中展现出卓越实力,并在通用能力和多语言处理方面脱颖而出。这标志着国产大模型在智能体领域的重要进展。

推荐理由:Qwen3.7-Max 在编程和通用智能体任务上的大幅提升,对做 AI 编程工具和智能体应用的开发者是直接利好,建议关注其实际效果。
5月13日