swyx 在 X 上问大家现在主力用哪个编程智能体,评论区能看到 Claude Code、Codex 这些工具的真实使用口碑,选工具前可以来翻翻。
#编程智能体
开发者删日志一直靠手动,这篇论文用 387 个真实案例测了四种编程智能体干这活的靠谱程度,结论是还差得远,但给出了哪些提示信息最管用。
Cua 的 Francesco Bonacci 讲怎么放心让智能体整夜写代码,低质量 PR 怎么处理、为什么补丁不能直接合并,做智能体编程的可以听听。
Replit 的 CEO 在峰会上聊了编程智能体的走向,还给靠大厂模型吃饭的创业公司提了个醒:你的供应商随时可能变成对手。
如果你想给自己的编程智能体加上自动评估能力,LangChain 这个新技能能直接复用仓库上下文和轨迹,挺省事的。
LandingAI 搞了两个 Agent Skills,装上后让 Claude Code 这类编程智能体直接对话里就能搭文档处理流水线,省掉你手写 API 脚本的功夫。
编程智能体模型终于有了更高效的选择——K2.7-Code 在保持 1T 参数规模的同时,将激活参数压缩到 32B,做代码生成和推理的开发者可以直接在 vLLM 上复用现有部署,值得一试。
基准测试更新直接影响了主流编程智能体的排名,做 AI 编程工具选型或评估模型能力的开发者值得关注——Claude Fable 5 新登顶,Codex 也大幅提升,建议点开看具体得分和对比。
程序员若还在怀疑AI编程的价值,这条回顾会颠覆你的认知——三年前的Code Interpreter已埋下智能体种子,现在不关注可能错过职业转型窗口。
做智能体编程评估的团队终于有了公平比较的基准——Claw-SWE-Bench解决了不同框架无法直接对比的痛点,建议做Agent评估的开发者直接用它来测试自己的适配器设计。
Elvis 点出了 AI 模型即将爆发的关键节点,做 AI 工程和智能体开发的团队应该立刻开始规划模型路由策略,避免被单一供应商绑定。
做 AI 编程智能体或评估基准的团队,这篇论文揭示了主流基准(如 SWE-Bench)掩盖的能力差距——强智能体在陌生语言上的元编程策略值得借鉴,建议点开看具体实现方法。
做智能体训练或微调的开发者终于有了大规模合成轨迹数据源——SynthTraces 用双模型对话自动生成 2000+ 条真实代码库交互轨迹,比手动标注高效太多,做 LLM 对齐或 Pi 优化的团队可以直接用。
Conductor 解决了大型组织无法本地开发的痛点,做企业级开发或安全敏感项目的团队可以直接用 Vercel 沙箱体验远程智能体编程,建议点开看看。
Simon Willison 点出了 AI 编程时代被忽视的关键——对话记录比 Git 提交更有价值,做 AI 辅助开发的团队建议立即调整工作流。
做 AI 编程智能体或搜索应用的团队可以直接用上 256k 上下文和视觉能力,Step 3.7 Flash 的 Advisor Mode 能显著提升复杂任务处理效率,值得关注。
RLM论文正在重塑编程智能体的工作方式,做AI编程工具或智能体开发的团队值得关注这一趋势,Claude Code的实践已证明其可行性。
Qwen3.7-Max 在多项基准上追平国际顶尖模型,做 Agent 和编程自动化的开发者可以直接拿来替代闭源方案,尤其是 preserve_thinking 参数对长周期任务很有用,值得一试。
Chollet 用一个生动的比喻点破了编程智能体的本质——不是万能助手,而是需要你设计约束的探索者。做 AI 编程的开发者看完会重新思考如何更有效地使用这些工具,建议点开。