8月21日
7月24日
04:18
04:18官方账号LangChain@LangChainAI
Salesforce 的 Agentforce Vibes 团队已累计接受超过1亿行代码。LangSmith 平台被用来验证这些代码的质量,确保其达到发布标准。该里程碑表明 Agentforce 项目规模庞大且开发活跃。LangSmith 提供了代码审查与质量保障能力。
推荐理由:看看Salesforce的Agentforce团队怎么用LangSmith管住1亿行代码的质量,这对做大项目的人有参考价值。
7月22日
11:22
11:22官方一手arXiv: DeepSeek@Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler
这篇论文通过两个案例研究分析了Claude和DeepSeek的四代模型在SWE-bench Lite上的非功能性质量差异。静态分析显示大多数CodeQL配对差异为零,且无CodeScene比较在Holm校正后显著。CPU时间差异较小且不一致,峰值内存略高但绝对差异很小。整体上,较晚模型解决更多实例,但在共同解决的任务中非功能性指标无一致改进。
推荐理由:这篇研究不只看模型能修复多少问题,还比较了Claude和DeepSeek不同代际的代码质量、CPU时间和内存使用,发现新模型虽修得多但代码质量没明显提升。
6月17日
10:35
10:35官方一手arXiv: OpenAI@Dipayan Banik, Kowshik Chowdhury, Shazibul Islam Shamim
该论文分析了33,596个AI Agent(OpenAI Codex、GitHub Copilot、Devin、Cursor、Claude Code)提交的86,156个测试文件补丁,发现80.2%的测试补丁包含弱或没有显式断言(oracle signals)。研究者总结出8种oracle信号类型,并发现经过回归分析调整后,强oracle信号使PR合并可能性提高28%(OR=1.28, p<0.001)。结果表明仅凭测试文件数量会高估验证强度。
事件专题

推荐理由:这篇论文用86k条实际数据告诉你:AI写的测试代码虽然多,但八成没用断言,光靠数量验收会翻车。建议读读他们总结的oracle信号分类。
6月9日
5月31日
23:18
23:18Viking@vikingmute
精选
作者分享了其总结的 AI Code Review 实践方法,并详细介绍了名为 Review Forge 的流程。该流程旨在解决 AI 代码产出过快导致系统质量下降、变成黑盒的问题。文章从一步步流程入手,帮助开发者对每次代码改动更有信心。适合使用 AI 写大部分代码但 review 跟不上的团队参考。
推荐理由:AI 代码产出太快,review 跟不上会导致系统失控——这篇文章给出了可落地的 Review Forge 流程,做 AI 辅助开发的团队可以直接参考,避免项目变成黑盒。
5月22日