8月24日
05:34
8月23日
21:34
00:04
00:04官方账号Simon Willison’s Weblog博客/媒体
精选
使用编码代理的关键技能是自信地指导他们进行更改,并验证这些更改是否正确应用。有时这需要审查他们所写的每一行代码,但还有其他方法可以达到这个目标。审查每一行代码从未是验证软件更改的最有效方式。
推荐理由:想要提高代码审查效率,可以尝试使用编码代理,它不仅能帮你审查代码,还能以更高效的方式验证更改的正确性。
8月22日
18:03
8月21日
8月7日
8月3日
09:23
09:23官方账号arXiv cs.AI@Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. Rigby
ARCTIC 是一个面向 AI 生成代码的代码批判系统,核心能力包括意图预测、漂移检测和代码聚焦。系统基于 1.8 万条真实代码评审归纳出六主题分类法。离线评测中,意图预测 F1 达 0.86,漂移检测与人工标注的 QWK 为 0.907,代码聚焦在质量估计上比基线 AI 评审员好 2.4 倍且 token 消耗减少 5 倍。试点中漂移评分让代码错位额外降低 5.76 个点(p=0.026),意图预测获 90.2% 认可。
推荐理由:这篇论文提出了 ARCTIC,专门解决 AI 写代码太多、人工审不过来的问题。它用意图预测和漂移检测揪出真正需要人看的改动,比传统工具更准更省 token。
7月25日
01:27
01:27官方账号LangChain@LangChainAI
FactoryAI CTO Eno Reyes 在 LangChain 的推文视频中展示了成本对比。针对同一代码审查任务,不同模型框架产生的价格差异极其显著。他强调一个优秀的模型无关框架可以让任何模型在该任务上更经济高效。
推荐理由:FactoryAI 技术负责人用真实数据告诉你,换一个框架做代码审查,成本能差多少倍,很实用。
7月24日
05:46
7月22日
03:29
03:29官方一手@OpenAIDevs@OpenAIDevs
74°
OpenAI 推出新功能,Codex Code Review 现在支持在 AGENTS.md 文件中定义自定义仓库规则。用户可以将审查者反复提到的常见问题写为简洁规则,让 Codex 捕获仓库特定问题,即使相关上下文被隔离。该功能提升了代码审查的准确性和针对性。
事件专题

推荐理由:Codex 代码审查现在能用 AGENTS.md 配置你的仓库专属规则了。把团队常见的检查点写进去,Codex 就能帮你自动抓私有仓库的特有问题。
00:39
7月19日
12:58
12:58官方一手Claude Code: GitHub Releases@ashwin-ant
Claude Code v2.1.215 取消了自动运行 /verify 和 /code-review 技能的机制。用户现在需要通过明确输入 /verify 或 /code-review 命令来主动触发代码验证和审查。这一改动避免了不必要的自动检查,让开发者按需调用。
事件专题

推荐理由:Claude Code 新版改了,自动校验和审查不再自动跑,需要你手动调用了。
7月11日
00:52
00:52官方一手GitHub Blog@Napalys Klicius
精选
GitHub团队发现,为Copilot代码审查引入更强大的工具反而导致性能下降。他们将Copilot的代码审查工作流迁移到共享Unix风格代码探索工具,并围绕pull request证据重构agent流程。这一改进显著降低了代码审查成本,提升了审查效率。
推荐理由:GitHub分享了改进Copilot代码审查的真实案例:不用更花哨的工具,而是用共享Unix工具调整工作流,成本确实降了。
7月10日
03:15
03:15coderabbitai@coderabbitai
CodeRabbit测试了GPT-5.6的两个变体Sol和Terra。Sol在遵循长任务、保持仓库上下文和代码审查基准中展现了更好的召回。Terra作为更便宜的选项适用于小范围工作。报告对比了Fable 5和Opus 4.8的定价与性能。

推荐理由:CodeRabbit实测了GPT-5.6的两个版本,Sol在代码审查中召回更强,Terra则更省钱。对比Fable 5和Opus 4.8,想升级编码工具可以看。
7月8日
01:39
01:39The Rundown AI@therundownai
精选
DoorDash 发布 DashBench 测试,用 105 个历史代码变更评估 AI 代码审查。双模型架构中,Kimi K2.6 负责快速扫描,Claude Fable 5 深入分析。组合方案捕获 65.2% 的真实问题(全 Anthropic 方案为 53.6%),并抓住 8/10 的关键 bug。成本从每变更 $3.91 降至 $3.81。
事件专题

推荐理由:DoorDash 搞了个新基准,用开源 Kimi K2.6 配合 Claude,更便宜还能多抓 bug,做代码审查的可以试试这个搭配。
7月3日
06:48
06:48cat@_catwu
精选
Anthropic发布了内部工具Claude Tag,覆盖工程、产品、数据、销售、营销等团队。该工具内部版本能实现65%的产品pull request成功落地。CEO和CTO分享了从Claude Code到Claude Tag的演进路径及安全设计原则。Claude Fable 5模型现已集成到Claude Tag中。
事件专题

推荐理由:Anthropic搞了个内部神器Claude Tag,能让65%的PR直接过,从CEO到码农都在用,还有Claude Fable 5加持,生产力直接起飞。
6月30日
08:30
08:30coderabbitai@coderabbitai
精选
两年前业界普遍认为AI将加速代码审查,实现同等工作更短时间。实际数据反驳了这一假设:AI审查发现的问题数量增加约1.7倍,逻辑错误增加75%,安全漏洞增加约2倍。代码审查的瓶颈从编写转移到了审查环节。

推荐理由:别以为AI真能帮你省时间——数据说反而多了1.7倍的问题和两倍的漏洞,搞代码的要警惕这个新瓶颈。
6月28日
6月23日
12:34
12:34官方一手arXiv: OpenAI@Haoran Yu, Lifei Liu, Xiaochong Jiang, Yuwen Jia, Su Wang, Pin Qian, Yihang Chen
一项基于AIDev数据集的长达七个月的纵向分析(400名重复审查者,共11,429条审查记录)发现,审查者对AI生成代码的批准率从30.1%上升至36.8%(Wilcoxon符号秩检验p<10^{-6})。随经验增加,批准率累计差距达14.5个百分点。与此同时,行内评论量下降22%(p=0.0014),但审查延迟增加3.5倍。这种模式提示审查者可能因工作负荷而产生习惯性麻木,而非理性信任调整。
事件专题

推荐理由:这篇论文用真实数据告诉你,人类审查AI代码时会越来越松懈——批准率涨了,评论却少了。做AI代码审核的团队应该看看。
6月21日
6月19日
10:58
10:58coderabbitai@coderabbitai
CodeRabbit 发布 CLI 更新,新增 light mode 模式,使代码审查运行速度提升 1.5 倍。用户可通过运行 `coderabbit --light` 命令启用该模式。该优化旨在减少 AI 代理循环中的代码审查瓶颈,提升开发效率。

推荐理由:CodeRabbit 搞了个 light mode,代码审查快了 1.5 倍,跑 agent 流程时瓶颈少多了,直接用命令行就能开。