7月9日
7月2日
05:13
03:17
03:17Windsurf@windsurf_ai
Cognition旗下Devin Cloud发布Security Swarm,基于新型Agentic MapReduce架构,用于检测复杂代码库中的安全漏洞。该工具声称比传统方法成本更低、准确率更高。用户可将发现的漏洞直接提交给Devin进行修复,并通过桌面应用管理多支修复代理。
事件专题

推荐理由:Devin Cloud出了个Security Swarm,用Agentic MapReduce架构找代码漏洞,比传统方法更经济准确,还能让Devin帮你自动修。
03:06
6月23日
12:34
12:34官方一手arXiv: OpenAI@Haoran Yu, Lifei Liu, Xiaochong Jiang, Yuwen Jia, Su Wang, Pin Qian, Yihang Chen
一项基于AIDev数据集的长达七个月的纵向分析(400名重复审查者,共11,429条审查记录)发现,审查者对AI生成代码的批准率从30.1%上升至36.8%(Wilcoxon符号秩检验p<10^{-6})。随经验增加,批准率累计差距达14.5个百分点。与此同时,行内评论量下降22%(p=0.0014),但审查延迟增加3.5倍。这种模式提示审查者可能因工作负荷而产生习惯性麻木,而非理性信任调整。
事件专题

推荐理由:这篇论文用真实数据告诉你,人类审查AI代码时会越来越松懈——批准率涨了,评论却少了。做AI代码审核的团队应该看看。
6月12日
13:31
13:31swyx (AI Engineer)@swyx
Mythos 正式上线,其 FrontierCode 被认定为下一代编程基准。在 FC Diamond 测试中,Opus 4.8 和 GPT 5.5 在随努力扩展方面表现不佳。Mythos/Fable 的后训练方法首次将测试时计算应用于解决超长任务,相当于数十小时人类工作、每任务数百美元。该功能现已在 Cognition 和 Devin 中可用,仅需 1.4x ACUs。
事件专题

推荐理由:Mythos 的 FrontierCode 基准揭示了当前顶级模型在长任务上的扩展瓶颈,做 AI 编程评估或开发长流程自动化的团队值得关注,可以直接在 Devin 中体验。
6月10日
11:44
11:44Cognition@cognition_labs
精选76°
Devin 平台现已集成 Claude Fable 5 模型,该模型在 FrontierCode 基准测试中排名第一。FrontierCode 是评估真实工程任务中代码合并性和质量的基准。这一更新意味着开发者可以在 Devin 中使用当前最强的代码生成模型之一,提升自动化编程效率。
事件专题

推荐理由:对于使用 Devin 做自动化编程的团队,Fable 5 的集成直接提升了代码质量和合并成功率,值得立即体验。
11:40
11:40Cognition@cognition_labs
83°
Cognition 宣布其最强智能体 Devin Ultra 现已集成 Claude Fable 5,专为长周期任务和调试优化。通过调整 harness,Ultra 的成本仅比默认 Devin 智能体高出约 40%。Claude Fable 5 还可在 Devin Desktop 和 Devin CLI 中使用。这为需要复杂自动化流程的开发者提供了更强大的选择。
事件专题

推荐理由:做复杂自动化或深度调试的开发者,现在可以用 Devin Ultra 以更可控的成本获得 Claude Fable 5 的能力,值得直接尝试。
6月5日
5月29日
5月28日
5月21日