有人收集了 83 个智能合约审计 Skill 做系统评测,发现效果主要看模型,Codex/GPT-5.5 检测分提升 22.8%,还开源了语料,做 agent 开发的可以看看。
#OpenAI Codex
这篇论文统计了 Codex、Copilot、Devin 等五个智能体的 6774 个 PR,发现它们合并后更容易出问题,但大多自己悄悄修好了,数据挺有意思。
Unity 推出了针对 Claude Code 和 OpenAI Codex 的官方插件,能防止 AI 代理使用过时教程,对开发者来说是个实用工具。
Spotify开放内部工具Xirp,一个界面同时跑Claude Code、Gemini CLI和OpenAI Codex,内部已处理3.6万次编码会话。
这期节目把ChatGPT Work的Memory和Proactivity讲透了,还说了它靠什么3周拉来1000万用户,比一般介绍具体得多。
Anthropic的数学家随手用Fable 5怼翻了87年的雅可比猜想,OpenAI的Codex也跟上了,连张益唐当年都没搞定,AI这波真有点猛。
这篇论文用Claude Code和OpenAI Codex实测了记忆注入攻击,发现一旦恶意指令写入记忆,后续会话都危险,搞AI安全的一定要看看。
看看这位把 Cursor 和 Bugbot 做起来的 PM,现在负责 OpenAI Codex 的 Agent 执行层,靠谱。
这篇论文用真实数据告诉你,人类审查AI代码时会越来越松懈——批准率涨了,评论却少了。做AI代码审核的团队应该看看。
OpenAI Codex新功能让你录屏演示一遍就能自动生成可编辑的工作流技能,不用写Prompt,适合重复性任务自动化。
OpenAI Codex 这次不用你写指令了,Mac 上演示一遍操作就能生成可复用的 Skill,下次改改参数自动跑,报销填单之类的好用了。
Qt Creator 20 新增了 ACP 框架,能直接连上 Claude Code 和 OpenAI Codex,写代码时边聊边改,还有禅模式减少干扰。
如果你在训练或使用开源编程模型,公开分享追踪数据能直接提升数据集质量,Hugging Face 的号召值得响应。做 AI 编程工具的团队也能从中获得更丰富的训练素材。
这篇拆解了个人 Agent 落地的真实架构和坑,做自动化工作流的开发者可以直接抄作业——从工具选型到数据组织到审批门控,全是实战经验。
AI从业者和开发者需要快速掌握行业脉搏——Pichai的I/O观点、Codex升级、CLI生成工具都直接影响工作流,建议花2分钟扫一眼。
Karpathy 点破了 AI 圈最大的认知偏差——免费版和高端代理模型的能力差距已经大到像两个物种。如果你是做编程、数学或研究的开发者,看完会理解为什么有人觉得 AI 已经能替代数周工作,而有人还在嘲笑它犯蠢。
Datasette 用户和 AI 编程爱好者可以看看这个博客的构建过程——用 Codex 直接生成网站,省去了手动搭建的繁琐,值得一试。