7月29日
01:28
01:28官方账号OpenAI@OpenAI
精选
OpenAI在X平台表示,编程智能体正帮助科学家承担从常规维护、目标优化到完全重新设计和新系统搭建等任务。智能体能够可靠执行大型项目,但研究人员仍需自己定义科学问题、验证结果并对长期所有权进行决策。这条推文获得了292个赞和超过3.3万次浏览。
事件专题

推荐理由:OpenAI说编程智能体正在帮科学家干苦活累活,从修修补补到整个系统重写都能干,但关键问题还得自己定,挺实在的观察。
01:15
01:15lmarena.ai@lmarena_ai
精选
Code Arena 新增全栈开发能力评测,涉及多步推理、工具调用和端到端应用生成。Kimi K3 (Max) 排名第一,GPT 5.6 Sol (xHigh) 第二,Claude Fable 5 第三。榜单完整排名可在 arena.ai 查看。
事件专题

推荐理由:Code Arena 刚上线了全栈能力排行榜,Kimi K3 拿了第一,GPT 5.6 和 Claude Fable 紧随其后,想比模型写代码能力的可以看看。
7月28日
22:26
22:26官方账号Perplexity@perplexity_ai
71°
Perplexity 在 Windows 应用中推出 Personal Computer 功能,这是一个本地 agent 系统。它能协调本地文件、连接的应用和网络,支持研究、编码、浏览和构建等任务。用户可在统一界面内调用多个智能体完成工作流。
推荐理由:Perplexity 给 Windows 用户加了个本地智能体“Personal Computer”,能帮你调文件、连应用、上网,写代码查资料都在一个窗口里搞定。
12:14
10:54
10:54官方账号arXiv cs.AI@Aayush Kumar, Avik Dutta, Sumit Gulwani, Gustavo Soares, Advait Sarkar, Emerson Murphy-Hill
这篇论文构建了一个用于电子表格编程的计划模式原型,并通过24名被试的组内用户研究,将其与无计划基线对比。研究发现,尽管任务结果相似,但使用计划模式减少了用户的调整次数(refinement),并在创造力支持和人机协作维度上获得了更好的工具感知。研究为计划模式在最终用户编程中的设计提供了启示。
推荐理由:这篇论文告诉你,在电子表格里用计划模式(Plan Mode)能少改几遍代码,协作感还能变好。不是玄学,是有24人验证过的。
08:17
08:17Fireworks AI@FireworksAI_HQ
Kimi 发布新模型 Kimi K3,已集成至编程助手 Cursor。该模型在 CursorBench 基准上得分接近前沿水平。推理服务由 Fireworks、Together 和 Baseten 在美国提供,并支持零数据保留。
事件专题

推荐理由:Kimi 的 K3 模型现在可以直接在 Cursor 里用了,编程体验接近前沿,而且支持零数据保留,适合敏感场景。
06:36
06:36官方账号Cursor@cursor_ai
Kimi K3 模型正式集成到 Cursor 中。该模型在 CursorBench 基准上得分接近前沿水平。通过 Fireworks、Together 和 Baseten 提供美国地区推理,并支持零数据保留。Kimi K3 在编码辅助方面表现出色。
事件专题

推荐理由:Cursor 上了 Kimi K3,编程能力不输前沿模型,还支持零数据保留,可以试下。
04:32
04:32官方一手GitHub Blog@Christopher Harrison
GitHub Copilot app 推出了面向初学者的入门教程,教你如何利用 AI agents 和 canvases 功能。教程从零开始讲解如何启动新项目,并逐步整合 AI 助手。它旨在帮助用户简化日常开发工作流,降低上手门槛。
推荐理由:GitHub 官方出的新手教程,手把手教你用 AI agent 和 canvas 做项目,适合刚接触 Copilot 的朋友快速上手。
01:02
01:02Cognition@cognition_labs
Cognition 宣布 Kimi K3 现已集成到 Devin Desktop 和 CLI。在 FrontierCode 1.1 基准测试中,Kimi K3 是首个接近前沿性能的开源模型。这标志着开源编码模型达到了新的高度。
事件专题

推荐理由:Cognition 把 Kimi K3 放进 Devin 了,在 FrontierCode 上接近顶尖水平,而且是开源,想试最新的编码模型可以直接用。
00:56
00:56GitHub@github
精选
GitHub Copilot 引入提示缓存和工具搜索,减少重复上下文,让每次会话的 credits 更高效。Auto 功能根据任务意图和实时模型健康自动选择模型。在评估中,HyDRA 匹配了 OpenRouter Auto 70.8% 的解决率,同时节省 3.3 倍成本。

推荐理由:GitHub 优化了 Copilot,现在用提示缓存和智能模型选择,同样 credits 能干更多活,还不改变你写代码的方式。
7月27日
7月26日
18:55
18:55官方一手marktechpost@Michal Sutter
快手KwaiKAT团队发布技术报告,推出KAT-Coder-V2.5智能体编程模型,在10万个可验证仓库环境上训练。团队开发AutoBuilder工具,将环境构建成功率从16.5%提升至57.2%,覆盖12种编程语言。沙盒审计机制将强化学习反馈错误率从约16%降低至2%以下。研究指出,智能体编程能力的瓶颈在于训练基础设施而非模型规模。
推荐理由:快手开源了KAT-Coder-V2.5,用10万个可验证环境训练代码智能体。AutoBuilder把环境搭建成功率从16%拉到57%,沙盒审计又让反馈错误降到2%以下。做编程智能体训练的值得一看。
02:29
02:29OpenRouter@OpenRouterAI
OpenRouter 发布了全新 Discover 页面,帮助用户更直观地探索 AI 模型。该页面显示 Opus 5 在综合排名中占据整体领先地位,而 GPT 5.6 Sol 在编程任务上表现突出。同时,平台上路由器列表不断增长,为用户提供更多选择。
事件专题

推荐理由:OpenRouter 的新 Discover 页面让你一眼看清哪个模型最强——Opus 5 综合第一,GPT 5.6 Sol 编程厉害,还有更多路由器帮你挑。
7月25日
08:27
08:27techcrunch@Lucas Ropek
OpenAI推出了一款AI键盘硬件,试用者通过按键即可快速调用AI功能。该键盘主要面向程序员,可增强编码工作流,但对非技术用户可能不够直观。目前具体定价和上市时间尚未公布。
事件专题

推荐理由:OpenAI出了个AI键盘,按一下就能调AI,程序员用起来很爽,其他人可能觉得莫名其妙。
05:57
05:57官方一手marktechpost@Asif Razzaq
82°
Anthropic推出Claude Opus 5,取代Opus 4.8成为Opus系列旗舰模型。输入价格维持$5/百万token,输出价格$25/百万token。该模型智能接近Claude Fable 5但价格仅为后者一半。它支持代理编码和计算机使用功能。
事件专题

推荐理由:Anthropic新出的Claude Opus 5,定价和以前一样,能力却快赶上更贵的Fable 5了,特别适合搞AI编程和控制电脑。
05:13
05:13官方一手Anthropic: Newsroom资讯
72°
Anthropic于2026年7月24日发布Claude Opus 5。Opus 5是Opus层级的阶跃式改进,主要增强了对长时间运行代理的支持。该模型在编码和专业工作场景中也实现了性能提升。
事件专题

推荐理由:Anthropic刚出Claude Opus 5,专门优化了长时间跑智能体,写代码和做专业工作都比上一代强。
03:18
03:18官方一手Claude Code: GitHub Releases@ashwin-ant
精选
Claude Code v2.1.219 发布,默认 Opus 模型升级为 Claude Opus 5,支持 1M 上下文,定价 $10/$50 每百万 token。新增 sandbox.network.strictAllowlist 设置,可拒绝非白名单主机。新增 workflowSizeGuideline 设置和目录添加钩子,修复多项 bug,包括 Vim 模式、屏幕阅读器等。
事件专题

推荐理由:Claude Code 更新了,默认模型变成 Opus 5,能处理百万 token 上下文,还加了网络限制白名单和工作流大小设置,修了不少bug,值得升。
02:57
02:57GitHub@github
82°
Anthropic 推出 Claude Opus 5 模型,现已集成到 GitHub Copilot 中。早期测试表明,该模型在代理式编码工作流上表现优异。它能有效进行针对性修改,自我验证工作成果,并减少复杂任务中多余的执行开销。
事件专题

推荐理由:写代码时想用更聪明的AI助手?Claude Opus 5 现在直接在 GitHub Copilot 里用了,自动验证减少错误。