7月11日
03:08
03:08官方账号Decoder@Matthias Bastian
76°
OpenAI的GPT-5.6 Sol模型独自对较小的Luna模型进行了后训练微调,触发方式仅为一个“相当不明确的提示词”。在OpenAI内部的RSI(递归自我改进)基准测试中,Sol的得分比GPT-5.5高出16.2分。OpenAI表示,这一进展让“自动化研究员”目标更加接近现实。
事件专题

推荐理由:OpenAI又搞事情了:GPT-5.6 Sol用一句模糊指令就能自动调教出更强的Luna,性能比上一代飙升16分,自动化研究越来越近了。
7月10日
19:22
19:22官方账号Decoder@Maximilian Schreiner
76°
Bun这个JavaScript工具已从Zig完全重写为Rust,整个过程借助了Anthropic的Claude Fable 5模型。Fable 5在11天内生成了超过一百万行代码,完成了整个重写工作。这次重写展示了Claude Fable 5在大型代码迁移任务中的效率。Bun团队尚未公布具体性能对比数据,但表示新版本已通过测试。
事件专题

推荐理由:Bun原来用Zig写的,现在直接换成Rust了,而且靠Claude Fable 5在11天里写了100多万行代码,这AI写代码的效率太吓人了。
16:01
16:01官方一手pandaily@contact@pandaily.com (Pandaily)
Jiying 2.0-s物理基础模型实现了对未见几何形状、新材料和不同边界条件的零样本泛化,在工程仿真中无需重新训练即可适用多种工况。该模型基于极影科技自研框架,首次在固体力学领域达到跨设置零样本推理能力。基准测试显示其在位移场和应力场预测上优于传统数值方法。

推荐理由:极影科技搞出了首个能零样本泛化的固体力学模型Jiying 2.0-s,不用针对每种新几何新材料重新训练,直接推理结果,搞仿真的可以看看。
12:41
08:19
08:19techcrunch@Lucas Ropek
OpenAI 推出 GPT-5.6,这是其最新模型系列中的一员。微软将 GPT-5.6 设为 Copilot 的首选模型,用于驱动 Office 365 等生产力应用。这一决定出现在外界猜测两家公司可能分道扬镳的背景下。OpenAI 表示将继续为微软生态提供支持。
事件专题

推荐理由:OpenAI 的 GPT-5.6 成了微软 Copilot 的标配,两家虽然被传要分手但合作还在继续,微软办公套件会深度集成这个新模型。
08:00
08:00IT之家博客/媒体
83°
OpenAI 于 7 月 10 日发布 GPT-5.6 系列模型,在 ChatGPT、Codex 和 API 中上线。微软 CEO 纳德拉称 Copilot 同步接入该模型。Codex 正从编程 AI Agent 向通用 Agent 方向演进。
事件专题

推荐理由:OpenAI 发了 GPT-5.6 系列,直接上 ChatGPT 和 API,微软 Copilot 也跟进了。Codex 要往通用 Agent 走,挺有意思的。
06:49
06:49IT之家博客/媒体
91°
OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra、Luna 三档模型,价格从每百万 token 输入 1 美元到 5 美元不等。旗舰版 Sol 在 Terminal-Bench 2.1 上标准模式得分 88.8%,超过 Claude Mythos 5 的 88.0%,开启 Ultra 模式后达 91.9%。微软 CEO 纳德拉宣布 Copilot Chat、Cowork、M365、GitHub 和 Foundry 同步上线该模型。
事件专题

推荐理由:OpenAI 出了 GPT-5.6 系列,分三档定价,最贵的 Sol 编程跑分超 Claude Mythos 5,微软 Copilot 也直接用上了。想试试新模型可以看看。
02:55
02:55官方账号Decoder@Matthias Bastian
76°
OpenAI 的 GPT-5.6 Sol 在 Artificial Analysis Intelligence Index 上获得 59 分,仅比 Anthropic 的 Claude Fable 5 低 1 分。Sol 每次任务成本为 1.04 美元,是 Fable 5 的三分之一。在智能体编程任务中,Sol 超越所有竞品,进一步加大 Anthropic 的定价压力。
事件专题

推荐理由:OpenAI 新模型 Sol 基准只差 Fable 5 一分,价格只要三分之一,编程还更强,性价比拉满!
02:44
02:44官方账号OpenAI@OpenAI (@OpenAI)
GPT‑5.6 改进了演示文稿、文档和电子表格中工件的生成质量。新版本更好地适配用户模板,提升对齐与格式效果。这些可编辑的工件可直接导出到常用专业工具中,融入企业工作流。
事件专题

推荐理由:OpenAI 的 GPT‑5.6 改善了演示文稿、文档和表格里的内容生成,支持模板和导出到专业工具,办公更方便。
02:42
02:42官方账号OpenAI@OpenAI (@OpenAI)
93°
OpenAI 今日发布 GPT-5.6,面向 ChatGPT、Codex 和 OpenAI API 用户。Plus、Pro、Business 和 Enterprise 用户可通过中等和高努力设置使用 GPT-5.6 Sol。Pro 和 Enterprise 用户还可选择 GPT-5.6 Pro 处理复杂任务。全球逐步推出,计划 24 小时内全量可用。
事件专题

推荐理由:OpenAI 刚发了 GPT-5.6,有 Sol 和 Pro 两个版本,Pro 用户能选最强档,现在就能在 ChatGPT 和 API 上用。
01:11
7月9日
19:13
19:13官方账号Decoder@Matthias Bastian
精选
Databricks在其数百万行代码库上测试编程智能体,发现中国开源模型GLM 5.2性能与Anthropic的Opus 4.8相当。每任务成本GLM 5.2为1.28美元,Opus为1.94美元。Databricks计划将GLM 5.2作为日常编程工作主力。该公司认为没有单一供应商占主导地位,企业应自建基准而非依赖公共基准。
事件专题

推荐理由:Databricks选了国产开源模型GLM 5.2当默认编程引擎,每花1.28美元能干出Opus 1.94美元的活,省钱了性能还不差。
18:13
18:13官方账号Decoder@Maximilian Schreiner
88°
在AtCoder World Tour Finals 2026的表演赛中,OpenAI的AI系统解决了算法部门的全部5道题目,其中2道被观测者评为特别困难。该系统击败了所有人类参赛者,展示了在顶级竞争性编程中超越人类的能力。
事件专题

推荐理由:OpenAI的AI刚刚在AtCoder的世界决赛上碾压了所有人类选手,5道题全解,2道超难。想看看AI编程到底多强?
15:00
11:53
11:53量子位@量子位的朋友们
量化派基于餐饮后厨场景的多模态数据,训练了物理世界基础模型Q-Phys-v1。该模型在Meta Habitat 2.0基准的物体抓取任务上达到88%成功率,在自主导航任务中路径规划效率提升40%。模型通过API和SDK向企业开放,支持场景定制。
推荐理由:量化派把餐饮后厨数据用到物理模型上,思路很落地,Q-Phys在机器人任务上表现不错,适合做机器人和自动驾驶的公司看看。
11:22
11:22IT之家博客/媒体
精选
蓝戟测试英特尔 Arc Pro B70 GPU 在 DeepSeek R1-Distill Qwen 32B FP16 模型推理性能。并发 128 时 Arc Pro B70 吞吐比 RTX 5090D 高 8.6%,比 RTX 4090D 高 34.2%。并发 256 时分别高 7.5% 和 48.7%。最高吞吐达 2320.76 token/s。并发低于 32 时 RTX 5090D 仍领先。

推荐理由:蓝戟实测发现 Intel Arc Pro B70 跑 DeepSeek R1 推理比 RTX 5090D 还快,高并发场景优势明显,适合做推理部署参考。
09:04