7月10日
11:59
11:40
11:40官方账号arXiv cs.LG@Chuning Zhu, Eva Xu, Jose Barreiros, Krishnan Srinivasan, Paarth Shah, Abhishek Gupta
Latent Memory Palace (LMP) 方法提出将控制策略的推理形式化为自回归变分推断,通过组织信息于潜在记忆宫殿实现自适应迭代检索。该方法推导出潜在空间强化学习技术以优化变分下界,得到策略 LMP-π 在仿真和真实场景中表现优异,并展示可解释的测试时计算分配。LMP-tok 作为变长动作分词器,显著提升了自回归策略的性能。论文提供了通过变分推断视角进行潜在推理控制的新观点。
推荐理由:这篇论文提出了Latent Memory Palace方法,把推理当成自回归变分推断来控制机器人,在模拟和现实任务都很强,还带可变长动作分词器,做控制方向的朋友可以看看。
07:47
07:47elvis@omarsar0
开发者同时使用Fable 5和GPT-5.6后表示,这两款模型带来了能力上的阶跃变化。他认为递归自我改进的AI时代已经来临,呼吁大家重新思考用AI能构建什么。推文获得了少量互动,但表达了对未来的强烈预期。
事件专题

推荐理由:一位开发者说同时玩Fable 5和GPT-5.6后感觉AI能力跳了一个台阶,建议你重新想想能用AI做什么。
07:16
06:58
06:58Genspark@genspark_ai
OpenAI 推出 GPT-5.6 系列三个模型:Sol 是下一代前沿模型,Terra 是日常高效工作的平衡模型,Luna 是快速低成本的批量处理模型。三个模型现已在 Genspark AI Chat Agent、Code Agent 和 Claw 中可用。用户可根据任务选择合适模型。
事件专题

推荐理由:OpenAI 出了三个 GPT-5.6 模型,Sol 冲前沿、Terra 干日常、Luna 省成本,Genspark 上直接能用,选一个试试。
06:16
06:16Poe@poe_platform
83°
OpenAI GPT-5.6系列模型已在Poe平台上线,包含三个版本:GPT-5.6-Sol专注复杂推理、高级编程和智能体工作流,GPT-5.6-Terra针对日常编程、分析和研究提供均衡性能,GPT-5.6-Luna面向高频常规任务,响应快速且成本低。
事件专题

推荐理由:Poe上了OpenAI GPT-5.6三个模型:Sol最擅长推理和编程,Terra均衡,Luna又快又便宜,按需挑。
05:46
05:46官方账号OpenAI@OpenAI
OpenAI发布的GPT-5.6 Sol在Agents' Last Exam基准测试中取得53.6分,比Claude Fable 5 (adaptive)的40.5分高出13.1分。在中等推理模式下,GPT-5.6 Sol以约四分之一成本领先Fable 5达11.4分。此外,GPT-5.6 Terra和Luna版本也以约十六分之一成本超越Fable 5。
事件专题

推荐理由:OpenAI新出的GPT-5.6 Sol在智能体测试里比Claude Fable 5强13分,而且更便宜,中推理下成本才四分之一,性价比很高。
04:59
04:59官方账号Simon Willison@simonw
91°
GPT-5.6 发布,API 新增程序化工具调用(programmatic tool calling)和多智能体(multi-agent)功能。该版本包含 6 个推理级别和 3 个新模型变体。开发者可通过 API 直接编排工具调用和多智能体工作流。
事件专题

推荐理由:GPT-5.6 的 API 直接支持工具调用和多智能体,开发新玩法更多了,值得试试。
04:37
04:37官方账号OpenAI@OpenAI
数学家 Bartosz (@nasqret) 借助 OpenAI 的 GPT-5.6 模型,成功解决了此前被认为无法求解的数学问题。这展示了 GPT-5.6 在复杂推理和数学证明方面的能力。该案例由 OpenAI 官方在 Twitter 上发布,引发社区对模型潜力的讨论。
事件专题

推荐理由:数学家 Bartosz 用 GPT-5.6 解开了过去无人能解的数学题,看看这代模型推理能力有多强。
03:15
03:15coderabbitai@coderabbitai
CodeRabbit测试了GPT-5.6的两个变体Sol和Terra。Sol在遵循长任务、保持仓库上下文和代码审查基准中展现了更好的召回。Terra作为更便宜的选项适用于小范围工作。报告对比了Fable 5和Opus 4.8的定价与性能。

推荐理由:CodeRabbit实测了GPT-5.6的两个版本,Sol在代码审查中召回更强,Terra则更省钱。对比Fable 5和Opus 4.8,想升级编码工具可以看。
02:49
02:49官方账号OpenAI@OpenAI
91°
OpenAI发布GPT-5.6 Sol模型,在编码、知识工作、网络安全和科学领域实现最先进性能。该模型使用更少token并降低计算成本。相比前代,它在多个基准测试中表现更优,但具体数字未公开。
事件专题

推荐理由:OpenAI新出的GPT-5.6 Sol能在编程、科研等领域做到顶尖,还省token省成本,想尝鲜的可以试试。
02:35
02:35官方账号OpenAI@OpenAI
OpenAI宣布ChatGPT Work由GPT-5.6模型驱动。GPT-5.6使ChatGPT在复杂任务推理上达到最先进水平。它还能根据用户模板、参考文件和偏好风格自动生成材料。用户只需描述期望结果,无需逐步说明步骤。
事件专题

推荐理由:OpenAI给ChatGPT Work换上了GPT-5.6,推理和按模板生成都变强了,不用一步步教它怎么做。
01:56
01:42
01:42官方账号Greg Brockman@gdb
OpenAI推出GPT-5.6系列模型,旗舰模型Sol在编码、知识工作、网络安全和科学任务上表现优异。Terra和Luna作为低成本变体,以更低价格和更少token消耗提供高性能。新系列在多项基准上超越前代,整体成本降低30%以上。
事件专题

推荐理由:OpenAI出了GPT-5.6,Sol很强,还有便宜的Terra和Luna,编程和科学更厉害,token用得少。
01:11
7月9日
22:38
18:13
18:13官方账号Decoder@Maximilian Schreiner
88°
在AtCoder World Tour Finals 2026的表演赛中,OpenAI的AI系统解决了算法部门的全部5道题目,其中2道被观测者评为特别困难。该系统击败了所有人类参赛者,展示了在顶级竞争性编程中超越人类的能力。
事件专题

推荐理由:OpenAI的AI刚刚在AtCoder的世界决赛上碾压了所有人类选手,5道题全解,2道超难。想看看AI编程到底多强?
17:30
17:30Hunyuan@TXhunyuan
腾讯混元推出 Hy3,一个 295B 参数的 MoE 模型,支持 256K 上下文窗口。该模型针对编码、推理、智能体和可靠工具使用进行优化。即日起至 7 月 21 日,可通过 OpenRouter 免费使用,并可在 OpenClaw 中调用。
事件专题

推荐理由:腾讯新出的 Hy3 模型 295B 参数,256K 上下文,现在 OpenRouter 上免费到月底,编码和推理都很强,赶紧去试试。
11:59
11:59Sualeh Asif@sualehasif996
71°
SpaceXAI 发布了 Grok 4.5,在 GDPval-AA v2 基准上以 Elo 1543 排名第四,仅次于 Anthropic 的最新 Claude 版本。每个任务的成本为 0.49 美元,低于 GLM-5.2 和 Kimi K2.6,且比排名更高的模型便宜近 90%。该模型在性能与成本的帕累托前沿上表现突出。
事件专题

推荐理由:Grok 4.5 在代理知识工作基准上排第四,每个任务只要 49 美分,比前面的模型便宜 90%,性价比很能打。
11:30
11:30官方账号Sam Altman@sama
Sam Altman 转发 dax 的推文,称 GPT-5.6 对团队产生了巨大影响,团队 Token 使用量达到以前的 5 倍。dax 表示 GPT-5.6 虽然不如 Fable 聪明,但极其可靠且使用体验愉快。这是 Altman 罕见地主动 hype 一个模型发布。
事件专题

推荐理由:Sam Altman 亲自夸 GPT-5.6 可靠又好用,团队用量翻了 5 倍,看看他为什么破例。
11:22
11:22IT之家博客/媒体
精选
蓝戟测试英特尔 Arc Pro B70 GPU 在 DeepSeek R1-Distill Qwen 32B FP16 模型推理性能。并发 128 时 Arc Pro B70 吞吐比 RTX 5090D 高 8.6%,比 RTX 4090D 高 34.2%。并发 256 时分别高 7.5% 和 48.7%。最高吞吐达 2320.76 token/s。并发低于 32 时 RTX 5090D 仍领先。

推荐理由:蓝戟实测发现 Intel Arc Pro B70 跑 DeepSeek R1 推理比 RTX 5090D 还快,高并发场景优势明显,适合做推理部署参考。