8月1日
01:55
01:55Google Gemini App@GeminiApp
72°
谷歌发布 Gemini 3.6 Flash 和 3.5 Flash-Lite 升级版。新版本在推理能力和响应速度上均有提升。用户可在 gemini.google 或 App 的模型下拉菜单中切换使用。两个模型目前均已开放体验。
事件专题

推荐理由:谷歌把 Flash 和 Flash-Lite 都升级了,推理更强速度更快,打开 Gemini 选模型就能试。
7月31日
13:53
13:53官方账号Greg Brockman@gdb
76°
GPT-5.6 Sol 找到了 Maxwell 猜想的反例,证实该猜想错误。这一猜想已存在超过 100 年,反例由 AI 发现后经人类数学家确认,论文已上传至 arXiv(编号 2607.27197)。成果展示了 GPT-5.6 Sol 在数学推理上的具体能力。
推荐理由:GPT-5.6 Sol 直接给 Maxwell 猜想找出了反例,人类数学家还验证了,这推理能力真有点吓人。
12:31
06:44
06:44官方账号OpenAI@OpenAI (@OpenAI)
ARC-AGI-3基准测试要求模型无需指令学习不熟悉的2D游戏。标准测试丢弃了GPT-5.6 Sol每步后的推理,并在上下文填满时丢弃早期动作。这导致模型无法积累有效经验,只能不断重启。测试结果凸显了长上下文维持对推理模型的关键性。
事件专题

推荐理由:ARC-AGI这个测试挺刁钻,GPT-5.6 Sol在没法记住之前推理的情况下学不会新游戏,说明长上下文对推理很重要。
03:33
03:33官方账号Sam Altman@sama
OpenAI 在部署后应用 GPT-5.6 Sol 进行效率自优化,让模型自身改进运行效率。结果显示,通过生产 GPU 内核优化,服务成本降低 20%。此外,改进的投机解码使 token 生成效率提升 15% 以上。这一成果展示了模型自我优化的实际收益。
事件专题

推荐理由:OpenAI 的 GPT-5.6 Sol 通过自学习优化运行,服务成本降了 20%,生成速度提了 15%,比手动调优更省心省钱。
03:16
03:16OpenRouter@OpenRouterAI
77°
OpenAI 宣布 GPT-5.6 Luna 降价 80%,GPT-5.6 Terra 降价 20%。GPT-5.6 Sol 在 API 中提供更快的推理选项。降价后,在 Codex 和 ChatGPT Work 中的用量计算方式同步调整,用户使用额度更耐用。
事件专题

推荐理由:OpenAI 给 GPT-5.6 系列降价了,Luna 降八成、Terra 降两成,Sol 还更快。正在用这些模型做产品或开发的,赶紧看下新价格和用量规则。
01:40
01:40官方账号OpenAI@OpenAI (@OpenAI)
81°
OpenAI 通过 GPT-5.6 Sol 实现自身运行效率提升,使服务成本降低 20%。改进推测解码后,令牌生成效率提升 15% 以上。这些优化已转化为 Luna 和 Terra 模型的 API 价格下调。OpenAI 旨在让先进智能更普及。
事件专题

推荐理由:OpenAI 又升级了,GPT-5.6 Sol 让运行成本降了20%,速度快了15%,Luna 和 Terra 也降价了,开发者快看。
7月30日
23:32
17:57
17:57官方账号OpenAI@OpenAI
72°
OpenAI 通过 Responses API 实现了一项测试,启用了 Retained reasoning 和 Context compaction 功能。在公开数据集上,GPT-5.6 Sol 的得分提升了 188%,同时输出 token 数量减少了 6 倍。这一改进显著提高了模型的推理效率和输出质量。
事件专题

推荐理由:OpenAI 用 Responses API 让 GPT-5.6 Sol 分数涨了 188%,输出 token 还少了 6 倍,效率提升很明显。
11:09
11:09小互@imxiaohu
Magnific 发布了 38 页的全新提示词手册,核心观点是传统关键词式提示已失效。手册提出 AI 已进入推理(Reasoning)与导演对话时代,需要用明确的专业视觉语言指挥前沿模型。该手册针对当前主流图像和视频生成模型提供实用指南。

推荐理由:Magnific 出了本 38 页的提示词手册,教你用导演思维跟 AI 对话,不再堆关键词,适合想用好前沿图像视频模型的人。
10:30
10:30官方账号Simon Willison@simonw
精选
GPT-5.6 通过 Codex 分析生产流量、改进负载均衡、重写 GPU kernel 和运行数百次推测解码实验,将端到端服务成本降低 20%。推测解码使 token 生成效率提升超 15%。这些优化为 OpenAI 每月节省数十亿美元成本。
事件专题

推荐理由:GPT-5.6 自己优化自己,服务成本降了20%,生成效率提了15%,省下来的钱都能买好几个数据中心了。
10:09
10:09官方一手Pandaily@contact@pandaily.com (Pandaily)
蚂蚁集团旗下Ant Bailing推出Ling-3.0-flash执行模型,总参数量124B,激活参数仅5.1B。该模型在12个基准测试中,以12%的参数量在11项上超越万亿参数模型Ring-2.6。在34个评估维度中,Ling-3.0-flash获得15个第一、19个第二,与DeepSeek V4 Flash并列平均最高分。
事件专题

推荐理由:蚂蚁百灵的新模型Ling-3.0-flash参数量只有124B,却在大多数基准测试里干翻了万亿参数的Ring-2.6,还和DeepSeek V4 Flash并列第一,小模型也能这么猛。
07:18
07:18官方一手@OpenAIDevs@OpenAIDevs
78°
OpenAI 使用 GPT-5.6 Sol 模型在 Codex 环境中对自身基础设施进行优化,改进在推理和智能体循环中产生更多有用工作。生产 GPU 内核优化使服务成本降低 20%,改进的推测解码使 token 生成效率提升 15% 以上。这些改进通过复用在相同硬件上获得更大的性能提升。
事件专题

推荐理由:OpenAI 让最新的 GPT-5.6 Sol 自己给自己打工,结果运行成本降了 20%、输出速度提升超 15%,看看模型怎么自己优化自己。
07:12
07:12官方一手OpenAI Blog博客/媒体
OpenAI 通过启用两个 API 设置(保留推理轨迹和启用结果压缩)让模型在 ARC-AGI-3 基准上的得分提升至原来的三倍。这些设置分别作用于推理过程和输出压缩,不增加额外计算成本。具体配置方法在官方博客中公开。
事件专题

推荐理由:OpenAI 官方分享的实用技巧,只改两个参数就让 ARC-AGI-3 分数翻三倍,玩模型的可以试试。
05:33
05:33官方账号OpenAI@OpenAI
85°
OpenAI 推文宣布推出 GPT-5,通过全栈优化(涵盖架构、训练与推理)在成本-智能曲线上每个点都达到最佳性能。该模型系列包含多种版本,针对不同计算成本进行调优。具体基准成绩尚未公开,但声称在各成本区间均保持领先。
事件专题

推荐理由:OpenAI 发了 GPT-5 系列,从低到高每个价位都做了性能最优的版本,想省钱或追求极致都能选到合适的。
04:04
03:44
03:44官方账号xAI@xai
xAI 发布 Grok Voice Think Fast 2.0,专为语音代理设计。该模型在嘈杂环境下能保持清晰听取。它能推理复杂工作流,并生成更自然的对话。相比前代,在实时交互中延迟更低、鲁棒性更强。
事件专题

推荐理由:xAI 出了个新语音模型,专门解决噪声环境下听不清的问题,还能处理复杂任务,适合做语音助手的开发者试试。
01:48
01:48OpenRouter@OpenRouterAI
阿里巴巴的Qwen3.7-Flash模型在OpenRouter平台正式上线。该模型具备视觉能力,支持多模态代理、视觉编码、搜索和计算机交互,上下文窗口达100万tokens。同时支持工具调用,适合快速推理场景。
推荐理由:阿里新模型上线OpenRouter,百万上下文还能看图和操作电脑,多模态推理速度很快。
7月29日
11:23
11:23官方一手arXiv: DeepSeek@Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou
该研究测试了大型语言模型(LLMs)在科研项目规划和提案评估中的表现。人类研究者与ChatGPT、Claude、DeepSeek(2025年中模型)分别生成了8个专家构思的研究项目的一页计划,共计32份提案。4位人类评审员和2个前沿LLM(Claude Opus 4.8、ChatGPT Pro 5.5)采用四维度评估标准盲审。人类评审员对AI和人类提案的整体评分相似,而AI评审员对AI提案的评分平均高出约1分(5分制)。人类评审员正确识别人类和AI提案的比例分别为72%和79%,而两个AI评审员均100%正确分类。研究表明当前LLM能生成与人类提案相当的计划,但AI评审员存在系统性偏好。
推荐理由:这篇论文测试了ChatGPT、Claude、DeepSeek写科研计划的能力,发现人类评委分不出好坏,但AI评委偏爱AI写的。值得一读。