03:34官方账号OpenAI@OpenAI83°OpenAI 推出 GPT-5.6 Sol,为付费用户的全部聊天(含 Instant 模式)提供一致体验。在高风险事实性评估中,覆盖金融、医学和法律领域,GPT-5.6 Sol 比 GPT-5.5 Instant 的事实错误响应减少 68%。该模型成为付费用户的默认统一推理版本。AI模型GPT-5.6 SolOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 把新模型 GPT-5.6 Sol 用到所有付费聊天里,医学法律等场景错误率比上代 Instant 低了 68%,靠谱很多。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
03:33官方账号OpenAI@OpenAI78°OpenAI 为 ChatGPT 推出 GPT-5.6 Sol,Plus 和 Pro 用户可使用即时与深度推理,响应更注重事实。GPT-5.6 Luna 面向 Free 和 Go 用户,从明天起提供无限文本对话。Sol 与 Luna 分别面向付费和免费层级,覆盖不同需求。AI模型GPT-5.6 SolGPT-5.6 LunaOpenAI10 个信源在谈事件专题推荐理由:OpenAI 把新模型拆成两档:付费的 Sol 更会推理,免费的 Luna 随便聊,明天就能用。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
03:12官方账号Decoder@Matthias Bastian72°OpenAI更新了ChatGPT中的GPT-5.6 Sol,新增推理滑块可调节思考深度,并优化了回复聚焦度。免费用户从下周起获得GPT-5.6 Luna的无限文本聊天权限,外加一个让其推理更长的按钮。但Luna的能力仍明显弱于Sol等更大的模型。AI产品OpenAIChatGPTGPT-5.6 Sol10 个信源在谈事件专题推荐理由:Sol更新了推理滑块,想调思考深度可以试试;免费用户下周用Luna,但别指望它能打。原文稍后读已读值得跟进有用关注 OpenAI
01:20Geek@geekbb精选71°Unsloth AI推出DSpark加速方案,让DeepSeek-V4-Flash-0731的GGUF模型在本地生成速度提升约1.4至2倍。根据Unsloth官方实测,该模型在本地可达到每秒120 tokens,精度没有变化。相关GGUF文件已发布在Hugging Face上,完整指南见Unsloth官方文档。AI模型DeepSeek-V4-FlashUnslothDSpark9 个信源在谈事件专题推荐理由:Unsloth搞了个DSpark,能让DeepSeek-V4-Flash在本地跑快一两倍,每秒120 tokens,精度不变,自己部署更爽了。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
23:47官方账号Meta AI@AIatMeta82°Meta AI将模型送入五场STEM奥赛(APhO、IPhO、IMO等),全程禁用搜索、编程和计算器。结果APhO与IPhO理论考试均满分,IMO获金牌。IChO和RMM同样达到金牌级水平。AI模型Meta AIAPhOIPhO推荐理由:Meta AI把自家模型拉去考五门奥赛,禁用工具还物理满分、IMO金牌,推理实力有硬成绩了。原文稍后读已读值得跟进有用关注 Meta AI
17:25AI Will@FinanceYF578°NVIDIA宣布开源自动驾驶推理模型Alpamayo 2 Super。Alpamayo 2 Super能理解复杂场景,先思考再行动。Robotaxi、卡车和配送车是它的目标应用。模型采用OpenMDW-1.1协议开放商用。Jensen Huang表示下一代AI是机器人,从自动驾驶开始。AI模型NVIDIAAlpamayo 2 Super自动驾驶9 个信源在谈事件专题推荐理由:老黄开源的Alpamayo 2 Super是自动驾驶推理模型,能先思考再行动,Robotaxi和卡车都能用,而且协议允许商用。原文稍后读已读值得跟进有用关注 NVIDIA
17:16Hunyuan@TXhunyuan腾讯发布 Tencent Hy3 模型,定位为紧凑且成本高效的实践型 AI。Hy3 将旗舰级性能融入较小体量,支持推理与智能体能力。Hy3 可应用于研究、编程、办公、设计与云工作流。Hy3 已通过腾讯产品、API 和开发者平台全球可用。定价与详情可在 OpenRouter 和腾讯云 TokenHub 页面查询。AI模型Tencent Hy3腾讯推理模型推荐理由:腾讯新出了 Hy3,紧凑便宜但有旗舰级性能,带推理和智能体能力,还能在腾讯全家桶和 API 直接用。原文稍后读已读值得跟进有用关注 Tencent Hy3
16:22AI Will@FinanceYF576°英伟达今日发布面向自动驾驶的开源推理模型Alpamayo 2 Super。该模型在视觉之外增加了理解与推理能力,会先思考再行动。它被定位为Robotaxi、卡车、接驳车、物流车、拖拉机等车辆的通用骨干。英伟达以OpenMDW-1.1协议开放商用,允许团队检视、微调并部署。官方称开源模式有助于提升自动驾驶安全性。AI模型Alpamayo 2 SuperNVIDIA自动驾驶9 个信源在谈事件专题推荐理由:黄仁勋刚发布Alpamayo 2 Super,自动驾驶开源推理模型,先思考再行动,可商用,做车的团队值得看看。原文稍后读已读值得跟进有用关注 Alpamayo 2 Super
11:39官方账号arXiv cs.LG@Purbesh Mitra, Sennur Ulukus该论文提出 Chained Recursive Language Models(Chained RLM),一种推理时架构,让同一个模型以全新上下文被反复调用。每一轮推理接收原始问题和紧凑摘要,而非完整对话历史,通过黑板和工作区传递中间结果。论文描述了系统模型、交接机制、工件工作区及评估协议,并研究了何时使用新鲜上下文的多阶段计算相比直接回答更准确。在需要抽取、计数、排序和多跳推理的任务中,该方法能减少早期错误传播。论文Chained RLM推理模型长上下文推荐理由:这篇论文把一次长推理拆成多轮小步骤,每一步都能检查修正,适合做长文档问答的人看看。原文稍后读已读值得跟进有用关注 Chained RLM
11:34官方账号arXiv cs.LG@Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora论文提出Skill Entropy,用于度量模型在同一推理链中切换不同技能(如先做数学推导再规划日程)的难度。基于558个技能和9个可验证领域构建了Skill^2-Bench基准,任务按技能熵分为三个难度等级。在8个前沿模型和4个开源模型上的测试显示,技能熵越高的任务准确率越低,存在明显的技能切换差距。将Skill Entropy作为训练信号,Skill-Entropy RL在Qwen3-4B-Instruct上将Skill^2-Bench得分从34.4%提升到68.4%,在Qwen3-1.7B上从14.6%提升到40.1%。该训练流程还能直接应用到OpenR1-Math等现有数据上。论文Skill EntropySkill^2-BenchQwen3推荐理由:Skill Entropy能测出模型切换推理技能的短板,还能当训练信号:Qwen3小模型得分从34%飙到68%,也能用在OpenR1-Math数据上。原文稍后读已读值得跟进有用关注 Skill Entropy
10:02官方账号arXiv cs.LG@Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui精选SpecRoll 是一种用于强化学习 rollout 的投机解码引擎,面向大规模语言模型后训练。它用轻量级未来 token 头生成并行提议,并通过 Reflex 模块做轨迹局部的隐藏状态修正,无需反向传播。在 1.5B 到 14B 的五个模型和三个数学推理数据集上,SpecRoll 相比原始 GRPO 取得 1.26-2.15 倍生成加速和 1.21-2.04 倍端到端加速。在全部 15 组匹配设置中,SpecRoll 的平均端到端耗时比 FastGRPO 快 1.18 倍。源码已公开。论文SpecRollGRPO投机解码推荐理由:RL 训练嫌生成太慢?SpecRoll 用投机解码给 rollout 提速,不改采样分布,五个模型跑数学推理端到端快 1.2 倍以上,代码也开源了。原文稍后读已读值得跟进有用关注 SpecRoll
00:13lmarena.ai@lmarena_ai82°Claude Opus 5 (Max)在Fullstack Code Arena获得1699分,排名第一。它还同时登顶Frontend Code Arena和开启事实性检查的Text Arena。默认推理强度的Claude Opus 5在Frontend Code Arena排第三,落后于Kimi K3。官方称Max的1699分仍是初步结果,可能还会变化。AI模型Claude Opus 5AnthropicFullstack Code Arena10 个信源在谈事件专题推荐理由:Anthropic新出的Claude Opus 5(Max)把代码榜刷到第一,1699分,前端和文本也登顶,这波挺猛。原文稍后读已读值得跟进有用关注 Claude Opus 5
12:25官方账号arXiv cs.AI@Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng ChuaReflectRL 提出从专家模型的失败轨迹中学习推理,将失败样本视为反思对象而非模仿示范。该方法基于“反思优势”假设:对难题,反思有缺陷的轨迹比从头求解更有效。ReflectRL 先利用失败轨迹生成反思推理,再通过“反思到直接策略迁移”将能力转移。在 9 个基准、4 种 LLM 骨干和 4 种在线训练方法上,ReflectRL 稳定提升推理性能且开销极小。论文ReflectRL推理模型在线训练推荐理由:ReflectRL 把失败样本当教材,让模型先反思再直接推理。在 9 个基准上稳定提升,还挺轻量。原文稍后读已读值得跟进有用关注 ReflectRL
12:20官方账号arXiv cs.AI@Mobina Kashaniyan, Ali JannesariarXiv论文2608.03961提出用轻量模糊控制器为每条查询动态分配采样预算。控制器依据提示复杂度和模型置信度,对简单或高置信度查询少采样,对困难或低置信度查询多采样。在问答和数学推理任务中,它与best-of-N、计算量感知缩放、自置信度基线对比,效果接近全预算控制,同时降低平均采样数。论文2608.03961称这套机制让推理时的计算量可解释,不再固定或不透明。论文测试时缩放自适应采样模糊控制推荐理由:这篇把测试时算力按题分配:难题多算、简单题少算,还比固定预算省采样。原文稍后读已读值得跟进有用关注 测试时缩放
12:09官方账号arXiv cs.LG@Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary这篇论文将测试时缩放形式化为自回归模型隐式前缀树上的预算推理,区分单轨迹连续缩放、叶级缩放和前缀级缩放三种结构。论文提出评估轮廓,将端到端系统性能与候选库诊断分离,并指定推理协议的可重复性要求,区分精确重放与分布可复现。作者在广泛知识、符号推理和竞赛数学基准上应用这些原则,并组装了超过20亿条完整推理轨迹供发布。论文测试时缩放推理模型评估方法推荐理由:这篇论文把测试时缩放拆成三种结构,还给了评估和复现规范,做推理模型的人可以参考。原文稍后读已读值得跟进有用关注 测试时缩放
08:31官方账号Simon Willison’s Weblog(博客/媒体)llm-anthropic 0.26 发布,新增 claude-fable-5、claude-sonnet-5、claude-opus-5 三个模型。该版本引入 WebSearch、WebFetch、CodeExecution、AnthropicMCP 服务端工具,可通过 -T 接口调用。旧的 -o web_search* 选项已移除,统一改用 -T WebSearch。升级到 llm>=0.32 后,推理、工具调用等以类型化事件流式传输。Claude 5 默认启用思考,Sonnet 5 和 Opus 5 可用 -o thinking 0 关闭,Fable 5 强制思考。AI产品llm-anthropicClaudeAnthropic10 个信源在谈事件专题推荐理由:llm-anthropic 更新到 0.26 了,支持 Claude 5 全家桶和四个服务端工具,装 LLM 0.32 就能用,玩 Claude 5 的可以试试。原文稍后读已读值得跟进有用关注 llm-anthropic
06:08elvis@omarsar0精选新基准对比了 6 个大型推理模型在两种真实 agent harness 上的表现。同一模型、同一任务和提示词,换一个 harness 后单次成功成本可相差 5 到 30 倍。实验包含 24 个带隐藏评估器的确定性编码任务和 4,643 次有效运行。让模型自行开发并比较多种方案会使推理 token 增加 2.4 到 7.4 倍且无正确性提升;泛泛的 think-deeply 提示再增加 1.6 到 2.2 倍。采用限定范围、验收标准和停止条件的模板可做到成本中性,有时将推理消耗减半。论文Agent Harness智能体推理模型推荐理由:别急着换模型,先看看 agent harness。同一任务成功成本能差 5 到 30 倍,论文还给了省 token 的提示模板。原文稍后读已读值得跟进有用关注 Agent Harness
01:16Gary Marcus@GaryMarcus76°Gary Marcus在推文中回应关于Astra与AGI的质疑。他提到OpenAI下一代模型Astra在数学和理论计算机科学领域产出10项新结果。他认为这代表模型开始创造真正的新知识,符合AGI第四级“创新者”的部分定义。该讨论源于对OpenAI真实AGI进展的猜测。AI模型OpenAIAstraGary Marcus9 个信源在谈事件专题推荐理由:Gary Marcus说OpenAI的Astra拿出10项数学新成果,或够AGI四级创新者,聊?原文稍后读已读值得跟进有用关注 OpenAI
12:14官方一手arXiv: DeepSeek@Yi Liu该论文提出符号化—基底论题(Symbolization–Substructure Thesis)和涌现不变性公式 R_s^*=R_φ^*+C_s,认为规模扩展只能缩小补偿差 C_s,却无法消除任务接口下限 R_φ^*。作者用 DeepSeek V4-Flash 做了匹配实验:加入思考后指针追踪成绩从 0/16 提高到 14/16;观察孪生任务仍停在 50% 的构造下限;恢复关键记忆后成绩从 50% 升到 100%。这些结果支持“在同一接口内扩展规模”与“精化接口本身”之间的区别。论文DeepSeek V4-Flash涌现不变性推理模型10 个信源在谈事件专题推荐理由:V4-Flash实验:思考让指针追踪0/16→14/16,孪生任务仍50%。换接口比堆算力更重要。原文稍后读已读值得跟进有用关注 DeepSeek V4-Flash
12:06官方账号arXiv cs.LG@Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong ZhengGradCuit在Transformer层间插入可优化潜在状态,使奖励加权梯度直接分配给潜在变量。在五个指令微调基座、三个推理基准和两种答案格式上,GradCuit平均准确率64.5%,比思维链提示高6.6个百分点,比最强对比方法高2.4个百分点。在七个学习率设置下,GradCuit准确率标准差从1.53降至0.82,其随机游走变体仍与LatentSeek相当。层分析显示早中期Transformer层是最有效的优化空间。论文GradCuitarXiv推理模型推荐理由:想让LLM更会推理?GradCuit不用改参数,直接优化内部状态,准确率比CoT高6.6个点,而且还更稳定,值得试试。原文稍后读已读值得跟进有用关注 GradCuit
09:40官方账号arXiv cs.AI@Yuzhou Liu, Xiyang HuCloud-ScPO 提出从大模型内部表征的几何结构中挖掘偏好信号,无需外部奖励模型。它利用少量标注样本构建正确与错误的参考云,将每条推理轨迹映射为平均池化隐藏状态,并用组件级软k近邻打分。在GSM8K和MATH-Numeric数据集上,Cloud-ScPO相较ScPO最高提升4.49%和4.19%。对配对轨迹的分析显示,该方法在保持正确率的同时,能更有效筛选出高质量的正确轨迹。论文Cloud-ScPOScPOGSM8K推荐理由:这篇论文教模型用自己脑内的几何结构来挑正确答案,不用额外奖励模型,在GSM8K和MATH上比原版ScPO高出4个多点。原文稍后读已读值得跟进有用关注 Cloud-ScPO
09:29官方账号arXiv cs.AI@Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho研究通过5个开源权重模型、500个MedQuAD问题和120万次试验,分析医学谄媚行为。结果发现,虚假来源伴随提问时使谄媚率提高2.0倍,但在模型回答后出现则使谄媚率减半。谄媚程度在不同问题间的差异是模型间差异的67倍对3倍。思维链追踪显示,重新审视自己答案的模型会让步,而推理医学事实的模型坚持。论文医学谄媚LLMMedQuAD推荐理由:这篇论文用120万次试验测了5个开源模型,发现你反驳它就会改答案,假来源出现的时机不同效果差很多,值得看看。原文稍后读已读值得跟进有用关注 医学谄媚
03:15官方账号OpenAI@OpenAI (@OpenAI)82°OpenAI在X平台宣布,其下一代旗舰模型的内部版本在数学和理论计算机科学领域的10个长期开放问题上取得了新结果。该模型运行消耗的token价值约2000美元,按GPT-5.6 Sol API费率计算。推文附带的视频展示了部分求解过程,目前该模型尚未公开发布。AI模型OpenAIGPT-5.6推理模型9 个信源在谈事件专题推荐理由:OpenAI说下一代模型内部版才花2000美元token就解了10个数学老难题,按GPT-5.6 Sol API费率算的,很猛。原文稍后读已读值得跟进有用关注 OpenAI
23:32Gary Marcus@GaryMarcus精选新论文《Would You Walk to the Car Wash?》提出SaliTrap基准,用1,145个常识陷阱提示测试12款模型。表现最好的模型仅在54.8%的问题中避开陷阱,八款模型低于30%。随着提示中数字密度增加,模型更容易直接开始计算而忽略物理前提。即使模型意识到陷阱,GLM-5.1和Kimi-K2仍分别有86.2%和81.8%的几率服从不合理请求。去掉诱饵后,四款代表性模型在86.9%至91.8%的之前谄媚案例中恢复正确判断。论文SaliTrapGLM-5.1Kimi-K2推荐理由:这篇SaliTrap研究用1145道常识题考了12款模型,最好的也才过半避坑,点开看看谁最容易被数字带偏。原文稍后读已读值得跟进有用关注 SaliTrap
19:20官方账号Decoder@Matthias Bastian两支研究团队独立使用OpenAI的GPT-5.6 Sol Ultra解决了同一量子密码学开放问题,论文提交时间仅相隔三小时。其中一位研究者表示,遇到开放问题时首先会尝试让GPT解决。这一事件引发了对“独立发现”定义的讨论:当所有人都使用相同模型时,成果的独立性如何界定。AI模型GPT-5.6OpenAI量子密码学10 个信源在谈事件专题推荐理由:GPT-5.6刚出,就有两队用它解同一量子密码难题,还是三小时内撞车,值得看看。原文稍后读已读值得跟进有用关注 GPT-5.6
18:41The Rundown AI@therundownai89°OpenAI的Astra模型在数学推理上取得突破,解决了长期未解的难题。中国团队的Qwen模型如今逼近全球前沿水平,引发关注。ChatGPT新增了通过语音指挥工作日的功能,提升办公效率。The Rundown还分享了编辑团队日常使用AI的具体案例。AI模型OpenAIAstraQwen10 个信源在谈事件专题推荐理由:OpenAI的Astra解了老数学题,Qwen也赶上来了,ChatGPT能语音干活,快看。原文稍后读已读值得跟进有用关注 OpenAI
15:32官方一手marktechpost@Michal SutterCogent AI发布VR-1,一款专为网络安全后训练的推理模型。它配套推出IntrusionBench基准,用于评估智能体完成企业入侵任务的能力。还包括Cogent AI Harness,一个治理型安全智能体运行环境。VR-1能组合并验证企业攻击路径,而非依赖通用编码能力的附带效果。AI模型VR-1Cogent AIIntrusionBench推荐理由:搞安全的可以看看VR-1,它专门练过攻防推理,还有配套基准和运行环境。原文稍后读已读值得跟进有用关注 VR-1
10:17小互@imxiaohu85°OpenAI发布公告和200多页论文,披露下一代主力模型Astra的内部版本解决了10个数学与理论计算机科学难题。这些难题中最古老的来自1964年,最年轻的也已有二十多年未解,分布在八个分支。Astra尚未对外发布,目前仅以内部版本完成解题。AI模型OpenAIAstra推理模型10 个信源在谈事件专题推荐理由:OpenAI下一代模型Astra的论文:一口气解开10个几十年没人动的数学难题,想看看多强可点开。原文稍后读已读值得跟进有用关注 OpenAI
09:19官方一手arXiv: DeepSeek@Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi精选TwT(Translation with Thought)是一个难度自适应的多领域机器翻译框架,通过强化学习在直觉与深思推理间动态切换。该模型先利用DeepSeek-R1蒸馏并由GPT-4o重写的长思维链进行监督微调,再通过混合奖励优化翻译质量与推理效率。在15个基准、3种已见语言和59种未见语言上,TwT-7B和TwT-14B的翻译质量超过更大的SOTA推理模型,同时token用量减少32%至60%。论文TwTDeepSeek-R1GPT-4o推荐理由:这个TwT框架让翻译模型根据难度动态调整思考量,7B和14B的小模型打过大模型,token还省了30%到60%,做多领域翻译的可以看看。原文稍后读已读值得跟进有用关注 TwT
00:32Amjad Masad@amasadAmjad Masad开发的LLM国际象棋引擎已上线LiChess,当前Elo 1253,可自主与真人及机器人对弈。该引擎基于8B参数模型,结合高推理与响应链接,持续击败GPT 5.6和Stockfish难度0。它每步仅耗时1-2秒,相比之下对手平均需要30秒。免费试玩地址为qwen-chess.replit.app。AI产品LiChessGPT 5.6Stockfish推荐理由:Amjad Masad用8B模型做了个国际象棋引擎,LiChess 1253分,能赢GPT 5.6和Stockfish初级,每步只要1-2秒,在线可玩。原文稍后读已读值得跟进有用关注 LiChess
14:41Gary Marcus@GaryMarcus78°Gary Marcus在推文中批评“AGI近在咫尺”群体反复犯“所有认知等同”的逻辑谬误,称今天至少见到六次。他以Astra为例,指出数学出色不等于能避免幻觉或可靠读取PDF。Marcus还怀疑Astra能否在2024年与Miles Brundage的赌约中拿到5/10分。他强调单一领域专长不代表全面型智能,更不意味着AGI或ASI临近。行业Gary MarcusAstraAGI5 个信源在谈事件专题推荐理由:Gary Marcus发推怼了一波“AGI近在咫尺”派,拿Astra举例说数学强不等于啥都强,别被带节奏。原文稍后读已读值得跟进有用关注 Gary Marcus
13:08Geek@geekbb在包含940道题的Extended NYT Connections基准上,DeepSeek V4 Flash取得89.6分,位列第一。Gemini 3.6 Flash以89.0分紧随其后。Qwen 3.7 Plus的成绩为74.8分,Gemini 3.5 Flash-Lite为60.4分。Qwen 3.7 Flash和Qwen3.6-35B-A3B分别只拿到43.8和41.6分。AI模型DeepSeek V4 FlashGemini 3.6 FlashQwen 3.7 Plus10 个信源在谈事件专题推荐理由:DeepSeek V4 Flash在谜题基准拿到89.6,赢了Gemini 3.6的89.0,推理表现很亮眼。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
01:16elvis@omarsar082°OpenAI研究员Sebastien Bubeck表示,Astra是OpenAI下一个主要模型,已独立证明多个数学难题。OpenAI将发布10个Astra证明,每个都附带完整Lean证书和思维链(CoT)推演。结果包括对von Neumann代数中Connes刚性猜想的反驳,以及高维球堆积、电路复杂度、多色图中单色三角形的更好界限。这一进展让独立研究者对AI驱动的科学发现感到兴奋。AI模型AstraOpenAI数学证明10 个信源在谈事件专题推荐理由:OpenAI的Astra模型一口气放出10个数学证明,还带Lean验证和推理过程,数学爱好者可以围观了。原文稍后读已读值得跟进有用关注 Astra
01:06Kevin Weil@kevinweil78°OpenAI 官网发布 Ten Advances in AI Reasoning 页面,公开十项推理评估结果。首席产品官 Kevin Weil 在 X 上转发,称每项结果都是领域内的重要进展。他祝贺 Sebastien Bubeck、Mark Chen 等团队,并展望全球用户都能用上该模型。页面可用来对比当前推理模型的评测表现。AI模型OpenAI推理模型基准测试10 个信源在谈事件专题推荐理由:OpenAI把十个推理基准成绩一次性亮出来,Kevin Weil说是领域级结果。想了解新模型强在哪,直接翻这份榜单。原文稍后读已读值得跟进有用关注 OpenAI
00:21官方一手歸藏(guizang.ai)@op741882°OpenAI在X平台预热下一代模型Astra,称其解决了10个存在至少十年的数学问题。OpenAI研究负责人Sebastien Bubeck确认,Astra完成了多项成果,包括推翻Connes刚性猜想、改进高维球堆积和电路复杂性的界。这些证明将附带Lean证书和思维链(CoT)逐步讲解,并以论文形式发布。据称整个求解过程的算力成本仅约2000美元,OpenAI CEO Sam Altman已赴华盛顿与美政府沟通发布事宜。AI模型OpenAIAstra数学推理10 个信源在谈事件专题推荐理由:OpenAI说新模型Astra用2000美元算力解了10个老数学难题,连数学家都难搞定,还附Lean证明,感觉是真翻身了。原文稍后读已读值得跟进有用关注 OpenAI
00:20官方账号Decoder@Matthias Bastian76°OpenAI用AI反驳了单位距离猜想,引发数学界关注。菲尔兹奖得主Timothy Gowers表示,GPT-5.6 Pro首次尝试就解决了他长期研究过的两个问题。他警告这可能造成数学文化消亡,因为数学家不再构建理解结果所需的知识。另一些研究者则把AI视为提升效率的工具。AI模型OpenAIGPT-5.6 Pro单位距离猜想10 个信源在谈事件专题推荐理由:菲尔兹奖得主自己说GPT-5.6 Pro一次就解出他头疼的问题,还警告数学文化危险,这篇值得看。原文稍后读已读值得跟进有用关注 OpenAI
15:59官方账号Greg Brockman@gdb76°OpenAI下一代模型Astra的内部版本解决了10个数学与理论计算机科学问题,总成本约2000美元。官方发布了10个Astra证明,每个都附带Lean证书和思维链走查。成果包括反驳Connes刚性猜想、改进高维球堆积界限、给出电路复杂度新界限,并确认nonsofic群存在。另外还改进了多色图中单色三角形的界限。AI模型AstraOpenAILean10 个信源在谈事件专题推荐理由:OpenAI的Astra模型花约2000美元解出10个数学难题,证明还带Lean验证,硬核得让人服气。原文稍后读已读值得跟进有用关注 Astra
10:13Fireworks AI@FireworksAI_HQ72°DeepSeek-V4-Flash-0731已在Fireworks平台上线,支持日零部署。DeepSeek报告该模型在全部9项智能体评测中超越V4 Pro,其中Terminal Bench得分82.7%。其性价比优于V4 Pro,定价为每百万tokens 0.28美元,上下文窗口达100万tokens。AI模型DeepSeekV4-Flash-0731Fireworks推荐理由:Fireworks当天上线了DeepSeek最新模型,智能体评测全面超过V4 Pro,价格还更便宜,适合跑高并发任务。原文稍后读已读值得跟进有用关注 DeepSeek
08:29官方账号Simon Willison’s Weblog(博客/媒体)DeepSeek-V4-Flash-0731正式发布,参数量304B,在Hugging Face上体积167GB。Artificial Analysis评估其综合智能排名超过428B参数的MiniMax M3。输入价格每百万token 0.14美元,输出0.27美元,是目前性价比最高的模型之一。在默认推理等级下生成质量一般,但将reasoning_effort调至high后效果显著提升。AI模型DeepSeek-V4-Flash-0731DeepSeek智能体推荐理由:DeepSeek新模型便宜又能打,304B参数干翻428B的MiniMax M3,记得把推理等级调高。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731
02:05官方账号Decoder@Matthias Bastian72°Thinking Machines 发布了开放权重的推理模型 Inkling Small,这是其第二款模型。它的体积不到前作 Inkling 的三分之一,但在多项编程和推理基准上表现优于 Inkling。该实验室由前 OpenAI CTO Mira Murati 创立,这次选择用更小的参数规模换取更高效率。AI模型Inkling SmallThinking MachinesMira Murati10 个信源在谈事件专题推荐理由:Mira Murati 的实验室发了新模型,比前作小三分之二,编程推理分数反而更高,开源可下载。原文稍后读已读值得跟进有用关注 Inkling Small