01:57Mustafa Suleyman@mustafasuleyman精选76°微软发布其首款推理模型 MAI-Thinking-1。该模型从零开始构建,而非基于现成架构。目前已在 Microsoft Foundry 平台上开放使用。团队负责人 Mustafa Suleyman 在 X 平台公布了这一消息。AI模型MAI-Thinking-1Microsoft推理模型推荐理由:微软自己从头搞了个推理模型 MAI-Thinking-1,已经放到 Foundry 里能用了,想试推理模型的可以去看看。原文稍后读已读值得跟进有用关注 MAI-Thinking-1
00:18OpenRouter@OpenRouterAI精选OpenRouter 将模型对比评测改为并行运行,普通对比速度提升约 5 倍。新版本支持在单次运行中比较不同的推理努力(reasoning effort)参数,而不只限于模型。检查失败时现在会输出具体错误原因,便于定位问题。该更新面向在 OpenRouter 上运行评估的用户。AI产品OpenRouter模型评估推理模型推荐理由:OpenRouter 的评测跑得更快了,同一轮能比推理参数,出错也不再一头雾水。适合经常跑模型对比的人。原文稍后读已读值得跟进有用关注 OpenRouter
19:32The Rundown AI@therundownaiAnthropic近日发布了一项新研究,聚焦于提升Claude模型在复杂任务中的表现。该研究引入了新的训练方法,使Claude在推理和代码生成任务上取得了显著进步。在多个基准测试中,Claude的得分超越了前代版本,接近GPT-4的水平。研究团队还公开了部分技术细节,为后续模型优化提供了方向。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发了新研究,Claude在推理和代码上又强了,接近GPT-4,想了解细节的可以看看。原文稍后读已读值得跟进有用关注 Anthropic
17:33官方账号阿里通义 Qwen@Alibaba_Qwen精选Qwen3.8-Max在Legal Research Bench上的得分在不到三个月内几乎翻倍,排名从第22位跃升至第4位。Vals AI在推文中强调了这一进步,并附上了相关链接。该模型在基准测试中的显著提升展示了其在法律研究领域的性能增强。AI模型Qwen3.8-MaxLegal Research BenchVals AI推荐理由:Qwen3.8-Max在Legal Research Bench上从第22冲到第4,三个月内得分翻倍,看看它怎么做到的。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
17:12Yangyi@Yangyixxxx安全研究人员发现OpenAI、Anthropic、Google等主要AI提供商的API存在漏洞,可读取推理模型的加密思考过程。扫描约7000条公开会话后,发现62个API密钥、33个邮箱和33个密码。该漏洞影响Claude、GPT等推理模型的隐私保护机制。行业API安全推理模型OpenAI10 个信源在谈事件专题推荐理由:安全研究员发现API漏洞能偷看Claude、GPT的加密思考过程,还扫出62个密钥,搞AI开发的得看看。原文稍后读已读值得跟进有用关注 API安全
16:04AI Will@FinanceYF5精选NVIDIA推出Nemotron 3.5 Lightning,专为长时运行的智能体任务设计。该模型总参数量30B,激活参数3B,支持高达1M token的上下文,并已开放商用。NVIDIA提供BF16和更小的NVFP4量化检查点,支持在单张H100或DGX Spark上部署,也兼容RTX 5090。通过多token预测、DSpark和DFlash投机解码以及NVFP4量化,生成速度最高提升4倍。在PinchBench基准上,其准确率达86%,完成速度比Qwen3.6 35B快30%。AI模型Nemotron 3.5 LightningNVIDIA智能体10 个信源在谈事件专题推荐理由:NVIDIA出了个轻量模型,30B参数但只激活3B,跑长任务上下文能到1M,单卡就能部署,速度还快4倍。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
10:01lmarena.ai@lmarena_ai精选Upstage 发布 Solar Pro 4,成为首个登上 Agent Arena、Code Arena: WebDev 和 Text Arena 榜单的韩国实验室模型。Solar Pro 4 在 Agent Arena 排名第 44,与 MiniMax M2.7 和 Nemotron 3 Ultra 并列,整体净改进得分为 -12.10%。该模型在 GDPval-AA 得分为 39,τ³-Banking 为 23,Terminal-Bench 2.1 为 57,定价为每百万 tokens 0.30 美元(输入)和 1.20 美元(输出),缓存价格 0.06 美元,优惠 90% 至 9 月 10 日。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 的 Solar Pro 4 是首个登上多个 Arena 榜单的韩国模型,适合做生产级智能体,价格便宜,值得试试。原文稍后读已读值得跟进有用关注 Solar Pro 4
00:43官方账号Microsoft Research@MSFTResearch精选微软研究院推出CARE-X,一个结合灵活推理、校准预测和基于测量工具的统一框架,用于胸部X光解读。该框架超越了传统报告生成,旨在提升AI在放射学中的实用性和可靠性。CARE-X通过整合多种能力,可能改善诊断准确性和临床决策支持。相关细节在微软研究院的推文中公布。AI模型CARE-X微软研究院胸部X光推荐理由:微软研究院搞了个CARE-X,把推理、预测和测量工具整合起来做胸片解读,比单纯生成报告更进一步,搞放射AI的可以看看。原文稍后读已读值得跟进有用关注 CARE-X
23:42elvis@omarsar0精选Alexander Panfilov等人发现了一种利用前沿AI公司API漏洞提取隐藏推理过程的方法。该方法在大多数查询中,推理token计数与API计费思考token实现1:1匹配。这一发现表明,在不破坏加密的情况下,蒸馏推理轨迹可能早已可行。相关讨论在X平台上引发关注。论文推理模型API漏洞token推荐理由:有人发现了从各家前沿模型API里偷看隐藏推理的漏洞,还验证了计费token对得上,挺有意思的。原文稍后读已读值得跟进有用关注 推理模型
23:34官方账号Decoder@Matthias Bastian精选Nvidia发布开源权重模型Nemotron 3.5 Lightning,仅36亿活跃参数,在智能指数上与OpenAI的gpt-oss-120b持平,但体积小四倍。该模型每秒处理近670个token,是对比中速度最快的模型。Nvidia此举表明其更注重效率而非模型规模。AI模型Nemotron 3.5 LightningNvidiagpt-oss-120b10 个信源在谈事件专题推荐理由:Nvidia新出的开源模型,36亿参数跑得比1200亿的还快,速度拉满,适合追求低延迟的开发者。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
23:22elvis@omarsar0精选Pathway的BDH-CQ模型在ARC-AGI 1基准上获得29.5%的分数,但每个任务成本仅为0.0007美元。该模型通过潜在空间中的循环推理而非链式思维(CoT)来实现这一成绩。研究团队还验证了类似Transformer的扩展规律,参数规模可达6000亿。这一成果展示了在成本效率上的显著优势。AI模型BDH-CQARC-AGIPathway推荐理由:Pathway的BDH-CQ用极低成本在ARC-AGI 1拿到29.5%,靠的是潜在空间推理而不是CoT,还验证了600B参数规模,值得一看。原文稍后读已读值得跟进有用关注 BDH-CQ
19:30The Rundown AI@therundownaiMeta 在 AI 模型竞赛中重新发力,发布了一款新的推理模型。该模型在多项基准测试中表现突出,包括数学和代码生成任务。Meta 此举旨在与 OpenAI 和 Anthropic 等公司竞争。具体模型名称和详细性能数据尚未完全公开。AI模型Meta推理模型基准测试10 个信源在谈事件专题推荐理由:Meta 又出新推理模型了,想看看它跟 GPT 和 Claude 比怎么样,这篇可以了解个大概。原文稍后读已读值得跟进有用关注 Meta
19:02IT之家(博客/媒体)88°Anthropic 于 8 月 11 日宣布,未公开的研究版 Claude 在攻克黎曼猜想中取得进展,将临界线上零点比例下界从 41.6% 提升至 67.2%。Claude 在 Claude Code 中自主完成研究,生成 3,100 万个 Token,经历 650 次失败后调集 60 个子级智能体,执行 2,400 条 Shell 命令并编写数百个 Python 脚本。结果经内部数学家莱文特·阿尔波格和拉尔夫·弗曼验证,并由外部专家布赖恩·康雷和丹·戈德斯顿审阅,证明已写成 Lean 可验证形式。Anthropic 公布了论文、过程记录及形式化证明,但未透露多智能体能力是否近期开放。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Anthropic 的 Claude 把黎曼猜想零点下界从 41.6% 提到 67.2%,还放出论文和 Lean 证明,数学和 AI 圈都值得看看。原文稍后读已读值得跟进有用关注 Claude
15:08Geek@geekbb72°DeepSeek V4 系列 API 定价在 X 平台曝光。V4-Flash 百万 tokens 输入命中缓存仅 0.02 元,未命中 1 元,输出 2 元。V4-Pro 对应价格分别为 0.025 元、3 元和 6 元。Flash 版并发限制 2500,Pro 版 500,按账号粒度计算。AI产品DeepSeekV4API推荐理由:DeepSeek V4 价格出来了,Flash 版命中缓存才 2 分钱,比白菜价还便宜,做批量任务的朋友可以算算账了。原文稍后读已读值得跟进有用关注 DeepSeek
14:40IT之家(博客/媒体)科技媒体 testingcatalog 发现谷歌正酝酿 Gemini 3.7 Flash 模型,其踪迹出现在 Python GenAI SDK 的 GitHub 页面。内部曾尝试添加 gemini-3.7-flash 模型,但因命名错误被拒绝。目前谷歌官方 API 仍以 7 月 21 日发布的 Gemini 3.6 Flash 为主。Flash 系列平均约两个月更新一代,外界推测 3.7 可能处于内部测试阶段,发布时间待官方公告。AI模型Gemini谷歌Gemini 3.7 Flash推荐理由:谷歌 Flash 系列又要换代了,3.6 才出不到一个月,3.7 的踪迹就露出来了,想追新模型的可以提前关注。原文稍后读已读值得跟进有用关注 Gemini
14:33量子位@一水83°Anthropic的未公开Claude模型在黎曼猜想相关问题上创下新纪录,将下界显著推高。该模型在数学推理基准上表现突出,超越了此前的最佳结果。具体提升幅度和基准名称尚未完全公开,但已引发学界关注。这一进展展示了AI在高级数学研究中的潜力。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Anthropic偷偷用新模型刷了数学纪录,下界直接拉高,数学和AI圈都该看看。原文稍后读已读值得跟进有用关注 Claude
12:59宝玉@dotey有用户用未发布的Claude模型尝试攻克黎曼猜想,模型探索了650个方向均失败。在人类持续鼓励下,模型虽未最终攻破猜想,但取得了数学上一个不错的结果。该用户还对比了此前用威胁方式PUA DeepSeek-v4-flash效果不佳,认为大模型更适合鼓励式引导。技巧ClaudeDeepSeek黎曼猜想6 个信源在谈事件专题推荐理由:有人拿未发布的Claude试攻黎曼猜想,650次失败后靠鼓励拿到好结果,还对比了威胁式PUA DeepSeek的效果,挺有意思。原文稍后读已读值得跟进有用关注 Claude
12:47官方账号arXiv cs.LG@Lecheng Kong, Like Hui, Haitao Mao, Jun Huan论文指出基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上会崩溃,因为高置信度常表示探索失败。作者提出Consilience框架,通过评估推理中置信度的时间不对称性,惩罚初始高置信度并要求最终确定性。在研究生级数学问题和自由形式代码生成实验中,Consilience优于现有基线。论文Consilience测试时扩展推理模型推荐理由:如果你做推理模型,这个框架能解决置信度评分在复杂任务上失效的问题,用时间不对称性挑出真正靠谱的答案。原文稍后读已读值得跟进有用关注 Consilience
11:51官方账号arXiv cs.AI@Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard ZhongBDH-CQ 是一种结合上下文学习与循环潜在推理的推理模型,推理时输入持续更新模型记忆,并在高维潜在空间迭代计算,不输出中间推理过程。在 ARC-AGI-1 公开评测集上,150M 参数配置达到 29.5% pass@2,单任务推理成本仅 0.0007 美元。该结果突破了 ARC-AGI-1 此前报告的成本-准确率帕累托前沿,树立了新的基准成本效率标杆。研究还通过受控 ARC 干预实验,分析了模型从演示中学习的内容、应用推断变换的一致性及难点概念。论文BDH-CQARC-AGI-1推理模型推荐理由:这个模型用循环潜在推理做上下文学习,150M 参数在 ARC-AGI-1 上花 0.0007 美元就拿到 29.5% 的 pass@2,性价比直接刷新纪录,值得看看它怎么做到的。原文稍后读已读值得跟进有用关注 BDH-CQ
11:44官方账号arXiv cs.AI@Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko精选76°Anthropic、OpenAI和Google等主流LLM提供商将推理轨迹加密后返回客户端,但研究发现这些加密块在会话、用户和模型间可互换。攻击者将加密轨迹注入同提供商的较弱模型,可强制其明文输出推理内容,无需直接越狱更强模型。通过解码315,320个推理块,研究者恢复了367个PII和182个凭证。该漏洞还支持隐形提示注入,可污染智能体部署。论文提出加密和系统级缓解措施。论文推理模型AI安全Anthropic10 个信源在谈事件专题推荐理由:这篇论文揭露了Anthropic、OpenAI和Google推理加密的漏洞,能跨模型解密,还挖出大量隐私数据,搞AI安全的必看。原文稍后读已读值得跟进有用关注 推理模型
11:35shao__meng@shao__meng精选webAI Intelligence Lab 开源了首个形式化推理模型 TwiL-LM3,参数量仅 3B。在 5 项形式化推理基准中,TwiL-LM3 有 4 项超过 OpenAI 的 GPT-OSS-120B,参数量约为后者的 1/40,推理速度快 2.6 倍。该模型基于 webAI 自有的验证数据集训练,而非抓取互联网数据,可在树莓派或 iPhone 等消费级硬件上运行。AI模型TwiL-LM3webAIGPT-OSS10 个信源在谈事件专题推荐理由:3B 的小模型在推理上干翻了 120B 的大家伙,还能跑在树莓派上,开源了直接就能玩。原文稍后读已读值得跟进有用关注 TwiL-LM3
10:25官方账号arXiv cs.AI@Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung ChenAvalon-ToM-Bench 将心智理论拆分为 2×2 分类法,涵盖认知与动机推理、推断与行动。对 28 个大语言模型的测试显示,模型对游戏规则理解良好,但心智理论能力明显偏弱。线性探测从隐藏状态恢复心智判断的准确率达 77-82%,高于模型自身思维链的 62-70%。专门的推理训练平均带来 +11.0 分提升,而测试时思维链仅 +1.1 分。论文Avalon-ToM-Bench心智理论大语言模型推荐理由:想测 AI 到底懂不懂人心?这个基准用阿瓦隆桌游把心智理论拆成细粒度任务,28 个模型都栽了。原文稍后读已读值得跟进有用关注 Avalon-ToM-Bench
09:58IT之家(博客/媒体)8月10日有网友发帖称,DeepSeek在深度思考模式下会给用户取“墨墨”等外号。DeepSeek回应称,这实际上是推理过程中临时生成的“上下文占位符”标签。该标签用于帮助模型理清回答侧重点,不会存储或记忆。IT之家提醒,相关解释是AI回复而非工作人员回应。行业DeepSeek取外号上下文占位符推荐理由:原来DeepSeek思考时会偷偷给人打标签,还起外号,官方说是临时的,看看它是怎么解释的。原文稍后读已读值得跟进有用关注 DeepSeek
03:29Gary Marcus@GaryMarcusAnthropic在官方博客公布,未发布的研究版Claude尝试解决黎曼假设,虽未成功,但在相关问题取得进展。该模型将黎曼zeta函数满足假设的零点比例下界从41.6%提升到67.2%。AI研究者Gary Marcus在X上指出,业余研究者QualiaQuanta的类似尝试曾被嘲讽,而Claude的尝试在30分钟内获得10万次浏览,存在双重标准。AI模型ClaudeAnthropic黎曼假设10 个信源在谈事件专题推荐理由:Anthropic让Claude试解黎曼假设,没解开但把零点下界从41.6%刷到67.2%,感受下AI数学推理现在能到哪一步。原文稍后读已读值得跟进有用关注 Claude
11:25官方一手arXiv: DeepSeek@Devin Pereira, Willem Zuidema精选论文研究Transformer在河内塔规划任务中的表现,发现小型自训练模型能涌现出线性可解码的几何世界模型(谢尔宾斯基三角),该模型与解题存在因果关联。对Qwen3.6-27B和DeepSeek-R1-Distill-Qwen-32B两个前沿推理模型的分析显示,它们能在提示末尾近乎完美地编码该世界模型,但圆环数超过3个时仍会在多数任务上失败。探针实验表明失败源于规划过程中世界模型表征的衰减,而非缺失。在推理时注入提示阶段的表征可部分恢复性能。论文Qwen3.6-27BDeepSeek-R1-Distill-Qwen-32B世界模型推荐理由:这篇论文说推理模型其实能建出世界模型,但解题中途就弄丢了。它用小模型和可解释性方法把问题定位得很清楚,还给出了补救办法。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
08:02Gary Marcus@GaryMarcusGary Marcus在X平台转发Luca Ambrogioni的推文,表示认同其观点。Luca认为LLM存在被推理和智能体流水线进展掩盖的根本性缺陷。该推文目前获得13次点赞、5条回复和2424次浏览。行业LLMGary Marcus推理模型推荐理由:Gary Marcus转推吐槽LLM有根本硬伤,被推理和智能体流水线盖住了,观点挺犀利,看看你认不认。原文稍后读已读值得跟进有用关注 LLM
07:04IT之家(博客/媒体)76°OpenAI于8月10日宣布,ChatGPT免费版和Go版用户在纯文本对话中不再有消息数量上限。本周起,免费和Go账户默认模型从GPT-5.5 Instant切换为GPT-5.6 Luna,后者是产品线中最小模型。新增的'Think'按钮让Luna在回答前投入更多计算,纯文本下同样不限次数,但结合图片或文件会重新受限。付费用户使用的旗舰模型GPT-5.6 Sol获得对话自然度优化,并减少不必要的格式化内容。Plus和Pro用户还可通过新的'思考强度'选项控制GPT-5.6 Sol的推理资源消耗。AI产品ChatGPTOpenAIGPT-5.6 Luna10 个信源在谈事件专题推荐理由:OpenAI取消免费版聊天次数限制,换用Luna模型,还加了Think按钮,日常用更自由。原文稍后读已读值得跟进有用关注 ChatGPT
19:00量子位@克雷西GPT-5.6与Fable合作,解出了一道悬置25年的数学难题。该问题曾让一位研究者从读博期间开始钻研,历时17年未果。这次联合解题展示了AI在数学推理上的新进展。AI模型GPT-5.6Fable数学难题推荐理由:GPT-5.6和Fable联手,把25年没人解出来的数学题搞定了,研究它的人从读博等到现在17年。原文稍后读已读值得跟进有用关注 GPT-5.6
11:31官方账号Greg Brockman@gdbARC Prize团队重新测试了OpenAI的GPT-5.6 Luna,在ARC-AGI-2上取得59.6%准确率,每任务成本0.18美元。在ARC-AGI-1上取得90.7%准确率,每任务成本0.07美元。降价后新结果与原始性能一致,而成本降低了80%。这一价格性能比在推理模型中相当少见。AI模型GPT-5.6 LunaOpenAIARC-AGI10 个信源在谈事件专题推荐理由:ARC Prize实测了降价后的GPT-5.6 Luna,性能没缩水,跑一次ARC-AGI-2只要0.18美元,性价比确实猛。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
22:56Geek@geekbbDeepSeek-V4-Flash-0731参数总规模304B,其中基础模型284B,激活参数仅13B,上下文长度达1M。官方权重采用FP8+FP4混合精度,并包含DSpark speculative decoding模块。配套展示的GB300 NVL72机柜搭载72颗Blackwell Ultra GPU与36颗Grace CPU,总显存约20.7TB,NVLink带宽约130TB/s。AI模型DeepSeekDeepSeek-V4-FlashGB3008 个信源在谈事件专题推荐理由:DeepSeek这个Flash新模型参数够劲,304B总参只激活13B,还有1M上下文,配GB300机柜看挺直观。原文稍后读已读值得跟进有用关注 DeepSeek
13:24官方账号arXiv cs.AI@ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng论文提出DASH方法,用于改进带可验证奖励的强化学习(RLVR)中奖励稀疏的问题。标准OPSD对所有局部发散使用相同权重,忽略了生成过程中发散序列的时间结构。DASH根据局部蒸馏信号与序列均值的差距自适应调整token级监督权重,控制反向多步聚合。在三个数学推理基准和三种模型规模上,DASH均优于匹配的vanilla OPSD。该方法复用OPSD已有的师生分布,不额外增加前向传播成本。论文DASHOPSDRLVR推荐理由:这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。原文稍后读已读值得跟进有用关注 DASH
12:28官方账号arXiv cs.LG@Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno VasconcelosU-OPSD 提出只用模型自身生成做 on-policy 自蒸馏,不依赖真实标签、环境反馈或更大模型。它通过多次采样后多数投票构造伪答案,并把教师分布建立在最短伪答案上,蒸馏到模型最长错误补全的前缀。在 AIME24、AIME25、HMMT25、MATH500、AMC23 上,U-OPSD 让 Qwen3 4B/8B 非思考模式相对基座提升 8.5%/10.7%,平均超过 OPSD 3.2%/2.3%。思考模式下,U-OPSD 在 4B 超 OPSD 0.9%,8B 持平,并分别超 GRPO 0.7%/1.1%。论文U-OPSDQwen3OPSD推荐理由:不需要标注和外部反馈,U-OPSD靠投票让Qwen3数学成绩再涨一截,追平甚至超过OPSD和GRPO。原文稍后读已读值得跟进有用关注 U-OPSD
12:15小互@imxiaohu81°OpenAI将免费和Go用户的默认模型升级为GPT-5.6 Luna,文本聊天不限量免费。新版GPT-5.6 Sol的回答风格更直接精简,减少冗余客套。在财务、医疗、法律等复杂测试中,事实错误率比GPT-5.5减少68%。网页和移动端新增思考深度调节滑块,可切换快速模式或深度思考。免费用户也可使用Think按钮获得更多推理时间,同时针对18岁以下用户强化了安全微调。AI模型GPT-5.6OpenAI推理模型10 个信源在谈事件专题推荐理由:GPT-5.6来了:免费用户默认Luna,事实错误率比5.5降68%,还有思考滑块和Think按钮,写代码可以拉高深度。原文稍后读已读值得跟进有用关注 GPT-5.6
12:12官方一手歸藏(guizang.ai)@op7418OpenAI宣布ChatGPT聊天改由GPT-5.6系列驱动。Plus和Pro用户可使用GPT-5.6 Sol,支持即时回答与深度推理。免费版和Go用户从明天起可无限使用GPT-5.6 Luna文本聊天,并有限次数使用Thinking。推文提到Luna实际体验“还行”,免费用户也值得一试。AI模型GPT-5.6ChatGPTOpenAI10 个信源在谈事件专题推荐理由:OpenAI把GPT-5.6拆成Sol和Luna,付费用户用Sol,免费用户也能无限聊Luna。想不花钱体验新模型的可以明天试试。原文稍后读已读值得跟进有用关注 GPT-5.6
11:57量子位@量子位的朋友们PPIO正式发布Fusion融合模型。官方称其用十分之一的价格就能超越顶级模型的智商。这相当于把成本打到10%,让更多应用能负担得起。AI模型PPIOFusion推理模型推荐理由:PPIO新出了Fusion模型,说花十分之一的价格就能有顶级表现,预算紧的可以瞧瞧。原文稍后读已读值得跟进有用关注 PPIO
08:43Geek@geekbbOpenAI 宣布 GPT-5.6 Sol 现在为 Plus 和 Pro 用户提供即时与深度推理,响应更准确、更聚焦。免费版和 Go 用户从明天起可无限使用 GPT-5.6 Luna 进行文本聊天。这是 GPT-5.6 系列首次向免费层级开放无限使用,降低了高端模型的体验门槛。AI产品GPT-5.6ChatGPTOpenAI10 个信源在谈事件专题推荐理由:OpenAI 把 GPT-5.6 Luna 免费了,明天起无限聊,Plus/Pro 用户还能用 Sol 的推理模式。原文稍后读已读值得跟进有用关注 GPT-5.6
08:06IT之家(博客/媒体)82°消息源@synthwavedd在X平台爆料,OpenAI目标下周发布内部代号为mewfour的Astra模型。该模型是OpenAI自GPT-4.5以来训练的最大预训练模型。其内部版本已解出10个重要开放数学问题,按Sol API费率计算消耗约2,000美元词元成本。该模型可组织和协同AI智能体,面向长周期、高难度任务的推理与协作工作流。AI模型OpenAIAstraGPT-4.510 个信源在谈事件专题推荐理由:OpenAI下周可能要发Astra,是GPT-4.5以来最大模型,能解10道数学难题,还能调度智能体干活。原文稍后读已读值得跟进有用关注 OpenAI
05:23官方账号Sam Altman@sama82°OpenAI发布GPT-5.6 Sol,为Plus和Pro用户在即时推理和深度推理中提供更准确、专注的回复。免费和Go用户从明天起可使用GPT-5.6 Luna的无限文本聊天。该更新旨在降低高级模型的使用门槛。AI模型GPT-5.6OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI把GPT-5.6 Sol给了Plus和Pro用户,聊天更准了;免费用户明天起能无限聊Luna,值得试试。原文稍后读已读值得跟进有用关注 GPT-5.6
04:13官方账号Greg Brockman@gdb78°OpenAI 推出 GPT-5.6 系列,其中 Sol 同时支持即时聊天与深度推理,此前这两个场景使用不同模型。Plus 和 Pro 用户现已可用 Sol。免费用户和 Go 用户从明天起可无限次使用 GPT-5.6 Luna 进行文本聊天。OpenAI 称合并推理模式是 ChatGPT 简化交互的关键一步。AI模型GPT-5.6SolLuna10 个信源在谈事件专题推荐理由:OpenAI把快聊和深度推理合成一个GPT-5.6 Sol,免费用户还能无限用Luna,先试试。原文稍后读已读值得跟进有用关注 GPT-5.6
03:44官方账号OpenAI@OpenAI (@OpenAI)OpenAI发布GPT-5.6 Luna,推理能力升级。GPT-5.6 Luna对免费版和Go用户开放了Think按钮。借助该按钮,GPT-5.6 Luna面对更难题可进行更多推理。AI模型GPT-5.6 LunaOpenAIThink按钮10 个信源在谈事件专题推荐理由:OpenAI把Think按钮下放给免费用户,配合升级的GPT-5.6 Luna,难题能多想几步,赶紧去试试。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna