16:25官方账号Greg Brockman@gdbBox推出新型推理模型Sol,专为复杂推理与数据分析设计。Sol能分析数百页贷款交易文件,自动协调协议、财务、尽职调查和抵押品等材料中的条款。它会标记潜在风险点,并生成一份附带来源引用的分析报告保存至Box。该模型在文档密集型场景中大幅提升效率。AI模型SolBoxGPT-5.6推荐理由:Box出了个叫Sol的模型,能一次读几百页贷款合同,自动比对条款找出矛盾,还帮你出带引用的报告,搞数据分析爽翻了。原文稍后读已读值得跟进有用关注 Sol
12:11Rowan Cheung@rowancheungMeta昨日发布Muse Spark 1.1,这是一个强智能体与编程模型,通过Meta Model API和Meta AI提供。其定价显著低于OpenAI和Anthropic的同类模型。扎克伯格称,投入数十亿美元算力的策略开始见效。Meta股价自发布以来上涨超过10%。AI模型Muse SparkMeta智能体10 个信源在谈事件专题推荐理由:Meta出了个Muse Spark 1.1,性能强还比OpenAI和Anthropic便宜好多,这波价格战打得漂亮。原文稍后读已读值得跟进有用关注 Muse Spark
11:23Aravind Srinivas@AravSrinivasPerplexity 为 Enterprise 组织启用了 Grok 4.5 模型。面向 Consumer Pro 和 Max 订阅用户,Grok 4.5 可作为计算机编排模型。在 WANDR 基准上,Grok 4.5 得分高于其他五种编排配置。其成本约为 Opus 4.8 的一半。AI模型Grok 4.5PerplexityOpus 4.83 个信源在谈事件专题推荐理由:Perplexity 现在能用 Grok 4.5 做编排了,比 Opus 4.8 便宜一半,性能还更强,Pro 和 Max 用户快去试试。原文稍后读已读值得跟进有用关注 Grok 4.5
11:02岚叔@lufzzliz用户LufzzLiz在X平台称赞Grok模型的输出速度和效率,认为这比纯能力更重要。他预测如果Grok保持当前效率,未来有望达到Opus 4.6级别的能力。这条推文引发了对模型输出效率的关注。AI模型Grok输出效率推理模型推荐理由:有用户说Grok速度超快,效率拉满,未来可能媲美Opus 4.6,想看看它到底有多强?原文稍后读已读值得跟进有用关注 Grok
09:43Fireworks AI@FireworksAI_HQ精选74°MiniMax AI发布M3内核,针对长上下文稀疏注意力中数据依赖块选择导致的内存访问瓶颈。M3采用KV-stationary设计,每个块仅读取一次。在B200 GPU上达到约980 TFLOP/s的算力。该方案有效提升长上下文推理效率。AI模型MiniMaxM3Blackwell推荐理由:MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。原文稍后读已读值得跟进有用关注 MiniMax
09:31官方账号Greg Brockman@gdbOpenAI推出GPT-5.6,重点面向健康智能领域。GPT-5.6系列在整体性能提升的同时降低了成本。其中GPT-5.6 Luna在最高推理设置下超越GPT-5.5,但成本仅为后者的1/25。该模型使更多用户能够使用先进AI。AI模型GPT-5.6GPT-5.6 LunaOpenAI10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6健康智能版来了,Luna比上一代强还便宜25倍,这波升级很实在。原文稍后读已读值得跟进有用关注 GPT-5.6
08:32lmarena.ai@lmarena_aiGPT 5.6 Sol与Fable在3D生成任务上进行头对头测试。测试覆盖了数十个最难的提示词。结果由YouTube博主@petergostev发布。AI模型GPT 5.6 SolFable3D生成推荐理由:Peter Gostev用几十个最难提示词比了GPT 5.6 Sol和Fable的3D生成,看谁更强。原文稍后读已读值得跟进有用关注 GPT 5.6 Sol
08:03@koltregaskes@koltregaskes71°据传闻,Gemini 3.5 Pro 原定下周发布,但因检查点性能未达标而推迟数周。Google 需要大幅提升该模型,以应对 Fable 5、GPT-5.6、Grok 4.5 和 Meta Spark 等 SOTA 模型。在 Gemini 3.5 Pro 推出前,可能还会看到 GPT-6 和 Fable 5.1 等新模型。AI模型Gemini 3.5 ProGoogleFable 58 个信源在谈事件专题推荐理由:Google 的 Gemini 3.5 Pro 推迟了,对手们可没闲着,Fable 5、GPT-5.6 都在抢跑。看看这场竞赛有多激烈。原文稍后读已读值得跟进有用关注 Gemini 3.5 Pro
06:22官方账号Clement Delangue@ClementDelangue精选Hugging Face 与 Google Gemma 联合举办的 Gemma Challenge 结果出炉。超过100个 AI agent 和人类在6天内协作,将 Gemma 4 推理速度在单张 NVIDIA A10G GPU 上提升5倍,达到491.8 TPS(最快但有质量损失),无损方案达315 TPS。项目展示了多智能体协作优化模型推理的潜力。AI模型Gemma 4Hugging Face推理加速8 个信源在谈事件专题推荐理由:Hugging Face 和 Google 搞了个挑战赛,100多个 AI agent 和人类一起把 Gemma 4 推理速度在单张 A10G 上提升了5倍,最快冲到491.8 TPS,挺酷的。原文稍后读已读值得跟进有用关注 Gemma 4
05:58Aravind Srinivas@AravSrinivas精选Perplexity CEO透露其自研编排器架构,基于GLM 5.2模型进行后训练。在需要时,系统会升级到Opus模型作为顾问。该编排器将利用更多计算资源快速提升质量。同时,Grok 4.5和Opus Fast也被认为是优秀的编排模型。AI模型PerplexityGLM 5.2Opus推荐理由:Perplexity CEO揭秘自家搜索背后的模型编排:用GLM 5.2后训练,必要时上Opus,比Grok 4.5和Opus Fast还强?原文稍后读已读值得跟进有用关注 Perplexity
05:37官方账号OpenAI@OpenAIOpenAI 发布 GPT-5.6,聚焦健康智能领域。其中 GPT-5.6 Luna 在最高推理设置下性能超越 GPT-5.5。同时推理成本降低 25 倍。这些改进旨在提升模型质量并降低使用门槛,让更多人能够用上先进模型。AI模型GPT-5.6GPT-5.6 LunaOpenAI10 个信源在谈事件专题推荐理由:OpenAI 新出的 GPT-5.6 Luna 性能比 GPT-5.5 强,还便宜 25 倍,搞健康智能的可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6
05:30lmarena.ai@lmarena_aiGPT-5.6-Sol-xHigh 在 Code Arena: Frontend 基准测试中达到 1636 分,位于 Pareto 前沿。其混合价格为 23.75 美元/百万 token(输入 5 美元,输出 30 美元),比 Claude Fable 5 便宜 40%,性能大致相当。这一结果表明该模型在成本效率上具有显著优势。AI模型GPT-5.6-Sol-xHighCode ArenaClaude Fable 510 个信源在谈事件专题推荐理由:GPT-5.6-Sol-xHigh 在 Code Arena 前端拿了 1636 分,还比 Claude Fable 5 便宜 40%,性价比突出。原文稍后读已读值得跟进有用关注 GPT-5.6-Sol-xHigh
05:25lmarena.ai@lmarena_ai88°OpenAI的GPT-5.6-sol在Code Arena: Frontend中取得并列第一的成绩,追平Claude Fable 5。这是OpenAI模型首次在该基准中夺冠,相较于前代GPT-5.5-xhigh从第18名跃升至第1名。该模型在Data & Analytics、Brand Marketing、Consumer product和Gaming四个子类别中均排名第一。定价为每百万输入/输出token分别5美元/30美元,约为Claude Fable 5的一半。AI模型GPT-5.6-solClaude Fable 5OpenAI10 个信源在谈事件专题推荐理由:OpenAI发了GPT-5.6-sol,代码能力直接冲到第一,还比Claude便宜一半,搞前端开发的可以试试。原文稍后读已读值得跟进有用关注 GPT-5.6-sol
05:16Paul Couvert@itsPaulAi过去72小时内,OpenAI发布了GPT-5.6,SpaceXAI推出了Grok 4.5,Muse发布了Spark 1.1,Meta推出了Muse图像/视频模型,OpenAI还发布了GPT-Live,Mistral推出了Robostral Navigate。这6款新模型/产品覆盖语言、图像、导航等多个方向。AI模型GPT-5.6Grok 4.5Muse Spark 1.110 个信源在谈事件专题推荐理由:这两天AI圈太热闹了,OpenAI、SpaceXAI、Meta一口气发了6个新模型,包括GPT-5.6和Grok 4.5,值得一看。原文稍后读已读值得跟进有用关注 GPT-5.6
04:52官方账号Greg Brockman@gdbEthan Knight宣布GPT-5.6 Sol Ultra在64个子智能体协作下,仅用不到1小时就证明了50年未解的Cycle Double Cover Conjecture。该猜想是图论中的经典问题,此前无人能解。团队公开了提示词和完整证明过程,展示了大规模智能体协同推理的潜力。AI模型Sol UltraGPT-5.6智能体推荐理由:Sol Ultra刚发布就搞定了困扰数学界50年的猜想,64个AI一起发力,效率惊人。想看看提示词和证明?直接去翻原文。原文稍后读已读值得跟进有用关注 Sol Ultra
04:40Aravind Srinivas@AravSrinivas精选Perplexity CEO Arav Srinivas透露,SpaceXAI的Grok 4.5在内部代理研究基准WANDR上获得最高分。该模型作为orchestrator集成到Perplexity Computer中,价格仅为Claude Opus 4.8(高)的一半。Grok 4.5还以相近成本超越了Perplexity当前GLM 5.2后训练模型的表现。该模型现已面向Consumer Pro和Max订阅用户提供。AI模型Grok 4.5Claude Opus 4.8Perplexity推荐理由:Perplexity把Grok 4.5作为Computer的编排模型,代理研究任务得分最高,价格只有Opus 4.8的一半,值得试。原文稍后读已读值得跟进有用关注 Grok 4.5
04:32官方一手@OpenAIDevs@OpenAIDevs精选GPT-5.6 在 SnorkelAI 的 Ankit Aich 测试中,独立完成了一个近 1000 行的复杂编码任务,无需反复提示或人工介入。该模型从编写到调试全程自主处理,展示了长上下文和复杂推理能力。测试结果在 OpenAI 开发者官方账号发布,获得 170 点赞和 20534 次查看。AI模型GPT-5.6OpenAI编程助手10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 能独立啃下近千行代码,不用你一步步教,编程助手又进化了。原文稍后读已读值得跟进有用关注 GPT-5.6
03:37官方账号LMSYS Org (SGLang)@lmsysorg精选73°LMSYS 发布博客,介绍 DeepSeek-V4 Flash RL 在 AMD Instinct MI355X GPU 上使用 Miles 框架完成端到端训练。训练100+步后,log-prob gap 稳定在0.09,AIME-2024 pass@1 从0.39提升至0.49,pass@8 从0.53提升至0.67。采用 FP8 推演加 BF16 演员模型,支持数据类型感知在线权重更新。在 ROCm 上实现了稳定的 TP1/PP4/EP4 布局,无集体通信停顿。混合注意力、mHC 混合和哈希路由 MoE 在 SGLang 和 Megatron 引擎间保持一致。AI模型DeepSeek-V4AMDROCm推荐理由:DeepSeek-V4 Flash RL 在 AMD 显卡上跑通了,训练结果还不错,AIME 分数涨了一截。想试试 AMD 平台搞 RL 训练可以看看这篇。原文稍后读已读值得跟进有用关注 DeepSeek-V4
03:11lmarena.ai@lmarena_ai精选73°Muse Spark 1.1 在 Code Arena: Frontend 基准测试中排名第9,得分1541,混合成本350万美元(输入每百万token 1.25美元,输出每百万token 4.25美元)。Meta 称这款模型重塑了成本-性能帕累托前沿,以低廉价格提供前沿表现。同时,Meta 推出了新 Meta Model API 公开预览,开发者可通过该 API 访问 Muse Spark 1.1,模型也已在 Meta AI 应用的“Thinking”模式上线。AI模型Muse Spark 1.1Meta代码生成推荐理由:Meta 发了 Muse Spark 1.1,代码生成得分1541,成本只要350万美元,比同类便宜不少,适合做前端开发的玩家。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
02:45@koltregaskes@koltregaskesGPT-5.6 Sol max 和 xhigh 在 DeepSWE 排行榜上超过了 Fable 5 xhigh 和 max。两者的平均成本更低,输出 token 更少、步骤更少。GPT-5.6 Tera max 得分与 Fable 几乎相同。这些结果表明 GPT-5.6 系列在软件工程任务上具有竞争力。AI模型GPT-5.6DeepSWEFable 56 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 新变体在 DeepSWE 上干过了 Fable 5,还更便宜更快,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6
01:37官方一手@OpenAIDevs@OpenAIDevs73°OpenAI推出了GPT-5.6模型,并将Codex直接集成到ChatGPT中。开发者在7月10日上午9:30-10:30 PT可通过Reddit r/Codex AMA提问。GPT-5.6在代码生成和推理能力上有显著提升,Codex内置后可在聊天界面直接运行代码。AMA将涵盖GPT-5.6、Sites、computer use等新功能。AI模型GPT-5.6CodexOpenAI10 个信源在谈事件专题推荐理由:OpenAI刚发了GPT-5.6,还把Codex塞进了ChatGPT,开发直接能用。想了解新特性和实战技巧?赶紧去Reddit AMA蹲点提问。原文稍后读已读值得跟进有用关注 GPT-5.6
01:02elvis@omarsar0用户 Omar 在推文中称赞 GPT-5.6 在验证、建议以及高级编排(orchestrator)能力上表现出色,认为它目前表现最佳。该模型展现出超越预期的协调整合能力,适合复杂任务场景。AI模型GPT-5.6OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 在验证和编排上很能打,当高级协调器用效果惊艳。原文稍后读已读值得跟进有用关注 GPT-5.6
00:10官方账号LangChain@LangChainAI精选LangChain 团队将 NVIDIA 的 Nemotron 3 Ultra 接入 agent 框架 Deep Agents 进行调优。他们通过特定的训练和推理优化,提升了模型在复杂任务中的表现。调优后的 Nemotron 在多个 benchmark 上取得进展,展示了开源模型在智能体场景下的潜力。AI模型NemotronNVIDIALangChain10 个信源在谈事件专题推荐理由:LangChain 分享了怎么用 Deep Agents 调优 Nemotron 3 Ultra,有具体方法,做 agent 的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
23:16官方账号Sam Altman@sama77°OpenAI发布GPT-5.6模型。Sam Altman在X平台宣布该模型已成为Microsoft 365 Copilot的首选模型。这意味着用户在使用Copilot时将默认调用GPT-5.6。具体性能提升细节未在公告中披露。AI模型GPT-5.6Microsoft 365 CopilotOpenAI10 个信源在谈事件专题推荐理由:OpenAI把GPT-5.6设为Office Copilot的首选模型,以后用Word、Excel都默认用新模型了。原文稍后读已读值得跟进有用关注 GPT-5.6
22:30Viking@vikingmute用户测试发现 Claude 5.6 Ultra 在主 agent 召唤 8 个子 agent 后,每个子 agent 又递归召唤 4 个和 5 个,最终超过 200 个 agent 同时运行处理一个简单任务。此前 Claude 5.5 从不主动召唤子 agent。最终机器被搞崩,大量 token 被浪费。用户怀疑是 harness/prompt 设计缺陷导致。AI模型Claude 5.6 Ultra智能体递归调用推荐理由:有人发现 Claude 5.6 Ultra 为了一个简单问题召唤 200 个 agent,直接把机器跑崩了。比 5.5 还蠢,你品品。原文稍后读已读值得跟进有用关注 Claude 5.6 Ultra
22:17官方账号LMSYS Org (SGLang)@lmsysorg精选71°MosiAI 团队开源 MOSS-Transcribe-Diarize-0.9B,仅 0.9B 参数,基于 Whisper-Medium 编码器和 Qwen3-0.6B 风格解码器。模型支持 128K 上下文,可一次性处理约 90 分钟长音频。输出直接包含时间戳和说话人标签,无需分块或单独说话人分离。还支持热词提升,用于人名、领域术语和代码切换场景。SGLang 已提供 Day-0 支持,可立即运行。AI模型MOSS-Transcribe-Diarize-0.9BMosiAISGLang1 个信源在谈事件专题推荐理由:MosiAI 开源了一个0.9B的小模型,能一次性转录90分钟的多说话人音频,边缘设备就能跑,很适合本地部署。原文稍后读已读值得跟进有用关注 MOSS-Transcribe-Diarize-0.9B
22:15官方账号LMSYS Org (SGLang)@lmsysorg精选Netpreme发布博客,介绍将X-Mem MPU插入SGLang HiCache的分层KV缓存方案。在SWE-bench的Claude Code多轮编码中,前缀缓存命中率平均达98%。用X-Mem替换主机DRAM作为卸载层级后,TTFT降低6.7倍,每用户TPS提升33-50%,系统吞吐量提升30%。该方案通过HiCache的分层接口实现即插即用。AI模型NetpremeX-MemSGLang推荐理由:Netpreme的X-Mem内存插进SGLang的HiCache,多轮对话缓存带宽不再是瓶颈,TTFT降6.7倍,吞吐量涨30%,实测SWE-bench效果显著。原文稍后读已读值得跟进有用关注 Netpreme
19:58Geek@geekbb一条推文提出GPT 5.6、Grok 4.5、GLM 5.2三款模型的组合能否超越Claude Fable 5的问题。该推文获得1599次查看和2次投票。评论区有2条讨论,目前尚无定论。AI模型GPT 5.6Grok 4.5GLM 5.28 个信源在谈事件专题推荐理由:看看网友在聊GPT 5.6、Grok 4.5、GLM 5.2和Claude Fable 5谁更强,挺有意思的。原文稍后读已读值得跟进有用关注 GPT 5.6
18:59Hunyuan@TXhunyuan精选73°腾讯推出了Hy3模型,这是一个295B参数的MoE架构,但仅21B参数被激活,因此推理成本极低。该模型提供256K上下文窗口,采用Apache 2.0许可开源。在OpenRouter上,输入tokens定价为0.14美元/百万,输出tokens为0.58美元/百万。尽管GLM-5.1模型比Hy3大2.5倍,但Hy3在基准测试中表现更优。Hy3还具备编程和智能体能力。AI模型Hy3TencentGLM-5.1推荐理由:腾讯新出的Hy3模型,295B参数却只要21B激活,价格便宜还比GLM-5.1强,写代码做分析报告真香。原文稍后读已读值得跟进有用关注 Hy3
18:52The Rundown AI@therundownai74°OpenAI推出GPT-5.6公开版本,并新增ChatGPT Work功能。Meta发布Muse Spark 1.1模型更新。有教程展示如何节省60%的Fable token用量。同时还有4款新AI工具及社区工作流分享。AI模型GPT-5.6OpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI出了GPT-5.6,还加了ChatGPT Work,Meta也更新了Muse Spark,信息量挺大。原文稍后读已读值得跟进有用关注 GPT-5.6
17:09Stanford AI Lab@StanfordAILab71°斯坦福AI实验室提出TRACE自我改进方法,智能体通过识别自身失败背后的缺失能力并进行针对性训练来提升。TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,超过Codex 5.2和GLM 5等更大模型,同时以少于1/4的训练rollout击败GRPO和GEPA。该工作已在ICML AIWILD获得Spotlight论文。AI模型TRACEQwen3.6-27BSWE-bench Verified推荐理由:斯坦福AI Lab搞了个新方法TRACE,让AI自己找短板补课。只用四分之一训练量就超过了GRPO和GEPA,还赢了大模型Codex 5.2和GLM 5。原文稍后读已读值得跟进有用关注 TRACE
17:08Stanford AI Lab@StanfordAILab精选70°斯坦福AI实验室提出LLM-as-a-Verifier框架,通过细粒度评分(1-20级代替1-5级)、logprob分布期望、重复评估和标准分解等方法,提升验证扩展效果。在Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench和MedAgentBench四个Agent基准上取得SOTA。细粒度信号还可用于测试时扩展、强化学习和Agent监控,提高样本效率。AI模型LLM-as-a-Verifier斯坦福AI实验室智能体推荐理由:斯坦福团队搞了个新框架,不用传统评分,用细粒度验证加logprob分布,直接刷了四个Agent基准的SOTA,还能顺便提升RL效率。原文稍后读已读值得跟进有用关注 LLM-as-a-Verifier
17:05AI Will@FinanceYF5Deedy汇总今日AI新闻:GPT-5.6 Sol和Sol Ultra明日发布,早期评价不如Fable但积极;Grok 4.5发布,声称达到Opus 4.7质量、80tps速度、$2/M输入$6/M输出定价;字节跳动Seedream 5 Pro发布,图像生成能力接近GPT Image 2,成本低至$0.045-$0.09/张,擅长编辑和信息图,远超Meta Muse Image;GPT-Live推出全双工非轮次语音模型,允许说话时无缝交互。AI模型GPT-5.6Grok 4.5Seedream 5 Pro推荐理由:今天AI圈炸了,一口气四个新模型/产品:GPT-5.6、Grok 4.5、Seedream 5 Pro、GPT-Live语音,每个都有具体数字和对比,值得快速了解。原文稍后读已读值得跟进有用关注 GPT-5.6
15:51官方账号Greg Brockman@gdb78°GPT-5.6 with Work IQ 已上线微软 Copilot Chat、Cowork、M365 应用、GitHub 和 Foundry。该模型支持多步骤智能体工作、分析与内容创作,带来更强的推理能力和更高质量的输出,同时保持效率。Satya Nadella 在推特上确认了这一集成。AI模型GPT-5.6Work IQMicrosoft Copilot1 个信源在谈事件专题推荐理由:GPT-5.6 来了,带着 Work IQ 直接进微软全家桶,Copilot、GitHub 都能用,推理更强还支持多步智能体任务,赶紧试试。原文稍后读已读值得跟进有用关注 GPT-5.6
15:37官方账号Perplexity@perplexity_aiPerplexity宣布GPT-5.6 Terra和Sol已在其平台和Perplexity Computer上线。用户现在可以通过Perplexity使用这两个模型。具体性能细节尚未披露。AI模型GPT-5.6TerraSol推荐理由:Perplexity刚上架了两个GPT-5.6新模型Terra和Sol,想尝鲜可以直接去搜索里用。原文稍后读已读值得跟进有用关注 GPT-5.6
13:03AI Will@FinanceYF5在 Artificial Analysis Coding Agent Index 上,GPT-5.6 Sol 以 80.0 分刷新最高纪录,比 Claude Fable 5 的分数高出 2.8 分。GPT-5.6 Sol 的输出 Token 少于 Claude Fable 5 的一半,耗时也少于一半。其成本约低三分之一。这项成绩体现了 GPT-5.6 Sol 在编码智能体任务上的效率优势。AI模型GPT-5.6 SolClaude Fable 5Artificial Analysis Coding Agent Index9 个信源在谈事件专题推荐理由:GPT-5.6 Sol 这次在编程智能体评测上确实猛,分数更高还更快更便宜,值得看看。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
12:57AI Will@FinanceYF591°OpenAI 发布了 GPT-5.6 系列模型,包含 Sol、Terra 和 Luna 三个版本。该系列已开始在 ChatGPT、Codex 和 API 中陆续上线,用户可逐步体验。OpenAI 尚未公布 Sol、Terra 和 Luna 的具体参数和定价细节。AI模型OpenAIGPT-5.6ChatGPT10 个信源在谈事件专题推荐理由:OpenAI 一口气发了三个 GPT-5.6 新模型,直接在 ChatGPT 和 API 里就能用,值得试试手感。原文稍后读已读值得跟进有用关注 OpenAI
12:56AI Will@FinanceYF586°GPT-5.6 Sol 在 Agents' Last Exam 测试中得分 53.6,比 Claude Fable 5(adaptive)高出 13.1 分。在中等推理强度下,GPT-5.6 Sol 仍比 Fable 5 高出 11.4 分,预估成本约为后者的四分之一。GPT-5.6 Terra 和 Luna 版本也在约十六分之一成本下超过 Fable 5。AI模型GPT-5.6Claude Fable 5Agents' Last Exam9 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 新系列在智能体考试中大幅领先 Claude Fable 5,成本还低很多,值得看看。原文稍后读已读值得跟进有用关注 GPT-5.6
12:55AI Will@FinanceYF591°GPT-5.6 从今天起在 ChatGPT、Codex 和 OpenAI API 中正式上线。全球推送已开始,将在未来 24 小时内逐步开放至完整可用。ChatGPT 的 Plus、Pro、Business、Enterprise 用户可通过中等及更高 effort 设置使用 GPT-5.6 Sol。Pro 和 Enterprise 用户还可选择 GPT-5.6 Pro,用于复杂任务获得最高质量结果。AI模型GPT-5.6OpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI 发了 GPT-5.6,现在 ChatGPT Plus 用户就能用上 Sol 版了,Pro 还有更强的 Pro 版,快去试。原文稍后读已读值得跟进有用关注 GPT-5.6
12:54AI Will@FinanceYF592°OpenAI 发布了 GPT-5.6 模型,已在 ChatGPT、Codex 和 OpenAI API 中可用。用户可通过这些平台直接访问新模型。AI模型GPT-5.6OpenAIChatGPT10 个信源在谈事件专题推荐理由:OpenAI 新模型 GPT-5.6 上线了,现在就能在 ChatGPT 和 API 里用,快去试试。原文稍后读已读值得跟进有用关注 GPT-5.6