10:36Marc Andreessen@pmarcaGPT-5.6 成功解决了 Erdős #793 问题,这是一个关于两素数集(2-primitive sets)的数论难题,已困扰数学界超过 50 年。该成果由 Jared Duker Lichtman 验证并公布。GPT-5.6 展现出在数学推理领域的强大能力。AI模型GPT-5.6推理模型数论推荐理由:GPT-5.6 又解开了一个 50 年没人能搞定的数学题,数学推理能力真的强。原文稍后读已读值得跟进有用关注 GPT-5.6
09:48IT之家(博客/媒体)Arena平台发布最新周榜(2026年7月6-12日),代码榜榜首由claude-opus-4-7-thinking以ELO 1553分登顶,原榜首claude-fable-5降至第五。综合榜claude-fable-5继续蝉联第一,ELO 1505分,前五名均为Anthropic模型。国产模型最高为qwen3.7-max-preview,综合榜第17名(1475分),代码榜第12名(1526分)。glm-5.1、ernie-5.1等国产模型排名相对稳定。AI模型claude-opus-4-7-thinkingclaude-fable-5Arena10 个信源在谈事件专题推荐理由:想快速了解本周最强AI模型?Arena周榜给出硬核排名:代码能力claude-opus-4-7-thinking超了claude-fable-5,国产qwen3.7也稳在Top20。原文稍后读已读值得跟进有用关注 claude-opus-4-7-thinking
09:23官方账号arXiv cs.LG@Peizhuo Li, Emre Aksan, Alexandru-Eugen Ichim, Thabo Beeler, Olga Sorkine-Hornung该论文提出一种无需重新训练的推理方法,通过温度采样(γ<1)和方差校正时间偏移来提升扩散模型的输出多样性。核心思想是:对分数进行γ缩放虽能重加权模式,但会膨胀每模式的方差;而在偏移的时间步查询网络并缩放分数,可抵消方差膨胀。在DiT、Stable Diffusion和Motion Diffusion模型上验证了该方法能一致提升多样性,同时保持样本质量和条件保真度。论文还发现时间干预时机可实现粗到细控制:高噪声阶段驱动跨模式的组合多样性,低噪声阶段驱动固定组合下的局部外观变化。论文DiTStable DiffusionMotion Diffusion推荐理由:想在不重训模型的情况下让扩散模型生成更多样化的结果?这篇论文给出了一个简单有效的技巧:温度采样配合时间偏移,在DiT、Stable Diffusion上都有效果。原文稍后读已读值得跟进有用关注 DiT
09:19官方账号arXiv cs.LG@Sudipto Ghosh, Tanmoy ChakrabortyGRADE是一种分层多智能体系统,通过四个轻量级门控网络联合控制智能体选择、层次深度、智能体间通信和分支修剪。训练采用CoGRPO(协作组相对策略优化),无需批评网络,为参与rollout的每个门控和智能体分配共享优势信号。在平均约17B活跃参数下,GRADE在GSM8K、MMLUPro和GPQA上超越所有基线,其中在MMLUPro上以一半活跃计算量高出最强基线4.8个百分点。在AIME-2025上,GRADE与现有框架竞争力持平。消融实验表明层次结构和掩码交叉注意力是精度最大贡献者,且每个智能体的校准对安全热替换必要。论文GRADECoGRPO多智能体推荐理由:GRADE用17B参数在MMLUPro上以一半计算量超基线4.8分,靠四个门控路由动态调深度,很实用。原文稍后读已读值得跟进有用关注 GRADE
09:15官方账号arXiv cs.LG@Keqin Peng, Chen Li, Yuanxin Ouyang, Yancheng Yuan, Liang Ding本文发现On-Policy Self-Distillation (OPSD)在复杂推理任务中会导致“Thinking Collapse”,即模型中间推理行为(以epistemic-token密度衡量)显著下降。通过熵梯度分析和token级目标分解,确定该崩溃源于高熵决策点的激进教师梯度。提出自适应双视角OPSD (AD-OPSD),通过冻结基础模型参考先验锚定高风险token。在多个数学基准(如GSM8K、MATH)上,AD-OPSD相比标准OPSD平均准确率提升最高达+4.1%。论文OPSDAD-OPSDThinking Collapse推荐理由:这篇论文把OPSD训练时模型思维崩溃的原因和解决方法都讲清楚了,AD-OPSD在数学题上能提4个点,做推理优化的值得看看。原文稍后读已读值得跟进有用关注 OPSD
07:24官方账号Greg Brockman@gdbPrzemek Chojecki 发推称 GPT-5.6 Sol Ultra 找到了 Erdős 问题 #793 的一个解法。该问题涉及 2-primitive 集的渐近性质。GPT 提出的构造极短且优雅,增强了 Erdős 原本用于证明较弱结果的方法。AI模型GPT-5.6Sol Ultra推理模型推荐理由:GPT-5.6 Sol Ultra 又解了一个 Erdős 难题 #793,构造比原方法更短更优雅,数学推理让人眼前一亮。原文稍后读已读值得跟进有用关注 GPT-5.6
06:00官方账号Clement Delangue@ClementDelangue77°Hugging Face 宣布 Transformers 模型现在可以直接在 vLLM 推理引擎中运行,达到原生速度,部分场景超越手写实现。此前,新模型架构需要在 Transformers(训练/研究)和 vLLM(生产推理)中分别实现,导致重复工作与维护成本。现在,模型作者只需在 Transformers 中实现一次,即可自动兼容 vLLM 的优化栈。在 4B 到 235B 参数模型的基准测试中,包括张量并行和 MoE 设置,Transformers 后端吞吐量匹配或超过原生 vLLM。AI模型Hugging FaceTransformersvLLM推荐理由:Hugging Face 把 Transformers 模型直接跑进 vLLM,性能不输手写,以后搞推理不用重复造轮子了。原文稍后读已读值得跟进有用关注 Hugging Face
05:15官方一手AWS Machine Learning Blog@Tanvi Girinath73°OpenAI 正式发布 GPT-5.6 系列三个模型 Sol、Terra 和 Luna,并已在 Amazon Bedrock 上全面可用。该系列是 OpenAI 迄今最智能的模型家族,针对高性能、安全性和可靠性优化。Amazon Bedrock 提供下一代推理引擎来运行这些模型。用户无需单独部署即可通过 Bedrock 调用 GPT-5.6 系列。AI模型GPT-5.6OpenAIAmazon Bedrock10 个信源在谈事件专题推荐理由:OpenAI 最强模型 GPT-5.6 系列直接上架 AWS,现在在 Bedrock 就能用,省去自己部署的麻烦,三个版本各有特色,性能很强。原文稍后读已读值得跟进有用关注 GPT-5.6
02:18官方账号LangChain@LangChainAI精选7月14日,LangChain的@bromann与Andrew Wong联合举办Webinar,演示如何构建会展示工作过程的Agent。该Agent实时输出工具调用和推理步骤,并引用Box的可信上下文。目标是消除黑盒猜测,提供有依据的回答。活动面向开发者,强调透明性和可信度。技巧LangChainBox智能体推荐理由:想学怎么让AI Agent不瞎猜、敢于展示推理过程?LangChain和Box的这场直播正好手把手教,还能看实时工具调用。原文稍后读已读值得跟进有用关注 LangChain
02:17官方账号vLLM@vllm_project精选Novita Labs 训练并开源了 DSpark 投机解码器,用于 Kimi-K2.6 和 Kimi-K2.7-Code 模型。DSpark 是 DeepSeek 提出的投机解码方法,能一次性生成整个 token 块。vLLM 从 v0.25.0 版本起原生支持 DSpark。使用该解码器可加快 Kimi 系列的推理速度。AI模型Kimi-K2.6Kimi-K2.7-CodeDSpark推荐理由:DeepSeek 的 DSpark 投机解码,能让 Kimi-K2.6 和 K2.7-Code 一次生成整块 token,配合 vLLM 0.25.0 原生支持,解码更快。原文稍后读已读值得跟进有用关注 Kimi-K2.6
19:33Julien Chaumond@julien_c这是作者在推文中对链式思维推理模型出现前AI发展阶段的个人回忆。推文未提供具体模型名、版本号、基准或数字。行业chain-of-thought推理模型推荐理由:一个小感慨,没有实质信息,适合无聊时看看。原文稍后读已读值得跟进有用关注 chain-of-thought
16:05官方一手pandaily@contact@pandaily.com (Pandaily)精选72°腾讯发布混元Hy3模型,采用295B MoE架构,参数量达295B。该模型在OpenRouter上排名第8,超越了多个竞品。其Agent性能表现强劲,尤其在任务执行和工具调用方面有显著提升。训练流程经过重新设计,重点优化了数据质量和强化学习环节。AI模型Hunyuan Hy3TencentOpenRouter推荐理由:腾讯新出的混元Hy3模型,295B参数,Agent能力很强,OpenRouter上排前8,感兴趣可以看看。原文稍后读已读值得跟进有用关注 Hunyuan Hy3
11:17官方账号Together AI@togethercompute精选GLM 5.2 模型在 Together AI 平台部署后,在 Artificial Analysis 评测中输出速度和延迟均获得第一名。该评测覆盖多个主流模型,GLM 5.2 在吞吐量和响应时间指标上表现领先。Together AI 通过优化推理栈使模型达到接近实时的生成速度。AI模型GLM 5.2Together AIArtificial Analysis推荐理由:GLM 5.2 在 Together AI 上跑出了最快速度和最低延迟,想用低成本跑推理的话可以去试试这个组合。原文稍后读已读值得跟进有用关注 GLM 5.2
10:43官方账号arXiv cs.AI@Kaiji Zhou, Ales Leonardis, Yue FengAgora是一种新提出的框架,引入激励相容的拍卖机制,将推理步骤视为可交易物品,让专家模型和工具基于修正后的胜任度进行竞标,从而将关键逻辑分配给最合适的求解器。在五个基准测试上的评估显示,Agora在可比候选池下优于匹配的单模型、路由和级联基线。该框架通过单个拍卖参数实现可控的成本-质量权衡。论文AgoraLLM Agent拍卖机制推荐理由:想提升LLM Agent推理效率?Agora用拍卖机制动态分配任务给专家模型,在五个基准上都比传统路由强,还能平衡成本和效果。原文稍后读已读值得跟进有用关注 Agora
09:17官方账号arXiv cs.LG@Spiros Baxevanakis, Peng-Jian Yang研究测试时扩展(TTS)是否适用于小规模开源视觉语言模型,使用EXAMS-V多语言视觉多项选择基准。实验对比self-consistency、describe-then-reason结合PRM引导束搜索等方法,基于Qwen2.5-VL-7B-Instruct和Qwen3.5-4B。关键因素是链的可解析性:提示格式导致链正确但不输出答案,加入答案提示和修复步骤后改善。每链token上限从1k升至2k恢复3.7个百分点,但增加链数从8到16仅提升0.15个百分点。PRM束搜索落后普通self-consistency 0.39个百分点且成本高8倍,最佳配置在ImageCLEF 2026测试集达84.1%并排名第一。论文Qwen2.5-VL-7B-InstructQwen3.5-4BEXAMS-V推荐理由:这篇论文告诉你,在小模型上用测试时扩展,关键是让模型把答案写出来,而不是复杂搜索。Qwen2.5-VL调参后性价比很高。原文稍后读已读值得跟进有用关注 Qwen2.5-VL-7B-Instruct
08:05andrew chen@andrewchenAndrew Chen预测消费级显卡2029年可运行Fable级别模型,依据是LLM知识压缩比约400:1,量化至4-bit后达1600:1。Densing Law显示模型能力每3.3个月翻倍,27B参数模型已接近几年前更大模型。当前27B参数量化版已能在32GB显存GPU运行,且每年效果提升。AI模型消费级GPUFableDensing Law推荐理由:Andrew Chen用Densing Law和量化数据推测,消费级显卡跑顶级模型可能只需几年,感兴趣可以看看他的推导。原文稍后读已读值得跟进有用关注 消费级GPU
08:49IT之家(博客/媒体)91°OpenAI 于 7 月 10 日宣布,GPT-5.6 Sol Ultra 模型在不到 1 小时内生成了循环双覆盖猜想的完整证明。该猜想是图论领域悬而未决 50 多年的重要难题。证明步骤包括将原猜想归约为三次图问题、利用 8-流定理和 GF(3) 上的线性代数构造。整个证明由 AI 独立完成,但尚未经过正式同行评审,也未使用 Lean 等形式化验证工具。AI模型GPT-5.6 Sol UltraOpenAI循环双覆盖猜想10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol Ultra 只用一小时就搞定了一个困扰数学家 50 年的图论难题,用的是 64 个子智能体协作,比人类更有耐心反复试错。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Ultra
01:46官方账号Decoder@Matthias Bastian82°OpenAI的GPT-5.6 Sol Ultra使用64个子智能体并行工作,在一小时内证明了图论中的Cycle Double Cover猜想。该猜想已悬而未决50年,被认为是图论领域的重要未解问题。数学家Thomas Bloom称该证明方法出人意料地初等,但批评其未引用已知的前期工作。这引发了关于AI是重组现有知识还是创造新知识的讨论。AI模型GPT-5.6 Sol UltraOpenAICycle Double Cover猜想10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6 Sol Ultra一小时破解了困扰数学界50年的Cycle Double Cover猜想,虽被指引用不足,但效率惊人。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Ultra
01:20官方账号Sam Altman@sama83°OpenAI发布GPT-5.6系列,在医疗任务中表现优于医生。最小变体GPT-5.6 Luna在最低推理努力下即超越GPT-5.5最高推理努力,成本降低25倍。最大变体GPT-5.6 Sol创下新标杆。研究收集了患者和临床医生两类任务,由专科医生花费无限时间并联网撰写回答,再由另一些医生盲评。在20000次轴评级(准确性、沟通、完整性、指令遵循、健康决策有用性)中,所有GPT-5.6变体在完美率上显著超过医生。AI模型GPT-5.6OpenAIAI医疗10 个信源在谈事件专题推荐理由:OpenAI发了GPT-5.6,医生写回答都写不过它,成本还更低,医疗AI又进步了一大截原文稍后读已读值得跟进有用关注 GPT-5.6
23:02Ethan Mollick@emollick用户将GPT-5.6 Sol模型通过Codex平台赋予电脑控制权,要求它赢得游戏Slay the Spire 2的每日挑战。该挑战包含随机化因子,无法通过预知方式作弊。模型连续工作了5个小时,自主做出复杂游戏决策,最终成功通关。此演示展示了AI在长时间自主任务中的决策能力。AI模型GPT-5.6 SolCodexSlay the Spire 2推荐理由:GPT-5.6 Sol在Codex里花了5小时自己打穿了Slay the Spire 2每日挑战,这自主性有点强啊。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
22:41AI Will@FinanceYF5精选新测试对比了 GPT-5.6(Sol Ultra、Terra Ultra、Luna Max)和 GPT-5.5 xhigh 在 4 项 canvas 动画提示上的表现。在 macOS 'hello' 手写测试中,Sol Ultra 与 5.5 并列最佳。火球入水测试中,GPT-5.5 的蒸汽和气泡效果更真实。燃烧湿纸测试里,5.5 的火焰在水边停止、湿半页焦黑的表现更准确。ChatGPT 应用 UI 测试中,5.6 三大变体均正确遵循多步指令并逐字流式输出,而 5.5 跳过了流式。结论:5.6 在指令遵循和多步协调上明显更好,但原始物理直觉仍是 5.5 更强。AI模型GPT-5.6GPT-5.5OpenAI10 个信源在谈事件专题推荐理由:想知道 GPT-5.6 哪里比 5.5 强、哪里反而弱?这篇实测用四个具体动画场景拆给你看,不吹不黑。原文稍后读已读值得跟进有用关注 GPT-5.6
16:25官方账号Greg Brockman@gdbBox推出新型推理模型Sol,专为复杂推理与数据分析设计。Sol能分析数百页贷款交易文件,自动协调协议、财务、尽职调查和抵押品等材料中的条款。它会标记潜在风险点,并生成一份附带来源引用的分析报告保存至Box。该模型在文档密集型场景中大幅提升效率。AI模型SolBoxGPT-5.6推荐理由:Box出了个叫Sol的模型,能一次读几百页贷款合同,自动比对条款找出矛盾,还帮你出带引用的报告,搞数据分析爽翻了。原文稍后读已读值得跟进有用关注 Sol
14:29量子位@henryGPT-5.6 通过 700 词 Prompt 调度 64 个子 Agent,在一小时内解开了悬而未决 50 年的数学猜想。该成果展示了大型语言模型在复杂推理和协作任务上的突破,子 Agent 架构可并行处理不同子问题。研究人员称,该方法不仅适用于数学,还可推广到科学发现和工程优化。AI模型GPT-5.6推理模型智能体推荐理由:GPT-5.6 用 700 词 Prompt 指挥 64 个小模型,一小时破解了数学家 50 年没解开的难题,推理能力强到离谱。原文稍后读已读值得跟进有用关注 GPT-5.6
11:02岚叔@lufzzliz用户LufzzLiz在X平台称赞Grok模型的输出速度和效率,认为这比纯能力更重要。他预测如果Grok保持当前效率,未来有望达到Opus 4.6级别的能力。这条推文引发了对模型输出效率的关注。AI模型Grok输出效率推理模型推荐理由:有用户说Grok速度超快,效率拉满,未来可能媲美Opus 4.6,想看看它到底有多强?原文稍后读已读值得跟进有用关注 Grok
09:31官方账号Greg Brockman@gdbOpenAI推出GPT-5.6,重点面向健康智能领域。GPT-5.6系列在整体性能提升的同时降低了成本。其中GPT-5.6 Luna在最高推理设置下超越GPT-5.5,但成本仅为后者的1/25。该模型使更多用户能够使用先进AI。AI模型GPT-5.6GPT-5.6 LunaOpenAI10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6健康智能版来了,Luna比上一代强还便宜25倍,这波升级很实在。原文稍后读已读值得跟进有用关注 GPT-5.6
09:22SuperTechFans(博客/媒体)92°GPT-5.6 Sol 在 Agents' Last Exam 上得分 53.6,领先 Claude Fable 5 达 13.1 分。中等推理模式下仅用约四分之一成本即领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上 Sol 取得 80 分,领先 Fable 5 2.8 分,token 和成本大幅降低。新推出 ultra 模式默认协调四个智能体并行工作,提升浏览和证券基准表现。安全方面经过广泛红队测试和自动化评估。AI模型GPT-5.6OpenAIClaude Fable 510 个信源在谈事件专题推荐理由:OpenAI 刚发了 GPT-5.6,三个型号性能都爆表,尤其 Sol 在编码和推理测试里吊打 Claude Fable 5,成本还低很多,编程和复杂任务都更强了。原文稍后读已读值得跟进有用关注 GPT-5.6
05:37官方账号OpenAI@OpenAIOpenAI 发布 GPT-5.6,聚焦健康智能领域。其中 GPT-5.6 Luna 在最高推理设置下性能超越 GPT-5.5。同时推理成本降低 25 倍。这些改进旨在提升模型质量并降低使用门槛,让更多人能够用上先进模型。AI模型GPT-5.6GPT-5.6 LunaOpenAI10 个信源在谈事件专题推荐理由:OpenAI 新出的 GPT-5.6 Luna 性能比 GPT-5.5 强,还便宜 25 倍,搞健康智能的可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6
04:52官方账号Greg Brockman@gdbEthan Knight宣布GPT-5.6 Sol Ultra在64个子智能体协作下,仅用不到1小时就证明了50年未解的Cycle Double Cover Conjecture。该猜想是图论中的经典问题,此前无人能解。团队公开了提示词和完整证明过程,展示了大规模智能体协同推理的潜力。AI模型Sol UltraGPT-5.6智能体推荐理由:Sol Ultra刚发布就搞定了困扰数学界50年的猜想,64个AI一起发力,效率惊人。想看看提示词和证明?直接去翻原文。原文稍后读已读值得跟进有用关注 Sol Ultra
04:32官方一手@OpenAIDevs@OpenAIDevs精选GPT-5.6 在 SnorkelAI 的 Ankit Aich 测试中,独立完成了一个近 1000 行的复杂编码任务,无需反复提示或人工介入。该模型从编写到调试全程自主处理,展示了长上下文和复杂推理能力。测试结果在 OpenAI 开发者官方账号发布,获得 170 点赞和 20534 次查看。AI模型GPT-5.6OpenAI编程助手10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 能独立啃下近千行代码,不用你一步步教,编程助手又进化了。原文稍后读已读值得跟进有用关注 GPT-5.6
04:03官方账号Simon Willison@simonwGPT-5.6 提供了多种模型和推理努力等级,用户常困惑如何选择。据测试,Sol medium 在编程任务上优于 5.5 xhigh。更高的推理等级(Sol 系列)能带来更佳性能,但会快速消耗限额。开发者正在改进沟通方式。技巧GPT-5.6Sol推理模型推荐理由:如果你用 GPT-5.6 写代码,可以试试 Sol medium,比 5.5 xhigh 更好用,别被复杂的选项吓到。原文稍后读已读值得跟进有用关注 GPT-5.6
02:08官方账号Decoder@Matthias BastianGPT-5.6 Sol提供从 Light 到 xhigh 的五个推理层级,并新增 Max 和 Ultra 模式,可并行调用多个子智能体。OpenAI 员工 Vaibhav Srivastav 建议用户从低层级开始,仅在必要时才升级推理强度。不同层级分别适用于简单问答、复杂逻辑分析、多步规划等不同复杂度任务。AI模型GPT-5.6 SolOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI员工亲自教你怎么选GPT-5.6 Sol的推理强度,从Light到xhigh再到Ultra,避免浪费算力。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
01:02elvis@omarsar0用户 Omar 在推文中称赞 GPT-5.6 在验证、建议以及高级编排(orchestrator)能力上表现出色,认为它目前表现最佳。该模型展现出超越预期的协调整合能力,适合复杂任务场景。AI模型GPT-5.6OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 在验证和编排上很能打,当高级协调器用效果惊艳。原文稍后读已读值得跟进有用关注 GPT-5.6
18:59Hunyuan@TXhunyuan精选73°腾讯推出了Hy3模型,这是一个295B参数的MoE架构,但仅21B参数被激活,因此推理成本极低。该模型提供256K上下文窗口,采用Apache 2.0许可开源。在OpenRouter上,输入tokens定价为0.14美元/百万,输出tokens为0.58美元/百万。尽管GLM-5.1模型比Hy3大2.5倍,但Hy3在基准测试中表现更优。Hy3还具备编程和智能体能力。AI模型Hy3TencentGLM-5.1推荐理由:腾讯新出的Hy3模型,295B参数却只要21B激活,价格便宜还比GLM-5.1强,写代码做分析报告真香。原文稍后读已读值得跟进有用关注 Hy3
18:07shao__meng@shao__meng精选OpenAI 发布了 GPT-5.6 的三个模型:gpt-5.6-sol(旗舰)、gpt-5.6-terra(平衡)和 gpt-5.6-luna(高吞吐)。每个模型支持 5 种推理强度(Light、Medium、High、Extra High、Ultra)和 2 种速度(Standard、Fast),共 30 种搭配。官方建议用户使用 GPT-5.6 时保持与之前版本相同的推理强度或降低一档。在提示词优化上,将冗长系统提示词缩减为精炼版本后,评测分数提升约 10%–15%,token 减少 41%–66%,成本降低 33%–67%。文档还强调,GPT-5.6 更主动,需明确权限边界,区分回答、修改、外部写入等操作。技巧GPT-5.6SolTerra10 个信源在谈事件专题推荐理由:OpenAI 出了 GPT-5.6 的官方使用指南,教你怎么选模型、强度和速度,还有省 token 的提词技巧,比老版本更灵活。原文稍后读已读值得跟进有用关注 GPT-5.6
15:51官方账号Greg Brockman@gdb78°GPT-5.6 with Work IQ 已上线微软 Copilot Chat、Cowork、M365 应用、GitHub 和 Foundry。该模型支持多步骤智能体工作、分析与内容创作,带来更强的推理能力和更高质量的输出,同时保持效率。Satya Nadella 在推特上确认了这一集成。AI模型GPT-5.6Work IQMicrosoft Copilot1 个信源在谈事件专题推荐理由:GPT-5.6 来了,带着 Work IQ 直接进微软全家桶,Copilot、GitHub 都能用,推理更强还支持多步智能体任务,赶紧试试。原文稍后读已读值得跟进有用关注 GPT-5.6
12:56AI Will@FinanceYF586°GPT-5.6 Sol 在 Agents' Last Exam 测试中得分 53.6,比 Claude Fable 5(adaptive)高出 13.1 分。在中等推理强度下,GPT-5.6 Sol 仍比 Fable 5 高出 11.4 分,预估成本约为后者的四分之一。GPT-5.6 Terra 和 Luna 版本也在约十六分之一成本下超过 Fable 5。AI模型GPT-5.6Claude Fable 5Agents' Last Exam9 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 新系列在智能体考试中大幅领先 Claude Fable 5,成本还低很多,值得看看。原文稍后读已读值得跟进有用关注 GPT-5.6
12:52AI Will@FinanceYF589°OpenAI 宣布推出 GPT-5.6 Sol,在代码、知识工作、网络安全和科学任务上达到领先表现。该模型在多项基准中实现了更高准确率,同时使用更少 Token 并降低推理成本。GPT-5.6 Sol 的定价较前代版本下降约 30%,继续推动大模型效率提升。AI模型GPT-5.6 SolOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 发了 GPT-5.6 Sol,智能更强还更省 Token,跑代码写论文都比以前快还便宜。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
12:21AI Will@FinanceYF5Fable 5模型接收一串首字母“iattfloewitsaiwytgwiw”,成功还原出用户意图:“我正在输入这句话里每个单词的首字母,并且想让你猜猜我写的是什么。”该演示展示了模型在仅有首字母信息时的逻辑推理与语言补全能力。此前未见其他AI模型公开进行类似测试。AI模型Fable 5推理模型首字母推理6 个信源在谈事件专题推荐理由:Fable 5能根据首字母猜整句话,像玩文字谜题一样,展示了它的推理能力,和别的模型比这种玩法挺新鲜。原文稍后读已读值得跟进有用关注 Fable 5
12:19官方账号arXiv cs.AI@Xinyan Chen, Ziyu Guo, Renrui Zhang, Dongzhi Jiang, Hongsheng LiOpenCoF 是一个包含 OpenCoF-17K 数据集和 Wan-CoF 模型的推理框架,覆盖 11 个任务家族。在 4 个视频推理基准上,Wan-CoF 相比 Wan2.2-I2V-A14B 基线取得显著提升。模型引入视觉和文本推理 token,分别捕捉低级视觉线索和高级语义先验。实验通过注意力分析探讨了这些 token 在不同深度、去噪步骤、空间和时间上的贡献。论文OpenCoFWan2.2-I2V-A14B视频生成推荐理由:这篇论文用视频帧序列做推理,比传统的思维链更直观。他们把 Wan2.2 模型微调成 Wan-CoF,在多个基准上分数更高,还开源了数据集和代码。原文稍后读已读值得跟进有用关注 OpenCoF
12:12官方账号arXiv cs.AI@Baha Rababah, Cuneyt Gurcan Akcora, Carson K. Leung该论文提出了正确性一致性(correctness agreement)指标,用于衡量基础模型与量化变体在正确预测上的重叠程度。在8-bit至2-bit的多种量化方案下,发现即使任务性能看似保持,中等量化也会导致行为分歧。分析表明查询和键投影的敏感性高于值和输出投影,揭示了低比特宽度的非线性断点。这些发现指出仅依赖准确率和困惑度会掩盖量化的真实影响。论文LLM量化模型评估推荐理由:这篇论文用新指标发现,量化后的模型即使分数不变,行为也可能跑偏,搞模型部署的同学建议看看。原文稍后读已读值得跟进有用关注 LLM