13:04Gary Marcus@GaryMarcus70°普林斯顿大学一位年轻教授在OpenAI发起的Erdos游戏挑战中,仅用3天就超越了OpenAI的表现。该游戏测试AI在数学推理上的能力,涉及Erdos数等概念。这位教授的方法基于arxiv.org/abs/2605.20579论文,展示了更高效的推理策略。论文推理模型大模型OpenAI4 个信源在谈事件专题推荐理由:普林斯顿教授3天反超OpenAI原文稍后读已读值得跟进有用关注 推理模型
23:36官方账号Logan Kilpatrick@OfficialLoganK精选Gemini 3.5 Flash 模型在 Vending Bench 基准测试中达到性价比帕累托前沿。Vending Bench 用于衡量模型运行模拟商店的能力。该模型在成本与智能之间取得最优平衡,优于其他竞品。这是 Gemini 系列在推理效率上的重要进展。AI模型Gemini 3.5 FlashGoogleVending Bench推荐理由:谷歌新模型性价比超群原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
17:51官方一手marktechpost@Asif Razzaq精选阿里巴巴 Qwen 团队在 2026 年阿里云峰会上推出 Qwen3.7-Max,这是其最先进的智能体模型。该模型拥有 100 万 token 的上下文窗口和扩展思考模式,专为长周期任务设计,包括编程、调试和多步骤工作流自动化。在 Artificial Analysis Intelligence Index 上得分为 56.6,在专有模型中排名第五。AI模型Qwen3.7-Max推理模型智能体推荐理由:百万 token 上下文窗口让长代码库分析和复杂工作流自动化成为可能,做 AI 智能体或编程工具的开发者值得关注,可以直接用于长周期任务。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
22:16Gary Marcus@GaryMarcusGaryMarcus 在 X 上转发了一条消息,称标准 GPT-5.5 已经成功复现了某个数学证明,并质疑这是否意味着所谓的“阶跃变化”只是问题本身更简单。该推文引用了 ChatGPT 的分享链接,显示模型在推理任务上的表现。这一讨论反映了 AI 社区对模型能力提升本质的持续争论:是模型真的变强了,还是任务难度被高估了。AI模型GPT-5.5推理模型阶跃变化推荐理由:AI 研究者和大模型用户值得关注——GPT-5.5 的推理表现引发了对“阶跃变化”定义的反思,看完会重新审视模型能力的评估标准。原文稍后读已读值得跟进有用关注 GPT-5.5
14:00OpenRouter@OpenRouterAI精选DeepSeek V4 Flash 在 OpenRouter 每周排行榜中登顶,获得 1196 次浏览和 38 个点赞。该模型是 DeepSeek V4 的轻量版本,表现出色。OpenRouter 排行榜基于用户使用量和反馈,V4 Flash 的领先显示了其在开发者中的受欢迎程度。AI模型DeepSeek V4 FlashDeepSeekOpenRouter推荐理由:DeepSeek新模型登顶社区排行榜原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
11:02官方账号arXiv cs.AI@Ali Hatamizadeh, Yejin Choi, Jan Kautz精选72°线性注意力模型通过固定大小的循环状态替代软注意力的无限缓存,但如何高效编辑压缩记忆而不打乱已有关联是难点。现有Delta规则模型使用单一标量门控同时控制擦除旧内容和写入新内容,存在耦合限制。Gated DeltaNet-2提出通道级擦除门控b_t和写入门控w_t,将两者解耦,可退化为KDA和Gated DeltaNet。在1.3B参数、100B FineWeb-Edu tokens训练下,该模型在语言建模、常识推理和检索任务上全面超越Mamba-2、Gated DeltaNet、KDA和Mamba-3。尤其在长上下文RULER基准的多键检索设置中优势显著,代码已开源。论文线性注意力门控机制长上下文推荐理由:线性注意力研究者终于有了更精细的门控机制——Gated DeltaNet-2把擦除和写入分开控制,做高效长序列建模的团队可以直接复现并对比效果。原文稍后读已读值得跟进有用关注 线性注意力
10:46官方一手arXiv: DeepSeek@Xiaogeng Liu, Xinyan Wang, Yingzi Ma, Yechao Zhang, Chaowei Xiao精选论文研究了在推理任务中,教师模型token的可靠性并非均匀分布,而是与序列中的位置强相关。作者提出分支可行性诊断方法,发现位置得分是预测教师token可靠性的最强指标(AUROC达0.83),而局部不确定性得分效果很差。基于此,提出位置加权在线策略自蒸馏(PW-OPSD),在保持原有训练框架的同时,对越靠后的token赋予更高权重。在Qwen3-4B上,PW-OPSD使AIME 2024和2025的Avg@12分别提升1.0和1.1分,在DeepSeek-R1-Distill-Llama-8B和Olmo-3-7B-Think上也取得一致改进。该方法无需额外教师计算,直接利用轨迹结构提升蒸馏效果。论文推理模型自蒸馏位置加权推荐理由:做推理模型蒸馏的团队终于有了一个简单有效的改进方向——不用改架构,只需调整token权重就能提升1分以上,值得在自家模型上复现。原文稍后读已读值得跟进有用关注 推理模型
09:37官方账号Together AI@togethercompute83°阿里巴巴推出Qwen3.7-Max旗舰模型,专为智能体时代设计,支持100万token上下文窗口。该模型在智能体编程、推理和长周期自主任务上表现领先。现在可通过Together Serverless Inference平台用于生产级智能体工作流。这标志着大模型从对话助手向自主智能体核心引擎的转变。AI模型Qwen3.7-Max智能体长上下文推荐理由:做智能体应用的开发者终于有了一个原生支持长上下文和自主决策的旗舰模型,1M上下文窗口直接解决复杂任务中的记忆瓶颈,建议在Together上试试生产级部署。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
08:05IT之家(博客/媒体)83°OpenAI 宣布其全新推理模型成功推翻了一个由数学家埃尔德什于 1946 年提出的几何猜想,这是 AI 首次自主攻克数学核心领域的重大未解难题。该模型并非为数学问题定制,而是通用推理系统,能梳理复杂逻辑链条并跨学科关联知识。OpenAI 附上了多位数学家的佐证,避免了此前 GPT-5 声称攻克难题却实为现成解法的尴尬。这一突破被认为将对生物学、物理学、工程学和医学产生深远影响。AI模型推理模型数学证明OpenAI10 个信源在谈事件专题推荐理由:AI 首次自主攻克数学核心难题,对数学、物理等领域的科研人员是重大信号——AI 已能发现人类未曾想到的解法,做基础研究的团队值得关注。原文稍后读已读值得跟进有用关注 推理模型
07:57SuperTechFans(博客/媒体)精选OpenAI 内部模型构造出单位距离对数为 n^(1+δ) 的点集,推翻长期认为方格构造最优的假设。该证明经外部数学家验证并发表伴随论文,是 AI 首次自主完成复杂数学证明的里程碑。菲尔兹奖得主蒂姆·高斯等数学家高度评价此成果,认为 AI 已具备原创性和执行力。AI模型OpenAI单位距离问题数学证明10 个信源在谈事件专题推荐理由:AI 首次独立证明数学猜想原文稍后读已读值得跟进有用关注 OpenAI
06:20官方账号阿里通义 Qwen@Alibaba_Qwen76°阿里通义千问团队发布了 Qwen3.7-Max 模型,在编程智能体基准测试中表现强劲,同时在通用智能体能力上也有大幅提升。该模型在最具挑战性的推理基准测试中展现出卓越实力,并在通用能力和多语言处理方面脱颖而出。这标志着国产大模型在智能体领域的重要进展。AI模型Qwen3.7-Max编程智能体推理模型推荐理由:Qwen3.7-Max 在编程和通用智能体任务上的大幅提升,对做 AI 编程工具和智能体应用的开发者是直接利好,建议关注其实际效果。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
03:55rohanpaul_ai@rohanpaul_aiQwen 3.7 Max 在编程和智能体能力上接近前沿模型,在 Artificial Analysis 排名第五,与 GPT 5.4 (xhigh) 相当,略高于刚发布的 Gemini 3.5 Flash。该模型现已通过 AI/ML API 提供,代理可靠性是其核心亮点。AI/ML API 还为用户提供免费试用码,方便开发者体验。AI模型Qwen 3.7 Max编程助手智能体推荐理由:Qwen 3.7 Max 在编程和智能体能力上逼近 GPT 5.4,做 AI 应用和智能体开发的团队值得试试,尤其是想低成本接近前沿模型的开发者。原文稍后读已读值得跟进有用关注 Qwen 3.7 Max
02:12rohanpaul_ai@rohanpaul_ai83°阿里巴巴发布了其最强旗舰模型 Qwen3.7-Max,专为真实世界任务和生产环境设计。该模型在智能体可靠性上做了核心优化,能够自主规划步骤、调用工具、检查结果并修复错误,不会在首次出错后崩溃。在 Artificial Analysis Intelligence Index 上,Qwen3.7-Max 得分 56.6,较 Qwen3.6-Max 提升 4.8 分,排名第五,与 GPT 5.4 相当。性能提升主要集中在科学推理、智能体能力和编程方面。此外,推理内核经过多轮底层 GPU 优化,实现了 10 倍的几何平均加速。AI模型阿里Qwen3.7-Max智能体推荐理由:Qwen3.7-Max 在智能体可靠性上的突破,让做自动化工作流和复杂任务编排的开发者有了更稳定的选择,建议直接上手测试。原文稍后读已读值得跟进有用关注 阿里
23:05berryxia@berryxiaQwen 3.7 Max 正式发布,博主使用经典的「AI模型二叉树Prompt」对其进行了深度思考和快速模式测试。该Prompt要求模型编写HTML程序绘制递归分形二叉树,并实现生长动画和摇曳效果。测试结果通过视频展示,并与之前的Gemini 3.5 Flash结果进行了对比。用户可自行测试不同模型在该任务上的表现。AI模型Qwen 3.7 Max推理模型编程助手推荐理由:Qwen 3.7 Max 的发布值得关注,尤其是对AI模型编程能力感兴趣的开发者,可以用这个二叉树Prompt亲自测试它的表现,看看它和Gemini 3.5 Flash相比如何。原文稍后读已读值得跟进有用关注 Qwen 3.7 Max
22:15官方账号阿里通义 Qwen@Alibaba_Qwen阿里发布 Qwen3.7-Max 旗舰模型,在 Artificial Analysis Intelligence Index 上获得 56.6 分,比 Qwen3.6-Max-Preview 提升 4.8 分。主要改进集中在科学推理、智能体能力和编程能力,同时幻觉率大幅下降。模型上下文窗口从 256K 提升至 1M 令牌,但仅支持文本输入输出。虽然仍落后于 OpenAI、Anthropic 和 Google 的模型,但这是阿里最接近前沿模型的一次。AI模型Qwen3.7-Max阿里推理模型10 个信源在谈事件专题推荐理由:阿里 Qwen 系列持续追赶前沿,Qwen3.7-Max 在推理和智能体能力上进步明显,做 AI 应用开发或模型选型的团队值得关注这次性能跃升。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
21:55官方账号阿里云 Alibaba Cloud@alibaba_cloud83°阿里云发布了 Qwen3.7-Max 模型,在 Artificial Analysis Intelligence Index 上获得 56.6 分,比预览版 Qwen3.6-Max-Preview 提升了 4.8 分。该模型在科学推理、智能体能力、编程和减少幻觉方面均有显著改进。这标志着阿里在大模型领域的持续迭代和竞争力提升。AI模型Qwen3.7-Max阿里云推理模型推荐理由:Qwen3.7-Max 在推理和智能体能力上大幅跃升,做 AI 应用开发和科学计算的团队值得关注,可以直接测试其编程和 agent 表现。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
21:05Patrick Loeber@patloeber76°Gemini 3.5 Flash (Medium) 在 Zapier 的 AutomationBench 基准测试中夺得第一,得分 14.5%,远超 GPT 5.5 (xhigh) 的 12.9%。值得注意的是,中等推理设置(medium)表现优于高推理(high),因为高推理会过度消耗工具调用限制。该模型还以约 7 倍的成本优势领先,成为目前最持久的自动化模型。Google 已推荐将 medium 作为默认 API 设置,适用于大多数任务。AI模型Gemini 3.5 FlashAutomationBench推理模型推荐理由:做自动化流程的开发者终于有了性价比之选——Gemini 3.5 Flash 不仅性能领先,成本还低 7 倍,建议直接试试 medium 设置。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
17:28orange.ai@oran_ge93°OpenAI 一个未公布的内部推理模型自主解决了 Erdős 1946 年提出的平面单位距离问题,这是 AI 首次独立解决一个数学领域的著名开放问题。模型的思维链长达 125 页,核心手法是从代数数论引入工具解决离散几何问题,这种跨领域连接是人类 80 年未曾想到的。该模型并非专为数学训练,而是通用推理模型,表明推理能力达到一定阈值后创造性会自然涌现。这一成果被认为是 AI 发展的里程碑时刻。AI模型推理模型数学OpenAI10 个信源在谈事件专题推荐理由:这是 AI 首次自主解决数学开放问题,证明了通用推理模型能跨领域创造新解法,做 AI 研究和数学研究的都该看看——它可能改变我们对 AI 创造力的认知。原文稍后读已读值得跟进有用关注 推理模型
15:49rohanpaul_ai@rohanpaul_ai精选72°一种名为GRAM(生成式递归推理)的新模型,仅用1000万参数,通过同时探索多条推理路径,在硬数独谜题上达到97%准确率,超越此前最佳递归模型(87.4%)。传统递归模型是确定性的,容易陷入错误轨迹,而GRAM在每个推理步骤注入随机性,生成多样化的推理路径,并在测试时并行运行并选择最佳结果。在N皇后等多解任务中,GRAM保持近乎完美的准确率,而确定性模型随解数量增加而崩溃。此外,GRAM还能作为生成器,用16步生成有效数独谜题,成功率99%,远超扩散模型。论文推理模型并行推理随机性推荐理由:GRAM用随机性打破了递归模型的确定性瓶颈,做推理模型或搜索算法的研究者可以直接复现,做数独或组合优化应用的团队值得关注。原文稍后读已读值得跟进有用关注 推理模型
14:57rohanpaul_ai@rohanpaul_ai83°OpenAI 的通用推理模型成功推翻了一个自 1946 年以来的 Erdős 平面单位距离猜想,证明了存在无限族构造能多项式改进已知上界。关键在于该模型并非专用定理证明引擎,而是通过增加测试时计算(推理阶段思考)来提升表现,无需大量领域特化训练。这一突破展示了通用推理系统在数学探索中的潜力,能够跨越几何与代数数论(如类域塔理论)的鸿沟,发现人类因学科边界和直觉限制而忽略的路径。外部数学家已验证了该证明的正确性。AI模型推理模型数学OpenAI10 个信源在谈事件专题推荐理由:OpenAI 用通用推理模型解决了一个困扰数学家近 80 年的难题,证明 AI 不需要专用引擎也能做前沿数学研究。做 AI 推理或数学建模的团队值得关注——它展示了“推理时计算”比“更多训练”更能带来突破。原文稍后读已读值得跟进有用关注 推理模型
14:35AI Will@FinanceYF588°OpenAI 的一个通用推理模型独立解决了数学家 Paul Erdős 在 1946 年提出的“平面单位距离问题”,这是 AI 首次自主解决一个数学领域的著名开放问题。该问题困扰了数学界近 80 年,此前最优解被认为接近正方形网格,而 AI 发现了一种全新的构造方式,表现更优。这一突破标志着 AI 开始具备长链条、跨领域推理能力,未来可能加速生物学、医学、工程学等领域的进展。但决定问题和解读结果的仍然是人类,AI 只是工具。AI模型OpenAI推理模型数学突破10 个信源在谈事件专题推荐理由:这是 AI 首次自主解决数学开放问题,做数学研究或 AI 推理的开发者值得关注——它展示了 AI 在长链条推理上的潜力,建议点开看看具体突破。原文稍后读已读值得跟进有用关注 OpenAI
12:11官方账号arXiv cs.LG@Kaiyi Zhang, Wei Wu, Yankai Lin精选DelTA提出了一种新方法,解决强化学习从可验证奖励(RLVR)中训练大语言模型时,token级信用分配不准确的问题。研究发现,标准RLVR更新中,高频格式token会主导梯度方向,掩盖真正区分高/低奖励的关键token。DelTA通过估计token系数,放大判别性方向、抑制共享模式,使更新更聚焦于推理关键步骤。在7个数学基准上,DelTA在Qwen3-8B和14B上分别平均提升3.26和2.62分,代码生成和跨领域任务也验证了其泛化能力。论文强化学习Token信用分配推理模型推荐理由:做RLHF或推理模型训练的团队,终于有了一个能精准分配token级信用的方法——DelTA解决了高频格式token淹没关键信号的问题,数学和代码任务上效果显著,值得在自家模型上试试。原文稍后读已读值得跟进有用关注 强化学习
12:09官方账号arXiv cs.LG@Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng精选76°研究发现强化学习(RLVR)训练中模型权重的变化轨迹是低秩且高度可预测的,大部分性能提升来自秩-1近似。基于此,研究者提出RELEX方法,仅需观察少量训练步数(如50步),通过线性回归外推未来检查点(如1000步),即可匹配甚至超越完整RLVR训练的性能。在Qwen2.5-Math-1.5B、Qwen3-4B-Base和Qwen3-8B-Base三个模型上验证,RELEX仅需15%的训练步数即可达到同等效果,且能外推至10-20倍于观察窗口。该方法无需额外学习模型,通过丢弃随机优化噪声实现去噪效果,从而提升外推性能。论文强化学习推理模型低秩近似推荐理由:RLVR训练成本高昂,RELEX用极低成本实现同等推理提升,做LLM推理优化的团队可以直接用代码复现,值得一试。原文稍后读已读值得跟进有用关注 强化学习
11:55官方账号arXiv cs.LG@Benhao Huang, Zhengyang Geng, Zico Kolter精选Equilibrium Reasoners (EqR) 是一种新的推理框架,通过将推理过程建模为学习任务条件吸引子(latent dynamical systems)来实现可扩展的测试时计算。该框架无需外部验证器或任务特定先验,通过增加迭代深度(更多步数)和广度(聚合多个随机轨迹)来提升性能。实验表明,测试时计算的增益与向解对齐吸引子的收敛程度紧密相关。在 Sudoku-Extreme 任务上,EqR 通过展开多达 40,000 层,将前馈模型的准确率从 2.6% 提升至超过 99%。这一视角为理解迭代潜在模型中的可扩展推理提供了机制性解释。论文推理模型测试时计算吸引子推荐理由:EqR 用吸引子理论解释了为什么迭代推理能泛化,做推理模型或可扩展计算的团队值得关注——它可能改变你对测试时计算分配的理解。原文稍后读已读值得跟进有用关注 推理模型
11:01官方账号arXiv cs.AI@Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma精选72°DeepWeb-Bench 是一个新的深度研究基准,旨在评估 AI 模型在开放网络上进行复杂研究的能力。与现有基准不同,该基准要求模型进行大规模证据收集、跨来源整合和长链条多步推理,难度显著提升。研究对九个前沿模型进行了评估,发现检索并非主要瓶颈(仅占12-14%错误),而推导和校准失败占70%以上。强模型和弱模型的失败模式不同:强模型主要因推导不完整出错,弱模型则因虚假精确性出错。该基准还揭示了模型在领域上的真实专长差异,跨模型一致性仅为0.61。论文基准测试深度研究推理模型推荐理由:做 AI 评估或研究基准的团队会发现,DeepWeb-Bench 揭示了现有基准无法区分的模型能力差异——尤其是推导和校准的短板。建议关注其分能力族评估和来源溯源设计,这对理解模型真实研究能力很有帮助。原文稍后读已读值得跟进有用关注 基准测试
10:22官方账号arXiv cs.LG@Xixiang He, Qiyao Sun, Ao Cheng, Xingming Li, Xuanyu Ji, Hailun Lu, Runke Huang, Qingyong Hu精选72°Group Relative Policy Optimization (GRPO) 在提升大语言模型推理能力方面表现出色,但存在优势坍塌问题:当组内奖励同质化(如全对或全错)时,优势趋近于零,导致梯度消失。研究者首次提出诊断指标 Advantage Collapse Rate (ACR),量化训练批次中梯度无效的比例,并在0.5B至14B参数模型上验证了ACR对训练停滞和最终性能的强预测性。为缓解该问题,他们提出 Adaptive Virtual Sample Policy Optimization (AVSPO),通过实时ACR监控注入虚拟奖励样本,无需额外模型推理即可从同质组中学习。AVSPO将优势坍塌减少58-63%,在所有模型规模上带来4-6个百分点的准确率提升,且保持了域外泛化能力。代码和数据集已开源。论文GRPO优势坍塌RLVR推荐理由:GRPO用户终于有了解决训练停滞的实用工具——AVSPO无需额外推理成本就能提升4-6个点准确率,做大模型RL训练的团队可以直接试。原文稍后读已读值得跟进有用关注 GRPO
10:22官方账号arXiv cs.LG@Lukas Twist, Helen Yannakoudakis, Jie M. Zhang精选论文揭示了一个关键问题:推理模型在微调时,若使用不含推理痕迹的普通指令-回复数据,会导致“推理痕迹坍塌”——模型虽能给出看似合理的最终答案,但中间推理步骤的结构性有效性大幅下降。研究者提出了一个结构评估框架,将答案正确性与推理痕迹有效性分离,测量有效、空、缺失和截断的推理痕迹。实验发现,标准监督微调会迅速抑制有效推理痕迹,而仅看答案正确率会掩盖这一失败。论文还表明,简单的损失掩码策略可以显著缓解坍塌,无需教师生成的推理痕迹。论文推理模型微调推理痕迹坍塌推荐理由:做推理模型微调的团队必须警惕:只看答案正确率会误判模型能力,这篇论文给出了评估和缓解方案,建议做模型对齐的开发者仔细阅读。原文稍后读已读值得跟进有用关注 推理模型
09:35SuperTechFans(博客/媒体)83°谷歌发布了 Gemini 3.5 系列模型,其中 3.5 Flash 版本在多项基准测试中表现优异,输出速度是其他前沿模型的 4 倍,特别适合大规模多步骤代理任务。该模型已通过 Gemini 应用、Google 搜索等渠道上线,开发者可通过 Antigravity 平台和 API 使用。推测其采用混合精度(FP4/FP8)和较少活跃参数,在保持高性能的同时降低成本。这一发布标志着智能代理技术的新突破,有望推动 AI 在复杂场景中的广泛应用。AI模型Gemini 3.5 Flash推理模型低延迟推荐理由:Gemini 3.5 Flash 解决了高智能与低延迟的矛盾,做多步骤代理和编码的开发者可以直接用上,成本还更低,值得一试。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
08:00IT之家(博客/媒体)83°谷歌在 2026 I/O 开发者大会上宣布,Gemini 3.5 Pro 模型将于下月正式发布。目前该模型已在谷歌内部使用,官方称其进步非常强,但未透露具体细节。这一消息表明谷歌在 AI 模型迭代上持续加速,Gemini 3.5 Pro 有望在性能、多模态或推理能力上带来显著提升,值得开发者和 AI 从业者关注。AI模型Gemini 3.5 Pro谷歌推理模型1 个信源在谈事件专题推荐理由:谷歌 Gemini 系列模型迭代节奏加快,3.5 Pro 内部使用已获「进步超强」评价,做多模态或推理应用的开发者值得提前关注,下月发布后可直接上手体验。原文稍后读已读值得跟进有用关注 Gemini 3.5 Pro
07:59IT之家(博客/媒体)在 AMD AI 开发者日活动上,CEO 苏姿丰表示 AI 进步令人难以置信,预计未来五年将有 50 亿人每日使用 AI。她强调不存在单一应用满足需求,需要多样化的模型和工作流。苏姿丰称这是她 30 多年科技生涯中最兴奋的时刻,AI 在最近几个月加速发展,推理型 AI 更普遍,企业 CEO 们都在讨论如何利用 AI。她指出 AI 技术需要推理、学习和数据流能力,智能体是关键,未来 GPU 将无处不在,AMD 将提供端到端计算能力。行业AMD苏姿丰AI 趋势推荐理由:苏姿丰的发言揭示了 AI 从技术到落地的关键转折点——未来五年 50 亿用户意味着巨大的应用和基础设施机会,做 AI 开发或企业决策的人值得关注 AMD 的端到端计算布局。原文稍后读已读值得跟进有用关注 AMD
07:59官方账号Noam Shazeer@noamshazeer91°在 Google IO 大会上,Noam Shazeer 宣布推出 Gemini 3.5 Flash 模型,专为智能体和编程场景优化。该模型具备前沿性能,速度是其他前沿模型的 4 倍,即日起全球上线。这标志着 Google 在实时 AI 应用领域的重要进展,尤其适合需要快速响应的智能体工作流。AI模型Gemini 3.5 Flash智能体编程助手推荐理由:做智能体开发和编程的团队终于有了速度与性能兼得的选择——Gemini 3.5 Flash 比同类快 4 倍,值得立即上手测试。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
07:59DeepLearning.AI@DeepLearningAIDeepLearningAI 在 X 平台发起一项投票,测试当前 AI 图像模型能否正确识别图片中的两种健身器材。该投票旨在引发对多模态推理模型能力的讨论,并推广其“AI Prompting for Everyone”课程。目前投票选项包括“能”、“不能”和“可能”,已有 682 次浏览和 5 次投票。这反映了业界对 AI 视觉理解真实世界物体能力的持续关注。AI模型多模态模型图像识别推理模型推荐理由:想了解多模态模型在真实场景中的识别能力?这个投票让你快速感知 AI 的视觉推理边界,做 AI 应用开发的可以参与讨论并学习提示技巧。原文稍后读已读值得跟进有用关注 多模态模型
07:59Ethan Mollick@emollick一年前,OpenAI曾宣称其未发布的通用模型在国际数学奥林匹克竞赛(IMO)中夺得金牌,但至今未公开该模型的具体名称或版本。这一神秘模型引发了外界对其能力的广泛猜测,尤其是它是否代表了OpenAI在推理和数学能力上的重大突破。如今,随着GPT-5.5 Pro Extended的推出,人们开始质疑新模型是否已追平或超越当年金牌模型的水平。该问题由学者Ethan Mollick在X上提出,再次引发对OpenAI模型演进和透明度讨论。AI模型OpenAI推理模型IMO10 个信源在谈事件专题推荐理由:OpenAI的IMO金牌模型至今未公开,这背后可能隐藏着模型能力的真实上限。关注推理模型和数学能力的开发者,值得思考GPT-5.5 Pro Extended是否已填补这一空白。原文稍后读已读值得跟进有用关注 OpenAI
07:54官方账号OpenAI@OpenAI (@OpenAI)OpenAI在一条推文中指出,AI系统正变得能够进行长而困难的推理链,连接不同领域的想法,并发现研究者可能未探索的路径。他们认为这些能力将很快加速生物学、物理学、工程学和医学领域的工作。同时强调,人类的判断力仍然至关重要,专业知识将变得更有价值,AI负责搜索、建议和验证,而人类选择重要问题、解释结果并决定下一步方向。AI模型推理模型科研加速OpenAI10 个信源在谈事件专题推荐理由:科研人员和工程师将看到AI从工具变为协作伙伴——长链推理能力让AI能跨领域连接想法,做科研的团队值得关注这一趋势,思考如何将AI融入工作流。原文稍后读已读值得跟进有用关注 推理模型
07:51官方账号OpenAI@OpenAI (@OpenAI)精选76°OpenAI 宣布其通用推理模型成功证明了一个数学难题,该模型并非专门为数学问题设计,而是具备广泛推理能力。这一成果被视为数学和 AI 社区的重要里程碑,展示了通用 AI 在复杂推理任务上的潜力。该证明由通用模型完成,而非针对特定问题优化的系统,凸显了 AI 推理能力的泛化性。AI模型推理模型数学证明OpenAI10 个信源在谈事件专题推荐理由:通用推理模型攻克数学难题,证明了 AI 在数学推理上的泛化能力,数学研究者和 AI 开发者值得关注这一突破。原文稍后读已读值得跟进有用关注 推理模型
07:08Google Gemini App@GeminiApp精选Google 发布 Gemini 3.5 Flash,即日起全球用户可免费使用。用户只需在 gemini.google 或移动应用底部下拉菜单中选择“3.5 Flash”即可体验。该模型侧重高效推理与快速响应,面向免费层级开放。AI模型Gemini 3.5 FlashGoogle推理模型推荐理由:谷歌免费上架新模型,试试手速原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
15:12AI Will@FinanceYF5精选72°Google 提出 Nexus 框架,将时间序列预测从纯数值模式匹配转向事件驱动的推理问题。Nexus 通过多个智能体分别处理历史文本事件、宏观环境、局部冲击,并由合成器校准,让模型理解数字背后的原因。在 Zillow 房价测试中,基于 Claude 的版本相比直接思维链提示,平均绝对百分比误差(MAPE)降低 86.6%。虽然目前仅在有限数据集上验证,但方向明确:未来的预测不仅要外推曲线,还要解释曲线为何移动。论文时间序列预测智能体推理模型推荐理由:做时间序列预测的团队终于有了一个能理解「为什么涨跌」的框架,Nexus 把事件和数字结合,效果显著。做量化、经济预测或房地产分析的建议点开论文看看。原文稍后读已读值得跟进有用关注 时间序列预测
13:40IT之家(博客/媒体)88°阿里千问今日正式发布 Qwen3.7-Max,定位为面向智能体时代的旗舰模型,即将通过阿里云百炼 API 提供服务。该模型在编程、办公自动化、长周期自主执行等智能体任务上表现突出,例如在长达 35 小时、超 1000 次工具调用的内核优化实验中保持连贯推理。在多项基准测试中,Qwen3.7-Max 在编程智能体(如 SWE-Pro 60.6)、通用智能体(如 MCP-Mark 60.8)和推理(如 GPQA Diamond 92.4)上均取得领先或与顶尖模型相当的成绩。此外,它支持跨框架部署,兼容 Claude Code、OpenClaw 等,并具备多语言理解与翻译能力。AI模型智能体编程助手MCP/工具7 个信源在谈事件专题推荐理由:Qwen3.7-Max 在长周期自主执行和跨框架兼容性上展现出实用价值,做自动化办公或复杂编程的开发者可以直接通过 API 体验,值得关注。原文稍后读已读值得跟进有用关注 智能体
13:09berryxia@berryxia83°Google DeepMind 推出了 Gemini 3.5 Flash 模型,在 Intelligence Index 上获得 55 分,比上一代 Gemini 3 Flash 高 9 分,超越 Grok 4.3 和 Claude Sonnet 4.6。Agentic 任务 Elo 评分达 1656,幻觉率从 92% 降至 61%,多模态理解 MMMU-Pro 达 84%,输出速度超 280 tokens/s,比前代快 70%。但成本大幅上升,运行一次测试的成本是 Gemini 3 Flash 的 5.5 倍,定价为 $1.5/$9 per 1M input/output tokens,是前代的 3 倍。这标志着智能与速度的 Pareto 前沿被刷新,但“Flash”系列的性价比优势不再。AI模型Gemini 3.5 FlashGoogle DeepMind推理模型推荐理由:Gemini 3.5 Flash 在智能和速度上实现了突破,做 AI 应用或 agent 开发的团队值得关注——性能提升显著,但预算敏感型项目需要重新评估成本。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
10:55官方一手arXiv: DeepSeek@Yanhang Li, Zhichao Fan, Zexin Zhuang精选该研究审计了推理模型在遗忘后是否仍通过思维链泄露已遗忘内容。使用 DeepSeek-R1-Distill-Qwen-7B 和 LoRA 记忆虚构作者,通过 NPO 遗忘和六 token canary 头条件,发现思维链替换为短非 canary 前缀可显著降低答案率,而 bypass 间隙本身不能可靠指示权重级记忆。不同种子下结果不一致,甚至出现反转。推荐在标准审计外增加解码时模板替换作为廉价检查。论文推理模型遗忘审计思维链推荐理由:做模型遗忘审计的团队会发现,思维链泄露可能被误判为权重记忆,这篇论文提供了一个简单有效的 sanity check 方法,值得在评估流程中加上。原文稍后读已读值得跟进有用关注 推理模型