15:36官方账号arXiv cs.AI@Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo YooKV-Rescue是一种无需训练的推理框架,通过轻量级全上下文助手桥接KV驱逐引入的信息缺口。在Qwen2.5-Math 7B和72B模型上,五个数学基准测试中,KV-Rescue在驱逐预算B=64时平均恢复了87%的精度损失。该框架使用在线检测器基于熵和可压缩性提前终止不连贯或重复的生成,将基础模型令牌生成量平均减少43%。论文KV-RescueKV缓存推理模型推荐理由:KV缓存驱逐会掉精度,KV-Rescue用个小模型当辅助,能救回87%的损失,还省43%的生成量,跑长推理的可以看看。原文稍后读已读值得跟进有用关注 KV-Rescue
09:14SuperTechFans(博客/媒体)一项针对AI数学能力的分析认为,其优势来自近乎无限的符号工作记忆,而非更强的推理能力。人类数学家受限于工作记忆容量,而AI的上下文窗口能同时容纳整个问题、数百个中间方程和多种尝试路径。多项研究表明,控制智力水平后,工作记忆仍能独立预测数学成绩。因此AI看似聪明,实则只是用外部草稿纸绕过了人类生物瓶颈。AI模型工作记忆数学推理上下文窗口推荐理由:这篇文章说AI数学强在记性好而不是脑子好,用上下文窗口碾压人类工作记忆,角度挺新鲜。原文稍后读已读值得跟进有用关注 工作记忆
23:53官方账号Decoder@Matthias Bastian数学家Timothy Gowers和Peter Sarnak指出,LLM擅长组合已知的数学方法,但在提出全新数学思想上缺乏直觉。他们认为LLM更像是强计算器,而非创造性思考者。两位专家还表示,模型无法真正理解数学中的深层结构。行业LLM数学推理Timothy Gowers推荐理由:两位数学大牛说,LLM只会拼凑已有套路,想不出新数学,想靠它搞原创研究得小心。原文稍后读已读值得跟进有用关注 LLM
21:17量子位@衡宇Claude在组合数学任务中取得新进展,完成了2000阶以下哈达玛矩阵存在性的全面验证。该结果覆盖了4到2000阶之间所有4的倍数阶数,将哈达玛矩阵的已知范围一次补齐。这项工作展示了Claude在数学推理上的能力,也让AI在解决经典数学难题上又添一例。AI模型Claude哈达玛矩阵数学推理推荐理由:Claude把2000阶以下的哈达玛矩阵全验证了一遍,以后数学系做组合题能省不少事。原文稍后读已读值得跟进有用关注 Claude
00:31techcrunch@Russell Brandom83°Anthropic的一个未发布模型在数学领域最著名的未解问题之一——黎曼猜想上取得了进展。该模型在相关基准测试中表现优于现有模型,尽管未能完全解决猜想,但展示了AI在数学推理方面的潜力。这一成果可能对数学研究产生深远影响。AI模型Anthropic黎曼猜想数学推理9 个信源在谈事件专题推荐理由:Anthropic的新模型在黎曼猜想上取得了进展,虽然没完全解决,但比预期强,值得看看AI在数学上能走多远。原文稍后读已读值得跟进有用关注 Anthropic
22:34Gary Marcus@GaryMarcusGary Marcus在X上发文称,Claude在黎曼猜想上的表现再次证明混合神经符号AI的价值。他指出,如果去掉其中的符号部分,仅靠神经网络无法成功解决该问题。这被视为神经符号AI在数学推理领域的重要验证。AI模型ClaudeGary Marcus神经符号AI推荐理由:想看AI数学推理到底行不行?Marcus说Claude解黎曼猜想靠的是符号+神经混合,不是纯神经网络。原文稍后读已读值得跟进有用关注 Claude
14:33量子位@一水83°Anthropic的未公开Claude模型在黎曼猜想相关问题上创下新纪录,将下界显著推高。该模型在数学推理基准上表现突出,超越了此前的最佳结果。具体提升幅度和基准名称尚未完全公开,但已引发学界关注。这一进展展示了AI在高级数学研究中的潜力。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Anthropic偷偷用新模型刷了数学纪录,下界直接拉高,数学和AI圈都该看看。原文稍后读已读值得跟进有用关注 Claude
11:52官方账号arXiv cs.AI@Congfeng Cao, Pengyu Zhang, Jelke Bloem本文系统研究了思维模式融合(TMF)训练中思考与非思考模式的数据比例和训练调度对数学推理的影响。作者构建了包含多种数据比例和三种训练调度的基准测试,发现增加非思考监督比例会降低思考模式准确率,两者存在不对称交互。不同训练调度可调节这种权衡,最优调度取决于数据比例。研究还量化了两种模式监督间的负相关,为TMF训练设计提供实践指导。代码和数据已在Fusion Bench开源。论文TMF数学推理训练调度推荐理由:想搞懂思考模式和非思考模式怎么配比训练?这篇论文用数学题做了系统实验,告诉你数据比例和调度怎么影响推理准确率,还开源了基准。原文稍后读已读值得跟进有用关注 TMF
11:39官方账号arXiv cs.AI@Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou精选在线策略蒸馏(OPD)是LLM后训练的核心环节,但存在退化一致性问题:学生通过重复循环获得与教师近乎完美的token一致,但整体回答有缺陷。论文将焦点转向师生不匹配,发现不匹配token分为学生多余和学生缺失两类。提出的TIDE方法采用有界Hellinger整形抑制多余token,并通过教师top-K注入恢复缺失token的概率质量。在Qwen3多个师生对上的数学推理基准中,TIDE优于标准OPD及近期基线,在强不匹配场景下Avg@8从6.9%提升至20.3%,平均响应长度缩短3.6倍。论文TIDE在线蒸馏Qwen3推荐理由:这篇论文讲了个反直觉的事:蒸馏时师生token一致反而可能有害。TIDE方法在数学推理上把准确率从6.9%拉到20.3%,还让回答短了3.6倍,值得做LLM后训练的人看看。原文稍后读已读值得跟进有用关注 TIDE
11:37官方账号arXiv cs.AI@Yubo Jiang, Fengying Xie, Zhiguo Jiang, Haopeng ZhangSKALD 是一种基于策略的自蒸馏框架,使用 Qwen3-Base 模型的两种上下文视图:仅问题的学生和基于抽象技能卡的教师。该方法通过退火指数倾斜目标稳定分布失配,并在验证奖励为正时激活蒸馏。在五个数学基准上,SKALD 在 0.6B、1.7B 和 4B 规模下分别比 GRPO 提升 +2.46、+4.85 和 +12.01 的 avg@8。在 1.7B 规模下,零方差蒸馏恢复 84.7% 的完整增益,且比 FLOP 匹配的 GRPO 高 +4.06。论文SKALDQwen3GRPO推荐理由:想提升数学推理模型?SKALD 把技能蒸馏进权重,比 GRPO 最高涨 12 分,还不用改推理时的输入。原文稍后读已读值得跟进有用关注 SKALD
10:41官方一手arXiv: DeepSeek@Bo Cheng, Qiaolin Lu, Yi Chang, Yuan Wu该研究用Top-K稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B在数学题上的中间表征,对比思维链(Thinking)与直接作答(NoThinking)两种模式。结果显示,Thinking模式依赖稀疏高强度特征驱动语言演绎,与题目难度无关;NoThinking模式则呈自适应扩散模式,侧重符号操作。通过抑制激活量最大的三个稀疏特征,发现推理与句法结构紧密耦合,干预会破坏LaTeX和框式答案格式。研究还发现,思维链的连贯性依赖特化特征间的脆弱协调,扰动后出现补偿性过度生成和低信息重复。论文DeepSeek-R1稀疏自编码器思维链推荐理由:想搞懂大模型“思考”和“直接答”到底差在哪?这篇用稀疏自编码器拆解了DeepSeek-R1的推理机制,结论挺反直觉。原文稍后读已读值得跟进有用关注 DeepSeek-R1
04:53宝玉@dotey91°Anthropic 今日公开了一个未发布研究版 Claude 的数学结果:它把黎曼 ζ 函数非平凡零点在临界线上的已知比例下界从 41.6% 提高到 67.2%。此前人类数学界从 1974 年 Levinson 的 33% 到 2020 年 Pratt 等人的 41.7%,花了近 50 年。Claude 结合了多位数学家近年论文与 Bombieri 2000 年的工作,Anthropic 数学家 Alpöge 和 Furman 已审查验证。Claude 还用 Lean 写出了可机器验证的证明。这次探索由 60 个子智能体协作,运行了 2400 条命令。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Claude 把黎曼零点下界从 41.6% 推到 67.2%,人类 50 年才推不到 9 个百分点,它一步干了 26 个点。原文稍后读已读值得跟进有用关注 Claude
04:31官方一手Anthropic: Research(资讯)72°Anthropic于8月10日发布研究称,未发布的Claude研究版在黎曼猜想相关问题上取得进展。该版本将黎曼ζ函数满足猜想的零点比例下界从41.6%提高到67.2%。研究来自Anthropic,展示了Claude在数学推理上的能力。论文ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Anthropic未发布Claude把黎曼猜想下界从41.6%推到67.2%,数学能力又进一步。原文稍后读已读值得跟进有用关注 Claude
01:57官方账号Anthropic@AnthropicAI精选72°Anthropic让未发布的研究版Claude尝试解决黎曼猜想。它没有证明该猜想,但将黎曼ζ函数满足猜想的零点比例下界从41.6%提高到67.2%。相关研究细节已发布在Anthropic研究页面上。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Anthropic让Claude研究版试解黎曼猜想,没解得动,却把下界从41.6%拉到67.2%,AI数学能力又往前一点。原文稍后读已读值得跟进有用关注 Claude
13:24官方账号arXiv cs.AI@ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng论文提出DASH方法,用于改进带可验证奖励的强化学习(RLVR)中奖励稀疏的问题。标准OPSD对所有局部发散使用相同权重,忽略了生成过程中发散序列的时间结构。DASH根据局部蒸馏信号与序列均值的差距自适应调整token级监督权重,控制反向多步聚合。在三个数学推理基准和三种模型规模上,DASH均优于匹配的vanilla OPSD。该方法复用OPSD已有的师生分布,不额外增加前向传播成本。论文DASHOPSDRLVR推荐理由:这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。原文稍后读已读值得跟进有用关注 DASH
03:15官方账号OpenAI@OpenAI (@OpenAI)82°OpenAI在X平台宣布,其下一代旗舰模型的内部版本在数学和理论计算机科学领域的10个长期开放问题上取得了新结果。该模型运行消耗的token价值约2000美元,按GPT-5.6 Sol API费率计算。推文附带的视频展示了部分求解过程,目前该模型尚未公开发布。AI模型OpenAIGPT-5.6推理模型9 个信源在谈事件专题推荐理由:OpenAI说下一代模型内部版才花2000美元token就解了10个数学老难题,按GPT-5.6 Sol API费率算的,很猛。原文稍后读已读值得跟进有用关注 OpenAI
10:17小互@imxiaohu85°OpenAI发布公告和200多页论文,披露下一代主力模型Astra的内部版本解决了10个数学与理论计算机科学难题。这些难题中最古老的来自1964年,最年轻的也已有二十多年未解,分布在八个分支。Astra尚未对外发布,目前仅以内部版本完成解题。AI模型OpenAIAstra推理模型10 个信源在谈事件专题推荐理由:OpenAI下一代模型Astra的论文:一口气解开10个几十年没人动的数学难题,想看看多强可点开。原文稍后读已读值得跟进有用关注 OpenAI
09:21官方一手arXiv: DeepSeek@Rui Zou, Yutao Zhu, Mengqi Wei, Ji-Rong WenAMTFV提出将数学验证建模与具体执行解耦,通过数学工具流接口支持精确计算。该方法先让验证智能体构建工作流,再用工具代理执行精确计算,最后辅助答案判定与修正。在DeepSeek、GPT和Gemini的七种模型配置上评估五个数学推理数据集,AMTFV总体优于基线。相比最强基线,单个模型配置下平均准确率最高提升8.3个百分点,中等和高等验证复杂度样本上提升更大。论文AMTFV数学推理自我修正推荐理由:这篇论文搞了个AMTFV,把数学验证拆成流程和计算两步,比直接写验证程序更稳,在多个模型上最高涨了8.3个点。原文稍后读已读值得跟进有用关注 AMTFV
07:21Gary Marcus@GaryMarcus82°Gary Marcus在X上列出外界对OpenAI Astra数学结果的八种误解。他认为数学领域擅长验证与合成数据,因此Astra的数学能力不代表通用智能,并援引IBM Watson从问答转向医疗失败的例子。Astra的证明写作水平不及证明本身,也未必能可靠处理PDF提取或写视频脚本。Marcus还驳斥了Astra即奇点的说法,并称一次Fable运行不足以证明数学史被改写。AI模型AstraOpenAI数学推理10 个信源在谈事件专题推荐理由:Gary Marcus盘点Astra数学8大误区,冷静看待OpenAI新模型,别被'数学已解决'带偏原文稍后读已读值得跟进有用关注 Astra
06:08Gary Marcus@GaryMarcus79°Gary Marcus 发文指出,OpenAI 的 Astra 在数学上的成功并不代表通用能力。数学依赖符号验证和合成数据,容易刷分,但现实世界无法模拟。Astra 只擅长某些数学题,并非全领域领先,其证明写作能力也不及题目求解。他质疑 Astra 能解决 PDF 数字提取等现有模型难题。Marcus 强调,Astra 不是奇点,也不意味着自动化科学发现时代到来。AI模型OpenAIAstraGary Marcus10 个信源在谈事件专题推荐理由:Gary Marcus 给 OpenAI 的数学成绩单泼冷水:Astra 能解数学题是因为数学能自动验证,换到现实问题就不好说。别急着吹成万能。原文稍后读已读值得跟进有用关注 OpenAI
14:40Gary Marcus@GaryMarcus75°Gary Marcus评论OpenAI Astra时承认其演示“显然令人印象深刻”,但认为数学问题比其他问题更依赖形式验证和合成数据。他质疑Astra在开放式真实世界问题中的可靠性,并指出目前不知道其是否使用Lean等工具。Marcus表示尚未看到问题尝试数量等细节,也没有独立验证。他回顾了此前社区对未试用模型的狂热后常出现失望的情况。行业OpenAIAstraGary Marcus10 个信源在谈事件专题推荐理由:Gary Marcus对OpenAI Astra的数学表现泼冷水:没公开细节,没独立验证,别急着吹。原文稍后读已读值得跟进有用关注 OpenAI
10:03Gary Marcus@GaryMarcus精选Eric Weinstein发文称,AI在纯数学上的表现被严重高估,距离顶级人类学者仍有距离。他向OpenAI提出10个未解决的数学物理难题作为新基准,包括寻找新的上同调理论、构造不矛盾的大统一理论、解释三代费米子等。他认为AI目前只会搜索反例或解离散题,无法处理理论构建式的深层问题。行业OpenAIEric Weinstein数学推理10 个信源在谈事件专题推荐理由:Eric Weinstein给OpenAI出了10道人类未解数学题,说AI现在只会解离散题,碰不了理论物理核心。看看吧,看他能不能被AI打脸。原文稍后读已读值得跟进有用关注 OpenAI
10:02Gary Marcus@GaryMarcus76°Gary Marcus发帖质疑,把AGI限定在可形式化领域是移动球门柱。他以2024年与Brundage的赌约为据,认为写视频脚本这类任务AGI应当能做。他承认Astra在数学上表现惊艳,但仅凭数学能力不足以证明其达到AGI。AI模型Gary MarcusAstra通用人工智能7 个信源在谈事件专题推荐理由:看了这条你会明白,Astra数学再强也不是AGI的充分证据,Gary Marcus一句话点破通用性该有的样子。原文稍后读已读值得跟进有用关注 Gary Marcus
01:37Gary Marcus@GaryMarcusGary Marcus在X上表示,OpenAI的Dean Ball称Astra能做任何事,但他怀疑Astra连数学都未必擅长。Ben Horne将Noam的推文输入Claude,Claude最后总结称,列表中的内容几乎都是构造或显式边界,只需展示巧妙对象即可验证。Claude还指出,所有这些成果都没有涉及构建新理论。Gary Marcus认为这些突破虽然惊人,但缺乏新理论值得思考。AI模型OpenAIAstraClaude10 个信源在谈事件专题推荐理由:Gary Marcus怼Astra全能论,还用Claude分析Noam推文,看看AI圈怎么吵的原文稍后读已读值得跟进有用关注 OpenAI
01:11Gary Marcus@GaryMarcusOpenAI公开了一篇249页的数学研究论文,展示新的数学结果。AI研究者Gary Marcus在X上发文批评,论文没有说明模型如何工作。文中也未交代证明的验证方式、人类参与程度以及是否存在错误。Marcus质疑这已经偏离了科学应有的公开透明原则。论文OpenAIGary Marcus数学推理5 个信源在谈事件专题推荐理由:Gary Marcus公开质疑OpenAI的249页数学论文不讲模型机制,和普通论文比缺了关键验证细节。原文稍后读已读值得跟进有用关注 OpenAI
00:21官方一手歸藏(guizang.ai)@op741882°OpenAI在X平台预热下一代模型Astra,称其解决了10个存在至少十年的数学问题。OpenAI研究负责人Sebastien Bubeck确认,Astra完成了多项成果,包括推翻Connes刚性猜想、改进高维球堆积和电路复杂性的界。这些证明将附带Lean证书和思维链(CoT)逐步讲解,并以论文形式发布。据称整个求解过程的算力成本仅约2000美元,OpenAI CEO Sam Altman已赴华盛顿与美政府沟通发布事宜。AI模型OpenAIAstra数学推理10 个信源在谈事件专题推荐理由:OpenAI说新模型Astra用2000美元算力解了10个老数学难题,连数学家都难搞定,还附Lean证明,感觉是真翻身了。原文稍后读已读值得跟进有用关注 OpenAI
23:08Gary Marcus@GaryMarcus74°Gary Marcus对OpenAI Astra的演示表示惊艳,但指出数学问题与其他问题不同,更适合形式化验证和合成数据。他认为该模型在开放式真实世界任务中的可靠性尚未可知,且未知是否依赖Lean等正式工具。Marcus质疑目前缺少具体实验细节,例如尝试了多少问题、成功多少,也没有独立验证。他提醒,过去社区多次对未亲测模型狂热,随后出现分歧或失望。AI模型OpenAIAstraGary Marcus10 个信源在谈事件专题推荐理由:Gary Marcus说:Astra数学成绩亮眼,但实际可靠性没验证,别急着嗨。原文稍后读已读值得跟进有用关注 OpenAI
16:26IT之家(博客/媒体)82°OpenAI公布十项数学与理论计算机科学进展,均由下一代核心模型Astra的内部版本计算得出,解决了多个十余年未解的难题。按Sol API费率计算,生成这些解答的总词元成本约为2000美元,约合13530元人民币。人类研究员在Lean语言中对证明进行了形式化验证并负责正确性,但数学论证本身由AI系统生成。成果包括将球体堆积密度上界收紧至Cohn-Elkies阈值、证明非柔性群存在、证伪Connes刚性猜想等。AI模型OpenAIAstra数学推理10 个信源在谈事件专题推荐理由:OpenAI用Astra模型解决了十个多年没人做出来的数学难题,整个研究烧了约2000美元的token,还在Lean里验证过,值得看看。原文稍后读已读值得跟进有用关注 OpenAI
15:29IT之家(博客/媒体)81°腾讯混元科研智能体 Hyra 为加法组合学中一个悬而未决 50 多年的问题给出完整答案:证明和集与差集扩张指数的最优上确界是 2。此前最佳构造纪录从 1969 年的 1.0290 提升到 2013 年的 1.1259,近一年 AI 辅助搜索达到 1.1449,内部实验中 Codex(GPT-5.5)达到 1.2851。Hyra 用约 24 小时提出基于十二进制数字结构、循环群对称加法基与中国剩余定理的显式构造,使指数可以任意逼近 2。论文预印本和 Lean 4 形式化证明均已公开。AI模型Hyra腾讯混元智能体推荐理由:腾讯混元的 Hyra 跑了24小时就证出加法组合学50年难题,还公开了 Lean 证明,比此前 AI 辅助搜索明显更进一步。原文稍后读已读值得跟进有用关注 Hyra
12:28官方账号arXiv cs.LG@Iliya Mirzaei该论文对七种自我反思方法进行对照实验,使用1.5B、3B和7B三种开源模型,在两个数学基准上各150道题。所有方法按实际生成token数对齐后,与重复采样取多数答案的基线比较,共36组配对检验。结果显示没有任何方法在相等成本下稳定优于重复采样,其中10组可靠更差,全部18组涉及模型自我检查的比较均为负面。Self-Refine和强制的Reflexion在7B模型上仍落后基线3.6至10.1个百分点,而最佳选择在1.5B时取多数答案比模型自选高8.0和11.3点,到7B时差距缩小至不显著。论文Self-RefineReflexion重复采样推荐理由:这篇论文把Self-Refine、Reflexion这些热门方法拉出来做了严格对比,发现相同token预算下自己反思不如多采样几次取多数,想省成本做推理的可以看看。原文稍后读已读值得跟进有用关注 Self-Refine
10:10官方一手arXiv: DeepSeek@Ken Ding精选数学推理的RLVR存在盲区:当一组采样全部失败时,GRPO的优势函数为零,导致模型在能力边界提示上无梯度。LSPO在每个RL步检测这类悬崖提示,用其标准答案快速拟合一个小型LoRA适配器,然后重新采样并将成功补全拼回批次。在DeepMath-103K上用DeepSeek-R1-Distill-Qwen-1.5B、n=5配对种子、1000步评估,LSPO在16个(基准,pass@k)组合中15胜1平,AIME24/pass@4提升+10.7点,MATH500/pass@1提升+2.4点,平均提升+3.8点。论文DeepSeek-R1-Distill-Qwen-1.5BGRPOLoRA推荐理由:DeepSeek-R1-Distill-Qwen-1.5B上,LSPO用LoRA支架捡回GRPO在零奖励提示上的梯度,比DAPO平均高3.8个点。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-1.5B
12:08Hunyuan@TXhunyuan精选腾讯混元团队利用 AI 研究助手 Hyra 和 Hy3 模型,构造出一个有限整数集 A 的例子,证明 |A+A| 与 |A-A| 增长的最优指数为 2,打破了 1969 年定理给出的上界。此前 50 年间最佳构造仅达到指数约 1.1。论文已发表在 arXiv(2607.27199),Hyra 博客和形式化证明也已公开。AI模型HyraHy3Tencent Hunyuan推荐理由:腾讯用自家 AI 助手 Hyra 和 Hy3 证出了一个 50 年没人能搞定的数学猜想,直接把最优指数从 1.1 推到 2,比之前所有构造都强一截。原文稍后读已读值得跟进有用关注 Hyra
12:01官方账号arXiv cs.AI@Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen提出Relay-OPD方法,解决同策略蒸馏(OPD)中的前缀失败问题:当学生模型进入错误推理方向后,后续生成偏离正确路径。该方法利用教师-学生在失败前缀上的延续不对称性作为无标签触发信号,让教师短暂接管生成然后交回学生训练。使用Qwen3-4B-Instruct-2507作为教师,Qwen3-0.6B/1.7B-Non-Thinking作为学生,在8个数学推理基准上,Relay-OPD在全部基准中取得最佳或次佳结果,1.7B模型平均超越标准OPD 5.73%,超越最强基线FastOPD 1.49%,且训练轨迹长度减少超过50%。论文Relay-OPDQwen3知识蒸馏推荐理由:这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。原文稍后读已读值得跟进有用关注 Relay-OPD
18:54The Rundown AI@therundownai71°Claude参与证伪一个持续87年的数学猜想,展示了AI在高级数学推理中的能力。该问题此前长期未被解决,Claude的推理过程被研究者用于辅助验证。这一成果凸显了大型语言模型在数学证明中的应用潜力。AI模型Claude数学推理推理模型推荐理由:Claude又帮数学家解决了一个87年的老问题,看看它怎么用逻辑推理证伪数学猜想的。原文稍后读已读值得跟进有用关注 Claude
22:16elvis@omarsar0网友 @omarsar0 在推文中称,其 LLM 模型 Fable 找到了 Jacobian 猜想的一个反例:映射 ((1+xy)^3 z + y^2 (1+xy)(4+3xy), y + 3x(1+xy)^2 z + 3xy^2(4+3xy), 2x - 3x^2 y - x^3 z) 的 Jacobian 行列式为 -2,且将 (0,0,-1/4)、(1,-3/2,13/2)、(-1,3/2,13/2) 均映射到 (-1/4,0,0)。作者认为标准基准测试不足以衡量 LLM 的真实能力,LLM 在解决极端难题上被低估了。AI模型FableJacobian猜想数学推理推荐理由:Fable 这个 LLM 自己找到了一个复杂数学猜想的反例,比很多基准测试中的题目难得多,值得关注。原文稍后读已读值得跟进有用关注 Fable
17:51官方账号Decoder@Matthias Bastian精选Moonshot的Kimi K3在Code Arena: Frontend排行榜上超越Claude Fable 5和GPT-5.6 Sol,成为首个登顶该榜单的中国模型。但在FrontierMath Tier 4数学测试中,Kimi K3仅得约39%,而OpenAI和Anthropic模型得分接近90%。差距主要体现在复杂数学推理能力上。AI模型Kimi K3Fable 5GPT-5.6 Sol10 个信源在谈事件专题推荐理由:国产模型Kimi K3前端代码很强,能超过Fable 5,但数学推理还差得远。想了解具体差距多大,可以看看这篇。原文稍后读已读值得跟进有用关注 Kimi K3
09:36官方账号arXiv cs.AI@Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus StenetorpAIMO可解释性挑战赛旨在通过模型内部机制区分前沿数学语言模型的鲁棒推理与虚假推理。比赛基于AI数学奥林匹克(AIMO)问题及Fields Model Initiative资源,提供新发布的奥林匹克级数学推理题及其符号表示。参赛者可访问前沿推理模型及其对抗鲁棒性评估,开发识别鲁棒推理的方法。比赛将创建开放的鲁棒性基准和基线系统,推动数学推理与可解释性研究。论文AIMOFields Model Initiative可解释性推荐理由:想测试数学推理模型是真会思考还是靠蒙?这个挑战赛提供了新基准和资源,帮你判断模型的鲁棒性。原文稍后读已读值得跟进有用关注 AIMO
03:51官方账号Greg Brockman@gdb用户称GPT-5.6 Sol是迄今为止最令人印象深刻的模型。在编程之外的数学和视觉能力方面,Sol(Max)表现极佳。测试显示Sol和Terra在视觉数学上远优于其他模型。这些改进非常显著。AI模型GPT-5.6 SolOpenAI多模态10 个信源在谈事件专题推荐理由:有人实测了GPT-5.6 Sol,数学和视觉超强,比Terra和其他模型厉害很多,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
07:24官方账号Greg Brockman@gdbPrzemek Chojecki 发推称 GPT-5.6 Sol Ultra 找到了 Erdős 问题 #793 的一个解法。该问题涉及 2-primitive 集的渐近性质。GPT 提出的构造极短且优雅,增强了 Erdős 原本用于证明较弱结果的方法。AI模型GPT-5.6Sol Ultra推理模型推荐理由:GPT-5.6 Sol Ultra 又解了一个 Erdős 难题 #793,构造比原方法更短更优雅,数学推理让人眼前一亮。原文稍后读已读值得跟进有用关注 GPT-5.6
10:17官方账号arXiv cs.AI@Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Zhang, Bin DongDanus是一个基于事实图记忆的协调系统,旨在提升研究级数学推理能力。系统包含一个主智能体进行规划和协调,多个工作智能体并行执行证明搜索,以及一个无状态验证器检查数学主张。每个验证的事实连同证明和逻辑依赖存储在事实图中,构建递增的长期论证。在代数几何、奇点理论和组合学的六个研究级案例中,Danus成功生成长而详细的数学证明。论文Danus数学推理智能体推荐理由:看看Danus怎么用事实图记忆帮多个推理智能体协作解数学难题,还能和数学家互动。原文稍后读已读值得跟进有用关注 Danus