8月18日
15:36
15:36官方账号arXiv cs.AI@Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo
KV-Rescue是一种无需训练的推理框架,通过轻量级全上下文助手桥接KV驱逐引入的信息缺口。在Qwen2.5-Math 7B和72B模型上,五个数学基准测试中,KV-Rescue在驱逐预算B=64时平均恢复了87%的精度损失。该框架使用在线检测器基于熵和可压缩性提前终止不连贯或重复的生成,将基础模型令牌生成量平均减少43%。
推荐理由:KV缓存驱逐会掉精度,KV-Rescue用个小模型当辅助,能救回87%的损失,还省43%的生成量,跑长推理的可以看看。
8月16日
23:53
8月12日
00:31
00:31techcrunch@Russell Brandom
83°
Anthropic的一个未发布模型在数学领域最著名的未解问题之一——黎曼猜想上取得了进展。该模型在相关基准测试中表现优于现有模型,尽管未能完全解决猜想,但展示了AI在数学推理方面的潜力。这一成果可能对数学研究产生深远影响。
事件专题

推荐理由:Anthropic的新模型在黎曼猜想上取得了进展,虽然没完全解决,但比预期强,值得看看AI在数学上能走多远。
8月11日
22:34
22:34Gary Marcus@GaryMarcus
Gary Marcus在X上发文称,Claude在黎曼猜想上的表现再次证明混合神经符号AI的价值。他指出,如果去掉其中的符号部分,仅靠神经网络无法成功解决该问题。这被视为神经符号AI在数学推理领域的重要验证。

推荐理由:想看AI数学推理到底行不行?Marcus说Claude解黎曼猜想靠的是符号+神经混合,不是纯神经网络。
04:31
04:31官方一手Anthropic: Research资讯
72°
Anthropic于8月10日发布研究称,未发布的Claude研究版在黎曼猜想相关问题上取得进展。该版本将黎曼ζ函数满足猜想的零点比例下界从41.6%提高到67.2%。研究来自Anthropic,展示了Claude在数学推理上的能力。
事件专题

推荐理由:Anthropic未发布Claude把黎曼猜想下界从41.6%推到67.2%,数学能力又进一步。
01:57
01:57官方账号Anthropic@AnthropicAI
精选72°
Anthropic让未发布的研究版Claude尝试解决黎曼猜想。它没有证明该猜想,但将黎曼ζ函数满足猜想的零点比例下界从41.6%提高到67.2%。相关研究细节已发布在Anthropic研究页面上。
事件专题

推荐理由:Anthropic让Claude研究版试解黎曼猜想,没解得动,却把下界从41.6%拉到67.2%,AI数学能力又往前一点。
8月7日
13:24
13:24官方账号arXiv cs.AI@ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng
论文提出DASH方法,用于改进带可验证奖励的强化学习(RLVR)中奖励稀疏的问题。标准OPSD对所有局部发散使用相同权重,忽略了生成过程中发散序列的时间结构。DASH根据局部蒸馏信号与序列均值的差距自适应调整token级监督权重,控制反向多步聚合。在三个数学推理基准和三种模型规模上,DASH均优于匹配的vanilla OPSD。该方法复用OPSD已有的师生分布,不额外增加前向传播成本。
推荐理由:这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。
8月4日
03:15
03:15官方账号OpenAI@OpenAI (@OpenAI)
82°
OpenAI在X平台宣布,其下一代旗舰模型的内部版本在数学和理论计算机科学领域的10个长期开放问题上取得了新结果。该模型运行消耗的token价值约2000美元,按GPT-5.6 Sol API费率计算。推文附带的视频展示了部分求解过程,目前该模型尚未公开发布。
事件专题

推荐理由:OpenAI说下一代模型内部版才花2000美元token就解了10个数学老难题,按GPT-5.6 Sol API费率算的,很猛。
8月3日
8月2日
10:02
10:02Gary Marcus@GaryMarcus
76°
Gary Marcus发帖质疑,把AGI限定在可形式化领域是移动球门柱。他以2024年与Brundage的赌约为据,认为写视频脚本这类任务AGI应当能做。他承认Astra在数学上表现惊艳,但仅凭数学能力不足以证明其达到AGI。
事件专题

推荐理由:看了这条你会明白,Astra数学再强也不是AGI的充分证据,Gary Marcus一句话点破通用性该有的样子。
8月1日
7月31日
7月30日
12:08
12:08Hunyuan@TXhunyuan
精选
腾讯混元团队利用 AI 研究助手 Hyra 和 Hy3 模型,构造出一个有限整数集 A 的例子,证明 |A+A| 与 |A-A| 增长的最优指数为 2,打破了 1969 年定理给出的上界。此前 50 年间最佳构造仅达到指数约 1.1。论文已发表在 arXiv(2607.27199),Hyra 博客和形式化证明也已公开。

推荐理由:腾讯用自家 AI 助手 Hyra 和 Hy3 证出了一个 50 年没人能搞定的数学猜想,直接把最优指数从 1.1 推到 2,比之前所有构造都强一截。
7月29日
12:01
12:01官方账号arXiv cs.AI@Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen
提出Relay-OPD方法,解决同策略蒸馏(OPD)中的前缀失败问题:当学生模型进入错误推理方向后,后续生成偏离正确路径。该方法利用教师-学生在失败前缀上的延续不对称性作为无标签触发信号,让教师短暂接管生成然后交回学生训练。使用Qwen3-4B-Instruct-2507作为教师,Qwen3-0.6B/1.7B-Non-Thinking作为学生,在8个数学推理基准上,Relay-OPD在全部基准中取得最佳或次佳结果,1.7B模型平均超越标准OPD 5.73%,超越最强基线FastOPD 1.49%,且训练轨迹长度减少超过50%。
推荐理由:这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。
7月21日
18:54
18:54The Rundown AI@therundownai
71°
Claude参与证伪一个持续87年的数学猜想,展示了AI在高级数学推理中的能力。该问题此前长期未被解决,Claude的推理过程被研究者用于辅助验证。这一成果凸显了大型语言模型在数学证明中的应用潜力。

推荐理由:Claude又帮数学家解决了一个87年的老问题,看看它怎么用逻辑推理证伪数学猜想的。
7月19日
17:51
17:51官方账号Decoder@Matthias Bastian
精选
Moonshot的Kimi K3在Code Arena: Frontend排行榜上超越Claude Fable 5和GPT-5.6 Sol,成为首个登顶该榜单的中国模型。但在FrontierMath Tier 4数学测试中,Kimi K3仅得约39%,而OpenAI和Anthropic模型得分接近90%。差距主要体现在复杂数学推理能力上。
事件专题

推荐理由:国产模型Kimi K3前端代码很强,能超过Fable 5,但数学推理还差得远。想了解具体差距多大,可以看看这篇。
7月16日
09:36
09:36官方账号arXiv cs.AI@Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus Stenetorp
AIMO可解释性挑战赛旨在通过模型内部机制区分前沿数学语言模型的鲁棒推理与虚假推理。比赛基于AI数学奥林匹克(AIMO)问题及Fields Model Initiative资源,提供新发布的奥林匹克级数学推理题及其符号表示。参赛者可访问前沿推理模型及其对抗鲁棒性评估,开发识别鲁棒推理的方法。比赛将创建开放的鲁棒性基准和基线系统,推动数学推理与可解释性研究。
推荐理由:想测试数学推理模型是真会思考还是靠蒙?这个挑战赛提供了新基准和资源,帮你判断模型的鲁棒性。
03:51
03:51官方账号Greg Brockman@gdb
用户称GPT-5.6 Sol是迄今为止最令人印象深刻的模型。在编程之外的数学和视觉能力方面,Sol(Max)表现极佳。测试显示Sol和Terra在视觉数学上远优于其他模型。这些改进非常显著。
事件专题

推荐理由:有人实测了GPT-5.6 Sol,数学和视觉超强,比Terra和其他模型厉害很多,值得关注。
7月14日
07:24
7月8日
10:17
10:17官方账号arXiv cs.AI@Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Zhang, Bin Dong
Danus是一个基于事实图记忆的协调系统,旨在提升研究级数学推理能力。系统包含一个主智能体进行规划和协调,多个工作智能体并行执行证明搜索,以及一个无状态验证器检查数学主张。每个验证的事实连同证明和逻辑依赖存储在事实图中,构建递增的长期论证。在代数几何、奇点理论和组合学的六个研究级案例中,Danus成功生成长而详细的数学证明。
推荐理由:看看Danus怎么用事实图记忆帮多个推理智能体协作解数学难题,还能和数学家互动。