#数学推理
共 122 条 · 7 天 11 条 · 30 天 28 条
8月18日
8月17日
8月16日
8月13日
8月12日
8月11日
TIDE:解决LLM在线蒸馏中师生不匹配问题
这篇论文讲了个反直觉的事:蒸馏时师生token一致反而可能有害。TIDE方法在数学推理上把准确率从6.9%拉到20.3%,还让回答短了3.6倍,值得做LLM后训练的人看看。
Anthropic 研究版 Claude 把黎曼零点下界从 41.6% 提到 67.2%
Claude 把黎曼零点下界从 41.6% 推到 67.2%,人类 50 年才推不到 9 个百分点,它一步干了 26 个点。
未发布研究版Claude试解黎曼猜想,零点比例下界从41.6%提升至67.2%
Anthropic让Claude研究版试解黎曼猜想,没解得动,却把下界从41.6%拉到67.2%,AI数学能力又往前一点。
8月7日
8月4日
8月3日
8月2日
Eric Weinstein:AI数学未达顶尖人类水平,列出10大难题
Eric Weinstein给OpenAI出了10道人类未解数学题,说AI现在只会解离散题,碰不了理论物理核心。看看吧,看他能不能被AI打脸。
8月1日
OpenAI公布数学与理论计算机科学十项进展,Token成本约2000美元
OpenAI用Astra模型解决了十个多年没人做出来的数学难题,整个研究烧了约2000美元的token,还在Lean里验证过,值得看看。
7月31日
论文12:28
采样更多反思更少:相同Token成本下Self-Refine与Reflexion不如重复采样这篇论文把Self-Refine、Reflexion这些热门方法拉出来做了严格对比,发现相同token预算下自己反思不如多采样几次取多数,想省成本做推理的可以看看。
LSPO:用LoRA支架恢复零奖励提示上的强化学习梯度
DeepSeek-R1-Distill-Qwen-1.5B上,LSPO用LoRA支架捡回GRPO在零奖励提示上的梯度,比DAPO平均高3.8个点。
7月30日
腾讯混元用 Hyra 和 Hy3 模型解决 50 年数学难题
腾讯用自家 AI 助手 Hyra 和 Hy3 证出了一个 50 年没人能搞定的数学猜想,直接把最优指数从 1.1 推到 2,比之前所有构造都强一截。
7月29日
论文12:01
Relay-OPD:通过轨迹接力改进同策略蒸馏这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。
7月21日
7月20日
7月19日
7月16日
7月14日
7月8日