math·general

math

别名
首次出现
2026-05-22
最近出现
2026-07-27
累计提及
68
§ 01综述

Math,作为人工智能推理能力的核心测试场,正在推动从大语言模型到智能体系统的关键突破。近期研究围绕数学推理的效率、知识迁移和本质机制展开,既展示了强化学习与蒸馏技术的威力,也揭示了推理成本与遗忘现象等新挑战。

Math近期进展

  • 知识蒸馏提升小模型数学能力:研究人员将DeepSeek-R1的推理能力蒸馏至Qwen2.5-7B,在约翰·奥布莱恩数学竞赛中表现显著提升,表明大模型的数学推理模式可有效迁移至小模型。知识蒸馏从DeepSeek-R1到Qwen2.5-7B:约翰·奥布莱恩数学竞赛案例研究
  • 推理即记忆:数学推理如何激活参数化知识:Google Research发现,LLM的数学推理过程本质上是将问题与训练时存储的模板匹配,而非真正逻辑演绎,这解释了为何推理链能提升准确性。‘思考即回忆’:推理如何解锁LLM参数化知识
  • 神经符号方法加速数学求解:用仅80万参数的Transformer,通过神经符号训练,15分钟即可解决数独,表明将符号逻辑与神经网络结合是处理规则型数学问题的有效途径。Neurosymbolic 崛起:800k Transformer 15分钟训练解决数独
  • 行业领袖称数学是AGI关键:Axiom CEO指出,数学推理是代码智能体迈向通用人工智能(AGI)的缺失路径,强调几何与代数能力对自主编程和规划的重要性。Axiom CEO:数学是代码智能体通往AGI的缺失路径
  • 当前焦点与观察点

    当前AI与math的交汇点集中在三方面:一是推理成本优化,如ReasonAlloc和LearnStop等研究通过动态预算和早期退出降低数学推理时的计算开销;二是推理机制的透明化,“思考即回忆”观点挑战了传统认知,暗示数学推理可能更多依赖记忆检索而非全新计算;三是工程落地的平衡,知识蒸馏虽提升小模型性能,但RLVR等后训练方法可能引发“推理遗忘”等副作用(如MAST研究)。总体看,数学推理正从基准测试演变为检验AI认知能力的核心场景,其效率和本质争议将持续推动研究边界。

    § 02相关报道10 条在档
    1. 01
      蚂蚁百灵发布原生混合推理模型Ling-3.0-Flash
      量子位
    2. 02
      PPL-Factory:任务感知与预算感知的数据选择方法
      arXiv cs.LG
    3. 03
      诊断与缓解On-Policy Self-Distillation中的Thinking Collapse
      arXiv cs.LG
    4. 04
      知识蒸馏从DeepSeek-R1到Qwen2.5-7B:约翰·奥布莱恩数学竞赛案例研究
      arXiv: DeepSeek
    5. 05
      LearnStop:推理模型早期退出的成本感知研究
      arXiv: DeepSeek
    6. 06
      后训练中被忽视的免费午餐:进度优势用于LLM智能体
      arXiv cs.LG
    7. 07
      ‘思考即回忆’:推理如何解锁LLM参数化知识
      Google Research: Blog
    8. 08
      RLM-Cascade: 响应级投机解码代理层系统降低LLM API成本45.8%
      arXiv: DeepSeek
    9. 09
      VibeCoder基于Qwen2.5-Coder-3B,后训练技术带来出色性能
      Sebastian Raschka
    10. 10
      MAST:机制引导的选择性遗忘方法,降低RLVR推理遗忘的附带损害
      arXiv cs.AI
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/math