OpenAI 把 722 篇论文全放出来了,就是那个 372 个数学结果的说法,平均每个只用了 ChatGPT Pro 3 小时算力,可以自己去翻原始材料。
#数学推理
共 121 条 · 7 天 10 条 · 30 天 27 条
信息流里打上「数学推理」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月10日
OpenAI 公开支持 open-problems 声明的 722 篇论文
10月9日
10月8日
10月7日
10月4日
Meta 发布六篇论文:数学家与 Muse Spark 1.1/1.2 协作求解开放数学问题
Meta 让数学家用 Muse Spark 的普通聊天界面做开放数学题,还发了六篇论文,每篇都标注人和 AI 各写了哪部分。
10月2日
10月1日
9月30日
9月29日
9月24日
UECR-GRPO:用熵校准统一策略内蒸馏与GRPO的信用分配
教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。
9月22日
论文10:59
Endless Exam 基准:用14类数学构造衡量模型通往超级智能的进度有人出了个数学基准 Endless Exam,14类构造题自动验证打分,8个模型全测了一遍,目前没谁超过人类已发表纪录。
9月18日
谷歌曝光内部数学推理模型 Mathematica,支持百万词元上下文
谷歌新出的 Mathematica 数学推理模型,能处理百万词元的上下文,专门解决数学难题,比之前的高阶数学竞赛模式更强。
IT之家原文
9月16日
一种改进的模型蒸馏方法,通过时间信用分配提升大语言模型性能
这篇论文提出了一种新的模型蒸馏方法γOPD,它通过引入折扣时间信用分配来平衡长时程监督和优化稳定性。实验表明,该方法在数学和代码推理任务上,比现有方法有更稳定的提升效果。
9月15日
9月14日
9月12日
GPT-6 Astra 刷穿 FrontierMath Tier 4
GPT-6 Astra 在数学推理上又进步了,这次是刷穿了 FrontierMath Tier 4,这个测试以前是专家和顶尖模型都过不了的。
9月10日
9月9日
9月8日
9月7日
9月5日
8月31日
8月26日
8月18日