#MATH-500
共 7 条 · 7 天 3 条 · 30 天 5 条
信息流里打上「MATH-500」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
研究:特定起始 token 提示可让 base 模型接近 RL 训练后的推理表现
不用 RL 训练,只在开头加个 "Okay" 就能让 Olmo-3-7B 数学成绩翻近一倍,这篇论文把原因挖得很透,做模型训练的值得看看。
从推理链哪一步重启更划算?arXiv 论文量化扩展位置的选择收益
论文发现重启推理链的位置本身就有讲究,选对位置在 MATH-500 上能用更少算力超过 self-consistency,做推理成本优化的人可以看。
9月26日
Reasoning from scratch 第5讲:对数概率打分与自我改进
Raschka 又更新了,这期手把手教你用 PyTorch 算 token 概率给模型答案打分,还搭了一个 self-refinement 循环,最后跑 MATH-500 看效果。
9月23日
OPD 蒸馏方法让低比特量化模型恢复推理能力
量化到 2-bit 后模型做数学题会发疯循环?这篇论文用 on-policy 蒸馏把 MATH-500 保留率从 35% 拉到 70%,做端侧部署的可以看看。
8月10日
7月1日