11:07官方账号arXiv cs.AI@Yan Zhou, Yue Ouyang, Kaiyang Zheng, Suncheng XiangCoBa是一种计算平衡路由策略,将测试时推理视为算力分配问题,决定下一步算力用于生成、验证还是停止。在涵盖MATH-500、AIME 2024/2025、AMC 2023及程序符号推理的3,129项评估中,CoBa-Routed-Strong达到85.13%的宏平均准确率,仅比自评估加权投票代理低0.07个百分点,却节省49.1%的参数加权token。与最佳16选多数投票相比,准确率差距在0.01个百分点以内,同时减少58.9%的参数加权token。配对bootstrap检验表明其显著优于单样本解码,但距池化oracle仍有提升空间。论文CoBa测试时扩展MATH-500推荐理由:算力有限时该先验证还是再生成?CoBa用路由策略帮你分配,省近一半token,准确率不掉。原文稍后读已读值得跟进有用关注 CoBa
09:22官方一手arXiv: DeepSeek@Zhe Dong, Fang Qin, Manish Shah精选论文提出LearnStop方法,在固定预算检查点从推理前缀预测正确性,使用答案置信度、熵、前缀投票份额等特征。在GSM8K、MATH-500、MMLU-Pro、AIME-90、GPQA等18个任务-模型设置上评估,涉及Qwen3和DeepSeek-R1蒸馏模型。在GSM8K上使用Qwen3-32B时,后验峰值自适应增益达+0.157,验证选择操作点保持正增益。在多项选择和极难设置上,标量置信度、熵或稳定性规则更具竞争力。结论:学习停止的价值取决于轨迹结构,当许多问题在预算结束前变正确但缺乏可靠标量停止信号时有用。论文LearnStop推理模型GSM8K推荐理由:这篇论文分析了推理模型什么时候该提前停止计算。LearnStop在数学题上比简单规则好,但难题还是用置信度更靠谱。原文稍后读已读值得跟进有用关注 LearnStop