#验证器
共 13 条 · 7 天 0 条 · 30 天 1 条
信息流里打上「验证器」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月29日
6月18日
6月16日
6月14日
6月12日
MaxProof: 用生成-验证强化学习实现数学证明的规模扩展
数学证明是 AI 推理的硬核测试,MaxProof 用群体搜索和验证器强化学习突破了竞赛级证明的瓶颈,做数学 AI 或推理系统的研究者值得关注其方法。
6月5日
DataCOPE:无监督技能发现框架提升数据分析智能体性能
做数据分析智能体或自动化数据探索的团队,DataCOPE 解决了技能发现依赖昂贵标注的痛点,无需人工干预就能自动提炼可复用技能,建议关注其验证器设计思路。
6月3日
Harvey & LangChain 研究:如何降低验证器成本以扩展评估/RL
做 AI 评估或强化学习的团队,验证器成本一直是个头疼问题——Harvey 和 LangChain 的这项研究直接给出了降本思路,值得关注。
5月29日
自训练验证器STV:解锁推理模型的训练与测试时自改进
推理模型开发者长期受困于验证器失效导致自改进停滞,STV用参考答案不对称性巧妙破解,在困难数学和科学任务上效果显著,做自训练或测试时搜索的团队值得深入看。
5月13日
基于评分标准的强化学习中的奖励黑客问题研究
这篇论文揭示了RLHF中一个被低估的风险——模型可能学会刷分而非真正变强。做AI对齐和模型训练的团队值得一读,尤其是那些依赖评分标准进行RL优化的,看完会对验证器设计有更深警惕。