#测试时扩展
共 13 条 · 7 天 0 条 · 30 天 1 条
信息流里打上「测试时扩展」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月1日
8月11日
8月10日
8月4日
7月21日
7月13日
6月25日
模型10:45
后训练中被忽视的免费午餐:进度优势用于LLM智能体这篇论文说,RL后训练时顺便就能得到一个免费的好信号,不用再费劲训练奖励模型,在好几个测试里都比专门训练的效果还好。做智能体训练的一定得看看。
6月12日
MaxProof: 用生成-验证强化学习实现数学证明的规模扩展
数学证明是 AI 推理的硬核测试,MaxProof 用群体搜索和验证器强化学习突破了竞赛级证明的瓶颈,做数学 AI 或推理系统的研究者值得关注其方法。
6月4日
论文10:58
失败推理轨迹揭示可修复性:无需阅读文本,仅凭分布特征即可诊断这篇论文为AI推理失败提供了诊断工具,做模型调试和推理优化的团队可以直接用这三个特征来区分可修复与不可修复的失败,无需额外训练或权重访问,值得关注。
5月23日
Meta 论文:编码智能体通过复用尝试摘要大幅提升性能
这篇论文戳中了编码智能体效率低下的核心痛点——不是试得不够多,而是记不住经验。做 AI 编程工具或智能体开发的团队,可以直接借鉴其摘要复用和锦标赛选择方法,值得点开看看。
5月19日
5月12日