事件专题 · 多源确认

训练无关验证器:验证成为AI扩展新轴

Stanford、NVIDIA、UC Berkeley 提出一种无需微调的验证器,直接从评分 token logits 读取连续校准分数。通过三个旋钮——分数粒度、重复评估、标准分解——提升准确率。在 Terminal-Bench V2 达 86.5%,SWE-Bench Verified 78.2%,RoboRewardBench 87.4%,MedAgentBench 73.3%。该连续分数还可作为 SAC 和 GRPO 的密集奖励,并已集成到 Claude Code 扩展中用于任务进度信号。论文见 arxiv.org/abs/2607.05391。

当前结论

斯坦福等团队出了个不用微调的验证器,用 token logits 读连续分数,SWE-Bench 干到 78.2%,还能给强化学习当奖励信号,很实用。

6 个信源73° AI 热度最后更新 2026/7/7 18:10:06

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情