7月7日
11:39
11:39官方账号arXiv cs.AI@Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
LLM-as-a-Verifier通过计算评分token logits的期望生成连续分数,替代传统的离散评分方法。该框架从评分粒度、重复评估和准则分解三个维度缩放验证能力,在Terminal-Bench V2上达86.5%,SWE-Bench Verified上达78.2%,RoboRewardBench上达87.4%,MedAgentBench上达73.3%。其细粒度信号可用于任务进度估计和RL训练,在SAC和GRPO上提升样本效率。论文还提供了Claude Code扩展,帮助开发者监控代理系统。
事件专题

推荐理由:这篇论文提出一种不依赖额外训练的验证框架,用连续分数替代离散评分,在四个agent基准上刷新了成绩,还顺手提升了RL样本效率。