#LLM-as-judge
共 4 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「LLM-as-judge」标签的资讯、产品与论文,按刊登时间排,新的在上。
8月13日
6月5日
模型23:18
RL后训练中验证器成本可能放大,LLM-as-judge 成关键做 RL 后训练的团队注意了——验证器成本可能成为瓶颈,而 LLM-as-judge 的性价比直接决定迭代速度,建议点开看看怎么优化。
6月3日
LangChain 对比 LLM-as-judge 两种评估方式:50 条标准任务
做 LLM 评估的团队终于有了省 API 调用的思路——批量评估 50 条标准只需 1 次调用,成本直降 50 倍,建议做自动化评测的开发者点开看看。
5月11日
Rubric-Grounded RL:结构化评判奖励实现泛化推理
该研究通过分解奖励为多标准评判规则,实现了更细粒度的优化信号,在多个推理基准上验证了迁移效果,对大模型推理能力的训练方法有重要参考价值。
arXiv cs.AI原文