模型23:18RL后训练中验证器成本可能放大,LLM-as-judge 成关键做 RL 后训练的团队注意了——验证器成本可能成为瓶颈,而 LLM-as-judge 的性价比直接决定迭代速度,建议点开看看怎么优化。#RL后训练#LLM-as-judge#验证器成本#奖励信号官方账号LangChain@LangChainAI原文稍后读已读值得跟进有用关注 RL后训练