02:23lmarena.ai@lmarena_ai精选LMSYS Arena 推出 AutoEval,一种在完整评测结果出炉前比较候选模型检查点的早期信号。实验显示,当两个模型的 Arena 分数差≥10 分时,AutoEval 在超过 90% 的案例中正确识别出更高分模型;分数差≥15 分时,对所有测试对均正确排序。AI模型AutoEvalLMSYS Arena模型评估推荐理由:如果你经常在评测结果出来前纠结选哪个检查点,AutoEval 能提前帮你判断,分差够大时几乎不出错。原文稍后读已读值得跟进有用关注 AutoEval
02:16向阳乔木@vista8Arena.ai 发布了新评测方法 AutoEval,使用基于数百万真实 Arena 用户偏好训练的奖励模型对模型进行排名。该方法与实时人工评测结果高度一致,并将评测速度从数天缩短至数小时。AutoEval 支持文本、视觉、图像和代码 Arena 多种模态。新模型上线后可直接在排行榜显示 AutoEval 预估分数。AI模型AutoEvalArena.ai奖励模型推荐理由:Arena.ai 出了 AutoEval,用真实用户偏好训练奖励模型,几个小时就能评测新模型,比人工快几十倍,结果还跟人工差不多。原文稍后读已读值得跟进有用关注 AutoEval