#AutoEval
共 14 条 · 7 天 1 条 · 30 天 2 条
信息流里打上「AutoEval」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月11日
8月26日
8月13日
8月1日
Inkling-Small进Text Arena,12B激活参数排名约88
Inkling-Small只用12B激活参数就逼近DeepSeek V4 Flash,开放模型里排21名,少算力也能打,关注后续人投排名。
7月31日
Inkling-Small 发布,276B参数12B活跃,Text Arena排名#88
Thinking Machines 新出的开源模型,276B 参数但只激活 12B,一发布就挤进 Text Arena 前 100,美国厂商里排前几,想试大参数但轻量推理的可以看看。
模型02:26
AutoEval 如何产生 Arena Score:基于奖励模型的评分流程想知道 Arena 排行榜上的自动评分怎么算的吗?这篇解释了 AutoEval 如何用数百万人类投票训练奖励模型来给新模型打分,快且透明。
AutoEval文本奖励模型:预测人类偏好比前沿LLM裁判准确8-10%
Chai团队搞了个AutoEval奖励模型,预测人类偏好比GPT-4之类还准8-10%,新模型刷榜前先看它评分,省得等人类投票。
模型02:16
Arena.ai 推出 AutoEval:基于数百万真实用户偏好的奖励模型评测方法Arena.ai 出了 AutoEval,用真实用户偏好训练奖励模型,几个小时就能评测新模型,比人工快几十倍,结果还跟人工差不多。