AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

ARC-Challenge

共 1 条相关 AI 资讯
7月28日
12:31
12:31官方一手arXiv: DeepSeek@Zongyou Yang, Yinghan Hou
精选
语言模型基准将是否到达可评估状态和答案是否正确合并为一个准确率分数。新提出的两层评估框架分离了执行证据(终止、答案暴露、可解析性、完成长度)和正确性。在5个Qwen和DeepSeek配置的2550个输出上,2048 token限制下:Qwen MATH有49/450未终止,DeepSeek MATH有5/300未终止,ARC无未终止。相同300个DeepSeek MATH输出在8192 token下无缺失最终答案终止。覆盖审计的目标验证表明候选选择与聚合策略可显著改变比较准确率估计。
论文QwenDeepSeekMATH

推荐理由:这篇论文用具体数字告诉你,准确率分数会骗人:同样2048 token,Qwen比DeepSeek多出近10倍的无答案失败,评估时得分开看执行状态和得分。
原文
精选全部日报登录